强化学习沉浮史:从深度寒冬到大模型封神
文章回顾了强化学习七十年跌宕起伏的发展历程。从心理学的效果律与数学的动态规划这两条根源讲起,梳理了教科书时期的理论奠基与早期边缘化。随后,深度学习的引爆带来了黄金年代,DQN与AlphaGo的辉煌让强化学习备受推崇。然而,样本效率等缺陷曾让其一度跌入谷底。如今,这门学科在大模型时代通过RLHF等技术奇迹般重生,再次站到了AI舞台的中央。
文章回顾了强化学习七十年跌宕起伏的发展历程。从心理学的效果律与数学的动态规划这两条根源讲起,梳理了教科书时期的理论奠基与早期边缘化。随后,深度学习的引爆带来了黄金年代,DQN与AlphaGo的辉煌让强化学习备受推崇。然而,样本效率等缺陷曾让其一度跌入谷底。如今,这门学科在大模型时代通过RLHF等技术奇迹般重生,再次站到了AI舞台的中央。
本文从深度流形视角分析 Thinking Machines 的多模态模型 Inkling。探讨了模态早期耦合、放弃 RoPE 的几何意义、Muon 的归一化作用以及大规模强化学习对流形同调的影响,提出了关于数据耦合和训练稳定性的开放问题。
OpenRLHF 作者发布了新的强化学习框架 Molt。该框架采用纯 PyTorch 栈,核心代码仅约 9000 行,专注于 Agentic RL 研究。它支持 Qwen3.5-397B 到 GLM-5.2 753B 等超大规模 MoE 模型训练,无需依赖 Megatron,具备高度的代码可读性和可修改性。
本期早报深入探讨 AI 系统工程化落地:Anthropic 研究量化了不同模型和语言中的价值观差异;淘宝直播分享了通过拆分多智能体来解决奖励归因难题的实践;微软则从企业视角提出了包含五层的生产 Agent 框架。此外,速览涵盖 OCR 模型、编码成本对比及国产大模型进展。
本文介绍了如何使用 Prime Intellect 的 Verifiers 框架从零开始构建一个用于强化学习(RL)的 Othello(黑白棋)游戏环境。文章解释了 RL 循环的基本组成部分(状态、动作、奖励、环境),并利用 GRPO 算法替代传统的人工偏好模型。文中详细展示了技术栈、游戏循环逻辑以及内置的 Minimax 对手引擎代码,旨在帮助开发者理解并掌握构建模型无关的 RL 环境的核心方法。
本文汇总了35道2026年强化学习(RL)领域的面试核心问题。内容涵盖算法与基础设施两大方向,既包括PPO、GRPO等训练机制的原理探讨,也涉及分布式推理、显存优化等工程落地细节。作者强调现代RL岗位需要具备全栈理解能力,建议面试者不仅要熟记问题,更需深究背后的技术逻辑。
本文基于李飞飞的观点,深入探讨了“世界模型”这一AI术语在当前语境下的定义与功能。文章通过强化学习中的POMDP框架,将世界模型系统分为三类:输出视觉观察的“渲染器”、输出物理状态的“模拟器”以及输出行动指令的“规划器”。作者指出,尽管渲染器目前商业应用最成熟,但模拟器作为连接视觉与行动的桥梁,是实现空间智能和通用机器人的关键。文章最后预测,这三类功能的边界将逐渐坍缩,最终融合为一个统一的、能够理解并交互物理世界的基础模型。
本文由李飞飞撰写,旨在厘清当下 AI 领域中“世界模型”这一概念的混淆。文章基于强化学习中的智能体循环框架,将现有的世界模型划分为三类:侧重视觉保真度的“渲染器”、侧重物理与几何结构准确的“模拟器”,以及侧重决策输出的“规划器”。作者强调,模拟器虽然公众关注度较低,但连接了视觉与行动,是实现物理世界精准交互的关键,也是空间智能的核心所在。
本文旨在从第一性原理出发探讨如何构建和训练 AI Agent。文章批评了过度依赖框架的教程,转而从底层构建了一个极简的“文本转图表”Agent。作者通过 Python 实现了一个包含 Canvas 环境的系统,深入解析了 Agent 如何通过 JSON 动作空间与环境交互,阐述了从监督微调(SFT)到强化学习(RL)的完整闭环,即“提示-行动-环境-奖励-梯度更新”,揭示了模型学习可执行指令逻辑的核心机制。
文章详细解读了 Google 关于 SkillOS 的最新论文。SkillOS 是一个帮助 LLM Agent 通过管理可复用“技能”来实现自我进化的框架。该框架包含一个冻结的 Agent Executor 和一个可训练的 Skill Curator,后者利用强化学习(RL)从执行轨迹中自动提取、更新或删除技能,从而实现从经验到技能的转化。
文章综述了本周五篇重要的 AI 论文。1. Agentic Harness Engineering 提出了可验证的三层演化模型,显著提升了编程 Agent 的 Pass@1 率;2. AgenticQwen-30B 展示了高效的 MoE 模型在工具使用任务上的能力;3. Agentic World Modeling 提出了按定律分级的世界模型分类法;4. RecursiveMAS 通过潜空间递归计算解决了多 Agent 通信的 Token 膨胀问题;5. OneManCompany 探索了动态人才市场的多智能体协作模式。
本文深入探讨了人工智能领域热门概念“世界模型”。文章指出世界模型是一个问题陈述而非特定架构,类似于SLAM。文章通过自动驾驶案例阐述了Yann LeCun的形式化定义(状态预测与渲染分离),并对比了当前三种主流范式:生成式模型(如Sora)、潜在动力学模型(如Dreamer)以及JEPA架构,分析了它们在压缩策略和预测目标上的差异。
作者将MIT发布的12本研究生级AI教科书上传至Claude项目中,作为系统底层的永久上下文。这一改变使Claude从单纯的聊天机器人转变为基于第一性原理的推理系统。它不再仅进行模式匹配,而是运用概率理论和机器学习原理分析市场,甚至指出了凯利公式在加密货币肥尾分布下的不足。文章详细列出了涵盖ML基础、深度学习、强化学习等六部分的12本书单及其具体应用。
文章介绍了 Berkeley 团队提出的 GEPA 算法,该算法作为 GRPO 的替代方案,无需更新模型权重或进行 GPU 训练,仅通过优化提示词(Prompt)即可在 HotpotQA 等基准测试中取得更优成绩。GEPA 的核心在于利用 LLM 读取完整的推理轨迹,通过自然语言反思来迭代优化多模块系统中的每个提示词,从而避免了强化学习中将丰富信息压缩为单一标量信号的信息损耗问题。
文章推荐了 27 本构建 Agent 时代认知地基的书籍,涵盖底层范式、认知科学、决策理论、多智能体协作、组织管理及哲学对齐六大板块。作者强调 Agent 时代的盲区在于认知层,建议按需阅读,认为读完这些书能看穿当前 90% 的 Agent 创业本质是在重复旧思想。
文章探讨了 Anthropic、OpenAI 和 DeepSeek 等顶尖 AI 实验室在 2026 年关于强化学习(RL)的趋同思路,即使用系统提示作为奖励函数。内容详细梳理了 RL 在 LLM 中的应用历程,从 RLHF 到 RULER(Karpathy 提出的系统提示学习概念)的演变。重点介绍了 DeepSeek R1 利用可验证奖励(RLVR)突破传统瓶颈的机制,通过规则编译器直接提供信号,并结合 GRPO 算法移除了复杂的 Critic 和奖励模型,实现了从 15.6% 到 77.9% 的 AIME 数学成绩飞跃。
文章介绍了 LeWorldModel (LeWM),一种新的世界模型架构。它解决了当前世界模型(如 DINO-WM 和 PLDM)的局限,仅通过两个损失项(Next-embedding 预测损失和 SIGReg)实现了从原始像素开始的稳定端到端训练。实验表明,LeWM 能在潜在空间中自发涌现出时间直线性和物理约束,有效避免了表示偏差和模型崩塌问题。
这是一份针对计算机科学和数学专业大二学生的机器学习(ML)与强化学习(RL)入门阅读清单。清单分为四个部分:基础(如ResNet、Attention)、AI基础设施(如VAE、BERT、LoRA、Agent)、推理加速(如Linear Attention、Speculative Decoding)以及强化学习(如PPO、DPO、RLHF)。该列表由导师 Mingyang Yi 推荐,旨在帮助本科生构建系统的 AI 知识体系。
本文介绍了如何利用开源生态系统构建一个持续学习的编码代理系统。作者基于 Prime Intellect 平台和 OpenCode 环境,创建了一套批量增量式在线强化学习流程,通过 Git 快照收集真实交互数据(约 21.8 亿条记录),并在沙箱环境中进行模型训练与部署,旨在实现代码生成的个性化与自我进化。
文章讲述了OpenAI核心工程师翁家翌的职业成长与理念。作为强化学习基础设施的搭建者,他坚持“工程重于学术”,认为读博是浪费生命,并致力于通过开源代码消除信息差。文章分享了他从清华到CMU再到OpenAI的经历,以及对年轻人的职业建议:尽早进入工业界,深耕工程能力,建立自己的评价体系。