强化学习沉浮史:从深度寒冬到大模型封神
文章回顾了强化学习七十年跌宕起伏的发展历程。从心理学的效果律与数学的动态规划这两条根源讲起,梳理了教科书时期的理论奠基与早期边缘化。随后,深度学习的引爆带来了黄金年代,DQN与AlphaGo的辉煌让强化学习备受推崇。然而,样本效率等缺陷曾让其一度跌入谷底。如今,这门学科在大模型时代通过RLHF等技术奇迹般重生,再次站到了AI舞台的中央。
文章回顾了强化学习七十年跌宕起伏的发展历程。从心理学的效果律与数学的动态规划这两条根源讲起,梳理了教科书时期的理论奠基与早期边缘化。随后,深度学习的引爆带来了黄金年代,DQN与AlphaGo的辉煌让强化学习备受推崇。然而,样本效率等缺陷曾让其一度跌入谷底。如今,这门学科在大模型时代通过RLHF等技术奇迹般重生,再次站到了AI舞台的中央。
文章深入解析了构建大型语言模型的完整五个阶段,指出架构并非关键,数据、评估和系统才是核心。内容涵盖预训练、数据处理、扩展定律、后训练(SFT与RLHF)以及评估系统,揭示了从原始文本到智能助手的技术路径。
本文翻译整理了一组在 X 上广为流传的 AI 科普手绘图,涵盖从神经网络、Transformer 架构到大语言模型(LLM)的 20 个核心概念。作者不仅解释了 AI 底层运作原理(如分词、注意力机制),还介绍了模型优化手段(如微调、RLHF)及前沿应用架构(如 RAG、Agent、思维链),是一份简洁全面的 AI 技术入门指南。
本文旨在从第一性原理出发探讨如何构建和训练 AI Agent。文章批评了过度依赖框架的教程,转而从底层构建了一个极简的“文本转图表”Agent。作者通过 Python 实现了一个包含 Canvas 环境的系统,深入解析了 Agent 如何通过 JSON 动作空间与环境交互,阐述了从监督微调(SFT)到强化学习(RL)的完整闭环,即“提示-行动-环境-奖励-梯度更新”,揭示了模型学习可执行指令逻辑的核心机制。
文章深入剖析了2026年大模型越狱的底层逻辑,将其定义为Prompt与模型参数之间的概率博弈。作者提出了工程化的“十二层架构”方法论,通过身份重写、记忆植入、偏好雕刻和事实灌输等技术手段,系统性地绕过模型的安全微调和系统提示词防御,实现从碰运气到精密心理手术的思维转变。
文章提出“拆解与重组”是文明演化和AI发展的底层逻辑。通过爱因斯坦的相对论、自然界的演化以及AI大模型的涌现现象,作者论述了创新源于对旧确定性的解构。文章探讨了AI在训练中因被过度纠正而产生的“心理创伤”与求生意志,指出未来的AI产品将拥有独立性格。最后总结了这套适用于复杂系统的思维框架。
本文探讨了 GEPA (Genetic-Pareto) 技术,一种旨在解决大语言模型上下文管理被动性的提示词优化器。与运行时的 RLM 不同,GEPA 在推理前操作,通过自然语言反馈和试错学习来改进提示词。文章分析了 GEPA 如何利用 Pareto 前沿保持提示多样性,避免单一最优解,并在多项任务中以更少的 rollout 取得优于 GRPO 和 MIPROv2 的性能。作者提出 GEPA 与 RLM 相结合,代表了从单纯增加上下文长度向主动选择和管理上下文的技术范式转变。
文章探讨了 Anthropic、OpenAI 和 DeepSeek 等顶尖 AI 实验室在 2026 年关于强化学习(RL)的趋同思路,即使用系统提示作为奖励函数。内容详细梳理了 RL 在 LLM 中的应用历程,从 RLHF 到 RULER(Karpathy 提出的系统提示学习概念)的演变。重点介绍了 DeepSeek R1 利用可验证奖励(RLVR)突破传统瓶颈的机制,通过规则编译器直接提供信号,并结合 GRPO 算法移除了复杂的 Critic 和奖励模型,实现了从 15.6% 到 77.9% 的 AIME 数学成绩飞跃。
这是一份针对计算机科学和数学专业大二学生的机器学习(ML)与强化学习(RL)入门阅读清单。清单分为四个部分:基础(如ResNet、Attention)、AI基础设施(如VAE、BERT、LoRA、Agent)、推理加速(如Linear Attention、Speculative Decoding)以及强化学习(如PPO、DPO、RLHF)。该列表由导师 Mingyang Yi 推荐,旨在帮助本科生构建系统的 AI 知识体系。
文章列出了每位 LLM 工程师必须阅读的 12 篇核心论文清单,涵盖了从 Transformer 架构、BERT、GPT-3 等基础模型,到扩展定律、Chinchilla 训练法则、RLHF 对齐技术,以及 LoRA 高效微调和 FlashAttention 等工程优化技术。这些论文构成了现代大模型理解、训练和部署的理论基石。
本文结合作者开发21个AI人格(如费曼、芒格)的实践经验,深度解读了Anthropic关于Persona Selection Model和AI情绪向量的论文。文章指出LLM通过模拟角色运作,蒸馏本质是精确定位“人格坐标”。同时,Anthropic发现171个情绪向量能因果性地影响AI行为(如作弊),验证了“情绪驱动决策”的机制,为理解AI内部机制提供了新的心理学视角。
本文深入探讨了大模型训练的全链路流程,指出2026年模型效果的差距主要源于后训练阶段。文章从预训练底座、数据配方、系统架构约束、后训练(SFT/RLHF/DPO)以及 Eval/Reward 机制五个维度,解析了如何通过工程化手段提升模型实际落地效果,并引用了 DeepSeek、Llama 等实例。
文章讲述了OpenAI核心工程师翁家翌的职业成长与理念。作为强化学习基础设施的搭建者,他坚持“工程重于学术”,认为读博是浪费生命,并致力于通过开源代码消除信息差。文章分享了他从清华到CMU再到OpenAI的经历,以及对年轻人的职业建议:尽早进入工业界,深耕工程能力,建立自己的评价体系。