📚 Wiki 知识库

🏷️ RL

6 篇

如何教授 AI 模型

文章通过人类学习的类比,通俗易懂地解释了 AI 模型如何学习新技能和行为。它涵盖了从预训练、监督微调到强化学习的三个阶段,以及通过基准测试评估模型和通过模型规范对齐模型行为的重要性,最后指出了当前模型在持续学习方面的局限性。

技术LLM ✍ Lee Robinson🕐 2026-07-24

如何从头构建一个 RL 环境:以 Othello 游戏为例

本文介绍了如何使用 Prime Intellect 的 Verifiers 框架从零开始构建一个用于强化学习(RL)的 Othello(黑白棋)游戏环境。文章解释了 RL 循环的基本组成部分(状态、动作、奖励、环境),并利用 GRPO 算法替代传统的人工偏好模型。文中详细展示了技术栈、游戏循环逻辑以及内置的 Minimax 对手引擎代码,旨在帮助开发者理解并掌握构建模型无关的 RL 环境的核心方法。

技术Agent ✍ Akshay🕐 2026-07-07

2026年强化学习面试题库:算法与基础设施

本文汇总了35道2026年强化学习(RL)领域的面试核心问题。内容涵盖算法与基础设施两大方向,既包括PPO、GRPO等训练机制的原理探讨,也涉及分布式推理、显存优化等工程落地细节。作者强调现代RL岗位需要具备全栈理解能力,建议面试者不仅要熟记问题,更需深究背后的技术逻辑。

技术LLM ✍ Xiuyu Li🕐 2026-06-08

打造公司大脑的一年经验总结

本文分享了作者构建“公司大脑”系统的经验。核心观点包括:企业智能将从单纯的知识库转向基于本体的记忆系统;公司记忆应自发于日常工作流而非简单的转录;系统需支持基于角色的多种本体视角,以解决不同部门对同一信息不同理解的问题;最终目标是建立企业的世界模型,通过强化学习机制,降低信息传递延迟,实现上下文实时感知与智能响应。

技术Agent ✍ Ashwin Gopinath🕐 2026-05-07

SFT、RL 与 On-Policy 蒸馏:原理与差异

本文深入探讨了模型后训练中的 SFT 与 RL 流程,重点分析了基于同族模型(Same-family)的 On-Policy 蒸馏(OPD)技术。文章解释了 SFT 存在性能天花板的原因,以及 RL 如何通过复利效应突破这一限制。作者指出 OPD 结合了 SFT 的低成本和 RL 的复合优势,能高效利用教师模型的反向 KL 散度信号,是实现高性能模型微调的关键手段。

技术LLM ✍ will brown🕐 2026-05-01

顶级AI实验室如何构建RL智能体:从RLHF到RULER的演进

文章探讨了 Anthropic、OpenAI 和 DeepSeek 等顶尖 AI 实验室在 2026 年关于强化学习(RL)的趋同思路,即使用系统提示作为奖励函数。内容详细梳理了 RL 在 LLM 中的应用历程,从 RLHF 到 RULER(Karpathy 提出的系统提示学习概念)的演变。重点介绍了 DeepSeek R1 利用可验证奖励(RLVR)突破传统瓶颈的机制,通过规则编译器直接提供信号,并结合 GRPO 算法移除了复杂的 Critic 和奖励模型,实现了从 15.6% 到 77.9% 的 AIME 数学成绩飞跃。

技术LLM ✍ Avi Chawla🕐 2026-04-28