OpenRLHF 作者发布 Agentic RL 框架 Molt:9K 行核心代码支持超大规模 MoE 训练 ✍ 青稞社区🕐 2026-07-16📦 10.2 KB 🟢 已读 𝕏 文章列表 OpenRLHF 作者发布了新的强化学习框架 Molt。该框架采用纯 PyTorch 栈,核心代码仅约 9000 行,专注于 Agentic RL 研究。它支持 Qwen3.5-397B 到 GLM-5.2 753B 等超大规模 MoE 模型训练,无需依赖 Megatron,具备高度的代码可读性和可修改性。 强化学习Agentic RLMoltPyTorchvLLMMoEOpenRLHF大模型训练深度学习框架 # OpenRLHF 作者又造一个 RL 框架!Agentic RL Research 框架 Molt:9K 行核心 RL 代码、纯 PyTorch **作者**: 青稞社区 **日期**: 2026-07-16T01:44:44.000Z **来源**: [https://x.com/qingke_ai/status/2077570093245145233](https://x.com/qingke_ai/status/2077570093245145233) ---  # TL;DR Molt 是一个 agentic-first、纯 PyTorch-Native 的强化学习框架: - 约 9,000 行核心 RL 代码,你能一口气从 CLI 追到执行分支; - 却能训练从 Qwen3.5-397B 到 GLM-5.2 753B 这样的超大规模 MoE; - 整个栈只有三个 PyTorch 原生组件:Ray(编排)· vLLM(rollout)· NVIDIA AutoModel + FSDP2(训练),全程不依赖 Megatron; - 智能体就是你写的一段 Python,奖励也是 —— 多轮工具、多模态 VLM、LLM-as-judge 全是一等公民。 # 一、先说痛点:为什么又要造一个 RL 框架? 如果你真的拿大模型跑过 agentic RL,大概都体会过这种无力感: 想验证一个想法 —— 换个奖励、加个工具调用、调一下 off-policy 的处理方式 —— 结果打开框架一看,五万行起步,和 Megatron 深度缠绕,想改一行得先啃一周源码,改完还不确定有没有踩到隐藏的控制流。 主流框架为了「什么都能做」,把复杂度堆到了研究者读不动、也不敢动的地步。但研究的本质是快速试错:你需要的是一个能看懂、改得动、又不掉规模的框架。 Molt 就是奔着这个矛盾去的:把 agentic RL 做小,但不做弱。 # 二、Molt 是什么 一句话:智能体即程序,训练器只是一个可训练的 actor,奖励是你写的任意 Python。 它把一个完整的 RL 后训练系统压缩到三个概念上: - 一个 agent API(Gymnasium 风格的 Env / ChatAgent); - 一个可训练 actor(PyTorch + AutoModel/FSDP2); - 一条异步循环(Ray 编排 rollout ↔ training)。 就这些。没有 Megatron,没有一层套一层的抽象,没有你追不到底的隐藏调度。 # 三、架构:三个盒子,一条异步循环  整个运行时就是 Ray Runtime(全异步) 下的四块,靠一条异步循环串起来: 1、 vLLM Router / Rollout —— 高吞吐生成,连续批处理,专家并行(EP 可达 256),负责把 token 路由到各个 vLLM engine; 2、 Agent(Environment / ChatAgent) —— 你的程序:Gymnasium API、多轮、工具、VLM、打分器、模拟器、API server; 3、 Ray Queue(Agent → Trainer) —— 缓冲轨迹、调度负载、背压与容错; 4、 RL Trainer(Single Actor) —— 计算 advantage、更新策略,跑在 PyTorch / FSDP2 / NVIDIA AutoModel 上。 数据流是 token-first 的:token id、logprob、action range、reward、多模态张量,从 rollout 到 training 全程对齐。而 权重同步是异步的(NCCL),trainer 更新完的权重异步刷回 vLLM router。 一句话概括这张图右下角的那颗星:Scales to Frontier MoE —— DeepSeek-V3,EP = 256,1T 级 MoE 直接跑在 vLLM 上。 # 四、核心设计:轻在哪,硬在哪 4.1 Agentic-first:智能体即程序 多数框架把「多轮 / 工具 / 多模态」当成事后拼接的插件。Molt 反过来:agent 就是你写的那段 Python,框架只负责在它外面跑异步的 rollout↔train 循环。 奖励?任意 Python 都行 —— 规则、启发式、LLM-as-judge、工具返回、模拟器信号。而且 LLM-as-judge 的调用会走回同一批驱动 rollout 的 vLLM engine,不用你再单独起一套推理。 ``` # Agent API (Gymnasium 对齐) obs, info = env.reset(seed) for t in range(T): action = agent.act(obs, info) obs, reward, done, info = env.step(action) ``` 也支持 OpenAI/Anthropic 接口黑盒访问环境。 Molt 会自动追踪背后的 token in token out 路径。 ``` from openai import AsyncOpenAI from molt.agents import ChatAgent, ChatAgentRunner, ChatContext, Result class MyAgent(ChatAgent): async def run(self, ctx: ChatContext) -> Result: # ctx.base_url carries the session id and auto-captures the token # trace — no extra_body, no logprobs=True, no session plumbing. client = AsyncOpenAI(base_url=ctx.base_url, api_key=ctx.api_key) resp = await client.chat.completions.create( model=ctx.model_name, messages=[{"role": "user", "content": ctx.prompt}], max_tokens=ctx.sampling_params.max_tokens, temperature=ctx.sampling_params.temperature, ) return Result(reward=grade(resp.choices[0].message.content, ctx.label)) class AgentRunner(ChatAgentRunner): def __init__(self): super().__init__(MyAgent) ``` 4.2 纯 PyTorch 栈:Ray + vLLM + AutoModel,不碰 Megatron - Ray 管放置和异步队列 —— 这就是整个运行时; - vLLM 管 rollout —— 连续批处理、高吞吐、动态扩缩; - NVIDIA AutoModel + FSDP2 管训练 —— MoE-native、TE 融合注意力、自定义并行化器,全程纯 PyTorch。 没有 Megatron 依赖,意味着你能把训练侧的每一步都读懂并改动,而不是隔着一层黑箱。 4.3 规模:从 397B 到 753B 轻量不等于跑不动大的。同一套约 9K 行的代码: - TP · EP · CP(可选 DP)并行,通信/计算重叠; - 已在 Qwen3.5-397B 上验证; - 一路扩到 GLM-5.2 753B 级 MoE; - 极限规模上,DeepSeek-V3 跑在 --fsdp.ep_size 256,最大 actor 支持优化器 CPU offload。 从单卡实验到千亿级 MoE,同一份代码,平滑扩展。 4.4 训推一致性:vllm_kl 与重要性采样矫正(硬核) 这是 Molt 我最想单独拎出来讲的部分,也是异步 RL 里最容易翻车、最难 debug 的地方。 异步 / partial rollout 会让 训练侧(FSDP actor 重算)的 logprob 和 推理侧(vLLM 生成时)的 logprob 产生偏差 —— 因为算子不同、还有一次 HTTP router 观察不到的权重切换。 Molt 用一个专门的指标 vllm_kl(= mean(rollout_logprob − actor_logprob),在 action token 上)把这个失配量化出来,并用逐 token 的重要性采样比 pi_train / pi_rollout 去矫正它。 矫正被拆成两个正交的旋钮: - --algo.advantage.is_correction_level {off, token, seq, geo} —— 被门控比值的粒度; - --algo.advantage.is_correction_mode {mask, clip, trunc} —— 出带后怎么处理。 默认的 geo × mask(几何均值过滤整条 + 存活 token 用逐 token IS 权重)对应业界的 seq-mask-tis;token × trunc/mask 覆盖 TIS / IcePop;seq/geo 则对应 masked importance sampling 一脉。这套东西的存在,本身就说明 Molt 是被「真的拿去训大模型」打磨出来的,而不是一个玩具。 4.5 MoE 路由稳定性:R3 MoE 训练最隐蔽的坑之一:vLLM 和 actor 把同一个 token 路由到了不同的专家,导致训推 logprob 悄悄发散。Molt 提供: - Router Replay(R3):捕获 rollout 时 vLLM 的逐 token top-k 专家选择,在训练 forward 里原样回放,让训练和 rollout 的路由对齐; - Router Freeze:直接冻住 gate/router 权重,从源头消除漂移。 4.6 全异步 rollout - --train.async_queue_size 解耦 rollout 与 training; - --train.partial_rollout_enable 让生成在权重同步时用 vLLM pause/resume 继续,和训练重叠; - 想严格 on-policy?一个 flag 切回同步。 # 五、能力矩阵 # 六、和 verl / slime / OpenRLHF 比,Molt 的位置 不是说别的框架不好 —— verl / slime / OpenRLHF 都很强。Molt 的差异化只有一句: > 别人几万行、深绑 Megatron;Molt 约 9K 行核心 RL 代码、纯 PyTorch,还是能扛到几百 B MoE。 它不追求「功能最全」,追求的是 「读得懂、改得动、又不掉规模」 这个别人很少同时给到的组合。对研究者来说,这往往比多几个开关重要得多。 # 七、快速上手 ``` python3 -m molt.cli.train_rl_ray \ --actor.model_name_or_path /path/to/automodel \ --data.prompt_dataset /path/to/prompts.jsonl \ --train.agent_path examples/python/agents/math.py \ --vllm.num_engines 2 --vllm.tensor_parallel_size 2 \ --rollout.batch_size 128 --train.batch_size 128 \ --algo.advantage.estimator reinforce \ --fsdp.attn_implementation te \ --ckpt.output_dir ./ckpt/rl ``` SFT 走同一套 AutoModel/FSDP2 加载路径;想上几百 B 的 MoE,把 --fsdp.ep_size / cp_size 调上去即可。 仓库里 examples/scripts/ 有从 Qwen3-4B 到 397B/753B 的现成 recipe。 # 八、这个框架适合谁 - 你想从想法直达实验,而不是先和一个五万行、绑 Megatron 的栈搏斗; - 你在做 agentic / 多轮 / 多模态 RL,需要奖励是任意 Python、工具和 judge 都能直接塞进去; - 你要训几百 B 的 MoE,但又想保留「整份代码读得懂、改得动」的能力; - 你在意训推一致性这种异步 RL 的深水区问题,想要一个把 vllm_kl / IS 矫正 / 路由回放当一等公民的框架。 # 结语 Molt 的设计信条很简单:人能一遍读懂的代码优先;智能体是程序,训练器是一个 actor,奖励是 Python。 几百 B 不该是重型框架的专利,这一次,约 9K 行就够了。 如果它帮到了你的研究,欢迎点 star、提 issue、引用技术报告。 代码:https://github.com/NVIDIA-NeMo/labs-molt 技术报告: https://www.researchgate.net/publication/409325071_Molt_A_Scalable_PyTorch-Native_Training_Framework_for_Agentic_Reinforcement_Learning ## 相关链接 - [青稞社区](https://x.com/qingke_ai) - [@qingke_ai](https://x.com/qingke_ai) - [https://github.com/NVIDIA-NeMo/labs-molt](https://github.com/NVIDIA-NeMo/labs-molt) - [https://www.researchgate.net/publication/409325071_Molt_A_Scalable_PyTorch-Native_Training_Framework_for_Agentic_Reinforcement_Learning](https://www.researchgate.net/publication/409325071_Molt_A_Scalable_PyTorch-Native_Training_Framework_for_Agentic_Reinforcement_Learning) - [Upgrade to Premium](https://x.com/i/premium_sign_up) - [9:44 AM · Jul 16, 2026](https://x.com/qingke_ai/status/2077570093245145233) - [4,031 Views](https://x.com/qingke_ai/status/2077570093245145233/analytics) --- *导出时间: 2026/7/16 14:45:12*
K K3 部署推理引擎指南 vLLM 宣布对 Kimi K3 模型提供首日支持。K3 是拥有 2.8 万亿参数的 MoE 模型,支持 100 万上下文窗口。vLLM 通过 DSpark 推测解码将吞吐量提升至 370 tok/s,并支持架构创新的混合缓存管理、预填充/解码分离及智能体服务,确保生产环境下的高性能与低延迟。 技术 › 后端 ✍ vLLM🕐 2026-07-28 vLLMKimi K3MoE推理引擎性能优化DSpark部署指南大模型基础设施
强 强化学习沉浮史:从深度寒冬到大模型封神 文章回顾了强化学习七十年跌宕起伏的发展历程。从心理学的效果律与数学的动态规划这两条根源讲起,梳理了教科书时期的理论奠基与早期边缘化。随后,深度学习的引爆带来了黄金年代,DQN与AlphaGo的辉煌让强化学习备受推崇。然而,样本效率等缺陷曾让其一度跌入谷底。如今,这门学科在大模型时代通过RLHF等技术奇迹般重生,再次站到了AI舞台的中央。 技术 › LLM ✍ snowboat🕐 2026-07-23 强化学习深度学习AlphaGo大模型RLHFAI历史萨顿动态规划深度学习OpenAI
关 关于 Inkling 的数学思考 本文从深度流形视角分析 Thinking Machines 的多模态模型 Inkling。探讨了模态早期耦合、放弃 RoPE 的几何意义、Muon 的归一化作用以及大规模强化学习对流形同调的影响,提出了关于数据耦合和训练稳定性的开放问题。 技术 › LLM ✍ deep Manifold🕐 2026-07-22 多模态Inkling流形学习RoPEMuon强化学习深度学习Transformer几何归一化
P PyTorch 训练流程速查表 这是一份关于 PyTorch 训练流程的单页速查表。文章通过代码示例和原理解析,深入浅出地讲解了张量的核心概念、矩阵乘法、自动求导机制、反向传播以及梯度下降优化过程。同时涵盖了 `nn.Module` 常用组件如 Linear、ReLU 和 GELU 的使用,旨在帮助开发者快速理解深度学习引擎的运作原理。 技术 › 编程语言 ✍ kozue🕐 2026-07-03 PyTorch深度学习教程张量Autograd机器学习速查表矩阵乘法反向传播Python
人 人工智能的工程全景(中):推理,后训练,对齐和安全 本文是AI工程全景的中篇,深入探讨了模型训练完成后的工程化路径。首先详述了推理优化的核心手段,包括模型瘦身(量化、蒸馏、剪枝、MoE)、投机解码以及主流推理引擎(vLLM, TensorRT-LLM, SGLang)的生态格局。文章分析了成本、延迟与吞吐的“不可能三角”,并重点介绍了“测试时计算”这一范式转变,即通过在推理阶段增加计算量来动态提升模型智能。 技术 › LLM ✍ snowboat🕐 2026-07-03 LLM推理优化量化投机解码测试时计算MoEvLLMAI工程
如 如何从零开始构建自己的大语言模型 (LLM) 文章揭秘了 GPT、Claude 等 LLM 背后通用的五阶段构建流程,指出数据质量而非架构才是核心。作者详细阐述了数据清洗、分词、训练目标(预测下一个 Token)及 Transformer 架构实现,并提供了包含 Tokenizer 和 PyTorch 模型的代码示例。 技术 › LLM ✍ Rahul🕐 2026-06-14 LLMTransformer深度学习模型训练分词PythonPyTorch源码解析方法论
什 什么是世界模型?概念溯源、流派划分与AI新前沿 本文深入探讨了当前AI领域的热门概念“世界模型”。文章梳理了该概念从1943年心理学起源到2024年爆发式发展的历史脉络,详细区分了两大核心阵营:用于行动的模型(如DreamerV3和JEPA)与用于呈现的模型(如Sora和视频生成)。文中分析了杨立昆、李飞飞及OpenAI等不同派别的技术路径与定义之争,揭示了世界模型如何成为超越大语言模型的下一代AI竞争焦点。 技术 › LLM ✍ snowboat🕐 2026-06-09 世界模型AI杨立昆Sora强化学习Agent深度学习技术趋势概念科普
2 2026年强化学习面试题库:算法与基础设施 本文汇总了35道2026年强化学习(RL)领域的面试核心问题。内容涵盖算法与基础设施两大方向,既包括PPO、GRPO等训练机制的原理探讨,也涉及分布式推理、显存优化等工程落地细节。作者强调现代RL岗位需要具备全栈理解能力,建议面试者不仅要熟记问题,更需深究背后的技术逻辑。 技术 › LLM ✍ Xiuyu Li🕐 2026-06-08 RL面试PPOGRPODeepSeekMoE基础设施算法强化学习大模型
M Mixture of Experts (MoE): Scaling AI with Specialized Models 文章深入探讨了混合专家模型(MoE),这是一种通过激活特定子网络来高效扩展 AI 模型的架构策略。文章回顾了 MoE 的历史背景,详细解释了其由门控网络和专家组成的结构及稀疏路由机制,并分析了其在 Transformer 中的应用、优势(如高效计算、参数扩展)以及面临的负载平衡和通信开销等挑战。 技术 › LLM ✍ Jayanth🕐 2026-05-07 MoE混合专家大模型架构设计Transformer稀疏路由AI深度学习模型扩展机器学习
O OpenAI 论文解读:VPT 视频预训练模型 文章介绍了 OpenAI 的 VPT(Video PreTraining)论文,该研究通过训练反向动力学模型(IDM)为海量无标注互联网视频打上伪标签,成功让 AI 智能体在 Minecraft 中学会了制作钻石镐等复杂任务。文章详细阐述了 VPT 的“少量标注撬动海量数据”的技术路线、三阶段训练过程以及其带来的数据杠杆效应,并探讨了该方法从游戏向机器人控制迁移的潜力和局限性。 技术 › OpenAI ✍ Mr Panda🕐 2026-05-06 OpenAIVPT强化学习行为克隆机器学习AI智能体论文解读深度学习视频预训练IDM
什 什么是世界模型?(WTF is a World Model?) 本文深入探讨了人工智能领域热门概念“世界模型”。文章指出世界模型是一个问题陈述而非特定架构,类似于SLAM。文章通过自动驾驶案例阐述了Yann LeCun的形式化定义(状态预测与渲染分离),并对比了当前三种主流范式:生成式模型(如Sora)、潜在动力学模型(如Dreamer)以及JEPA架构,分析了它们在压缩策略和预测目标上的差异。 技术 › LLM ✍ Vai Viswanathan🕐 2026-05-02 世界模型Yann LeCun机器人技术SoraDreamerJEPA深度学习强化学习
A AI/ML 所需的线性代数知识(完整路线图) 本文旨在消除从事 AI/ML 工作对数学博士学位的恐惧,提供了一份精准的线性代数学习路线图。文章分为五个阶段:从标量、向量、矩阵等基础概念,到特征值、SVD(奇异值分解)等核心机器学习数学工具,再到连接微积分的梯度与雅可比矩阵。作者强调了掌握这些概念对于理解神经网络、PCA、推荐系统及 LoRA 微调等技术的重要性。 技术 › LLM ✍ vixhaℓ🕐 2026-04-24 人工智能机器学习线性代数数学基础SVD深度学习学习路线矩阵PyTorch张量