📚 Wiki 知识库

🏷️ 后训练

4 篇

SFT、RL 与 On-Policy 蒸馏:原理与差异

本文深入探讨了模型后训练中的 SFT 与 RL 流程,重点分析了基于同族模型(Same-family)的 On-Policy 蒸馏(OPD)技术。文章解释了 SFT 存在性能天花板的原因,以及 RL 如何通过复利效应突破这一限制。作者指出 OPD 结合了 SFT 的低成本和 RL 的复合优势,能高效利用教师模型的反向 KL 散度信号,是实现高性能模型微调的关键手段。

技术LLM ✍ will brown🕐 2026-05-01

DeepSeek V4是怎么训练出来的?58页论文深入解读

文章深入解读了DeepSeek V4论文,指出其核心价值在于将百万上下文、Agent原生能力与低价格结合,抬高了AI应用的地板。技术层面,V4通过mHC稳定残差连接,采用CSA+HCA混合注意力机制解决长上下文算力难题,并用Muon优化器替代AdamW。此外,文章还详细介绍了其1.6T参数量的训练稳定性技巧、反AI坍缩的数据构建以及基于“Specialist + OPD”的后训练范式转变。

技术LLM ✍ 花叔🕐 2026-04-25

罗福莉:AI 范式已然巨变!OpenClaw 与 Agent 时代的深度解析

本文详细介绍了小米大模型负责人罗福莉关于 AI 行业发展趋势的深度见解。罗福莉指出,2026 年 AI 的核心已从预训练主导的 Chatbot 时代转向后训练主导的 Agent 时代。文章重点分析了 OpenClaw 框架的划时代意义,其通过分层记忆和模型编排弥补了短板,实现了极致的生产力提升。此外,还探讨了后训练算力权重的增加、团队组织方式的变革以及未来 AGI 的实现路径。

技术Agent ✍ Saito🕐 2026-04-24

你不知道的大模型训练:原理、路径与新实践

本文深入探讨了大模型训练的全链路流程,指出2026年模型效果的差距主要源于后训练阶段。文章从预训练底座、数据配方、系统架构约束、后训练(SFT/RLHF/DPO)以及 Eval/Reward 机制五个维度,解析了如何通过工程化手段提升模型实际落地效果,并引用了 DeepSeek、Llama 等实例。

技术LLM ✍ Tw93🕐 2026-04-03