📚 Wiki 知识库

🏷️ MoE

16 篇

从 Kimi K3 看下一代 MoE 架构的转折点:LatentMoE

文章分析了 2026 年大模型架构的新趋势 LatentMoE。通过对比 NVIDIA Nemotron 3 Super 和 Moonshot AI Kimi K3,揭示了 LatentMoE 如何通过将 token 投影到低维潜在空间,大幅降低内存和通信开销,从而在同等推理成本下激活更多专家,提升模型性能与效率。

技术LLM ✍ 青稞社区🕐 2026-07-20

OpenRLHF 作者发布 Agentic RL 框架 Molt:9K 行核心代码支持超大规模 MoE 训练

OpenRLHF 作者发布了新的强化学习框架 Molt。该框架采用纯 PyTorch 栈,核心代码仅约 9000 行,专注于 Agentic RL 研究。它支持 Qwen3.5-397B 到 GLM-5.2 753B 等超大规模 MoE 模型训练,无需依赖 Megatron,具备高度的代码可读性和可修改性。

技术LLM ✍ 青稞社区🕐 2026-07-16

人工智能的工程全景(中):推理,后训练,对齐和安全

本文是AI工程全景的中篇,深入探讨了模型训练完成后的工程化路径。首先详述了推理优化的核心手段,包括模型瘦身(量化、蒸馏、剪枝、MoE)、投机解码以及主流推理引擎(vLLM, TensorRT-LLM, SGLang)的生态格局。文章分析了成本、延迟与吞吐的“不可能三角”,并重点介绍了“测试时计算”这一范式转变,即通过在推理阶段增加计算量来动态提升模型智能。

技术LLM ✍ snowboat🕐 2026-07-03

实测美团 LongCat-2.0:国产芯片万亿模型的实用价值

本文实测了美团发布的基于 5 万张国产算力芯片训练的万亿参数大模型 LongCat-2.0。文章指出,该模型在预训练到大规模部署的全流程中实现了国产算力闭环,具有里程碑意义。虽然通用推理能力与顶级闭源模型仍有差距,但在 Terminal-Bench 和 SWE-bench Pro 等 Agent 与编程任务中表现强劲。作者实测了将其接入 Claude Code 和 Codex 进行工作流处理,结果显示其在长上下文处理和任务拆解上表现稳定,为开发者提供了一个可行的非国产替代方案。

技术LLM ✍ 卡尔的AI沃茨🕐 2026-07-02

2026年强化学习面试题库:算法与基础设施

本文汇总了35道2026年强化学习(RL)领域的面试核心问题。内容涵盖算法与基础设施两大方向,既包括PPO、GRPO等训练机制的原理探讨,也涉及分布式推理、显存优化等工程落地细节。作者强调现代RL岗位需要具备全栈理解能力,建议面试者不仅要熟记问题,更需深究背后的技术逻辑。

技术LLM ✍ Xiuyu Li🕐 2026-06-08

DeepSeek 的 10 万亿美元大战略:技术、算力与国产芯片的未来

本文深入分析了 DeepSeek 如何通过 MLA、MoE、mHC 等一系列底层技术创新,极大幅度降低大模型对 HBM(高带宽内存)和先进 GPU 制程的依赖。文章指出,DeepSeek 的战略并非局限于软件订阅,而是旨在通过算法优化盘活中国产能充足的 NAND 闪存和 LPDDR 产业,以此构建一套独立于西方之外的 AI 硬件生态,最终撬动价值 10 万亿美元的产业巨兽。

技术LLM ✍ 宝玉🕐 2026-05-24

Mixture of Experts (MoE): Scaling AI with Specialized Models

文章深入探讨了混合专家模型(MoE),这是一种通过激活特定子网络来高效扩展 AI 模型的架构策略。文章回顾了 MoE 的历史背景,详细解释了其由门控网络和专家组成的结构及稀疏路由机制,并分析了其在 Transformer 中的应用、优势(如高效计算、参数扩展)以及面临的负载平衡和通信开销等挑战。

技术LLM ✍ Jayanth🕐 2026-05-07

别再迷信参数量:中国开源模型在硅谷踢馆成功

文章记录了作者利用中国开源模型 MiniMax M2.5(仅 10B 激活参数),通过行为工程和 Goose 运行时的优化,在 Databricks OfficeQA 基准测试中以 71.5% 的准确率击败了 Claude Opus 4.5 的实战经历。文章指出,企业级 AI 的竞争已从单纯的模型参数量转向行为工程与驾驭层能力,并揭示了中美 AI 生态(中国执行引擎+美国编排方法论)结合所产生的高效低成本优势。

技术LLM ✍ 柳文浩🕐 2026-05-06

DeepSeek V4是怎么训练出来的?58页论文深入解读

文章深入解读了DeepSeek V4论文,指出其核心价值在于将百万上下文、Agent原生能力与低价格结合,抬高了AI应用的地板。技术层面,V4通过mHC稳定残差连接,采用CSA+HCA混合注意力机制解决长上下文算力难题,并用Muon优化器替代AdamW。此外,文章还详细介绍了其1.6T参数量的训练稳定性技巧、反AI坍缩的数据构建以及基于“Specialist + OPD”的后训练范式转变。

技术LLM ✍ 花叔🕐 2026-04-25

GLM-5.1、Qwen 3.6 Max 与 Kimi 2.6 国产大模型横向评测与选型指南

文章对 2026 年上半年三款国产旗舰大模型(智谱 GLM-5.1、阿里 Qwen 3.6 Max、月之暗面 Kimi 2.6)进行了深度横向对比。分析涵盖核心技术参数、能力评测及商业定价,指出各模型分别在自主编程、通用全能与长文本协作领域的优势,并针对不同业务场景提供了具体的技术选型建议。

技术LLM ✍ yishan🕐 2026-04-22

Gemma4 选型指南:8个模型该选哪个?

Google 发布 Gemma4 系列开放权重模型,本文为本地部署选型指南。文章解析了 '-it' 指令微调版与基版的区别,以及 E4B/E2B 移动端优化技术(Per-Layer Embeddings)的原理。针对不同场景推荐模型:本地对话选 26B-A4B(MoE 激活 4B);写代码选 31B;语音助手选 E4B;树莓派尝鲜选 E2B。

技术LLM ✍ karminski-牙医🕐 2026-04-03

为什么程序员钟爱Codex,Vibe Coding的人却离不开Claude?一文弄懂它!

文章深入探讨了 AI 辅助编程领域中 Codex 与 Claude 的差异化定位。Codex 采用 MoE 架构,以模块化和高精准度成为传统程序员修复 Bug 和重构代码的利器;而 Claude 基于 Dense 架构,凭借全脑激活的细腻逻辑和对自然语言的深度理解,成为“Vibe Coding”用户进行创意原型开发的首选。文章最后建议在实际工作流中混合使用,取长补短。

技术LLM ✍ Berryxia.AI🕐 2026-03-31