从 Kimi K3 看下一代 MoE 架构的转折点:LatentMoE ✍ 青稞社区🕐 2026-07-20📦 8.2 KB 🟢 已读 𝕏 文章列表 文章分析了 2026 年大模型架构的新趋势 LatentMoE。通过对比 NVIDIA Nemotron 3 Super 和 Moonshot AI Kimi K3,揭示了 LatentMoE 如何通过将 token 投影到低维潜在空间,大幅降低内存和通信开销,从而在同等推理成本下激活更多专家,提升模型性能与效率。 LatentMoEKimi K3MoE架构设计大模型NVIDIAMoonshot AI推理优化量化负载均衡 # 从 kimi k3 看下一代 MoE 架构的转折点:LatentMoE **作者**: 青稞社区 **日期**: 2026-07-20T02:49:23.000Z **来源**: [https://x.com/qingke_ai/status/2079035914740019638](https://x.com/qingke_ai/status/2079035914740019638) ---  以 Kimi K3 与 Nemotron 3 Super 为例,看 MoE 架构如何在 2026 年完成一次关键的范式跳跃。 2026 年上半年,两件事同时发生:NVIDIA 发布了 120B 参数的 Nemotron 3 Super,Moonshot AI 发布了 2.8T 参数的 Kimi K3。两个体量差距悬殊的模型,却在架构上做了同一个选择——Latent MoE(潜在 MoE)。 在长远来看,潜在moe架构作为业界实现简洁,而性能高效的架构值得每个正在做基座模型的学者关注。 # MoE 遇到了什么问题? 过去几年,MoE 成为大模型扩展的主流路径。道理很直接:激活参数少,总参数多,计算量可控,能力却能堆得很高。DeepSeek-V4、kimi、Qwen3 都走的这条路。 但随着模型越做越大,一个隐藏的结构性问题开始显现。 每当一个 token 被路由到某个 Expert 时,系统需要从内存里把那个 Expert 的权重矩阵读出来——大小是 d × m,其中 d 是模型的隐藏维度。对于一个现代大模型,d 通常在 4096 到 7168 之间。同时,在多机分布式部署时,每次路由还需要做一次 All-to-All 通信,传输量也正比于 d。 当你想激活更多 Expert(提升质量)的时候,这两个开销都会线性放大。这就是传统 MoE 的结构性困境:你想更好,但代价太高。 NVIDIA 的研究者把这个问题分析得很透彻:如果想同时解决延迟和吞吐两个方向的瓶颈,唯一有效的切入点就是把隐藏维度 d 缩小。但 d 不能随意缩——模型的特征表达需要足够的维度,否则质量会崩。 这个约束下,LatentMoE 的思路就很清晰了:不要直接缩小 d,而是在进入 Expert 之前,先把 token 投影到一个更小的潜在空间 ℓ 里,让 Expert 在这个压缩空间里完成计算,最后再投影回来。 # LatentMoE 具体怎么做 操作上分三步: - token x(维度 d)通过一个可学习的下投影矩阵 W↓,压缩到低维潜在空间 ℓ(比如 1024,是 d 的四分之一) - 在 ℓ 维度里完成路由和 Expert 计算 - Expert 输出再通过上投影矩阵W↑ 投影回 d 维度  核心收益来自这个压缩比。Expert 的权重从 d×m 缩小到 ℓ×m,内存读取少了 4 倍;All-to-All 通信量也少了 4 倍。这 4 倍的节省用来做什么?用来部署更多 Expert,同时激活更多 Expert。 这就是 LatentMoE 的精髓:同等推理成本下,你能让模型同时咨询 4 倍多的专家,专家组合的空间指数级扩大,自然对应更细粒度的知识路由和更强的模型能力。 值得注意的一个细节:路由门控(Gate)、共享 Expert、注意力层,这些”非路由”的计算都保持在完整的 d 维度上,因为它们不是瓶颈所在,不值得为了压缩损失表达能力。 # LatentMoE 真的更好吗?有数据 这是一个很自然的疑问:压缩进潜在空间,信息损失了,准确率会不会下降? NVIDIA 的 LatentMoE 原论文给出了明确的对比结果。在相同参数量的 Transformer MoE 基线上,LatentMoE 在所有评测任务上准确率均更高——包括推理、知识、代码等维度。在 Hybrid Mamba-Attention MoE 架构上也复现了同样的结论。也就是说,同等参数量、同等推理成本,LatentMoE 的准确率稳定优于标准 MoE。  更直观的数据来自万亿参数规模的推算:如果标准 MoE 想追上 LatentMoE 的准确率,需要额外多堆 350B 参数。反过来理解,在准确率对齐的情况下,LatentMoE 推理速度最高可以快 3.5 倍。  当然,LatentMoE 不是免费的——它需要在 Expert 路由前后各加一层线性投影。但这个额外开销经实测约为 9%,远小于标准 MoE 追上精度所需的参数成本。一个 9% 的开销换来持续的准确率优势,这笔账算下来是非常划算的。 # 两个团队的不同实践 Nemotron 3 Super 的配置是 512 个 Expert,每个 token 激活 22 个(Top-22),潜在维度 ℓ=1024,相当于 d/4 的压缩比。对比类似规模的标准 MoE(通常是 Top-8),这意味着在相同推理成本下激活了将近 4 倍的 Expert。 NVIDIA 还配套了几项关键设计:Mamba-2 层承担主要的序列建模(线性时间复杂度,让 1M 上下文变得实用),少量 Transformer 注意力层作为”全局锚点”(处理需要精确关联召回的任务),以及共享权重的 Multi-Token Prediction 头(用于投机解码,平均接受长度 3.45,超过 DeepSeek-R1)。最终结果是:推理吞吐是 GPT-OSS-120B 的 2.2 倍,是 Qwen3.5-122B 的 7.5 倍,而准确率基本持平。 Kimi K3 把这件事做到了更极端的规模:896 个 Expert,每个 token 只激活 16 个(Top-16),稀疏比达到 56:1。在这种极端稀疏度下,Expert 负载均衡变成了训练能否稳定的核心问题。 K3 为此专门提出了 Quantile Balancing——不依赖启发式更新,直接从 Router 的 score 分位数推导专家分配,消除了传统方法里那些敏感的超参数。这使得在 2.8T 参数规模下保持训练稳定成为可能。最终收益是相对 Kimi K2 约 2.5 倍的 scaling efficiency——同等 compute 换来更多智能。 # 两条路线,同一方向 NVIDIA 的路线可以概括为”效率智能”——在尽量小的激活参数里装入尽量强的能力,适合高并发、低延迟的推理场景。Kimi 的路线是”极致规模”——用 LatentMoE 解锁了 2.8T 参数的训练可行性,用 Quantile Balancing 维持了这个规模下的训练健康。 但两者的底层逻辑是一样的:通过压缩 Expert 的计算维度,把省下来的资源转化为更大的专家组合空间。 # 往前看 LatentMoE 解决了一个具体的工程瓶颈,但它本身还有很大的提升空间。 当前实现用的是固定的压缩比(d/ℓ 是预设值)。一个自然的延伸是让压缩比变得自适应——对于信息密集的 token,保留更多维度;对于简单 token,压缩得更彻底。这在理论上能进一步提升效率,而且实现并不复杂。 在路由端,K3 的 Quantile Balancing 把负载均衡从”带超参数的黑盒”变成了”基于统计的确定性过程”。这个思路的泛化版本——比如多头路由、基于内容的动态 Top-K——可能是下一步值得实验的方向。 在训练端,NVIDIA 发现 NVFP4 训练到后期会出现约 7% 的零梯度参数,这其实是低精度训练下”结构化稀疏性自然涌现”的现象。与其把这视为问题,倒不如在架构设计时主动利用它——专门设计感知这种稀疏性的 Expert 结构,可能是一条新路。 更长远来看,LatentMoE 和线性序列建模(Mamba、KDA 这类)的结合,让”1M token 上下文 + 稀疏激活”不再只是实验性的设想,而是真正可以产品化部署的能力。 这为下一代 MoE 架构提供了一个清晰的基础:用线性序列模型处理长程依赖,用 LatentMoE 扩展知识容量,用低精度训练降低计算成本——三者叠加,正在成为行业的新默认选项。 > 作者:华裳羽照<br>https://zhuanlan.zhihu.com/p/2061464412574242573 ## 相关链接 - [青稞社区](https://x.com/qingke_ai) - [@qingke_ai](https://x.com/qingke_ai) - [https://zhuanlan.zhihu.com/p/2061464412574242573](https://zhuanlan.zhihu.com/p/2061464412574242573) - [Upgrade to Premium](https://x.com/i/premium_sign_up) - [10:49 AM · Jul 20, 2026](https://x.com/qingke_ai/status/2079035914740019638) - [1,025 Views](https://x.com/qingke_ai/status/2079035914740019638/analytics) --- *导出时间: 2026/7/20 13:11:29*
K K3 部署推理引擎指南 vLLM 宣布对 Kimi K3 模型提供首日支持。K3 是拥有 2.8 万亿参数的 MoE 模型,支持 100 万上下文窗口。vLLM 通过 DSpark 推测解码将吞吐量提升至 370 tok/s,并支持架构创新的混合缓存管理、预填充/解码分离及智能体服务,确保生产环境下的高性能与低延迟。 技术 › 后端 ✍ vLLM🕐 2026-07-28 vLLMKimi K3MoE推理引擎性能优化DSpark部署指南大模型基础设施
人 人工智能的工程全景(中):推理,后训练,对齐和安全 本文是AI工程全景的中篇,深入探讨了模型训练完成后的工程化路径。首先详述了推理优化的核心手段,包括模型瘦身(量化、蒸馏、剪枝、MoE)、投机解码以及主流推理引擎(vLLM, TensorRT-LLM, SGLang)的生态格局。文章分析了成本、延迟与吞吐的“不可能三角”,并重点介绍了“测试时计算”这一范式转变,即通过在推理阶段增加计算量来动态提升模型智能。 技术 › LLM ✍ snowboat🕐 2026-07-03 LLM推理优化量化投机解码测试时计算MoEvLLMAI工程
L LongCat-2.0 深度技术解读 本文对美团发布的 LongCat-2.0 万亿参数大模型进行了深度技术拆解。文章涵盖了 MoE 架构与稀疏注意力(LSA)的优化、N-gram Embedding 的应用,以及在国产算力受限情况下的 6D 并行训练工程、超节点组网、推理加速等关键技术细节。 技术 › LLM ✍ 向阳乔木🕐 2026-07-01 MoE稀疏注意力N-gram国产算力工程化推理优化超节点并行计算架构设计美团
M Mixture of Experts (MoE): Scaling AI with Specialized Models 文章深入探讨了混合专家模型(MoE),这是一种通过激活特定子网络来高效扩展 AI 模型的架构策略。文章回顾了 MoE 的历史背景,详细解释了其由门控网络和专家组成的结构及稀疏路由机制,并分析了其在 Transformer 中的应用、优势(如高效计算、参数扩展)以及面临的负载平衡和通信开销等挑战。 技术 › LLM ✍ Jayanth🕐 2026-05-07 MoE混合专家大模型架构设计Transformer稀疏路由AI深度学习模型扩展机器学习
M MCP新规范:更灵活的协议 MCP新规范将协议从双向有状态改为请求/响应模型,服务端可部署在Serverless和边缘基础设施上。类比银行业务,以前需找固定柜员,现在任意柜员均可办理,提升了灵活性和效率。 技术 › 工具与效率 ✍ Gorden Sun🕐 2026-07-29 MCP协议Serverless边缘计算Cloudflare WorkersNetlifyHTTP服务负载均衡架构设计
K Kimi K3 技术报告拆解:全球首个开源 3T 级模型 本文拆解了 Kimi K3 的技术报告,这是一个全球首个开源的 2.8 万亿参数模型。文章详细解析了其混合注意力架构、注意力残差机制、MoE 设计以及在长文本训练和推理优化上的创新。报告指出 K3 性能虽略逊于顶级闭源模型,但在多项任务中表现优异,且具有极高的成本效率,甚至已能辅助团队进行内核优化和芯片设计。 技术 › LLM ✍ Berryxia.AI🕐 2026-07-29 Kimi K3模型架构MoE长文本技术报告开源模型AI芯片内核优化推理加速
K Kimi K3 登顶设计榜单的秘密 Kimi K3 在单次前端竞技场中排名第一,Elo 评分达 1408。其成功归功于独特的思维链模式,在推理过程中模拟 Agent 工作流,通过大量代码迭代和心理测试,实现了更精细的设计和外部依赖集成。 技术 › LLM ✍ Design Arena🕐 2026-07-24 Kimi K3前端思维链Moonshot AIAI设计
K Kimi K3 + 图工程:降低85%成本并提升18%准确率 文章介绍了通过结合 Kimi K3 模型与图工程构建 AI 系统的方法。相比传统 RAG,该架构利用知识图谱存储实体关系,能处理复杂推理,实现成本降低85%和准确率提升18%。文章引用微软 GraphRAG 等研究,详细阐述了如何从零开始构建该系统。 技术 › LLM ✍ Noisy🕐 2026-07-23 Kimi K3图工程GraphRAG知识图谱RAG架构设计LLM成本优化
聊 聊聊我对 Kimi K3 的体感 作者分享了使用 Kimi K3 模型的实际体验,通过 3D 坦克大战游戏、权力游戏地图动画和教学视频制作三个案例,展示了其在多模态和复杂任务处理上的强大能力。文章指出 K3 提供了 Claude 和 Codex 之外的优质选择,且具备合规性优势,但同时也面临算力短缺的局限。 技术 › LLM ✍ Wang Shuyi🕐 2026-07-21 Kimi K3多模态代码生成测评Agent教学应用大模型AI工具
K Kimi 3 完全使用指南 本文详细介绍了 Kimi K3 的实际使用方法,澄清了关于开源、1M 上下文和免费会员的常见误区。文章通过网页 Agent、Kimi Work、Kimi Code 和 API 四个入口的实战演示,指导读者如何利用 K3 完成数据处理、文件整理和工程开发任务,并提供了编写 Agent 任务的六段式方法论。 技术 › LLM ✍ Ando🕐 2026-07-18 KimiKimi K3Agent编程使用指南大模型实战测试API
2 2026年强化学习面试题库:算法与基础设施 本文汇总了35道2026年强化学习(RL)领域的面试核心问题。内容涵盖算法与基础设施两大方向,既包括PPO、GRPO等训练机制的原理探讨,也涉及分布式推理、显存优化等工程落地细节。作者强调现代RL岗位需要具备全栈理解能力,建议面试者不仅要熟记问题,更需深究背后的技术逻辑。 技术 › LLM ✍ Xiuyu Li🕐 2026-06-08 RL面试PPOGRPODeepSeekMoE基础设施算法强化学习大模型
T Top Companies Are Secretly Working on This (It Will Replace LLMs) 文章探讨了顶级科技公司正在秘密研发的架构转变——状态空间模型(SSM)。旨在解决 Transformer 架构在长序列处理中的计算成本高和内存消耗大的问题。文章详细解析了 SSM 的工作原理、相比 LLM 的优势(线性时间复杂度、恒定内存),并展示了 NVIDIA、IBM 和 Microsoft 等公司在 Nemotron、Bamba 和 SambaY 等混合架构上的实际应用进展。 技术 › LLM ✍ Siddharth🕐 2026-05-06 SSMTransformerMamba架构NvidiaDeep Learning推理优化LLMInferenceState Space Models