K3 部署推理引擎指南
vLLM 宣布对 Kimi K3 模型提供首日支持。K3 是拥有 2.8 万亿参数的 MoE 模型,支持 100 万上下文窗口。vLLM 通过 DSpark 推测解码将吞吐量提升至 370 tok/s,并支持架构创新的混合缓存管理、预填充/解码分离及智能体服务,确保生产环境下的高性能与低延迟。
vLLM 宣布对 Kimi K3 模型提供首日支持。K3 是拥有 2.8 万亿参数的 MoE 模型,支持 100 万上下文窗口。vLLM 通过 DSpark 推测解码将吞吐量提升至 370 tok/s,并支持架构创新的混合缓存管理、预填充/解码分离及智能体服务,确保生产环境下的高性能与低延迟。
本文是张小珺对月之暗面创始人杨植麟的第二次深度访谈,发生在Kimi K2模型发布后。文章深入探讨了AI如何通过编码能力突破“缸中之脑”,走向Agent与自我进化,以及杨植麟对技术挑战与创业心境的思考。
文章分析了 2026 年大模型架构的新趋势 LatentMoE。通过对比 NVIDIA Nemotron 3 Super 和 Moonshot AI Kimi K3,揭示了 LatentMoE 如何通过将 token 投影到低维潜在空间,大幅降低内存和通信开销,从而在同等推理成本下激活更多专家,提升模型性能与效率。
OpenRLHF 作者发布了新的强化学习框架 Molt。该框架采用纯 PyTorch 栈,核心代码仅约 9000 行,专注于 Agentic RL 研究。它支持 Qwen3.5-397B 到 GLM-5.2 753B 等超大规模 MoE 模型训练,无需依赖 Megatron,具备高度的代码可读性和可修改性。
本文是AI工程全景的中篇,深入探讨了模型训练完成后的工程化路径。首先详述了推理优化的核心手段,包括模型瘦身(量化、蒸馏、剪枝、MoE)、投机解码以及主流推理引擎(vLLM, TensorRT-LLM, SGLang)的生态格局。文章分析了成本、延迟与吞吐的“不可能三角”,并重点介绍了“测试时计算”这一范式转变,即通过在推理阶段增加计算量来动态提升模型智能。
本文实测了美团发布的基于 5 万张国产算力芯片训练的万亿参数大模型 LongCat-2.0。文章指出,该模型在预训练到大规模部署的全流程中实现了国产算力闭环,具有里程碑意义。虽然通用推理能力与顶级闭源模型仍有差距,但在 Terminal-Bench 和 SWE-bench Pro 等 Agent 与编程任务中表现强劲。作者实测了将其接入 Claude Code 和 Codex 进行工作流处理,结果显示其在长上下文处理和任务拆解上表现稳定,为开发者提供了一个可行的非国产替代方案。
本文对美团发布的 LongCat-2.0 万亿参数大模型进行了深度技术拆解。文章涵盖了 MoE 架构与稀疏注意力(LSA)的优化、N-gram Embedding 的应用,以及在国产算力受限情况下的 6D 并行训练工程、超节点组网、推理加速等关键技术细节。
本文汇总了35道2026年强化学习(RL)领域的面试核心问题。内容涵盖算法与基础设施两大方向,既包括PPO、GRPO等训练机制的原理探讨,也涉及分布式推理、显存优化等工程落地细节。作者强调现代RL岗位需要具备全栈理解能力,建议面试者不仅要熟记问题,更需深究背后的技术逻辑。
本文深入分析了 DeepSeek 如何通过 MLA、MoE、mHC 等一系列底层技术创新,极大幅度降低大模型对 HBM(高带宽内存)和先进 GPU 制程的依赖。文章指出,DeepSeek 的战略并非局限于软件订阅,而是旨在通过算法优化盘活中国产能充足的 NAND 闪存和 LPDDR 产业,以此构建一套独立于西方之外的 AI 硬件生态,最终撬动价值 10 万亿美元的产业巨兽。
文章深入探讨了混合专家模型(MoE),这是一种通过激活特定子网络来高效扩展 AI 模型的架构策略。文章回顾了 MoE 的历史背景,详细解释了其由门控网络和专家组成的结构及稀疏路由机制,并分析了其在 Transformer 中的应用、优势(如高效计算、参数扩展)以及面临的负载平衡和通信开销等挑战。
文章记录了作者利用中国开源模型 MiniMax M2.5(仅 10B 激活参数),通过行为工程和 Goose 运行时的优化,在 Databricks OfficeQA 基准测试中以 71.5% 的准确率击败了 Claude Opus 4.5 的实战经历。文章指出,企业级 AI 的竞争已从单纯的模型参数量转向行为工程与驾驭层能力,并揭示了中美 AI 生态(中国执行引擎+美国编排方法论)结合所产生的高效低成本优势。
本文基于 Reiner Pope 的播客内容,深入剖析了大模型在集群中的运行机制。文章通过 Roofline 分析和 KV Cache 等核心概念,解释了推理延迟、Batch Size、API 定价策略及 MoE 架构背后的物理与经济逻辑,揭示了硬件限制如何塑造 AI 进展。
文章深入解读了DeepSeek V4论文,指出其核心价值在于将百万上下文、Agent原生能力与低价格结合,抬高了AI应用的地板。技术层面,V4通过mHC稳定残差连接,采用CSA+HCA混合注意力机制解决长上下文算力难题,并用Muon优化器替代AdamW。此外,文章还详细介绍了其1.6T参数量的训练稳定性技巧、反AI坍缩的数据构建以及基于“Specialist + OPD”的后训练范式转变。
文章对 2026 年上半年三款国产旗舰大模型(智谱 GLM-5.1、阿里 Qwen 3.6 Max、月之暗面 Kimi 2.6)进行了深度横向对比。分析涵盖核心技术参数、能力评测及商业定价,指出各模型分别在自主编程、通用全能与长文本协作领域的优势,并针对不同业务场景提供了具体的技术选型建议。
Google 发布 Gemma4 系列开放权重模型,本文为本地部署选型指南。文章解析了 '-it' 指令微调版与基版的区别,以及 E4B/E2B 移动端优化技术(Per-Layer Embeddings)的原理。针对不同场景推荐模型:本地对话选 26B-A4B(MoE 激活 4B);写代码选 31B;语音助手选 E4B;树莓派尝鲜选 E2B。
文章深入探讨了 AI 辅助编程领域中 Codex 与 Claude 的差异化定位。Codex 采用 MoE 架构,以模块化和高精准度成为传统程序员修复 Bug 和重构代码的利器;而 Claude 基于 Dense 架构,凭借全脑激活的细腻逻辑和对自然语言的深度理解,成为“Vibe Coding”用户进行创意原型开发的首选。文章最后建议在实际工作流中混合使用,取长补短。