# Kimi K3 技术报告拆解: 全球首个开源 3T 级模型,一边承认打不过对手,一边给自己造芯片。
**作者**: Berryxia.AI
**日期**: 2026-07-28T03:05:18.000Z
**来源**: [https://x.com/berryxia/status/2081939025443840272](https://x.com/berryxia/status/2081939025443840272)
---

> 申明:该内容部分是有AI生成,有体质敏感者,请悉知。
全球首个开源 3T 级模型,一边承认打不过对手,一边给自己造芯片。
一份技术报告,开头第二段就承认自己打不过对手,这不常见。
Kimi K3 的技术报告就是这么开场的。它白纸黑字写道,整体性能仍落后于最强的两个闭源模型,Claude Fable 5 和 GPT-5.6 Sol。一个团队花几个月、烧掉天文数字的算力做出来的旗舰,报告里第一件事是认怂。
但你往下读会发现,这份坦诚背后站着的东西一点都不软。2.8 万亿总参数,全球第一个开源的 3T 级别模型。原生多模态。
100 万 token 上下文。更离谱的是报告里藏着的一句话,在 K3 开发的后期,一个还没发布的 K3 早期版本,已经在承担团队大部分的 GPU 内核优化工作了。
一个还没出生的模型,在帮着优化生它的那条流水线。

这篇文章想干的事,是把这份 47 页的报告拆开,讲清楚三件事。这个 3 万亿的大家伙,架构上到底动了什么手脚。这么大的模型是怎么训得起、也训得稳的。以及它为什么已经能给自己造芯片、写编译器、剪自己的宣传片。
## 一个模型,朝三个方向同时长大
先说架构总览,这是理解 K3 的钥匙。

传统上,把一个语言模型做大,大家想到的就是堆层数、堆参数。K3 的设计思路更立体,它让信息沿着三个方向同时流动,序列长度、网络深度、模型宽度。你可以把它想象成一栋楼,长度是每层楼有多宽敞,深度是楼有多少层,宽度是每层能同时容纳多少个专业工种。
> 注意力机制(Attention):让模型处理每个词时,能同时看到句子里其他所有词,并判断谁更重要。就像你在嘈杂的聚会里找朋友,眼睛会自动扫向熟悉的轮廓,而不是逐张脸排查。它是所有大模型的地基。
序列方向上,K3 用了一套混合注意力,把三层 Kimi Delta Attention 配一层 Gated MLA,三比一的比例贯穿整个网络。深度方向上,一套叫 Attention Residuals 的机制,让每一层都能回头看之前所有层的信息。宽度方向上,每层注意力后面接一个 Stable LatentMoE,从 896 个专家里每次只挑 16 个干活。

▲ 图 2 · Kimi K3 架构。
右侧是主干,每个 block 由三层 KDA 加一层 Gated MLA 组成,暗红色的连线就是 AttnRes,让每层能回看之前所有 block。左上是 Stable LatentMoE 的共享专家与路由专家,左下是 KDA 模块,底部是原生视觉通路 MoonViT-V2。
这三招合起来,加上更精细的数据和训练配方,换来一个硬指标,相比上一代 Kimi K2,整体的扩展效率提升了约 2.5 倍。

> 扩展效率(Scaling Efficiency):花同样的算力,能换出多少智能。2.5 倍的意思是,K3 用一份算力干的活,K2 得用两份半才能追上。在动辄烧掉上亿美元训练成本的年代,这个倍数直接决定了一家公司烧钱的性价比。

▲ 图 7 · 横轴是算力(FLOPs),纵轴是验证损失,越低越好。红色是 K3,蓝色是 K2。同样的损失水平,红线只需要蓝线约五分之二的算力就能达到,那个横向箭头标的就是 2.5 倍的效率差。
下面三节,把这三个方向一个个拆开看。
## 序列方向,让长文本变便宜的 KDA。
大模型读长文本,最大的敌人是成本。
标准注意力有个要命的毛病,每多读一个词,它都要拿这个词跟前面所有词两两比对一遍,计算量随着长度平方级暴涨。读一篇短文没事,读一百万字的文档,光注意力这一项就能把显存和时间烧穿。
K3 的解法是 Kimi Delta Attention,简称 KDA。
> 线性注意力(Linear Attention):把注意力从平方级成本压到线性级的一类技术。传统注意力像你每记一件新事,都要把脑子里所有旧事翻出来对一遍。线性注意力像随身带一个不断更新的笔记本,来一件新事就往本子上改几笔,不用每次重翻全本。KDA 就是这类笔记本里比较聪明的一种,它给笔记本的每一栏都配了一个可调的遗忘开关,哪些旧信息该淡忘、哪些该留着,模型自己学。
但纯线性注意力有个短板,它太依赖那个压缩过的笔记本,有时候会漏掉需要精确翻查原文的细节。所以 K3 每隔三层 KDA,就插一层 Gated MLA 做全局注意力兜底,把最要紧的全局关系重新精确算一遍。而且网络最后一层一定是 Gated MLA,保证模型收尾时看的是全局。
省钱的活交给 KDA,较真的活交给 MLA,三比一搭配。这套组合还带来一个意外的好处,K3 处理位置信息不靠传统的位置编码,而是靠 KDA 那套遗忘和衰减机制隐式地记住谁先谁后。好处是,它能直接外推到一百万 token,不需要任何位置编码上的魔改。

## 深度方向,让每一层都能回头看。
第二个方向是深度,也就是层与层之间怎么传信息。

常规的深层网络有个隐忧,信息是一层一层顺着往上传的,传到几十层之后,最底下那层学到的东西,可能早就在层层转手里被稀释得差不多了。就像一个消息在一百个人之间口耳相传,传到最后跟原话往往对不上。
K3 用 Attention Residuals(注意力残差)解决这件事。
> 注意力残差(AttnRes):让网络里每一个模块,都能越过中间所有层,直接回头去调取最初的输入、以及之前任意一个模块的输出。打个比方,普通网络像流水线上的工人,只能拿到上一个工位递过来的半成品。而装了 AttnRes 的工人,随时能调出仓库里的原材料和之前任何一道工序的成品,按需取用。它靠一组可学习的伪查询来决定每一层该回看哪些历史。
对一个有 93 层的深层模型来说,这个能力很关键。它让深层的信息访问不再是单线的接力,而是变成一张可以按需检索的网。底层学到的原始信号,到了顶层依然能被精准调用。
## 宽度方向,896 个专家里怎么只用 16 个还不翻车
第三个方向,宽度,也就是 MoE。
> 混合专家模型(MoE):把一个巨大的模型拆成很多个专家子网络,每次只唤醒其中几个来处理当前的词。好比一家 896 人的会诊医院,每个病人只安排 16 个最对口的专家出诊,其他人待命。医院名义规模巨大,但每次接诊的实际人力成本很低。这是万亿级模型能跑得起的核心原因,参数量做得极大,但每个 token 实际激活的计算量被控制得很小。
K3 的这套叫 Stable LatentMoE,把路由专家扩到 896 个,每个 token 只激活 16 个。这个稀疏度相当极端,激活的专家还不到总数的百分之二。
稀疏度一旦拉到这么高,训练就容易出乱子。最典型的问题是专家分配不均,有些专家被抢着用、累到冒烟,有些常年闲置、白占参数。K3 用了一个叫 Quantile Balancing 的办法,直接从路由分数的分位数来推导专家分配,砍掉了传统方法里那个又敏感又难调的平衡超参数。配合归一化和一个新的激活函数 SiTU-GLU,才把这么稀疏的模型在训练时摁稳。

一句话总结这三节,K3 不是简单地把模型堆大,它是想清楚了信息在一个巨型模型里会在哪几个方向卡住,然后一个方向一个方向地把管道拓宽。
## 从 K2 到 K3,到底大了多少?
这些改动落到具体数字上,是一次全面的放大。报告里给了一张 K2 和 K3 的对照表,很能说明问题。

> 激活参数(Activated Parameters):模型每处理一个 token,真正参与计算的那部分参数。K3 总参数 2.78 万亿,但每次只激活 1042 亿。这个区分很重要,总参数决定模型见识的上限,激活参数决定它跑起来的实际开销。K3 相当于一个见多识广的巨人,但每次只调动身体的一小部分肌肉,所以既聪明又跑得动。
还有一点容易被忽略,K3 是原生多模态。它不是先训好一个语言模型,再把视觉模块焊上去,而是从训练的第一天起,文字和图像的 token 就交织在同一个预测目标里一起学。
视觉这条路用的是一个叫 MoonViT-V2 的 4 亿参数视觉编码器,能处理最高 3584×3584 像素的图像,还能在百万 token 的上下文里放得下。
## 一百万 token 是怎么喂进去的
上下文从 K2 的 12.8 万直接干到 K3 的一百万,这不是把数字改大就行。
真正长又连贯的文档和视频其实很稀缺,网上大量的长内容是重复、截断、机器生成的垃圾日志。K3 先用一套专门的清洗流水线把这些噪声滤掉,再刻意把优质长文档上采样,免得训练时被海量短文本淹没。
光有长文档还不够,长度本身不等于长程能力。所以团队还合成了一批特殊的长上下文数据,把多个文档和子任务精心打乱、拼接,让里面埋的任务只有跨越整个一百万 token、把散落各处的信息都串起来才能解出来。这等于是逼着模型在真实的长距离上练本事,防止它偷懒退化成只看眼前。

训练的时候,上下文窗口是分四个阶段慢慢撑大的,预训练期从 8K 长到 64K,冷却期再从 256K 拉到 1M。把最烧钱的超长序列计算集中在训练后期一小段,既省了成本,又让模型循序渐进地适应越来越长的依赖关系。
## 九个专家,蒸成一个。
架构和预训练之后,是后训练,这一步决定模型好不好用。
K3 的后训练分三步走。先用监督微调打个高质量的底子,再用强化学习练出各个领域的专家,最后把这些专家合并成一个统一的模型。
> 强化学习(RL):让模型通过大量试错来学习,做对了给奖励,做错了给惩罚,逼它自己摸索出更优的策略。就像训练一只牧羊犬,你不用逐个动作教它,你只在它把羊赶到位时奖励它,它自己就会琢磨出该怎么跑位。当前最强模型的推理和智能体能力,很大程度上都是 RL 练出来的。
K3 的 RL 铺得很广,横跨三大领域,通用任务、通用智能体、编程智能体。每个领域再配三档思考强度,低、高、最高。三乘三,一共练出 9 个专家模型。
问题来了,用户总不能面对九个模型自己挑。K3 用一套叫多教师在线策略蒸馏的方法,把这九个专家的本事,统统压进一个统一的模型里。
> 蒸馏(Distillation):让一个模型(学生)去模仿一个或多个更强模型(老师)的输出,从而把老师的能力学过来。这里是九个各有所长的老师同时带一个学生,学生最后一个人就能顶九个专家。好处是用户拿到的是一个既全能、又不用手动切换的模型。
还有个工程上的细节,K3 从监督微调阶段就开始做量化感知训练,权重用 MXFP4、激活用 MXFP8 这种低精度格式。
> 量化感知训练(QAT):在训练过程中就让模型习惯低精度的数字格式,而不是训练完再压缩。好比运动员平时就穿着比赛装备训练,正式上场时不会因为装备变化而失常。这让 K3 天生兼容各种硬件的低精度推理,跑起来更省。

## 把 2.8 万亿训起来,靠的是基建
一个 2.8 万亿参数、要吃一百万 token 的模型,光有好设计还不够,底下得有能扛住的基建。报告里这部分是硬功夫,挑三个最关键的说。
第一个是训练时的负载均衡。这么多专家分布在成百上千张卡上,只要有一部分专家忙一部分闲,整个集群的吞吐就会被最慢的那批拖垮。
K3 搞了一套叫 MoonEP 的方案,让专家执行完美均衡,用静态的计算形状和零拷贝通信,把这种忙闲不均消灭掉。
第二个是推理时的缓存。KDA 那个固定大小的笔记本状态,和 MLA 那个随长度增长的常规缓存,两者性质完全不同,分开管会把逻辑搞得又乱又重。
K3 设计了一套 KDA 感知的前缀缓存,把两种缓存统一到同一套分页管理里,让百万 token 的前缀既能便宜地存着,又能跨请求复用。这直接关系到它能不能以有竞争力的价格对外服务。
第三个是智能体训练用的沙箱。K3 的很多任务动辄要调用成百上千次工具、跑上几百万 token,中途一旦崩了不能从头再来。团队用了可恢复的微型虚拟机沙箱,配上部分回合保留、外部 KV 缓存保持等一系列手段,把长命的模型状态和环境状态都稳稳兜住。

这些东西平时没人聊,但它们才是一个 3T 模型能真跑起来的地基。
## 跑分,能打,且便宜
现在看成绩单。

K3 的整体定位很清楚,落后于 Claude Fable 5 和 GPT-5.6 Sol 这两座山,但对其余所有开源和闭源模型都保持领先。这是它自己承认的,也是评测印证的。但在几个具体项目上,它是全场第一。
基准Kimi K3说明SWE-Marathon42.0超长软件工程任务,全场最高BrowseComp91.2网络浏览搜索,全场最高OmniDocBench91.1文档解析,超过所有闭源模型WebDev Arena1678 Elo首个登顶该榜的开源模型

第三方的独立评测也给了位置。在 Artificial Analysis 的智能指数 v4.1 上,K3 拿到 57.1 分,在 580 个模型里排第四。
在众包的人类偏好竞技场 WebDev Arena 上,K3 以 1678 的 Elo 拿下第一,成为第一个登顶这个榜单的开源模型。
但 K3 最有杀伤力的地方,是成本。
在 Kimi Code Bench 2.0 上,它只比 Claude Fable 5 低 4 分,成本却只有对方的 38%。在 BrowseComp 上,它拿了全场最高分,每个任务只花 2.03 美元,是 GPT-5.6 Sol 的一半,比 Claude 系列在最高强度下便宜一个数量级。
报告的原话是,K3 稳稳坐在成本效率的前沿上,用 Fable 5 零头的价格,交付接近顶尖的分数。

▲ 图 13 · 四个任务上的分数(纵轴)对每任务成本(横轴)。
红色五角星是 K3,它几乎总是待在图的左上角,也就是又贵又强的对手拿不到的那个位置,同样的分数它花的钱最少。
对一个开源模型来说,能打是本分,又能打又便宜才是杀招。
## 它已经开始给自己干活了
技术报告的最后是案例研究,这部分最能说明 K3 到底强在哪,也最超现实。
先说那个开头埋的伏笔。团队测了各家模型优化 GPU 内核的能力,每个模型在相同沙箱里独立干最多 24 小时。
K3 把一个 AttnRes 内核的延迟从 283.6 毫秒压到 114.4 毫秒,另外两个内核分别提速 55% 和 74%,成绩追平带回退的 Fable 5,大幅甩开其他对手。而在 K3 开发后期,一个早期版本的 K3 就已经在承担团队大部分的内核优化工作了。

▲ 图 14 · AttnRes 内核优化过程。横轴是投入的工作小时,纵轴是相对基线的提速百分比。红色的 K3 冲得最快最高,最终 +59.7%,几乎贴着带回退的 Fable 5,把两个 GPT 甩在身后。
模型帮着优化生产它自己的流水线。这个自举的循环,是这份报告里最让人后背发凉的信号。
再往下,一个比一个夸张。
K3 从零写了一个类 Triton 的编译器 MiniTriton,从 DSL 前端、中间表示优化,一直到 PTX 代码生成和运行时,是一条完整的链路,某些工作负载上性能还超过了 Triton 本身。
它甚至给一个基于自身架构的 nano 模型设计了一块推理芯片,在一次 48 小时的完全自主运行里,用开源工具完成构建、优化和验证,4 平方毫米内跑到 100 MHz、每秒 8700 多 token 的解码吞吐。
科研上,为了复现计算天体物理里的一组普适关系,K3 审阅了 20 多篇论文、评估了 300 多个状态方程、写了 3000 多行 Python,还顺手揪出了已发表公式里的错误,全程约 2 小时,而一个有经验的研究员干这个要一到两周。
它还做了一份关于 ASIC 行业 42 年历史的交互式研究网站,经历 120 多轮自我改进,翻阅了超过 1.1 万页材料。
最后一个案例带点黑色幽默。K3 用它的原生多模态能力,剪了一支自己的发布预告片,56 段素材,逐帧卡点。它还做了一支 3Blue1Brown 风格的动画讲解视频,讲的正是它自己的架构。
模型给自己做科普。这个画面,想想就很魔幻。
## 结语,前沿这个词,第一次对所有人开放
回到开头那个反常的开场。
一份技术报告,为什么敢在第二段就承认打不过对手?读完 47 页你会明白,因为它手里的牌,根本不需要靠话术来撑。全球第一个开源 3T 模型,一块自己设计的芯片,一个从零手搓的编译器,还有五分之一的旗舰价格。承认与 Fable 5 的差距,反而把开源阵营最强这件事衬得无可辩驳。
报告结论里有一句话,我很喜欢。它说,尽管与最强闭源模型的差距仍在,K3 建立起了一个新的开源前沿,一个人人触手可及的前沿。
过去很长一段时间,前沿是个封闭的词,被锁在几家巨头的服务器里。而这份报告在说的是,从现在起,那道前沿的门,向所有想研究、想部署、想创新的人打开了。
更值得琢磨的是那个反复出现的自举信号。K3 优化了生产 K3 的内核,K3 给基于自己架构的模型设计了芯片,K3 讲解了自己的架构。一个模型开始参与构建它自己的下一版,这件事正在从科幻概念,变成技术报告里一行行朴素的记录。
模型学会造模型的那一天,也许不会有惊天动地的宣告。它可能就是这样,安安静静地写在一份坦诚的技术报告里,夹在一句「早期版本已经在帮我们优化内核了」的轻描淡写之间。
原文来源:Kimi K3 Technical Report · Moonshot AI
## 相关链接
- [Berryxia.AI](https://x.com/berryxia)
- [@berryxia](https://x.com/berryxia)
- [221K](https://x.com/berryxia/status/2081939025443840272/analytics)
- [Kimi K3 Technical Report · Moonshot AI](https://github.com/MoonshotAI/Kimi-K3)
- [Upgrade to Premium](https://x.com/i/premium_sign_up)
- [11:05 AM · Jul 28, 2026](https://x.com/berryxia/status/2081939025443840272)
- [221.7K Views](https://x.com/berryxia/status/2081939025443840272/analytics)
- [View quotes](https://x.com/berryxia/status/2081939025443840272/quotes)
---
*导出时间: 2026/7/29 09:01:46*