
三份技术报告全部读完:Kimi K3(arXiv 2607.24653,47 页)、DeepSeek V4(arXiv 2606.19348,58 页)、GLM-5(arXiv 2602.15763;GLM-5.2 没有独立报告,其改动来自 GLM-5 报告 + 官方 research 页)。加上三家的 checkpoint 结构、许可证和部署方案,做一个完整拆解。
先说结论:三家在架构上分道扬镳,却在训练管线上殊途同归——而真正拉开差距的,是后训练那部分没人愿意公开的工程细节。真正让我意外的不是架构,是 K3 公开的算力账本:后训练吃掉了总计算量的 75% 左右,后训练阶段 MFU 只有 27%。预训练已经不是主战场了。
三个最值得带走的数字:
| Kimi K3 | V4-Pro | V4-Flash | GLM-5(含 5.2) | |
|---|---|---|---|---|
| 总参数 | ~3.0T(2,998,191,185,920) | ~1.6T | ~284B | ~744B |
| 激活参数 | ~107B(107,075,425,280) | ~49B | ~13B | ~40B |
| 上下文 | 1M | 1M | 1M | 1M |
| 注意力 | KDA + GMLA 混合 | DSA(DLA + VLA) | DSA(DLA + VLA) | MLA 变体(细节较少) |
| 优化器 | Muon | Muon | Muon | 未强调 |
| 许可证 | Modified MIT | MIT | MIT | MIT |
| 技术报告 | arXiv 2607.24653(47 页) | arXiv 2606.19348(58 页) | arXiv 2602.15763 | |
事实:四者全是 MoE,全都冲 1M 上下文,许可证全都宽松。推断:这说明"超大 MoE + 超长上下文"已经是行业共识,不再是差异化来源——差异化只能来自训练。
K3 的注意力是 KDA(Kimi Delta Attention)+ GMLA 的混合:69 层 KDA + 24 层 GMLA = 93 层。Model Card 里写的 n_layers 3,168 与这个 93 明显矛盾——这是我无法自洽解释的一处,存疑,我倾向 93 是正确值、3,168 是笔误或别的口径,但报告没给说明。
其余 Model Card 关键字段(事实):
n_vocab 164,096(BBPE、NFC 归一化)head_dim 128,n_heads 64,n_kv_heads 8消融数据是这份报告最值钱的部分(事实,均为论文表格):
| 表 | 结论 |
|---|---|
| Table 16(混合注意力) | KDA + GMLA 优于纯 KDA;上下文课程 80K→240K→480K 的组合 PPL 最优(2.529 / 3.183) |
| Table 17(KDA 消融,2.4B) | 逐项拆 KDA 各组件的贡献 |
| Table 18(MoE 组件,8B) | Stable LatentMoE / SiTU / AttnRes / Gated DeltaNet 各自有效 |
| Table 19(QAT 层敏感性) | 早期层最敏感(量化后 ΔPPL 1.142 > 晚期 1.066 > 中期 1.045)——量化要优先保早期层 |
| Table 20(FP4) | FP4 几乎无损:PPL 2.645 vs FP8 的 2.633 |
做法上的启示:QAT 不是"训练完再压",而是要按层敏感度区别对待;FP4 已经可以当默认部署精度。这两点 K3 是用消融数据说话的,不是口号。
V4 的核心是 DSA(DeepSeek Sparse Attention),由两部分组成(事实):
核心卖点(事实):1M 上下文下,DSA 的计算量约为稠密 MLA 的 1/10。这就是 V4 敢把 Pro / Flash 都推到 1M 的底气。
架构超参(Table 16,只列我有把握的行——Pro 的部分字段提取顺序存疑,宁缺毋滥):
| 字段 | Flash | Pro |
|---|---|---|
| 层数 | 37 | — |
| hidden | 3072 | — |
| 注意力头 | 24 | — |
| 专家数 / 选中数 | 256 选 6 | 384 选 8 |
| indexed | 64 | 128 |
| MLA latent | 2048 | — |
| head input / output | 256 / 512 | — |
另外两点(事实):优化器用 Muon,开了 QK-norm。推断:Muon + QK-norm + 稀疏注意力,和 K3 的选择不谋而合——这俩已经是超大 MoE 训练的事实标准。
GLM-5 报告对架构细节的披露明显少于前两家(事实:可提取的量化架构字段更少)。能确认的是 744B 总参 / 40B 激活 / 1M 上下文 / MIT。推断:GLM 这一代把重心放在工程落地和推理优化,而不是架构叙事——这和它"最先开放权重、主打可用"的产品策略一致。
| K3 | V4 | GLM | |
|---|---|---|---|
| 架构重心 | 混合注意力 + MoE 稳定性 | 稀疏注意力压 1M 成本 | 工程落地 |
| 最大亮点 | 消融做得最全 | 1M 计算量 1/10 | 开放最激进 |
| 短板 | 报告叙事偏学术 | 部署复杂(见 4.2) | 细节披露少 |

这一节是全篇信息密度最高的。K3 的 Table 5 是三份报告里唯一一份完整的算力账本,值得逐行看(事实):
| 阶段 | tokens | kH800 | PFU-days | FLOPs | MFU |
|---|---|---|---|---|---|
| 预训练 | 15.6T | 379,134,855 | 95,169 | 1.04e24 | 54% |
| 上下文扩展 | 108B | 5,529,761 | 1,388 | — | 62% |
| 后训练 | 14.6T | 1,190,757,067 | 298,885 | 3.25e24 | 27% |
| 总计 | ~30.4T | 1,575,421,683 | 395,442 | 4.30e24 | 33% |
从这张表能读出三个别人不告诉你的结论(推断,但数字是事实):
V4 和 GLM 没给这种级别的账本(事实:V4 报告附录里可能有部分算力数据,但本次 PDF 后半部分提取失败,我无法确认;GLM 报告未提供)。建议:评估任何一家"开源"模型时,先看它敢不敢公开后训练算力——这是比权重更诚实的信号。
| 预训练语料 | 备注 | |
|---|---|---|
| K3 | 23T(Table 1,明确披露) | 上下文扩展候选池另有 31.5T |
| V4 | 未完整披露 | 报告重心在架构与 RL |
| GLM | 未完整披露 | — |
修正:我早先写"K3 未披露数据量"是错的。K3 的 Table 1 和 Table 4 把语料构成和 token 账本都给了,是三家里数据披露最完整的之一。
| 来源 | 占比 | tokens |
|---|---|---|
| Web(CommonCrawl) | 69.91% | 16.24T |
| Code & STEM(GitHub/arXiv) | 15.34% | 3.56T |
| 合成数据 | 8.41% | 1.95T |
| PDF/PPT/TXT | 4.73% | 1.10T |
| 书籍 | 1.57% | 0.36T |
| 考试 | 0.03% | 6.7B |
| 合计 | 100% | ~23T |
Web 占七成、代码和 STEM 占一成半——这个配比和 LLaMA / Qwen 系的主流做法一致,没有特别激进的偏向。真正值得看的是下面这条。
K3 的后训练数据 93.13% 是合成数据(13.66T)(事实,Table 4)。这是我认为全篇最重要的单个数字之一:
推断:真实世界的高质量文本已经被预训练阶段消耗得差不多了,后训练阶段的"数据"本质上是用算力 + 教师模型造出来的。这直接呼应第 2 节——后训练吃 75% 算力,一部分就是在"造数据"。
K3 的上下文扩展候选池有 31.5T,但真正用于扩展的只有 108B(事实)。Table 16 的消融显示最优课程是 80K→240K→480K 分阶段拉长。结论:1M 上下文不是喂长文本喂出来的,是精心设计的课程 + 从超大候选池里筛出来的少量高质量长样本。

把三家管线并排走一遍,差异立刻清楚。
数据: 23T 预训练语料(Web 70% / Code&STEM 15% / 合成 8%)
预训练: 15.6T tokens,MFU 54%
上下文: 从 31.5T 候选池选 108B,课程 80K→240K→480K,MFU 62%
mid: 489B tokens
post: SFT 259B → MOPD 11.3T → Agentic 2.47T
→ 交错推理&agent 2.4T → 并行 RL 670B(MFU 仅 27%)
量化: QAT,按层敏感度区别对待(早期层优先保)
checkpoint: Base / Instruct / Thinking
token 账本(Table 4,事实)逐项:预训练 15.6T / 上下文扩展 108B / mid 489B / SFT 259B / MOPD 11.3T / Agentic 2.47T / 交错 2.4T / 并行 RL 670B。
一处存疑:这些分项加起来约 33.3T,而报告口径的总消耗是 30.4T,两者对不齐。可能是部分阶段 token 重复计数口径不同。我无法确认原因,如实标注。
架构: DSA(DLA+VLA)稀疏注意力,1M 计算量约稠密 MLA 的 1/10
优化: Muon + QK-norm
post: SFT 30 万样本 → rubric RL(详见第 5 节)
蒸馏: R1 / V3.2 作为 teacher 做跨代知识蒸馏,抬高 SFT/RL 起点
部署: DSA 与 MTP 不兼容 → 额外训一个稠密 draft 模型
(6 层 Flash 式稠密 MLA + 稠密 FFN,V4 权重初始化 + 100B token 继续训练)
checkpoint: Pro / Flash 两个尺寸
关键坑(事实):DSA 和 MTP(multi-token prediction)不兼容,所以 V4 不得不多训一个稠密 draft 模型来做投机解码。架构上省下来的 1M 计算量,在部署侧要靠额外的 draft 模型补回来——这是"稀疏注意力便宜"这句话背后没人提的代价。
GLM 报告能确认的管线节点有限:744B/40B、1M 上下文、MIT 权重。事实层面我无法像 K3 那样给出完整 token 账本,这里不编。建议:想了解 GLM-5.2 相对 GLM-5 的具体改动,看官方 research 页比看论文更有效。
这是三家真正分高下的地方,也是最有信息量的部分。
K3 的后训练 token 分配(事实,Table 4):
后训练消融(Table 21,事实)逐阶段叠加的效果:
| 阶段 | 累计得分 |
|---|---|
| Base | 7.6 |
| + Agent | 41.6 |
| + Reasoning | 52.4 |
| + General | 58.6 |
| + Thinking | 71.3 |
结论:Agent 数据是单阶段提升最大的(7.6→41.6),Thinking 模式的收尾提升也很可观。推断:K3 的 Thinking / Instruct 双版本,本质是这条流水线开不开最后一级开关的产物。

并行环境从 256 扩到 65,536:
| 指标 | 256 环境 | 65,536 环境 |
|---|---|---|
| SWE | 70.6 | 71.4 |
| BrowseComp | 29.1 | 35.6 |
| Terminal-Bench 2 | 38.9 | 47.3 |
结论:环境数量规模化对 BrowseComp / Terminal-Bench 这类 agentic 任务提升明显,对 SWE 提升有限。RL 的瓶颈不只在算法,更在能并行跑多少个真实环境。
V4 第 4 章把后训练拆得很清楚(事实):
最关键的是 Figure 10 的 RL 环境 scaling law(事实):并行环境从 1K 扩到 100K,SWE-bench Verified 对数线性提升、无饱和。最终规模——6 万 SWE rollout、10 万并行环境、3,600+ SWE rubrics。
这是全篇我认为最重要的趋势信号:RL 环境数量正在变成一条新的 scaling law,而且还没到头。配合第 2 节"后训练 MFU 只有 27%",方向很清楚——下一代竞争 = 谁的 RL 环境基建更强 + 谁的 RL 算力效率更高。
第 3 条尤其值得记——reward hacking 在长程 agentic 任务上是公开承认的未解难题。任何拿 agentic benchmark 吹牛的模型,都要先回答这个问题。
只列我有把握的数字,并标注存疑处(事实,除特别注明)。
| 指标 | K3 Thinking | K3 Instruct | V4 Pro | GPT-5.4 xhigh |
|---|---|---|---|---|
| MMLU-Pro | 88.7 | — | 85.7 | 90.5 |
| HMMT Feb25 | 93.3 | — | 88.2 | — |
| AIME25 | 96.1 | — | 90.5 | — |
| GPQA-D | 87.6 | — | 87.2 | 91.1 |
| HLE-Full | 26.7 | — | 27.1 | 30.7 |
| SWE-bench Verified | 71.3 | 66.4 | 76.7(位置推断,存疑) | 78.3 |
| Terminal-Bench | 55.8 | — | 65.2 | 74.0 |
| BrowseComp | 35.6 | — | 56.7 | 76.4 |
| LongBench v2 | 61.0 | — | 67.0 | — |
| MRCR v2 1M | — | — | 60.8 | — |
两点提醒(重要):
n_layers 3,168 与 93 层矛盾;② K3 token 分项合计与总口径对不齐;③ V4 的 SWE-bench Verified 76.7 为位置推断;④ V4 Table 16 Pro 列部分字段提取顺序存疑,本文只保留高置信行。参考:Kimi K3 Technical Report — arXiv 2607.24653 · DeepSeek V4 Technical Report — arXiv 2606.19348 · GLM-5 Technical Report — arXiv 2602.15763 · 各家 HuggingFace 权重仓库