← 博客首页

拆完 GLM-5.2、Kimi K3、DeepSeek V4 三份技术报告:后训练吃掉 75% 算力,架构是最不重要的部分

三家模型与训练管线封面图

三份技术报告全部读完:Kimi K3(arXiv 2607.24653,47 页)、DeepSeek V4(arXiv 2606.19348,58 页)、GLM-5(arXiv 2602.15763;GLM-5.2 没有独立报告,其改动来自 GLM-5 报告 + 官方 research 页)。加上三家的 checkpoint 结构、许可证和部署方案,做一个完整拆解。

先说结论:三家在架构上分道扬镳,却在训练管线上殊途同归——而真正拉开差距的,是后训练那部分没人愿意公开的工程细节。真正让我意外的不是架构,是 K3 公开的算力账本:后训练吃掉了总计算量的 75% 左右,后训练阶段 MFU 只有 27%。预训练已经不是主战场了。

三个最值得带走的数字:

0 · 三个模型,一张总表

Kimi K3V4-ProV4-FlashGLM-5(含 5.2)
总参数~3.0T(2,998,191,185,920)~1.6T~284B~744B
激活参数~107B(107,075,425,280)~49B~13B~40B
上下文1M1M1M1M
注意力KDA + GMLA 混合DSA(DLA + VLA)DSA(DLA + VLA)MLA 变体(细节较少)
优化器MuonMuonMuon未强调
许可证Modified MITMITMITMIT
技术报告arXiv 2607.24653(47 页)arXiv 2606.19348(58 页)arXiv 2602.15763

事实:四者全是 MoE,全都冲 1M 上下文,许可证全都宽松。推断:这说明"超大 MoE + 超长上下文"已经是行业共识,不再是差异化来源——差异化只能来自训练。

1 · 架构细节与消融

1.1 K3:KDA + GMLA 混合注意力,MoE 做了四件事

K3 的注意力是 KDA(Kimi Delta Attention)+ GMLA 的混合:69 层 KDA + 24 层 GMLA = 93 层。Model Card 里写的 n_layers 3,168 与这个 93 明显矛盾——这是我无法自洽解释的一处,存疑,我倾向 93 是正确值、3,168 是笔误或别的口径,但报告没给说明。

其余 Model Card 关键字段(事实):

消融数据是这份报告最值钱的部分(事实,均为论文表格):

结论
Table 16(混合注意力)KDA + GMLA 优于纯 KDA;上下文课程 80K→240K→480K 的组合 PPL 最优(2.529 / 3.183)
Table 17(KDA 消融,2.4B)逐项拆 KDA 各组件的贡献
Table 18(MoE 组件,8B)Stable LatentMoE / SiTU / AttnRes / Gated DeltaNet 各自有效
Table 19(QAT 层敏感性)早期层最敏感(量化后 ΔPPL 1.142 > 晚期 1.066 > 中期 1.045)——量化要优先保早期层
Table 20(FP4)FP4 几乎无损:PPL 2.645 vs FP8 的 2.633

做法上的启示:QAT 不是"训练完再压",而是要按层敏感度区别对待;FP4 已经可以当默认部署精度。这两点 K3 是用消融数据说话的,不是口号。

1.2 V4:DSA 稀疏注意力,为 1M 上下文而生

V4 的核心是 DSA(DeepSeek Sparse Attention),由两部分组成(事实):

核心卖点(事实):1M 上下文下,DSA 的计算量约为稠密 MLA 的 1/10。这就是 V4 敢把 Pro / Flash 都推到 1M 的底气。

架构超参(Table 16,只列我有把握的行——Pro 的部分字段提取顺序存疑,宁缺毋滥):

字段FlashPro
层数37
hidden3072
注意力头24
专家数 / 选中数256 选 6384 选 8
indexed64128
MLA latent2048
head input / output256 / 512

另外两点(事实):优化器用 Muon,开了 QK-norm。推断:Muon + QK-norm + 稀疏注意力,和 K3 的选择不谋而合——这俩已经是超大 MoE 训练的事实标准。

1.3 GLM-5:披露最少,路线最保守

GLM-5 报告对架构细节的披露明显少于前两家(事实:可提取的量化架构字段更少)。能确认的是 744B 总参 / 40B 激活 / 1M 上下文 / MIT。推断:GLM 这一代把重心放在工程落地和推理优化,而不是架构叙事——这和它"最先开放权重、主打可用"的产品策略一致。

1.4 分岔的本质

K3V4GLM
架构重心混合注意力 + MoE 稳定性稀疏注意力压 1M 成本工程落地
最大亮点消融做得最全1M 计算量 1/10开放最激进
短板报告叙事偏学术部署复杂(见 4.2)细节披露少

2 · 训练算力与成本:K3 是唯一把账算明白的

后训练吃掉约 75% 算力示意图

这一节是全篇信息密度最高的。K3 的 Table 5 是三份报告里唯一一份完整的算力账本,值得逐行看(事实):

阶段tokenskH800PFU-daysFLOPsMFU
预训练15.6T379,134,85595,1691.04e2454%
上下文扩展108B5,529,7611,38862%
后训练14.6T1,190,757,067298,8853.25e2427%
总计~30.4T1,575,421,683395,4424.30e2433%

从这张表能读出三个别人不告诉你的结论(推断,但数字是事实):

V4 和 GLM 没给这种级别的账本(事实:V4 报告附录里可能有部分算力数据,但本次 PDF 后半部分提取失败,我无法确认;GLM 报告未提供)。建议:评估任何一家"开源"模型时,先看它敢不敢公开后训练算力——这是比权重更诚实的信号。

3 · 训练数据

3.1 规模对比

预训练语料备注
K323T(Table 1,明确披露)上下文扩展候选池另有 31.5T
V4未完整披露报告重心在架构与 RL
GLM未完整披露
修正:我早先写"K3 未披露数据量"是错的。K3 的 Table 1 和 Table 4 把语料构成和 token 账本都给了,是三家里数据披露最完整的之一。

3.2 K3 语料构成(Table 1 + Table 25 + Appendix I,事实)

来源占比tokens
Web(CommonCrawl)69.91%16.24T
Code & STEM(GitHub/arXiv)15.34%3.56T
合成数据8.41%1.95T
PDF/PPT/TXT4.73%1.10T
书籍1.57%0.36T
考试0.03%6.7B
合计100%~23T

Web 占七成、代码和 STEM 占一成半——这个配比和 LLaMA / Qwen 系的主流做法一致,没有特别激进的偏向。真正值得看的是下面这条。

3.3 后训练数据:93% 是合成的

K3 的后训练数据 93.13% 是合成数据(13.66T)事实,Table 4)。这是我认为全篇最重要的单个数字之一:

推断:真实世界的高质量文本已经被预训练阶段消耗得差不多了,后训练阶段的"数据"本质上是用算力 + 教师模型造出来的。这直接呼应第 2 节——后训练吃 75% 算力,一部分就是在"造数据"。

3.4 长上下文数据:不是靠堆长度,是靠课程

K3 的上下文扩展候选池有 31.5T,但真正用于扩展的只有 108B(事实)。Table 16 的消融显示最优课程是 80K→240K→480K 分阶段拉长。结论:1M 上下文不是喂长文本喂出来的,是精心设计的课程 + 从超大候选池里筛出来的少量高质量长样本。

4 · 端到端管线走查:数据 → 预训练 → mid-train → post-train → checkpoint

训练管线五阶段示意图

把三家管线并排走一遍,差异立刻清楚。

4.1 K3 管线(披露最完整)

数据:   23T 预训练语料(Web 70% / Code&STEM 15% / 合成 8%)
预训练: 15.6T tokens,MFU 54%
上下文: 从 31.5T 候选池选 108B,课程 80K→240K→480K,MFU 62%
mid:    489B tokens
post:   SFT 259B → MOPD 11.3T → Agentic 2.47T
        → 交错推理&agent 2.4T → 并行 RL 670B(MFU 仅 27%)
量化:   QAT,按层敏感度区别对待(早期层优先保)
checkpoint: Base / Instruct / Thinking

token 账本(Table 4,事实)逐项:预训练 15.6T / 上下文扩展 108B / mid 489B / SFT 259B / MOPD 11.3T / Agentic 2.47T / 交错 2.4T / 并行 RL 670B。

一处存疑:这些分项加起来约 33.3T,而报告口径的总消耗是 30.4T,两者对不齐。可能是部分阶段 token 重复计数口径不同。我无法确认原因,如实标注。

4.2 V4 管线(架构省钱,部署不省)

架构:   DSA(DLA+VLA)稀疏注意力,1M 计算量约稠密 MLA 的 1/10
优化:   Muon + QK-norm
post:   SFT 30 万样本 → rubric RL(详见第 5 节)
蒸馏:   R1 / V3.2 作为 teacher 做跨代知识蒸馏,抬高 SFT/RL 起点
部署:   DSA 与 MTP 不兼容 → 额外训一个稠密 draft 模型
        (6 层 Flash 式稠密 MLA + 稠密 FFN,V4 权重初始化 + 100B token 继续训练)
checkpoint: Pro / Flash 两个尺寸

关键坑(事实):DSA 和 MTP(multi-token prediction)不兼容,所以 V4 不得不多训一个稠密 draft 模型来做投机解码。架构上省下来的 1M 计算量,在部署侧要靠额外的 draft 模型补回来——这是"稀疏注意力便宜"这句话背后没人提的代价。

4.3 GLM 管线(披露最少)

GLM 报告能确认的管线节点有限:744B/40B、1M 上下文、MIT 权重。事实层面我无法像 K3 那样给出完整 token 账本,这里不编。建议:想了解 GLM-5.2 相对 GLM-5 的具体改动,看官方 research 页比看论文更有效。

5 · RL 与后训练深挖

这是三家真正分高下的地方,也是最有信息量的部分。

5.1 K3:后训练是一条多阶段流水线

K3 的后训练 token 分配(事实,Table 4):

后训练消融(Table 21,事实)逐阶段叠加的效果:

阶段累计得分
Base7.6
+ Agent41.6
+ Reasoning52.4
+ General58.6
+ Thinking71.3

结论:Agent 数据是单阶段提升最大的(7.6→41.6),Thinking 模式的收尾提升也很可观。推断:K3 的 Thinking / Instruct 双版本,本质是这条流水线开不开最后一级开关的产物。

5.2 K3:环境规模化(Table 22,事实)

RL 并行环境规模化示意图

并行环境从 256 扩到 65,536:

指标256 环境65,536 环境
SWE70.671.4
BrowseComp29.135.6
Terminal-Bench 238.947.3

结论:环境数量规模化对 BrowseComp / Terminal-Bench 这类 agentic 任务提升明显,对 SWE 提升有限。RL 的瓶颈不只在算法,更在能并行跑多少个真实环境。

5.3 V4:rubric-based RL 是目前披露最细的 RL 方案

V4 第 4 章把后训练拆得很清楚(事实):

最关键的是 Figure 10 的 RL 环境 scaling law(事实):并行环境从 1K 扩到 100K,SWE-bench Verified 对数线性提升、无饱和。最终规模——6 万 SWE rollout、10 万并行环境、3,600+ SWE rubrics。

这是全篇我认为最重要的趋势信号:RL 环境数量正在变成一条新的 scaling law,而且还没到头。配合第 2 节"后训练 MFU 只有 27%",方向很清楚——下一代竞争 = 谁的 RL 环境基建更强 + 谁的 RL 算力效率更高。

5.4 V4 自己承认的三个局限(第 6 章,事实)

第 3 条尤其值得记——reward hacking 在长程 agentic 任务上是公开承认的未解难题。任何拿 agentic benchmark 吹牛的模型,都要先回答这个问题。

6 · Benchmark 交叉核对

只列我有把握的数字,并标注存疑处(事实,除特别注明)。

指标K3 ThinkingK3 InstructV4 ProGPT-5.4 xhigh
MMLU-Pro88.785.790.5
HMMT Feb2593.388.2
AIME2596.190.5
GPQA-D87.687.291.1
HLE-Full26.727.130.7
SWE-bench Verified71.366.476.7(位置推断,存疑)78.3
Terminal-Bench55.865.274.0
BrowseComp35.656.776.4
LongBench v261.067.0
MRCR v2 1M60.8

两点提醒(重要):

7 · 结论:五个判断

附录 · 数据可信度声明


参考:Kimi K3 Technical Report — arXiv 2607.24653 · DeepSeek V4 Technical Report — arXiv 2606.19348 · GLM-5 Technical Report — arXiv 2602.15763 · 各家 HuggingFace 权重仓库