
这篇整理 Kimi K3(arXiv 2607.24653,47 页)、DeepSeek V4(arXiv 2606.19348,58 页)和 GLM 系列的训练材料。GLM-5.2 没有在本文材料中对应一份独立报告,相关说明来自 GLM-5 报告与官方 research 页。V4 后半部分曾提取失败,因此下文不能视作三份报告逐页完整核验的结果;存疑字段保留标记。
K3 的算力表有一个值得展开的比例:按表中 FLOPs 计算,后训练约占总量的 75.6%,相应阶段 MFU 为 27%。后文先拆这份账本,再对照数据来源、累计消融和环境规模。
先列出后文会用到的三个 K3 数字;它们采用的统计口径分别是计算量、利用率和数据构成:
| Kimi K3 | V4-Pro | V4-Flash | GLM-5(含 5.2) | |
|---|---|---|---|---|
| 总参数 | ~3.0T(2,998,191,185,920) | ~1.6T | ~284B | ~744B |
| 激活参数 | ~107B(107,075,425,280) | ~49B | ~13B | ~40B |
| 上下文 | 1M | 1M | 1M | 1M |
| 注意力 | KDA + GMLA 混合 | DSA(DLA + VLA) | DSA(DLA + VLA) | MLA 变体(细节较少) |
| 优化器 | Muon | Muon | Muon | 未强调 |
| 许可证 | Modified MIT | MIT | MIT | MIT |
| 技术报告 | arXiv 2607.24653(47 页) | arXiv 2606.19348(58 页) | arXiv 2602.15763 | |
表中几款模型都有 MoE 和长上下文配置,但注意力实现、激活参数、训练流程及许可证条款并不相同。共同的配置标签不足以证明架构不再影响效果或成本。
K3 的注意力是 KDA(Kimi Delta Attention)+ GMLA 的混合:69 层 KDA + 24 层 GMLA = 93 层。Model Card 里写的 n_layers 3,168 与这个 93 明显矛盾——这是我无法自洽解释的一处,存疑,我倾向 93 是正确值、3,168 是笔误或别的口径,但报告没给说明。
其余 Model Card 关键字段(事实):
n_vocab 164,096(BBPE、NFC 归一化)head_dim 128,n_heads 64,n_kv_heads 8下表保留本文摘录的消融结果。比较时要看对应实验规模和任务,不直接外推到全部部署负载:
| 表 | 结论 |
|---|---|
| Table 16(混合注意力) | KDA + GMLA 优于纯 KDA;上下文课程 80K→240K→480K 的组合 PPL 最优(2.529 / 3.183) |
| Table 17(KDA 消融,2.4B) | 逐项拆 KDA 各组件的贡献 |
| Table 18(MoE 组件,8B) | Stable LatentMoE / SiTU / AttnRes / Gated DeltaNet 各自有效 |
| Table 19(QAT 层敏感性) | 早期层最敏感(量化后 ΔPPL 1.142 > 晚期 1.066 > 中期 1.045)——量化要优先保早期层 |
| Table 20(FP4) | 该消融中 FP4 与 FP8 PPL 接近:PPL 2.645 vs FP8 的 2.633 |
在这组消融中,量化精度对不同层和任务的影响不一样。因此部署时还需要用目标负载检查质量损失与吞吐,表里的 PPL 不能替代全部任务评估。
V4 的核心是 DSA(DeepSeek Sparse Attention),由两部分组成(事实):
报告中列出的比较是:在 1M 上下文条件下,DSA 计算量约为稠密 MLA 的 1/10。这里的分母是对应注意力实现,不能把它直接当作整次训练或推理的总成本降幅。
架构超参(Table 16,只列我有把握的行——Pro 的部分字段提取顺序存疑,宁缺毋滥):
| 字段 | Flash | Pro |
|---|---|---|
| 层数 | 37 | — |
| hidden | 3072 | — |
| 注意力头 | 24 | — |
| 专家数 / 选中数 | 256 选 6 | 384 选 8 |
| indexed | 64 | 128 |
| MLA latent | 2048 | — |
| head input / output | 256 / 512 | — |
材料还列出了 Muon 和 QK-norm。这些相同的选择可以继续按训练条件和消融结果对照。
本文使用 GLM-5 报告、GLM-5.2 的产品说明和权重配置,它们不是同一份材料。表中的 744B/40B、上下文与许可证字段仍需对应到具体版本,不能据此补出一份 GLM-5.2 的完整训练账本。
| K3 | V4 | GLM | |
|---|---|---|---|
| 架构重心 | 混合注意力 + MoE 稳定性 | 稀疏注意力压 1M 成本 | 工程落地 |
| 可对照的设计 | 消融做得最全 | 1M 计算量 1/10 | 开放最激进 |
| 短板 | 报告叙事偏学术 | 部署复杂(见 4.2) | 细节披露少 |

K3 的 Table 5 把不同阶段的计算量和利用率列在一起。下面沿用本文摘录,重点看同一份账本内部怎样分配成本:
| 阶段 | tokens | kH800 | PFU-days | FLOPs | MFU |
|---|---|---|---|---|---|
| 预训练 | 15.6T | 379,134,855 | 95,169 | 1.04e24 | 54% |
| 上下文扩展 | 108B | 5,529,761 | 1,388 | — | 62% |
| 后训练 | 14.6T | 1,190,757,067 | 298,885 | 3.25e24 | 27% |
| 总计 | ~30.4T | 1,575,421,683 | 395,442 | 4.30e24 | 33% |
按上表口径计算,可以得到以下差异。比例是表内推算,造成差异的原因需要另有证据:
本文没有取得 V4、GLM 同口径的完整算力账本,V4 后半部分还存在提取缺口。因此这里先解释 K3 自身各阶段的比例,不做三家总训练成本排名。
| 预训练语料 | 备注 | |
|---|---|---|
| K3 | 23T(Table 1,明确披露) | 上下文扩展候选池另有 31.5T |
| V4 | 未完整披露 | 报告重心在架构与 RL |
| GLM | 未完整披露 | — |
更正:K3 Table 1 和 Table 4 已列出语料构成与 token 账本,早先“未披露数据量”的表述不准确。本文据此补入表格。
| 来源 | 占比 | tokens |
|---|---|---|
| Web(CommonCrawl) | 69.91% | 16.24T |
| Code & STEM(GitHub/arXiv) | 15.34% | 3.56T |
| 合成数据 | 8.41% | 1.95T |
| PDF/PPT/TXT | 4.73% | 1.10T |
| 书籍 | 1.57% | 0.36T |
| 考试 | 0.03% | 6.7B |
| 合计 | 100% | ~23T |
这张表描述 K3 预训练数据的配比。它不能说明某个来源已经用尽,也不能替代后训练阶段的数据账本;下面另看合成数据占比。
K3 Table 4 列出的后训练合成数据占比为 93.13%,对应 13.66T:
这个比例说明合成数据在该训练流程中的份额很高。生成、筛选和验证各自需要多少算力,还需要单独的成本数据,不能由 token 占比反推。
K3 材料中的扩展候选池为 31.5T,实际用于扩展的量为 108B;本文摘录的 Table 16 比较了 80K→240K→480K 等课程安排。要解释长上下文效果,需要同时看采样和课程消融,不能只比较最终标注的窗口长度。

下面按数据、训练阶段和产物整理已有材料。没有取得同等细节的位置保留空缺,不替报告补齐。
数据: 23T 预训练语料(Web 70% / Code&STEM 15% / 合成 8%)
预训练: 15.6T tokens,MFU 54%
上下文: 从 31.5T 候选池选 108B,课程 80K→240K→480K,MFU 62%
mid: 489B tokens
post: SFT 259B → MOPD 11.3T → Agentic 2.47T
→ 交错推理&agent 2.4T → 并行 RL 670B(MFU 仅 27%)
量化: QAT,按层敏感度区别对待(早期层优先保)
checkpoint: Base / Instruct / Thinking
token 账本(Table 4,事实)逐项:预训练 15.6T / 上下文扩展 108B / mid 489B / SFT 259B / MOPD 11.3T / Agentic 2.47T / 交错 2.4T / 并行 RL 670B。
一处存疑:这些分项加起来约 33.3T,而报告口径的总消耗是 30.4T,两者对不齐。可能是部分阶段 token 重复计数口径不同。我无法确认原因,如实标注。
架构: DSA(DLA+VLA)稀疏注意力,1M 计算量约稠密 MLA 的 1/10
优化: Muon + QK-norm
post: SFT 30 万样本 → rubric RL(详见第 5 节)
蒸馏: R1 / V3.2 作为 teacher 做跨代知识蒸馏,抬高 SFT/RL 起点
部署: DSA 与 MTP 不兼容 → 额外训一个稠密 draft 模型
(6 层 Flash 式稠密 MLA + 稠密 FFN,V4 权重初始化 + 100B token 继续训练)
checkpoint: Pro / Flash 两个尺寸
V4 材料中使用单独的稠密 draft 模型支持投机解码。评估总成本时,除了主模型的注意力计算,还要计入 draft 的训练、内存和调度,并在相同负载下比较。
这里没有与 K3 同口径的完整 token 账本。GLM-5 报告、GLM-5.2 research 页和具体 checkpoint 的字段也不能直接合并成一条已核验的训练流程。需要核对某项改动时,应回到对应版本的原始说明。
这一节查看后训练阶段、累计消融和环境规模。它们能说明报告测到了哪些变化,不能据此给三家团队排出整体高下。
K3 的后训练 token 分配(事实,Table 4):
后训练消融(Table 21,事实)逐阶段叠加的效果:
| 阶段 | 累计得分 |
|---|---|
| Base | 7.6 |
| + Agent | 41.6 |
| + Reasoning | 52.4 |
| + General | 58.6 |
| + Thinking | 71.3 |
表中加入 Agent 阶段后,相关分数从 7.6 变为 41.6。由于各行是逐阶段累计的结果,不能把它当作完全隔离其他因素的单项因果实验,也不能仅凭末行推断 Thinking 与 Instruct 的全部训练差别。

并行环境从 256 扩到 65,536:
| 指标 | 256 环境 | 65,536 环境 |
|---|---|---|
| SWE | 70.6 | 71.4 |
| BrowseComp | 29.1 | 35.6 |
| Terminal-Bench 2 | 38.9 | 47.3 |
在列出的实验范围内,扩展环境数量对 BrowseComp、Terminal-Bench 等项目的影响不同。要判断收益来自并行数、更多 rollout 还是总训练量,还需要实验中其他条件的控制信息。
V4 第 4 章把后训练拆得很清楚(事实):
Figure 10 比较了从 1K 到 100K 的并行环境,展示范围内的分数随规模增长。材料还列出 6 万 SWE rollout、10 万并行环境和 3,600+ SWE rubrics,它们分别描述样本量、环境规模与评分要求。
这组结果值得继续追踪,但曲线在已测区间没有饱和,不代表扩到任意规模都继续有效。环境扩展、数据生成与硬件利用率应一起计成本;K3 的 MFU 数据也不能直接用来解释 V4 的收益。
其中 reward hacking 与长程任务的验证方式有关。比较 agentic benchmark 时,需要看验证器覆盖了哪些要求、有没有检查利用评分规则取得高分的情况。
以下分数按报告摘录,存疑字段继续作标记。由于测试协议与模型版本可能不同,表格用于寻找需要核对的任务差异,不合成为总榜。
| 指标 | K3 Thinking | K3 Instruct | V4 Pro | GPT-5.4 xhigh |
|---|---|---|---|---|
| MMLU-Pro | 88.7 | — | 85.7 | 90.5 |
| HMMT Feb25 | 93.3 | — | 88.2 | — |
| AIME25 | 96.1 | — | 90.5 | — |
| GPQA-D | 87.6 | — | 87.2 | 91.1 |
| HLE-Full | 26.7 | — | 27.1 | 30.7 |
| SWE-bench Verified | 71.3 | 66.4 | 76.7(位置推断,存疑) | 78.3 |
| Terminal-Bench | 55.8 | — | 65.2 | 74.0 |
| BrowseComp | 35.6 | — | 56.7 | 76.4 |
| LongBench v2 | 61.0 | — | 67.0 | — |
| MRCR v2 1M | — | — | 60.8 | — |
跨报告比较还有两个限制:
K3 的账本给出了后训练计算量、利用率与合成数据占比,V4 的材料进一步涉及环境规模与评分要求。它们可以帮助确定下一步该查哪些训练成本,但目前没有同口径数据可比较三家的总效率。
对部署与选型,仍要回到任务表现、许可证、资源需求和可复现材料。报告中的一个高比例或一条上升曲线,只回答其对应实验的问题。
n_layers 3,168 与 93 层矛盾;② K3 token 分项合计与总口径对不齐;③ V4 的 SWE-bench Verified 76.7 为位置推断;④ V4 Table 16 Pro 列部分字段提取顺序存疑,本文只保留高置信行。参考:Kimi K3 Technical Report — arXiv 2607.24653 · DeepSeek V4 Technical Report — arXiv 2606.19348 · GLM-5 Technical Report — arXiv 2602.15763 · 各家 HuggingFace 权重仓库