本文按求学、分布式系统和机器学习系统展开,后半部分保留八篇论文的技术摘要。Dean 的工作与多位合作者、不同团队交织,不能把这些系统写成一个人独立创造的结果;访谈回忆也与论文中的可核对设计分开列出。
先看参与过的系统与研究
关键数字
分布式基础设施
| 系统 | 论文/时间 | 核心贡献 | 行业影响 |
|---|---|---|---|
| GFS | SOSP 2003 | 廉价商用机上的容错分布式文件系统 | HDFS 思想来源 |
| MapReduce | OSDI 2004 | 把大规模数据处理抽象为 map/reduce 两阶段 | 催生 Hadoop,定义"大数据" |
| Bigtable | OSDI 2006 | 稀疏、分布式、持久化的多维排序表 | HBase、Cassandra 的蓝本 |
| Spanner | OSDI 2012 | 全球分布式、强一致关系数据库 | 全球级事务系统标杆 |
| LevelDB | 2011 开源 | 轻量级持久化键值存储 | 众多数据库的底层引擎参考 |
AI/ML 系统与算法
| 系统/算法 | 时间 | 核心贡献 |
|---|---|---|
| Google Brain | 2011 | 与 Andrew Ng、Greg Corrado 等创建深度学习研究团队;2012 年起由 Dean 领导 |
| DistBelief | 2011 | 第一代大规模分布式深度学习训练框架,支撑 Search、Ads、Translate、Photos 等产品 |
| TensorFlow | 2015 开源 | Dean 是初始系统主要设计者之一;GPU、自动微分、数据流图、移动端支持 |
| TPU | 2015 部署,2016 公布 | 推动定制 AI 加速器;参与多代 TPU(v1–v7/Ironwood)研究 |
| Pathways | 2021 愿景,2022 论文 | 下一代异构分布式 ML 平台,支撑 PaLM 与 Gemini 超大规模训练 |
| word2vec / 蒸馏 / 稀疏模型 | 2013– | 词向量、知识蒸馏、稀疏神经网络架构的共同开创者之一 |
| 芯片布局 RL | 2021 Nature | 用强化学习做 ASIC 布局布线,达到或超过人类专家水平 |
主要荣誉
| 年份 | 荣誉 | 说明 |
|---|---|---|
| 2009 | ACM Fellow / NAE 院士 | 计算机协会会士与美国国家工程院院士 |
| 2012 | Mark Weiser + ACM 计算奖 + ACM-Infosys | 操作系统创造力奖、ACM 计算奖;与 Sanjay 共获 Infosys 奖 |
| 2016 | 美国艺术与科学院院士 | American Academy of Arts and Sciences |
| 2021 | IEEE John von Neumann Medal | IEEE 冯·诺依曼奖章 |
| 2025 | TIME100 AI | 《时代》周刊 AI 领域 100 位最具影响力人物 |
逐年大事记(1968–2026)
| 年份 | 事件 |
|---|---|
| 1968 | 7 月 23 日生于夏威夷;父亲 Andy Dean 是热带病研究者,母亲为医学人类学家 |
| ~1981 | 跳过八年级最后三个月,随父母赴索马里难民营帮忙 |
| 1985 | 16 岁,据报道为父亲的流行病学软件 Epi Info 编写约 20 万行 Pascal 代码 |
| 1990 | 明尼苏达大学计算机科学与经济学双学士(summa cum laude);本科论文做神经网络并行训练 |
| 1990–91 | WHO 日内瓦总部全球艾滋病项目,开发 HIV/AIDS 统计建模与预测软件 |
| 1996 | 华盛顿大学计算机科学博士,导师 Craig Chambers,方向为编译器与整体程序优化 |
| 1996–99 | DEC 西部研究院(WRL),做性能分析工具与微处理器架构;结识 Sanjay Ghemawat |
| 1999 | 短暂任职 mySimon;年中加入 Google(约第 30 号员工),与 Sanjay 同年入职 |
| 2000 | 3 月索引系统危机:与 Sanjay 一个周末定位廉价 RAM 比特翻转问题并重写索引系统 |
| 2003 | GFS 论文(SOSP);参与五代爬取/索引/查询系统建设 |
| 2004 | MapReduce 论文(OSDI),与 Ghemawat 两人合著 |
| 2006 | Bigtable 论文(OSDI) |
| ~2007 | 机器翻译系统优化:"12 小时翻一句话"降到百毫秒级 |
| 2009 | LADIS 演讲给出"每个程序员都该知道的延迟数字";同年获 ACM Fellow、NAE 院士 |
| 2011 | LevelDB 开源;与 Andrew Ng 等创立 Google Brain;DistBelief 投入使用 |
| 2012 | 猫神经元实验(ICML);获 Mark Weiser 奖、ACM 计算奖、ACM-Infosys 奖;开始领导 Google Brain |
| 2013 | word2vec 论文(与 Mikolov 等合作) |
| 2015 | 11 月 9 日 TensorFlow 开源(v0.5.0);TPU v1 部署进数据中心 |
| 2016 | TPU 对外公布;TPU v1 支撑 AlphaGo 对弈李世石;获美国艺术与科学院院士 |
| 2017 | TPU v1 论文(ISCA);Transformer 论文《Attention Is All You Need》出自 Google Brain(Dean 领导 Brain,但不在作者名单) |
| 2018 | 4 月出任 Google AI 负责人;TPU v3 发布;《纽约客》发表 Dean–Sanjay 特写 |
| 2021 | 芯片布局 RL 论文登 Nature;获 IEEE 冯·诺依曼奖章;10 月发布 Pathways 愿景 |
| 2022 | Pathways 系统论文(MLSys);PaLM 发布(540B,6,144 块 TPU v4) |
| 2023 | Brain × DeepMind 合并;Dean 任 Google 首席科学家、Gemini 联合技术负责人;Gemini 1.0 发布 |
| 2024 | Gemini 1.5 发布(长上下文,跨都市区数据中心训练);TPU v6 Trillium |
| 2025 | 2 月 Dwarkesh 播客与 Noam Shazeer 同台;5 月 Sequoia AI Ascent 主旨演讲;入选 TIME100 AI;TPU v7 Ironwood |
| 2026 | 8 月 5 日:宣布离开 Google,与 Sanjay、Quoc Le、Oriol Vinyals 创办 Discovery Loop 任 CEO;同日 Hassabis 卸任 DeepMind CEO |
童年与求学(1968–1996)
FROM HAWAII TO GENEVA
在热带病研究者家庭长大
Jeffrey Adgate Dean 1968 年 7 月 23 日出生于夏威夷。他的父亲 Andy Dean 是热带病研究者,后来担任过明尼苏达州流行病学家并在 CDC 工作;母亲是医学人类学家。由于父母工作的关系,童年时期他随家庭频繁搬迁。
传记资料记载,Dean 少年时曾随父母到索马里参与相关工作。父亲的公共卫生研究让他较早接触到统计与软件处理的实际需求。
第一台电脑与 16 岁的 20 万行 Pascal
Dean 的编程启蒙来自父亲。父亲在家组装了一台 Altair 8800 套件计算机,Dean 在旁边帮忙调试,逐渐学会自己编程。12、3 岁时,他买了一本包含游戏源代码的书,先照着写,再修改,最后开始原创。
Dean 少年时期参与过父亲使用的流行病学软件 Epi Info。传记中反复出现“约 20 万行 Pascal”的记述;本文没有对应版本的代码仓库,保留为传记来源中的说法。
明尼苏达本科:计算机 + 经济学
1990 年,Dean 获得明尼苏达大学计算机科学与经济学学位,并在课程中接触神经网络并行训练。他后来描述过在 32 处理器 Hypercube 上实现模型并行和数据并行的经历:
我本科最后一年上一门并行计算课,其中一节讲到了神经网络,我就是这样接触到它的。我在一台 32 处理器的 Hypercube 机器上实现了模型并行和数据并行。
"I got introduced to neural nets in one section of one class on parallel computing that I was taking in my senior year... I implemented model parallelism and data parallelism on a 32-processor Hypercube machine." — Dwarkesh Podcast, 2025-02
课程中的并行训练实验,是他早年接触机器学习系统的记录。本科期间,他也结识了后来的妻子 Heidi Hopper。毕业后,他先从事公共卫生软件,再进入编译器研究。
日内瓦:用软件追踪艾滋病疫情
1990–1991 年,Dean 在日内瓦为 WHO 的全球艾滋病项目开发统计建模、预测和分析软件。模型需要接收数据、执行计算,并给使用者返回可解释的结果;这份工作将软件开发与科学问题放在了同一个项目里。
华盛顿大学博士:编译器与整体程序优化
之后他进入华盛顿大学,在 Craig Chambers 指导下研究编译器和面向对象语言的整体程序优化,1996 年取得博士学位。
DEC 时期与 Sanjay Ghemawat 的合作
THE FRIENDSHIP THAT MADE GOOGLE HUGE
博士毕业后,Dean 加入 DEC Western Research Lab,在系统研究工作中结识了 Sanjay Ghemawat。两人后来在 Google 合作多年,共同署名的论文提供了比人物轶事更清楚的工作记录。
像爵士乐手一样结对编程
《纽约客》2018 年的特写描写了两人共用一台电脑结对编程:一人输入,另一人审阅和讨论。文章对性格与节奏的描述属于采访观察。Dean 也谈过这种合作带来的收益:
和 Sanjay 一起写出的代码,比我们各自单独写的都要好。
"When I work with Sanjay, the code we write together is better than anything either one of us could write alone."
两人随后都加入了 Google
Dean 与 Ghemawat 于 1999 年先后加入 Google。此后,他们与同事共同发表的系统论文,记录了两人从搜索基础设施到机器学习系统的合作。
加入 Google 与 2000 年的那个周末
EARLY GOOGLE · 索引故障与排查
Dean 于 1999 年年中加入 Google,是公司大约第 30 号员工。彼时 Google 只有 25 到 30 人。他的第一份工作是广告、抓取、索引与查询服务系统,此后参与了五代爬取、索引与查询服务系统的实现。他回忆:
我加入的时候,公司也就 25、26 个人,差不多那样。
"When I joined, we were 25 people, 26 people, something like that." — Dwarkesh Podcast, 2025-02
一次索引故障的排查
《纽约客》记录了 Google 早期的一次索引故障。当时公司正在扩大搜索业务,索引的可靠性是团队需要处理的实际问题。下面的过程来自这篇报道,不等同于完整事故报告。
六位工程师挤进临时作战室。公司的第一位员工 Craig Silverstein 和 Bogdan Cocosel 花了四天没找到原因。Dean 和 Ghemawat 接手后,把损坏的索引文件转储成原始二进制,最终发现:廉价内存芯片会在运行时自发翻转比特位(0 变 1,1 变 0),造成静默数据损坏,而不是软件 bug。
报道中的排查把问题追到数据损坏与容错。随着机器数量增加,组件故障需要成为系统的常规处理对象。这也是后来 GFS、MapReduce 等论文中反复出现的设计条件。
Google 的存储与分布式计算系统
GFS · MAPREDUCE · BIGTABLE
随后,Dean 与 Ghemawat 及其他同事参与了 GFS、MapReduce、Bigtable 等系统。它们分别处理文件存储、批量计算和结构化数据,工作负载不同,共同面对集群规模与故障恢复问题。
GFS(2003):把廉价硬盘当成一个文件系统
Ghemawat、Howard Gobioff 与 Dean 在 SOSP 2003 发表 GFS 论文,讨论用商用机器支持大文件、追加写入与故障恢复。master 管理元数据,chunkserver 保存数据,副本与恢复机制应对组件故障。
MapReduce(2004):把任务与运行时分开
Dean 与 Ghemawat 在 OSDI 2004 发表 MapReduce。应用提供 map 和 reduce 等逻辑,运行时负责分配任务、移动数据和重试失败任务。这让程序员可以减少每个批处理任务中重复编写的分布式执行逻辑。
Bigtable(2006):半结构化数据的分布式答案
2006 年 OSDI,Dean、Ghemawat 与 Fay Chang、Mike Burrows 等发表了 Bigtable,为 Google 的搜索索引、Google Earth、Google Finance 等提供可扩展的稀疏表存储。它是 HBase、Cassandra 等 NoSQL 系统的直接灵感来源。
Spanner、LevelDB、Protocol Buffers 与 Jeff Dean 数字
同一时期,Dean 还参与了:
- Spanner(OSDI 2012):全球分布式、强一致关系数据库,用原子钟和 TrueTime API 解决跨地域事务。
- Protocol Buffers:Google 内部 RPC 和数据持久化的结构化序列化格式,后来成为 gRPC 的核心部分。
- LevelDB(2011 开源):轻量级、可嵌入的键值存储,由 Dean 和 Ghemawat 设计,被无数系统借鉴。
此外,工程师圈子里流传着一份"Jeff Dean 数字"——他 2009 年在 LADIS 大会主旨演讲《Designs, Lessons and Advice from Building Large-Scale Distributed Systems》中整理的数据中心各级延迟:L1 缓存 ~0.5ns、分支预测失败 ~5ns、内存访问 ~100ns、SSD 随机读 ~150μs、磁盘寻道 ~10ms、跨数据中心往返 ~150ms。这份表后来经 Johan Boné 的 gist 传播,成为无数系统设计与面试题的标准参考(原始 PDF 仍可在 Cornell 与 Google Research 站点找到)。
转向机器学习:从翻译系统到猫神经元
THE PIVOT TO MACHINE LEARNING
2007 年:"翻译一句话要 12 小时"
Dean 从基础设施转向机器学习,有一个常被提到的转折故事。2007 年前后,Google 的机器翻译系统慢到令人难以置信。他在 2025 年 2 月的 Dwarkesh 播客里回忆:
"翻译一个句子要 12 个小时。"我们重新设计了内存中的压缩 N-gram 表示和并行查询,把延迟降到了百毫秒级。
"It takes 12 hours to translate a sentence." — Jeff Dean, Dwarkesh Podcast, Feb 2025
这段访谈提到的需求,把机器学习模型与系统性能放在同一个问题里。随后要解决的不仅是模型如何训练,还有更多机器参与以后,数据与参数怎样交换。
2011:Google Brain 的诞生
2011 年,Dean 与 Andrew Ng(时任斯坦福大学教授)、Greg Corrado 等人共同创建了 Google Brain。团队被放进 Google X 实验室,目标是"建造非常大的神经网络"。2012 年,Dean 开始直接领导这个团队。第一代训练系统 DistBelief 让模型可以扩展到数千个 CPU 核心,训练出的模型比之前大约大 60 倍,被部署在 Search、Ads、Translate、Photos、Maps、Street View、语音识别和 YouTube 等产品中。
2012:大规模无监督图像实验
2012 年,Google Brain 团队发表了 ICML 论文 "Building high-level features using large scale unsupervised learning"(Quoc Le 等,包括 Jeff Dean 与 Andrew Ng)。实验用 1,000 台机器、16,000 个 CPU 核心,无监督地观看了约 1,000 万张 YouTube 视频帧。结果,网络最高层自发涌现出一个对"猫脸"强烈响应的神经元——它从未被告诉过"猫"是什么。Dean 回忆:
那个神经网络可能比之前训练过的最大网络大 50 倍,而且效果很好。扩大神经网络规模看起来是个好主意——事实证明它确实是。
"That neural net was probably 50x bigger than one that had been trained previously, and it got good results... scaling up neural nets seems like, I thought it would be a good idea and it seems to be." — Dwarkesh Podcast, 2025-02
实验在当时的数据和训练设置下,观察到对特定视觉模式有选择性响应的单元。它提供了一组关于大规模无监督学习的结果,具体效果要与论文的任务和对照一起阅读。
深度学习基础设施:TensorFlow、TPU 与算法-硬件协同设计
DISTBELIEF → TENSORFLOW → TPU
TensorFlow:重写 DistBelief,开源 2015
TensorFlow 接续了 DistBelief 之后的训练系统工作,2015 年 11 月 9 日开源。相比仅看“重写”这个动作,更值得检查的是数据流图、设备放置、自动微分和部署接口怎样变化。
Dean 将自己列为 TensorFlow 初始设计与实现者之一。开源后的框架让研究者可以在公开接口上定义计算图、训练模型并尝试不同设备,相关功能也随版本继续变化。
TPU:从工作负载估算到专用硬件
TPU 项目的触发点是一个粗略估算:如果用户每天只用语音搜索 3 分钟,Google 就得把数据中心容量翻倍。这促使团队设计专用 ASIC。Dean 参与撰写的 ISCA 2017 论文 In-Datacenter Performance Analysis of a Tensor Processing Unit 显示,TPU v1 在推理任务上相对同时期 GPU 有约 15–30 倍吞吐优势、30–80 倍能效优势。Dean 提到,TPU v1 从设计想法到部署进数据中心大约只用了 15 个月。他解释设计动机时说:
我们在 Google 开始造 TPU,它本质上就是一台低精度线性代数机器。顺便说一句,这些算术可以用很低的精度完成,所以你还能塞进更多乘法器单元。
"We started to build TPUs at Google that were really just reduced-precision linear algebra machines... the arithmetic can be really low precision, so then you can squeeze even more multiplier units in." — Dwarkesh Podcast, 2025-02
TPU 的代际演进大致如下(基于公开报道整理,非 Google 官方完整规格表):
| 代数 | 时间 | 关键特征 |
|---|---|---|
| TPU v1 | 2015 部署,2016 公布 | 推理专用,INT8,256×256 脉动阵列,92 TOPS;支撑 AlphaGo vs. 李世石 |
| TPU v2 | 2017 | 首次支持训练,引入 bfloat16,Cloud TPU 上线,256 芯片 Pod |
| TPU v3 | 2018 | 性能约为 v2 两倍,液冷,1,024 芯片 Pod |
| TPU v4 | 2020 部署,2021 公布 | 光路交换实现可重构 4,096 芯片 Pod,训练 LaMDA/MUM/PaLM |
| TPU v5e/v5p | 2023 | 分推理优化(v5e)与训练优化(v5p)两条线 |
| TPU v6 Trillium | 2024 | 公开报道中训练 Gemini 2.0 的硬件之一 |
| TPU v7 Ironwood | 2025 | 面向推理与 Gemini 3 级负载设计,更高 HBM 与算力密度 |
其他重要贡献
- word2vec(2013):与 Mikolov 等合作的词分布式表示论文,让"king - man + woman ≈ queen"成为可能。
- 蒸馏(Distillation):该技术早期的共同开创者之一,让小模型继承大模型能力。
- 用强化学习做芯片布局(2021 Nature):将 ASIC 布局布线建模为强化学习问题,达到或超过人类专家水平。
- 医疗 AI:参与多项将机器学习用于医疗诊断与健康管理的项目。
大模型时代:Pathways、PaLM、Gemini 与首席科学家
PATHWAYS → PaLM → GEMINI
Pathways 愿景(2021)
2021 年的 Pathways 博客提出统一处理多类任务的方向,2022 年系统论文进一步描述异步分布式数据流和加速器编排。愿景与已经实现的系统接口需要分开看,不能把前者的任务范围写成当时已有能力。
PaLM(2022):Pathways 的大规模训练案例
PaLM 使用 Pathways 在 6,144 块 TPU v4 上训练 5,400 亿参数模型。它既是一项模型实验,也是观察跨加速器训练编排的案例;后文分别列出模型任务表现和系统利用率。
2023:Google Brain 与 DeepMind 合并
2023 年,Google 将 Google Brain 与 DeepMind 合并为 Google DeepMind。Dean 转任 Google 首席科学家,同时担任 Gemini 的联合技术负责人。他的角色从"带一支团队"变成"把 Google 最前沿的 AI 研究串在一起"。在 2025 年的访谈中,他透露 Gemini 1.5 曾在多个都市区的数据中心之间联合训练——"我们已经在这么做了"。
离开与 Discovery Loop:2026 年 8 月 5 日
THE NEXT CHAPTER
2026 年 8 月,Google 公布 AI 组织调整,Dean 与几位长期合作者也公布新公司。组织职务的变化与新公司的研究目标分别列在下面。
- Jeff Dean 离开 Google,结束 27 年生涯(时年 58 岁)。
- Demis Hassabis 卸任 Google DeepMind CEO,转任 DeepMind 董事长与 Alphabet 首席科学家,继续领导 Isomorphic Labs;他在内部信里表示 AGI"近在咫尺"。DeepMind 日常管理由高级副总裁 Koray Kavukcuoglu 接管,直接向 Sundar Pichai 汇报。
- Dean 与 Sanjay Ghemawat、Quoc Le、Oriol Vinyals 联合创办 Discovery Loop。
Discovery Loop 的轮廓
| 维度 | 内容 |
|---|---|
| 法律形态 | 独立的公共利益公司(public benefit corporation) |
| 使命 | 自动化机器学习、科学与工程,用 AI 加速科学发现;让系统能"并行运行成千上万个实验" |
| 闭环逻辑 | "AI 提出实验、执行实验、从结果中学习、递归迭代"——先从自动化机器学习研究本身做起,再进入物理世界 |
| 领域 | 工程、医学、材料设计、清洁能源(Radical Ventures 投资信的表述) |
| 联合创始人 | Jeff Dean(CEO)、Sanjay Ghemawat、Quoc Le、Oriol Vinyals |
| 投资方 | Radical Ventures 与 Khosla Ventures 联合领投种子轮;Alphabet 作为创始投资方参与并任云合作伙伴 |
新公司准备解决什么问题
Discovery Loop 的公开说明把自动化实验循环作为目标:提出实验、执行、分析结果,再据此迭代。与以往为研究提供计算基础设施相比,这次公布的目标还包括让 AI 参与安排实验。
新公司的目标尚需后续研究和系统结果来检验。组织调整说明了人员与职责变化,还不足以判断一个研究项目的技术前景。
八篇核心论文深度解析
KEY PAPERS, PROBLEM → DESIGN → IMPACT
以下八篇论文覆盖存储、分布式计算、训练框架和硬件。每篇先交代问题,再列设计与实验范围,便于回到原文继续阅读。
① The Google File System
SOSP 2003 · Ghemawat, Gobioff, Dean
问题
怎样在规模较大的商用机器集群中,支持大文件工作负载并处理持续发生的组件故障?
设计
单 master 元数据服务器 + 大量 chunkserver;文件切成 64MB 的 chunk,每块三副本;把"组件必然失效"写进设计前提,靠快速重复制而非持久硬件保证可靠性。
影响
GFS 的接口、数据布局与容错设计影响了 HDFS 等后续系统。阅读后继实现时,还要看其工作负载和相应改动。
② MapReduce
OSDI 2004 · Dean, Ghemawat(仅两位作者)
问题
Google 有大量"对全量数据做某种统计"的需求,但每次都要手写分布式并行、容错、数据分发代码。
设计
应用提供 map 和 reduce 计算,运行时负责分区、调度、数据本地性和失败任务重执行。函数是否无副作用,以及重试需要什么条件,应按论文的编程模型讨论。
影响
Hadoop MapReduce 借鉴了这套编程与执行模型。Spark 后来采用不同的数据抽象和执行机制,以处理包括迭代计算在内的其他需求。
③ Bigtable
OSDI 2006 · Chang, Dean, Ghemawat 等
问题
Google 的数据形态介于关系表与文件之间:稀疏、海量、需要低延迟随机读写。
设计
"稀疏的、分布式的、持久的多维排序映射",构建在 GFS 之上;tablet 为管理单位,按行键排序;牺牲 SQL 语义换取扩展性。
影响
Bigtable 影响了 HBase、Cassandra 等系统的部分设计。它对数据模型和一致性的选择,服务于论文中描述的工作负载。
④ 猫神经元实验
ICML 2012 · Quoc Le 等(含 Dean, Andrew Ng)
问题
不标注数据,神经网络能否自己学出有意义的概念?
设计
9 层局部连接的稀疏自编码器,约 10 亿连接,跑在 1,000 台机器 / 16,000 CPU 核心上;喂入 1,000 万张 200×200 的 YouTube 无标注帧,训练三天。
数字与影响
论文记录了相应识别评估中的提升,并观察到对猫脸等模式有选择性响应的单元。这些结果的范围由训练数据、模型和测试任务共同决定。
⑤ TensorFlow 白皮书
arXiv 2016 / OSDI 2016 · Abadi 等(Dean 为主要设计者之一)
问题
DistBelief 的系统接口与硬件适配限制,促使团队重新考虑面向研究和部署的数据流框架。具体限制要回到论文描述,不能笼统写成旧系统无法使用或无法开源。
设计
数据流图 + 自动微分;算子可放置在 CPU/GPU/移动设备;同一套代码从手机跑到数千卡集群。
影响
TensorFlow 开源后,研究者和开发者可以基于公开接口构建训练与部署程序。它与其他框架一起,降低了重复实现底层计算和设备适配的工作量。
⑥ TPU v1 论文
ISCA 2017 · Jouppi 等(含 Dean)
问题
CNN 推理需求爆炸,通用 CPU/GPU 的能效撑不住"每人每天 3 分钟语音搜索"这种规模。
设计
推理专用 ASIC:256×256 INT8 脉动阵列(92 TOPS)、约 28MiB 片上存储、PCIe 协处理器;砍掉通用性换取密度与能效。
数字与影响
原稿摘录的吞吐、能效和开发周期数字,要与论文使用的基准、硬件及功耗口径一起阅读。它们说明专用加速器在那组负载中的表现,不代表对所有同期 GPU 任务的统一倍率。
⑦ Pathways: Asynchronous Distributed Dataflow for ML
MLSys 2022 · Barham, Chowdhery, Dean, Ghemawat 等
问题
上一代系统一次只能跑一个模型、绑定单一并行策略;超大模型需要跨数千加速器、混合并行、甚至跨数据中心。
设计
异步分布式数据流 + 单控制器编排;gang scheduling;构建在 XLA 之上,兼容 JAX 等前端;数据面依赖不阻塞控制面执行。
数字与影响
在 2,048 块 TPU 上跑 SPMD 计算达到接近 100% 加速器利用率;支持 16 级流水线、跨加速器岛分片。PaLM 与 Gemini 的训练底座;Dean 称之为第三代训练系统。
⑧ PaLM: Scaling Language Modeling with Pathways
2022 · Chowdhery, Narang, Devlin 等 60+ 作者(含 Dean)
问题
Pathways 愿景能不能在真实规模上兑现?
设计
540B 参数稠密 Transformer,跨两个 Cloud TPU v4 Pod、共 6,144 块芯片训练,模型并行度 12 路、数据并行 512 路。
数字与影响
报告列出的 MFU 为 57.8%,并给出了语言与推理任务结果。MFU 衡量训练执行效率,基准分数衡量指定任务表现,不能合并成对模型全部能力的一次验证。
他本人怎么说:访谈引语集
IN HIS OWN WORDS
以下引语均出自公开访谈,按主题分组(中文为意译,英文为原文)。
关于起点
我本科最后一年上一门并行计算课,其中一节讲到了神经网络——我就是这样接触到它的。我在一台 32 处理器的 Hypercube 机器上实现了模型并行和数据并行。
"I got introduced to neural nets in one section of one class on parallel computing that I was taking in my senior year." — Dwarkesh Podcast, 2025-02
我加入 Google 的时候,公司也就 25、26 个人,差不多那样。
"When I joined, we were 25 people, 26 people, something like that." — Dwarkesh Podcast, 2025-02
关于规模
那个网络可能比之前训练过的最大网络大 50 倍,而且效果很好。
"That neural net was probably 50x bigger than one that had been trained previously, and it got good results." — Dwarkesh Podcast, 2025-02
一代代模型之间的进步,往往部分由硬件和更大的规模驱动。
"Improvements from generation to generation of these models often are partially driven by hardware and larger scale." — Dwarkesh Podcast, 2025-02
模型可能会继续变大,你还能从那里拿到一两个数量级的提升。
"The models are probably going to be bigger, you'll get another order of magnitude or two from that." — Dwarkesh Podcast, 2025-02
关于硬件
我们在 Google 开始造 TPU,它本质上就是一台低精度线性代数机器。
"We started to build TPUs at Google that were really just reduced-precision linear algebra machines." — Dwarkesh Podcast, 2025-02
别去看新硬件的牙口。
"Never look new hardware in the mouth." — Dwarkesh Podcast, 2025-02
关于未来(Sequoia AI Ascent,2025-05)
- 预测 AI 系统在大约一年内达到初级软件工程师的水平,尤其是长时间运行的 agent 式编程任务。
- 推理硬件优化的两个关键:减少数据搬运与提高算力供给效率。
- 未来进步的关键在 context engineering 与推理时计算,而不只是更大的预训练。
- 提出"1000 倍能耗差距":如果模型能达到人脑能效水平,相对当前硬件还有约三个数量级的余量。
- 预测 ML 系统参与改进 ML 系统自身——分解目标、自动跑实验,延续 AlphaEvolve 类工作的方向。
关于克制
面对 AGI 时间表,我大概在中间位置。我就是不喜欢炒作还没做完的东西。
"I'm somewhere in the middle... I just don't like to hype things that aren't done yet." — Dwarkesh Podcast, 2025-02
我确实相信,让这些系统变得安全是可能的。
"I do think it is possible to make these systems safe." — Dwarkesh Podcast, 2025-02
与合作者的工作如何衔接
COLLABORATORS · 结合具体论文和项目阅读
Dean 与多位研究者在不同项目中合作。下表按项目和工作方向列出关联,便于继续查阅各自的论文与职责。
| 人物 | 原型 | 代表作 | 与 Dean 的对照 |
|---|---|---|---|
| Sanjay Ghemawat | 另一半:安静的深度型工程师 | GFS、MapReduce、Bigtable、LevelDB | 27 年搭档,同进退;2026 年一起离职创业 |
| Andrew Ng | 教育者与创业者 | Google Brain 共同创始人、Coursera、deeplearning.ai | 同为 Brain 创始人,Ng 走向教育与创业,Dean 留在 Google 造系统 |
| Demis Hassabis | AGI 野心家、诺奖得主 | AlphaGo、AlphaFold(2024 诺贝尔化学奖)、Isomorphic Labs | Hassabis 的科学路径拿了诺奖;Dean 则把科学留给了离职后的 Discovery Loop |
| Noam Shazeer | 论文作者、产品化冲刺者 | 《Attention Is All You Need》共同作者 | 2021 年出走创办 Character.AI,2024 年以约 27 亿美元授权交易回归任 Gemini 联合负责人,2026 年 6 月又转投 OpenAI;Dean 在一家公司待了 27 年才离开 |
| Oriol Vinyals | 全能型研究者 | seq2seq 共同发明人、AlphaStar 负责人、Gemini 联合负责人 | Discovery Loop 联合创始人之一,与 Dean、Quoc Le 再聚首 |
| Quoc Le | 现代深度学习的先行者 | 猫神经元论文一作、seq2seq 共同作者 | Discovery Loop 联合创始人;2012 年那篇论文的三个人(Le、Dean、Ng)如今各奔东西又部分重聚 |
| Hinton / LeCun / Bengio | 学术界的深度学习三巨头 | 反向传播、CNN、深度学习理论(2018 图灵奖;Hinton 另获 2024 诺贝尔物理学奖) | 他们提出思想,Dean 造出让思想在行星尺度上跑起来的机器 |
这些论文经常涉及同一个难点:研究方法能在小规模实验中运行以后,怎样在更大的系统里保持效率和可靠性。GFS、TensorFlow、TPU 和 Pathways 给出的回答各不相同。
合作关系帮助串起这些项目,具体贡献仍以论文和公开项目记录为准。
合作方式与工程哲学
PRINCIPLES, NOT JUST SYSTEMS
Jeff 与 Sanjay 的结对工作
Dean 与 Ghemawat 的合作是 Google 工程文化最持久的传奇。他们共用一台电脑,一人敲键盘、一人实时审阅;《纽约客》把他们的关系比作 Monet 与 Renoir、Picasso 与 Braque 式的"双重创造力"。他们一起获得 2012 年 ACM-Infosys Foundation Award,并成为 Google 最早的两位 Senior Fellow(L11)。
几条贯穿始终的原则
- 异步优先:"我热爱异步性,它让你能扩展的规模大得多。"从 MapReduce 的容错到 DistBelief 的异步 SGD,再到 Pathways 的异步数据流,异步性是他系统里反复出现的主题。
- 软硬件协同设计:低精度算术、为算法定制芯片(TPU)、用强化学习做芯片布局,都在同一条逻辑线上。
- 把故障当常态:2000 年 RAM 比特翻转事件后,他的系统都把硬件故障视为默认假设,在软件层做检测、路由、自愈。
- 谨慎乐观,拒绝炒作:被问到 AGI 时间表时,他说自己"在中间位置";并有一条明确的表达纪律:"我不喜欢炒作还没做完的东西。"
彩蛋:Jeff Dean Facts
ENGINEERING FOLKLORE
2008 年左右,Google 工程师 Kenton Varda 受"Chuck Norris Facts"启发,在内部 App Engine 上建了一个匿名网站,让大家提交关于 Jeff Dean 的夸张段子,并在 2008 年 4 月 1 日把链接发给了全公司。经典的"事实"包括:
这些段子是工程师文化中的玩笑,不是技术事实。关于 Dean 查日志找到作者的故事,也应作为轶事阅读,不能拿来证明他具备超常能力。
参考与证据边界
SOURCES & UNCERTAINTY
- Jeff Dean 官方简介 — Google Research:教育、加入时间、三代训练系统、TensorFlow/Pathways/Spanner/word2vec/蒸馏/稀疏模型/芯片布局 RL/医疗 AI 等贡献的第一来源
- Wikipedia — Jeff Dean:出生、WHO 经历、DEC、Google 职务时间线、奖项(本文奖项表主要来源)
- The New Yorker(2018-12-10): "The Friendship That Made Google Huge" by James Somers:Dean 与 Ghemawat 的合作、2000 年索引危机、Level-11 Senior Fellow 等细节;付费墙外可参见 Duke 大学课堂 PDF 摘录
- University of Minnesota CSE: "Jeff Dean: Google's Unsung Hero" 与 Conan Daily 传记:童年、家庭、Altair 8800、Epi Info、WHO 等细节,多家传记网站交叉印证
- Dwarkesh Podcast(2025-02): "Jeff Dean & Noam Shazeer — 25 years at Google":本文直接引语的主要来源
- Sequoia AI Ascent 2025 主旨演讲视频 与 Business Insider(2025-05):"虚拟工程师"预测等 AI Ascent 要点
- Google Blog(2012-06-26): 猫神经元实验官方介绍 与 ICML 2012 论文页、NPR 报道
- Pathways 系统论文(arXiv:2203.12533) 与 PaLM 论文(arXiv:2204.02311)
- vlsi.kr: Google TPU from v1 to Ironwood 与 Intuition Labs: TPU architecture:TPU 代际时间线(公开报道整理)
- ExpertBeacon: TensorFlow 简史 与 Databricks: What is TensorFlow?
- Dean LADIS 2009 主旨演讲 PDF(Jeff Dean 数字原始出处) 与 Johan Boné 的 latency numbers gist
- Radical Ventures: Our Investment in Discovery Loop:使命、闭环逻辑、领域与创始人背景的一手来源
- Reuters(2026-08-05) · The Decoder(2026-08-05) · NYT(2026-08-05) · TechCrunch(2026-08-05):离职与重组的多方交叉报道
- Wikipedia — Noam Shazeer 与 CNBC(2026-06-18):Shazeer 轨迹(Character.AI → 2024 回归 → 2026 转投 OpenAI)
- Wikipedia — Oriol Vinyals 与 Google Research 简介:seq2seq、AlphaStar、Gemini 联合负责人
- TIME100 AI 2025 — Jeffrey Dean
- TheJeffDeanFacts (GitHub) 与 tropf.io: Jeff Dean Facts:梗的归档与经典例子
- 高置信度:教育背景、加入 Google 时间、主要系统贡献、Google 官方职务、奖项,来自 Google Research 官方简介、Wikipedia、ACM/NAE 官方记录与论文本身。
- 中等置信度,多家报道交叉:童年经历(Altair、索马里难民营、Epi Info 20 万行 Pascal)、2000 年索引危机细节、"要我就得也要 Sanjay",来自传记、New Yorker、Minnesota CSE 等;部分属于轶事/二手叙述。TPU 代际与 PaLM MFU 57.8% 等数字来自论文或公开技术报道,具体以 Google 官方发布为准。
- 快速发展的近期事件(2026-06 至 2026-08):Shazeer 转投 OpenAI、Dean 离职与 Discovery Loop、Hassabis 职务变动来自 CNBC/Reuters/NYT/TechCrunch/The Decoder 等多家主流媒体,但公司尚处交接期,后续细节可能变化。
- 我的解读(非事实):"从 WHO 到 Discovery Loop 的闭环"、"Dean 是 AI 时代的总工程师而非发明家"、同侪对照中的原型归纳,均是我个人的主题性阅读,不代表 Dean 本人或任何来源的表述。