← 返回博客
The Engineer Who Built Google’s AI

Jeff Dean:从 Google 分布式系统到 Discovery Loop

2026 年 8 月,Jeff Dean 与 Sanjay Ghemawat、Oriol Vinyals、Quoc Le 共同创办 Discovery Loop。新公司的方向是用 AI 自动化实验过程。要理解这次选择,可以先沿他在 Google 的公开论文和产品记录,看看过去具体解决过哪些问题。

2026-08-06 人物 · AI 历史 约 25 分钟阅读
Scroll

本文按求学、分布式系统和机器学习系统展开,后半部分保留八篇论文的技术摘要。Dean 的工作与多位合作者、不同团队交织,不能把这些系统写成一个人独立创造的结果;访谈回忆也与论文中的可核对设计分开列出。

先看参与过的系统与研究

关键数字

0年
在 Google(1999–2026),约第 30 号员工
≈ 10,000 天
0大支柱
GFS / MapReduce / Bigtable
0代系统
DistBelief → TensorFlow → Pathways
0CPU 核心
2012 猫神经元实验规模
≈ 1,000 台机器
0行 Pascal
据报道 16 岁为 Epi Info 所写
1999落幕 / 启程
离开 Google,创办 Discovery Loop 任 CEO
1999–2026

分布式基础设施

系统论文/时间核心贡献行业影响
GFSSOSP 2003廉价商用机上的容错分布式文件系统HDFS 思想来源
MapReduceOSDI 2004把大规模数据处理抽象为 map/reduce 两阶段催生 Hadoop,定义"大数据"
BigtableOSDI 2006稀疏、分布式、持久化的多维排序表HBase、Cassandra 的蓝本
SpannerOSDI 2012全球分布式、强一致关系数据库全球级事务系统标杆
LevelDB2011 开源轻量级持久化键值存储众多数据库的底层引擎参考

AI/ML 系统与算法

系统/算法时间核心贡献
Google Brain2011与 Andrew Ng、Greg Corrado 等创建深度学习研究团队;2012 年起由 Dean 领导
DistBelief2011第一代大规模分布式深度学习训练框架,支撑 Search、Ads、Translate、Photos 等产品
TensorFlow2015 开源Dean 是初始系统主要设计者之一;GPU、自动微分、数据流图、移动端支持
TPU2015 部署,2016 公布推动定制 AI 加速器;参与多代 TPU(v1–v7/Ironwood)研究
Pathways2021 愿景,2022 论文下一代异构分布式 ML 平台,支撑 PaLM 与 Gemini 超大规模训练
word2vec / 蒸馏 / 稀疏模型2013–词向量、知识蒸馏、稀疏神经网络架构的共同开创者之一
芯片布局 RL2021 Nature用强化学习做 ASIC 布局布线,达到或超过人类专家水平

主要荣誉

年份荣誉说明
2009ACM Fellow / NAE 院士计算机协会会士与美国国家工程院院士
2012Mark Weiser + ACM 计算奖 + ACM-Infosys操作系统创造力奖、ACM 计算奖;与 Sanjay 共获 Infosys 奖
2016美国艺术与科学院院士American Academy of Arts and Sciences
2021IEEE John von Neumann MedalIEEE 冯·诺依曼奖章
2025TIME100 AI《时代》周刊 AI 领域 100 位最具影响力人物

逐年大事记(1968–2026)

年份事件
19687 月 23 日生于夏威夷;父亲 Andy Dean 是热带病研究者,母亲为医学人类学家
~1981跳过八年级最后三个月,随父母赴索马里难民营帮忙
198516 岁,据报道为父亲的流行病学软件 Epi Info 编写约 20 万行 Pascal 代码
1990明尼苏达大学计算机科学与经济学双学士(summa cum laude);本科论文做神经网络并行训练
1990–91WHO 日内瓦总部全球艾滋病项目,开发 HIV/AIDS 统计建模与预测软件
1996华盛顿大学计算机科学博士,导师 Craig Chambers,方向为编译器与整体程序优化
1996–99DEC 西部研究院(WRL),做性能分析工具与微处理器架构;结识 Sanjay Ghemawat
1999短暂任职 mySimon;年中加入 Google(约第 30 号员工),与 Sanjay 同年入职
20003 月索引系统危机:与 Sanjay 一个周末定位廉价 RAM 比特翻转问题并重写索引系统
2003GFS 论文(SOSP);参与五代爬取/索引/查询系统建设
2004MapReduce 论文(OSDI),与 Ghemawat 两人合著
2006Bigtable 论文(OSDI)
~2007机器翻译系统优化:"12 小时翻一句话"降到百毫秒级
2009LADIS 演讲给出"每个程序员都该知道的延迟数字";同年获 ACM Fellow、NAE 院士
2011LevelDB 开源;与 Andrew Ng 等创立 Google Brain;DistBelief 投入使用
2012猫神经元实验(ICML);获 Mark Weiser 奖、ACM 计算奖、ACM-Infosys 奖;开始领导 Google Brain
2013word2vec 论文(与 Mikolov 等合作)
201511 月 9 日 TensorFlow 开源(v0.5.0);TPU v1 部署进数据中心
2016TPU 对外公布;TPU v1 支撑 AlphaGo 对弈李世石;获美国艺术与科学院院士
2017TPU v1 论文(ISCA);Transformer 论文《Attention Is All You Need》出自 Google Brain(Dean 领导 Brain,但不在作者名单)
20184 月出任 Google AI 负责人;TPU v3 发布;《纽约客》发表 Dean–Sanjay 特写
2021芯片布局 RL 论文登 Nature;获 IEEE 冯·诺依曼奖章;10 月发布 Pathways 愿景
2022Pathways 系统论文(MLSys);PaLM 发布(540B,6,144 块 TPU v4)
2023Brain × DeepMind 合并;Dean 任 Google 首席科学家、Gemini 联合技术负责人;Gemini 1.0 发布
2024Gemini 1.5 发布(长上下文,跨都市区数据中心训练);TPU v6 Trillium
20252 月 Dwarkesh 播客与 Noam Shazeer 同台;5 月 Sequoia AI Ascent 主旨演讲;入选 TIME100 AI;TPU v7 Ironwood
20268 月 5 日:宣布离开 Google,与 Sanjay、Quoc Le、Oriol Vinyals 创办 Discovery Loop 任 CEO;同日 Hassabis 卸任 DeepMind CEO

童年与求学(1968–1996)

FROM HAWAII TO GENEVA

在热带病研究者家庭长大

Jeffrey Adgate Dean 1968 年 7 月 23 日出生于夏威夷。他的父亲 Andy Dean 是热带病研究者,后来担任过明尼苏达州流行病学家并在 CDC 工作;母亲是医学人类学家。由于父母工作的关系,童年时期他随家庭频繁搬迁。

传记资料记载,Dean 少年时曾随父母到索马里参与相关工作。父亲的公共卫生研究让他较早接触到统计与软件处理的实际需求。

第一台电脑与 16 岁的 20 万行 Pascal

Dean 的编程启蒙来自父亲。父亲在家组装了一台 Altair 8800 套件计算机,Dean 在旁边帮忙调试,逐渐学会自己编程。12、3 岁时,他买了一本包含游戏源代码的书,先照着写,再修改,最后开始原创。

Dean 少年时期参与过父亲使用的流行病学软件 Epi Info。传记中反复出现“约 20 万行 Pascal”的记述;本文没有对应版本的代码仓库,保留为传记来源中的说法。

明尼苏达本科:计算机 + 经济学

1990 年,Dean 获得明尼苏达大学计算机科学与经济学学位,并在课程中接触神经网络并行训练。他后来描述过在 32 处理器 Hypercube 上实现模型并行和数据并行的经历:

我本科最后一年上一门并行计算课,其中一节讲到了神经网络,我就是这样接触到它的。我在一台 32 处理器的 Hypercube 机器上实现了模型并行和数据并行。

"I got introduced to neural nets in one section of one class on parallel computing that I was taking in my senior year... I implemented model parallelism and data parallelism on a 32-processor Hypercube machine." — Dwarkesh Podcast, 2025-02

课程中的并行训练实验,是他早年接触机器学习系统的记录。本科期间,他也结识了后来的妻子 Heidi Hopper。毕业后,他先从事公共卫生软件,再进入编译器研究。

日内瓦:用软件追踪艾滋病疫情

1990–1991 年,Dean 在日内瓦为 WHO 的全球艾滋病项目开发统计建模、预测和分析软件。模型需要接收数据、执行计算,并给使用者返回可解释的结果;这份工作将软件开发与科学问题放在了同一个项目里。

华盛顿大学博士:编译器与整体程序优化

之后他进入华盛顿大学,在 Craig Chambers 指导下研究编译器和面向对象语言的整体程序优化,1996 年取得博士学位。

DEC 时期与 Sanjay Ghemawat 的合作

THE FRIENDSHIP THAT MADE GOOGLE HUGE

博士毕业后,Dean 加入 DEC Western Research Lab,在系统研究工作中结识了 Sanjay Ghemawat。两人后来在 Google 合作多年,共同署名的论文提供了比人物轶事更清楚的工作记录。

像爵士乐手一样结对编程

《纽约客》2018 年的特写描写了两人共用一台电脑结对编程:一人输入,另一人审阅和讨论。文章对性格与节奏的描述属于采访观察。Dean 也谈过这种合作带来的收益:

和 Sanjay 一起写出的代码,比我们各自单独写的都要好。

"When I work with Sanjay, the code we write together is better than anything either one of us could write alone."

两人随后都加入了 Google

Dean 与 Ghemawat 于 1999 年先后加入 Google。此后,他们与同事共同发表的系统论文,记录了两人从搜索基础设施到机器学习系统的合作。

加入 Google 与 2000 年的那个周末

EARLY GOOGLE · 索引故障与排查

Dean 于 1999 年年中加入 Google,是公司大约第 30 号员工。彼时 Google 只有 25 到 30 人。他的第一份工作是广告、抓取、索引与查询服务系统,此后参与了五代爬取、索引与查询服务系统的实现。他回忆:

我加入的时候,公司也就 25、26 个人,差不多那样。

"When I joined, we were 25 people, 26 people, something like that." — Dwarkesh Podcast, 2025-02

一次索引故障的排查

《纽约客》记录了 Google 早期的一次索引故障。当时公司正在扩大搜索业务,索引的可靠性是团队需要处理的实际问题。下面的过程来自这篇报道,不等同于完整事故报告。

六位工程师挤进临时作战室。公司的第一位员工 Craig Silverstein 和 Bogdan Cocosel 花了四天没找到原因。Dean 和 Ghemawat 接手后,把损坏的索引文件转储成原始二进制,最终发现:廉价内存芯片会在运行时自发翻转比特位(0 变 1,1 变 0),造成静默数据损坏,而不是软件 bug。

报道中的排查把问题追到数据损坏与容错。随着机器数量增加,组件故障需要成为系统的常规处理对象。这也是后来 GFS、MapReduce 等论文中反复出现的设计条件。

Google 的存储与分布式计算系统

GFS · MAPREDUCE · BIGTABLE

随后,Dean 与 Ghemawat 及其他同事参与了 GFS、MapReduce、Bigtable 等系统。它们分别处理文件存储、批量计算和结构化数据,工作负载不同,共同面对集群规模与故障恢复问题。

GFS(2003):把廉价硬盘当成一个文件系统

Ghemawat、Howard Gobioff 与 Dean 在 SOSP 2003 发表 GFS 论文,讨论用商用机器支持大文件、追加写入与故障恢复。master 管理元数据,chunkserver 保存数据,副本与恢复机制应对组件故障。

MapReduce(2004):把任务与运行时分开

Dean 与 Ghemawat 在 OSDI 2004 发表 MapReduce。应用提供 map 和 reduce 等逻辑,运行时负责分配任务、移动数据和重试失败任务。这让程序员可以减少每个批处理任务中重复编写的分布式执行逻辑。

Bigtable(2006):半结构化数据的分布式答案

2006 年 OSDI,Dean、Ghemawat 与 Fay Chang、Mike Burrows 等发表了 Bigtable,为 Google 的搜索索引、Google Earth、Google Finance 等提供可扩展的稀疏表存储。它是 HBase、Cassandra 等 NoSQL 系统的直接灵感来源。

Spanner、LevelDB、Protocol Buffers 与 Jeff Dean 数字

同一时期,Dean 还参与了:

  • Spanner(OSDI 2012):全球分布式、强一致关系数据库,用原子钟和 TrueTime API 解决跨地域事务。
  • Protocol Buffers:Google 内部 RPC 和数据持久化的结构化序列化格式,后来成为 gRPC 的核心部分。
  • LevelDB(2011 开源):轻量级、可嵌入的键值存储,由 Dean 和 Ghemawat 设计,被无数系统借鉴。

此外,工程师圈子里流传着一份"Jeff Dean 数字"——他 2009 年在 LADIS 大会主旨演讲《Designs, Lessons and Advice from Building Large-Scale Distributed Systems》中整理的数据中心各级延迟:L1 缓存 ~0.5ns、分支预测失败 ~5ns、内存访问 ~100ns、SSD 随机读 ~150μs、磁盘寻道 ~10ms、跨数据中心往返 ~150ms。这份表后来经 Johan Boné 的 gist 传播,成为无数系统设计与面试题的标准参考(原始 PDF 仍可在 Cornell 与 Google Research 站点找到)。

转向机器学习:从翻译系统到猫神经元

THE PIVOT TO MACHINE LEARNING

2007 年:"翻译一句话要 12 小时"

Dean 从基础设施转向机器学习,有一个常被提到的转折故事。2007 年前后,Google 的机器翻译系统慢到令人难以置信。他在 2025 年 2 月的 Dwarkesh 播客里回忆:

"翻译一个句子要 12 个小时。"我们重新设计了内存中的压缩 N-gram 表示和并行查询,把延迟降到了百毫秒级。

"It takes 12 hours to translate a sentence." — Jeff Dean, Dwarkesh Podcast, Feb 2025

这段访谈提到的需求,把机器学习模型与系统性能放在同一个问题里。随后要解决的不仅是模型如何训练,还有更多机器参与以后,数据与参数怎样交换。

2011:Google Brain 的诞生

2011 年,Dean 与 Andrew Ng(时任斯坦福大学教授)、Greg Corrado 等人共同创建了 Google Brain。团队被放进 Google X 实验室,目标是"建造非常大的神经网络"。2012 年,Dean 开始直接领导这个团队。第一代训练系统 DistBelief 让模型可以扩展到数千个 CPU 核心,训练出的模型比之前大约大 60 倍,被部署在 Search、Ads、Translate、Photos、Maps、Street View、语音识别和 YouTube 等产品中。

2012:大规模无监督图像实验

2012 年,Google Brain 团队发表了 ICML 论文 "Building high-level features using large scale unsupervised learning"(Quoc Le 等,包括 Jeff Dean 与 Andrew Ng)。实验用 1,000 台机器、16,000 个 CPU 核心,无监督地观看了约 1,000 万张 YouTube 视频帧。结果,网络最高层自发涌现出一个对"猫脸"强烈响应的神经元——它从未被告诉过"猫"是什么。Dean 回忆:

那个神经网络可能比之前训练过的最大网络大 50 倍,而且效果很好。扩大神经网络规模看起来是个好主意——事实证明它确实是。

"That neural net was probably 50x bigger than one that had been trained previously, and it got good results... scaling up neural nets seems like, I thought it would be a good idea and it seems to be." — Dwarkesh Podcast, 2025-02

实验在当时的数据和训练设置下,观察到对特定视觉模式有选择性响应的单元。它提供了一组关于大规模无监督学习的结果,具体效果要与论文的任务和对照一起阅读。

深度学习基础设施:TensorFlow、TPU 与算法-硬件协同设计

DISTBELIEF → TENSORFLOW → TPU

TensorFlow:重写 DistBelief,开源 2015

TensorFlow 接续了 DistBelief 之后的训练系统工作,2015 年 11 月 9 日开源。相比仅看“重写”这个动作,更值得检查的是数据流图、设备放置、自动微分和部署接口怎样变化。

Dean 将自己列为 TensorFlow 初始设计与实现者之一。开源后的框架让研究者可以在公开接口上定义计算图、训练模型并尝试不同设备,相关功能也随版本继续变化。

TPU:从工作负载估算到专用硬件

TPU 项目的触发点是一个粗略估算:如果用户每天只用语音搜索 3 分钟,Google 就得把数据中心容量翻倍。这促使团队设计专用 ASIC。Dean 参与撰写的 ISCA 2017 论文 In-Datacenter Performance Analysis of a Tensor Processing Unit 显示,TPU v1 在推理任务上相对同时期 GPU 有约 15–30 倍吞吐优势、30–80 倍能效优势。Dean 提到,TPU v1 从设计想法到部署进数据中心大约只用了 15 个月。他解释设计动机时说:

我们在 Google 开始造 TPU,它本质上就是一台低精度线性代数机器。顺便说一句,这些算术可以用很低的精度完成,所以你还能塞进更多乘法器单元。

"We started to build TPUs at Google that were really just reduced-precision linear algebra machines... the arithmetic can be really low precision, so then you can squeeze even more multiplier units in." — Dwarkesh Podcast, 2025-02

TPU 的代际演进大致如下(基于公开报道整理,非 Google 官方完整规格表):

代数时间关键特征
TPU v12015 部署,2016 公布推理专用,INT8,256×256 脉动阵列,92 TOPS;支撑 AlphaGo vs. 李世石
TPU v22017首次支持训练,引入 bfloat16,Cloud TPU 上线,256 芯片 Pod
TPU v32018性能约为 v2 两倍,液冷,1,024 芯片 Pod
TPU v42020 部署,2021 公布光路交换实现可重构 4,096 芯片 Pod,训练 LaMDA/MUM/PaLM
TPU v5e/v5p2023分推理优化(v5e)与训练优化(v5p)两条线
TPU v6 Trillium2024公开报道中训练 Gemini 2.0 的硬件之一
TPU v7 Ironwood2025面向推理与 Gemini 3 级负载设计,更高 HBM 与算力密度

其他重要贡献

  • word2vec(2013):与 Mikolov 等合作的词分布式表示论文,让"king - man + woman ≈ queen"成为可能。
  • 蒸馏(Distillation):该技术早期的共同开创者之一,让小模型继承大模型能力。
  • 用强化学习做芯片布局(2021 Nature):将 ASIC 布局布线建模为强化学习问题,达到或超过人类专家水平。
  • 医疗 AI:参与多项将机器学习用于医疗诊断与健康管理的项目。

大模型时代:Pathways、PaLM、Gemini 与首席科学家

PATHWAYS → PaLM → GEMINI

Pathways 愿景(2021)

2021 年的 Pathways 博客提出统一处理多类任务的方向,2022 年系统论文进一步描述异步分布式数据流和加速器编排。愿景与已经实现的系统接口需要分开看,不能把前者的任务范围写成当时已有能力。

PaLM(2022):Pathways 的大规模训练案例

PaLM 使用 Pathways 在 6,144 块 TPU v4 上训练 5,400 亿参数模型。它既是一项模型实验,也是观察跨加速器训练编排的案例;后文分别列出模型任务表现和系统利用率。

2023:Google Brain 与 DeepMind 合并

2023 年,Google 将 Google Brain 与 DeepMind 合并为 Google DeepMind。Dean 转任 Google 首席科学家,同时担任 Gemini 的联合技术负责人。他的角色从"带一支团队"变成"把 Google 最前沿的 AI 研究串在一起"。在 2025 年的访谈中,他透露 Gemini 1.5 曾在多个都市区的数据中心之间联合训练——"我们已经在这么做了"。

离开与 Discovery Loop:2026 年 8 月 5 日

THE NEXT CHAPTER

2026 年 8 月,Google 公布 AI 组织调整,Dean 与几位长期合作者也公布新公司。组织职务的变化与新公司的研究目标分别列在下面。

  • Jeff Dean 离开 Google,结束 27 年生涯(时年 58 岁)。
  • Demis Hassabis 卸任 Google DeepMind CEO,转任 DeepMind 董事长与 Alphabet 首席科学家,继续领导 Isomorphic Labs;他在内部信里表示 AGI"近在咫尺"。DeepMind 日常管理由高级副总裁 Koray Kavukcuoglu 接管,直接向 Sundar Pichai 汇报。
  • Dean 与 Sanjay Ghemawat、Quoc Le、Oriol Vinyals 联合创办 Discovery Loop。

Discovery Loop 的轮廓

维度内容
法律形态独立的公共利益公司(public benefit corporation)
使命自动化机器学习、科学与工程,用 AI 加速科学发现;让系统能"并行运行成千上万个实验"
闭环逻辑"AI 提出实验、执行实验、从结果中学习、递归迭代"——先从自动化机器学习研究本身做起,再进入物理世界
领域工程、医学、材料设计、清洁能源(Radical Ventures 投资信的表述)
联合创始人Jeff Dean(CEO)、Sanjay Ghemawat、Quoc Le、Oriol Vinyals
投资方Radical Ventures 与 Khosla Ventures 联合领投种子轮;Alphabet 作为创始投资方参与并任云合作伙伴

新公司准备解决什么问题

Discovery Loop 的公开说明把自动化实验循环作为目标:提出实验、执行、分析结果,再据此迭代。与以往为研究提供计算基础设施相比,这次公布的目标还包括让 AI 参与安排实验。

新公司的目标尚需后续研究和系统结果来检验。组织调整说明了人员与职责变化,还不足以判断一个研究项目的技术前景。


八篇核心论文深度解析

KEY PAPERS, PROBLEM → DESIGN → IMPACT

以下八篇论文覆盖存储、分布式计算、训练框架和硬件。每篇先交代问题,再列设计与实验范围,便于回到原文继续阅读。

① The Google File System

SOSP 2003 · Ghemawat, Gobioff, Dean

问题

怎样在规模较大的商用机器集群中,支持大文件工作负载并处理持续发生的组件故障?

设计

单 master 元数据服务器 + 大量 chunkserver;文件切成 64MB 的 chunk,每块三副本;把"组件必然失效"写进设计前提,靠快速重复制而非持久硬件保证可靠性。

影响

GFS 的接口、数据布局与容错设计影响了 HDFS 等后续系统。阅读后继实现时,还要看其工作负载和相应改动。

② MapReduce

OSDI 2004 · Dean, Ghemawat(仅两位作者)

问题

Google 有大量"对全量数据做某种统计"的需求,但每次都要手写分布式并行、容错、数据分发代码。

设计

应用提供 map 和 reduce 计算,运行时负责分区、调度、数据本地性和失败任务重执行。函数是否无副作用,以及重试需要什么条件,应按论文的编程模型讨论。

影响

Hadoop MapReduce 借鉴了这套编程与执行模型。Spark 后来采用不同的数据抽象和执行机制,以处理包括迭代计算在内的其他需求。

③ Bigtable

OSDI 2006 · Chang, Dean, Ghemawat 等

问题

Google 的数据形态介于关系表与文件之间:稀疏、海量、需要低延迟随机读写。

设计

"稀疏的、分布式的、持久的多维排序映射",构建在 GFS 之上;tablet 为管理单位,按行键排序;牺牲 SQL 语义换取扩展性。

影响

Bigtable 影响了 HBase、Cassandra 等系统的部分设计。它对数据模型和一致性的选择,服务于论文中描述的工作负载。

④ 猫神经元实验

ICML 2012 · Quoc Le 等(含 Dean, Andrew Ng)

问题

不标注数据,神经网络能否自己学出有意义的概念?

设计

9 层局部连接的稀疏自编码器,约 10 亿连接,跑在 1,000 台机器 / 16,000 CPU 核心上;喂入 1,000 万张 200×200 的 YouTube 无标注帧,训练三天。

数字与影响

论文记录了相应识别评估中的提升,并观察到对猫脸等模式有选择性响应的单元。这些结果的范围由训练数据、模型和测试任务共同决定。

⑤ TensorFlow 白皮书

arXiv 2016 / OSDI 2016 · Abadi 等(Dean 为主要设计者之一)

问题

DistBelief 的系统接口与硬件适配限制,促使团队重新考虑面向研究和部署的数据流框架。具体限制要回到论文描述,不能笼统写成旧系统无法使用或无法开源。

设计

数据流图 + 自动微分;算子可放置在 CPU/GPU/移动设备;同一套代码从手机跑到数千卡集群。

影响

TensorFlow 开源后,研究者和开发者可以基于公开接口构建训练与部署程序。它与其他框架一起,降低了重复实现底层计算和设备适配的工作量。

⑥ TPU v1 论文

ISCA 2017 · Jouppi 等(含 Dean)

问题

CNN 推理需求爆炸,通用 CPU/GPU 的能效撑不住"每人每天 3 分钟语音搜索"这种规模。

设计

推理专用 ASIC:256×256 INT8 脉动阵列(92 TOPS)、约 28MiB 片上存储、PCIe 协处理器;砍掉通用性换取密度与能效。

数字与影响

原稿摘录的吞吐、能效和开发周期数字,要与论文使用的基准、硬件及功耗口径一起阅读。它们说明专用加速器在那组负载中的表现,不代表对所有同期 GPU 任务的统一倍率。

⑦ Pathways: Asynchronous Distributed Dataflow for ML

MLSys 2022 · Barham, Chowdhery, Dean, Ghemawat 等

问题

上一代系统一次只能跑一个模型、绑定单一并行策略;超大模型需要跨数千加速器、混合并行、甚至跨数据中心。

设计

异步分布式数据流 + 单控制器编排;gang scheduling;构建在 XLA 之上,兼容 JAX 等前端;数据面依赖不阻塞控制面执行。

数字与影响

在 2,048 块 TPU 上跑 SPMD 计算达到接近 100% 加速器利用率;支持 16 级流水线、跨加速器岛分片。PaLM 与 Gemini 的训练底座;Dean 称之为第三代训练系统。

⑧ PaLM: Scaling Language Modeling with Pathways

2022 · Chowdhery, Narang, Devlin 等 60+ 作者(含 Dean)

问题

Pathways 愿景能不能在真实规模上兑现?

设计

540B 参数稠密 Transformer,跨两个 Cloud TPU v4 Pod、共 6,144 块芯片训练,模型并行度 12 路、数据并行 512 路。

数字与影响

报告列出的 MFU 为 57.8%,并给出了语言与推理任务结果。MFU 衡量训练执行效率,基准分数衡量指定任务表现,不能合并成对模型全部能力的一次验证。

他本人怎么说:访谈引语集

IN HIS OWN WORDS

以下引语均出自公开访谈,按主题分组(中文为意译,英文为原文)。

关于起点

我本科最后一年上一门并行计算课,其中一节讲到了神经网络——我就是这样接触到它的。我在一台 32 处理器的 Hypercube 机器上实现了模型并行和数据并行。

"I got introduced to neural nets in one section of one class on parallel computing that I was taking in my senior year." — Dwarkesh Podcast, 2025-02

我加入 Google 的时候,公司也就 25、26 个人,差不多那样。

"When I joined, we were 25 people, 26 people, something like that." — Dwarkesh Podcast, 2025-02

关于规模

那个网络可能比之前训练过的最大网络大 50 倍,而且效果很好。

"That neural net was probably 50x bigger than one that had been trained previously, and it got good results." — Dwarkesh Podcast, 2025-02

一代代模型之间的进步,往往部分由硬件和更大的规模驱动。

"Improvements from generation to generation of these models often are partially driven by hardware and larger scale." — Dwarkesh Podcast, 2025-02

模型可能会继续变大,你还能从那里拿到一两个数量级的提升。

"The models are probably going to be bigger, you'll get another order of magnitude or two from that." — Dwarkesh Podcast, 2025-02

关于硬件

我们在 Google 开始造 TPU,它本质上就是一台低精度线性代数机器。

"We started to build TPUs at Google that were really just reduced-precision linear algebra machines." — Dwarkesh Podcast, 2025-02

别去看新硬件的牙口。

"Never look new hardware in the mouth." — Dwarkesh Podcast, 2025-02

关于未来(Sequoia AI Ascent,2025-05)

  • 预测 AI 系统在大约一年内达到初级软件工程师的水平,尤其是长时间运行的 agent 式编程任务。
  • 推理硬件优化的两个关键:减少数据搬运与提高算力供给效率。
  • 未来进步的关键在 context engineering 与推理时计算,而不只是更大的预训练。
  • 提出"1000 倍能耗差距":如果模型能达到人脑能效水平,相对当前硬件还有约三个数量级的余量。
  • 预测 ML 系统参与改进 ML 系统自身——分解目标、自动跑实验,延续 AlphaEvolve 类工作的方向。

关于克制

面对 AGI 时间表,我大概在中间位置。我就是不喜欢炒作还没做完的东西。

"I'm somewhere in the middle... I just don't like to hype things that aren't done yet." — Dwarkesh Podcast, 2025-02

我确实相信,让这些系统变得安全是可能的。

"I do think it is possible to make these systems safe." — Dwarkesh Podcast, 2025-02

与合作者的工作如何衔接

COLLABORATORS · 结合具体论文和项目阅读

Dean 与多位研究者在不同项目中合作。下表按项目和工作方向列出关联,便于继续查阅各自的论文与职责。

人物原型代表作与 Dean 的对照
Sanjay Ghemawat另一半:安静的深度型工程师GFS、MapReduce、Bigtable、LevelDB27 年搭档,同进退;2026 年一起离职创业
Andrew Ng教育者与创业者Google Brain 共同创始人、Coursera、deeplearning.ai同为 Brain 创始人,Ng 走向教育与创业,Dean 留在 Google 造系统
Demis HassabisAGI 野心家、诺奖得主AlphaGo、AlphaFold(2024 诺贝尔化学奖)、Isomorphic LabsHassabis 的科学路径拿了诺奖;Dean 则把科学留给了离职后的 Discovery Loop
Noam Shazeer论文作者、产品化冲刺者《Attention Is All You Need》共同作者2021 年出走创办 Character.AI,2024 年以约 27 亿美元授权交易回归任 Gemini 联合负责人,2026 年 6 月又转投 OpenAI;Dean 在一家公司待了 27 年才离开
Oriol Vinyals全能型研究者seq2seq 共同发明人、AlphaStar 负责人、Gemini 联合负责人Discovery Loop 联合创始人之一,与 Dean、Quoc Le 再聚首
Quoc Le现代深度学习的先行者猫神经元论文一作、seq2seq 共同作者Discovery Loop 联合创始人;2012 年那篇论文的三个人(Le、Dean、Ng)如今各奔东西又部分重聚
Hinton / LeCun / Bengio学术界的深度学习三巨头反向传播、CNN、深度学习理论(2018 图灵奖;Hinton 另获 2024 诺贝尔物理学奖)他们提出思想,Dean 造出让思想在行星尺度上跑起来的机器

这些论文经常涉及同一个难点:研究方法能在小规模实验中运行以后,怎样在更大的系统里保持效率和可靠性。GFS、TensorFlow、TPU 和 Pathways 给出的回答各不相同。

合作关系帮助串起这些项目,具体贡献仍以论文和公开项目记录为准。

合作方式与工程哲学

PRINCIPLES, NOT JUST SYSTEMS

Jeff 与 Sanjay 的结对工作

Dean 与 Ghemawat 的合作是 Google 工程文化最持久的传奇。他们共用一台电脑,一人敲键盘、一人实时审阅;《纽约客》把他们的关系比作 Monet 与 Renoir、Picasso 与 Braque 式的"双重创造力"。他们一起获得 2012 年 ACM-Infosys Foundation Award,并成为 Google 最早的两位 Senior Fellow(L11)。

几条贯穿始终的原则

  • 异步优先:"我热爱异步性,它让你能扩展的规模大得多。"从 MapReduce 的容错到 DistBelief 的异步 SGD,再到 Pathways 的异步数据流,异步性是他系统里反复出现的主题。
  • 软硬件协同设计:低精度算术、为算法定制芯片(TPU)、用强化学习做芯片布局,都在同一条逻辑线上。
  • 把故障当常态:2000 年 RAM 比特翻转事件后,他的系统都把硬件故障视为默认假设,在软件层做检测、路由、自愈。
  • 谨慎乐观,拒绝炒作:被问到 AGI 时间表时,他说自己"在中间位置";并有一条明确的表达纪律:"我不喜欢炒作还没做完的东西。"

彩蛋:Jeff Dean Facts

ENGINEERING FOLKLORE

2008 年左右,Google 工程师 Kenton Varda 受"Chuck Norris Facts"启发,在内部 App Engine 上建了一个匿名网站,让大家提交关于 Jeff Dean 的夸张段子,并在 2008 年 4 月 1 日把链接发给了全公司。经典的"事实"包括:

"Jeff Dean 的键盘只有两个键:0 和 1。"
"编译器不会警告 Jeff Dean;Jeff Dean 会警告编译器。"
"当上帝说'要有光'时,Jeff Dean 在场做代码评审。"

这些段子是工程师文化中的玩笑,不是技术事实。关于 Dean 查日志找到作者的故事,也应作为轶事阅读,不能拿来证明他具备超常能力。

参考与证据边界

SOURCES & UNCERTAINTY

证据边界与不确定性说明:
  • 高置信度:教育背景、加入 Google 时间、主要系统贡献、Google 官方职务、奖项,来自 Google Research 官方简介、Wikipedia、ACM/NAE 官方记录与论文本身。
  • 中等置信度,多家报道交叉:童年经历(Altair、索马里难民营、Epi Info 20 万行 Pascal)、2000 年索引危机细节、"要我就得也要 Sanjay",来自传记、New Yorker、Minnesota CSE 等;部分属于轶事/二手叙述。TPU 代际与 PaLM MFU 57.8% 等数字来自论文或公开技术报道,具体以 Google 官方发布为准。
  • 快速发展的近期事件(2026-06 至 2026-08):Shazeer 转投 OpenAI、Dean 离职与 Discovery Loop、Hassabis 职务变动来自 CNBC/Reuters/NYT/TechCrunch/The Decoder 等多家主流媒体,但公司尚处交接期,后续细节可能变化。
  • 我的解读(非事实):"从 WHO 到 Discovery Loop 的闭环"、"Dean 是 AI 时代的总工程师而非发明家"、同侪对照中的原型归纳,均是我个人的主题性阅读,不代表 Dean 本人或任何来源的表述。
写于 2026-08-06 · 事实核查基于文中所列来源 · 有错漏欢迎指正
文章目录16
Silent Star约 24 分钟