← 播客精读
Jeff Dean, Important Trends in AI — Princeton CS Distinguished Colloquium

Jeff Dean 普林斯顿演讲:从造神经网络到指挥一百个 AI Agent

普林斯顿大学 CS Distinguished Colloquium · 2026 年 2 月 10 日 · 1 小时 18 分
🎓 主讲:Jeff Dean · Google Research 与 Google DeepMind 首席科学家 · Gemini 项目共同负责人
🏛 场合:普林斯顿大学计算机系 Distinguished Colloquium · 2026 年 2 月 10 日 16:30 · CS 104 教室
📺 来源YouTube · Important Trends in AI: How Did We Get Here, What Can We Do Now, and Where are We Headed?(1:18:39 · 英文)
⏱ 全文约 16 分钟读完 · 英文引文保留原话(还原标点、去除语气词,未改语义),中文为编译 约 43 分钟 ·

介绍人开场说:「我 90 年代就认识 Jeff,那时他在 DEC 西部研究院,所以我可以确认,这不是一夜成名的故事。」

整场演讲的骨架是一条 35 年的时间线:1990 年一个本科生想用 32 台电脑训练神经网络,2012 年一次微厨房偶遇,2013 年一张信封背面的算术题,到 2026 年一千多人共同署名一篇技术报告。Jeff 讲的不是「AI 有多厉害」,而是今天的模型是被哪些具体的、经常很土的工程决定推出来的

一、1990 年,32 台电脑,和被搁置的 25 年

他先给了四条判断当框架:机器学习彻底改变了人们对计算机的预期;扩大规模(算力、数据、模型)持续带来更好结果;算法与架构改进同样带来巨大提升;想跑的计算和跑它的硬件正在剧烈变化。他强调后两者相乘:「规模给你 20 倍,算法给你 50 倍,最后拿到的是一千倍。」

Some observations 幻灯片:Jeff Dean 开场的四条判断

开场的四条观察,也是整场演讲的框架

他自己第一次见到神经网络是在本科入门课上——一张现在看非常朴素的图:一堆输入,做点处理,决定要不要发放信号、以多大强度发放,反向传播负责调整每条连接的权重。

I saw these as an undergrad in 1990 and I got super excited. I said, "Oh wow, that seems like a really good abstraction. It feels like it's a trainable thing and it can learn almost anything."

问题是当时电脑太弱——原话是 pathetically wimpy computers。于是他动了个念头:系里不是有台并行计算机?

Maybe if we use the parallel computer in the department, we could train much bigger neural networks. Maybe we just need to use 32 computers instead of one. So I did it.

他找 Vipin Kumar 教授做了毕业论文,试了两种并行方案,当年叫 pattern partitionedpipelined approach——也就是今天的数据并行和模型并行。回看那张加速比曲线他自己吐槽:曲线会走平,是因为增加机器时没同步把模型做大

然后是全场最有分量的自嘲:

I sort of filed that away as "oh, that's an interesting abstraction and it seems like something I should pay attention to" — and then I ignored it for the next 25 years.

二、微厨房里撞见 Andrew Ng

幻灯片:Fifteen Years of Machine Learning Advances

章节页:十五年机器学习进展,或者说,今天的模型是怎么来的

把他拉回神经网络的,是 Google 微厨房里的一次偶遇。他碰见斯坦福教授 Andrew Ng,随口问了句「你在这儿干嘛」。

Jeff: Oh, what are you doing here?
Andrew Ng: I'm not sure yet — I just started a week ago. But my students at Stanford are doing interesting things with training neural networks for speech and vision.
Jeff: Oh, that's cool. We should train really big neural networks. …And that was the origin, because we actually had quite a lot of computers in those days.

「我们有挺多电脑」是字面意思。他们据此造了 DistBelief:一套能在大量机器上同时做模型并行和数据并行训练的系统,训出的网络比当时公开可查的最大模型大 50–100 倍

2012 年 DistBelief 分布式训练幻灯片:模型并行与数据并行

2012 年 NeurIPS Large Scale Distributed Deep Networks:左为模型并行(一个网络切到 4 台机器),右为数据并行(多副本各自算梯度交参数服务器)。

一个细节:模型副本异步更新参数服务器——一个副本算完梯度送回去时,参数早被别的副本改过了。Jeff 直说这在数学上「绝对不对」:

Because it's asynchronous, [it's] definitely not the right mathematical thing… but it seemed to work, so we were sort of happy anyway despite it being theoretically wrong.

第一个大实验是拿 1000 万帧随机 YouTube 画面做完全无监督训练,用重建损失逼模型在高层形成比像素更抽象的表示。结果最高层有些神经元学会了对猫脸敏感,有些对人脸,有些对人的轮廓——没人告诉过它这些图里有什么。把它当初始化再做有监督训练,在 ImageNet 22000 类上相对提升了 70%

语言方向同期也有收获:用浅模型预测邻近词,cat、puma、tiger 就在高维空间里彼此靠近,且方向本身有意义——king→queen 和 man→woman 是同一个位移。一两年后 Ilya Sutskever、Oriol Vinyals、Quoc Le 用 LSTM 做出了序列到序列模型。

三、一张信封背面的算术题,逼出了 TPU

TPU 的起点不是宏大战略,而是 2013 年 5 月一次内部评审会的一页纸。

2013 年 TPU 起源幻灯片:语音识别声学模型的算力估算

原始幻灯片:8 层 × 2560 单元的声学模型,每 10 毫秒语音约 1 亿次乘加;10 亿用户 × 每天 3 分钟 ≈ 每天 2000 万核心日

背景是他们刚训出一个很好的语音识别模型——约六个月做出了相当于二十年语音研究的错误率改进,架构不花哨,八层全连接喂大量数据。问题出在部署:

That back-of-the-envelope calculation said if we wanted to deploy this to a scenario where we had a billion users talking to this model 3 minutes a day, we would need to double the number of computers Google had. And that didn't seem very tenable.

为一个语音功能把整个 Google 的机器翻一倍,这条路走不通。于是他们组建芯片团队,两年后 TPUv1 出来,靠的是神经网络的两个性质:推理时降低精度完全可以接受(七八位就够);模型几乎都由少数几类线性代数操作反复组合而成(核心是矩阵乘)。收益很直接——这块芯片不需要跑 Microsoft Word,也不需要跑 Chrome

TPUv1 turned out to be 15 to 30x faster than contemporary CPUs and GPUs, and 30 to 80 times more energy efficient. It's also now the most cited paper in ISCA's 50-year history.

TPU 超级计算机幻灯片:机架照片与光互连拓扑

TPU pod:机架实物、数据中心,以及 TPU v4 的光路交换拓扑(arXiv:2304.01433)

之后芯片团队转向训练,TPU 从单芯片变成「机器学习超级计算机」。v4 引入机架级光互连:系统能让一个 64 块加速器的机架「看起来」紧挨着一百米外的另一个;机架挂了就换,拓扑上照样是「就在旁边」。规模越大故障越多,能重新配置就是刚需。

复合增长是这样的:TPU v4 单芯片峰值约 275 TFLOPS,最大 pod 4096 块芯片;若把 TPU v2 整 pod 性能记为 1,第六代 Ironwood 约 3600 倍,能效约好 30 倍。同期 TensorFlow、PyTorch、JAX 也在改变整个领域——Gemini 用的是 JAX。

四、Transformer:不用再排队等上一个词

2017 年那篇论文的动机,是 LSTM 有两个结构性毛病。第一,它必须排队:每读一个词更新一次状态,每次都要等上一次就绪,严格的串行依赖,在现代硬件上并行不了第二,它把一切都压进一个向量:你想记住的所有东西都得塞进那一个状态向量,而不是把沿途每个向量都留下来、需要时再回头看。

Transformer 的关键观察针对第二点:把这些向量都存下来,用可学习的注意力机制去关注它们。效果不是小修小补——

10 to 100x less compute and a 10x smaller model gave you roughly the same quality as an LSTM that's much larger and much more compute-intensive.

另一条主线是自监督学习,逻辑粗暴:

There's a lot of text in the world. Self-supervised learning on this text can give you almost unlimited amounts of training data where you know the right answer.

两种训练目标:自回归(只看左边前缀,预测下一个词)和填空(双向都能看,遮住中间的词让模型猜)。填空更适合学表示,但没法做聊天机器人——对话时右边还不存在。他放了张为普林斯顿现做的例子:Princeton ___ 很难猜,但 Princeton University is cold in the ___ 就好猜多了。台下笑了。

五、稀疏模型:大脑不会为垃圾车调用莎士比亚

稠密模型的问题是:每个 token 都要把整个模型激活一遍。Jeff 说这不像大脑的工作方式:

While I'm worried about the garbage truck backing up at my car, some parts of my brain are active and the part that thinks about Shakespearean poetry is not active.

Mixture of Experts 让模型不同部分擅长不同的事,且连「该激活哪部分」的路由机制也是学出来的。容量可以很大,但每个 token 只激活一小部分参数,推理成本压得住。

2017 年稀疏模型幻灯片:Mixture of Experts 架构与性能曲线

ICLR 2017 Outrageously Large Neural Networks(Shazeer 等)。右图横轴计算预算,纵轴测试困惑度:蓝 LSTM,绿 MoE

省下的算力有两种花法:A——同样精度,训练算力降到约 1/8B——同样算力,换明显更好的模型。Jeff 的实际做法是「通常两边各要一点,最后落在中间某处」。

六、当芯片开始悄悄撒谎

这是全场最「系统工程」也最少被谈论的一节。规模一大,硬件就不再是「要么好用要么坏掉」:

Not all chips or machines or network cards or cables work as designed. That's a very sad but true state of the world. And in particular, some of them don't just fail in ways that you can detect immediately — they sometimes non-deterministically produce incorrect results silently, and sometimes that's related to dynamic conditions like the temperature of the rack at that particular moment.

跑独立计算已经够麻烦。但训练是同步的:几万块芯片被编排成一台机器,错误会顺着梯度迅速扩散。

If one of these things flips one of the bits in the exponent field of your gradient, all of a sudden you'll get 10 to the 20th propagating as a gradient instead of 0.2. And that makes you very, very sad.

指数位翻一个 bit,梯度就从 0.2 变成 10²⁰。应对办法是持续监控每层梯度范数,看有没有尖峰。

Silent Data Corruption 导致的梯度尖峰幻灯片

「Metrics anomaly: anomaly due to SDC」——纵轴梯度范数、横轴时间,黄框那次尖峰由静默数据损坏造成。

区分二者的办法朴素而聪明:确定性重放。检测到尖峰就自动重跑最近几步——结果相同多半是数据导致的,不同多半是硬件在算错。他还补了个边界情况:也存在确实发生了静默损坏、却没引起明显尖峰的,那种就没被检测到。

Pathways 分布式系统幻灯片

Pathways(MLSys 2022):Region A 两栋楼、Region B——不同颜色的箭头是不同层级的互连。

兜住这一切的是 Pathways。它按距离自动选通信路径:pod 内走 TPU 定制互连,跨 pod 同楼走数据中心网络,跨楼走园区链路,跨城域走广域网。JAX 跑在它之上时,整个训练由单台主机上的一个 Python 进程驱动——那进程觉得自己拥有几千块 TPU,哪部分坏了怎么换由 Pathways 在底下处理。

故障恢复的流程是:训练作业留有热备,并在空闲芯片上持续跑 SDC 检查器提前筛坏件。一旦重放发现两次答案对不上,系统就定位到具体哪个 pod、哪些芯片,踢出去、换上热备、训练继续。

七、写出解题过程,再想办法省下算力

思维链:你四年级数学老师说过的话

2022 年,「在推理时多想一会儿」开始成为正经事。做法是在提示里给一个写出了完整步骤的例题,模型就会照着这个模式,把目标题目的中间步骤也写出来。

思维链提示对比幻灯片与 GSM8K 曲线

左:标准提示直接给答案,答成 50(错);右:思维链写出中间步骤,答对。曲线是 GSM8K 解题率随规模变化。

This is what your fourth grade math teacher told you, and it's nice to see that ML models behave the same way.

他给了个理解角度:每生成一个 token 就是过一遍模型,答案长度正比于投入的计算量——写过程就是给它更多思考算力。

蒸馏:一篇被 NeurIPS 拒掉的论文

蒸馏要解决的是怎么把大模型能力搬进更小更便宜的模型,关键在老师给的不是标准答案,而是一整个概率分布

知识蒸馏幻灯片:教师模型与学生模型

「perform the concerto for ___」:答案是 violin,但老师模型还会给出 piano、trumpet、airplane 的概率——比「猜没猜中 violin」信息量大得多。

论文里那组语音识别实验:

设置训练帧准确率测试帧准确率
基线,100% 训练数据63.4%58.9%
基线,仅 3% 训练数据67.3%(过拟合)44.5%
软标签蒸馏,仅 3% 数据65.4%57.0%

3% 的数据,测试准确率 57.0% vs 全量数据的 58.9%——几乎追平。幻灯片角落还有一行注脚,显然故意放的:

Rejected from NeurIPS 2014. Published in workshop & put on arXiv. 24,000+ citations.

它今天在 Gemini 里的用途很具体:从 Pro 规模蒸出 Flash 规模,且后者几乎一样好。

这几年还有一条主线是 RL——用人类反馈、奖励模型,或可验证领域(数学交给定理证明器,代码看能否编译、过单元测试)来引导模型。他点出这里仍敞着一个问题:不可验证的领域里,奖励信号该从哪找?

投机解码:难的 token 很少,简单的很多

自回归解码的瓶颈在串行:生成完第一个 token,才能拿它的注意力状态去生成第二个。而从大 Transformer 解码是访存受限的——硬件能做的浮点运算,远多于它把权重搬进乘法单元的能力。

投机解码幻灯片:访存受限与草稿模型

观察一:解码是访存受限的。观察二:the sqrt of 7 is 2.646 里 7 好猜、2.646 难猜。

第二个观察是 token 难度差别极大:

"Can you tell me what the square root of seven is?" "Sure, the square root of seven is ___." That last token is really, really hard for the model to predict. But a lot of the other ones are very easy.

于是:草稿模型一口气生成比如 8 个 token,大模型并行检查。批大小从 1 变成 8,平均能接受 4.5 个。最漂亮的是代价:不改架构、不重新训练、输出分布严格不变,只换了解码算法。

八、Gemini:把分散的算力和想法合并起来

Gemini 的起源同样不浪漫。当时 Google 内部好几个组各自在做语言和多模态模型:

I sort of said, "this is stupid — why don't we all work together?" Instead of fragmenting our compute and our ideas, let's all work together and build a single kind of model that is multimodal, that has a lot of compute investment behind a more singular effort. That's the origin of the Gemini project.

项目 2023 年 2 月启动。到今天他已是一篇一千多位作者论文的共同作者——光列名单就要好几页,而且他们总想办法让开头几个作者名拼出一个好玩的词

「从一开始就多模态」是硬要求:语言、音频、图像、视频,外加非人类模态——近几代掺了少量激光雷达和机器人控制数据,先让模型知道「世上还存在这类数据」。现在输入输出都可以是任意模态交错混合。

上下文窗口:清晰 vs 糊成一团

Gemini 1.5 长上下文幻灯片

Gemini 1.5:模型内部可处理至多 1000 万 token,对外 API 提供至多 200 万 token 的文本/视频上下文

Unlike tokens in the training data — where you've taken trillions of tokens and stirred them together into hundreds of billions of parameters and it's all a little bit muddled and fuzzy — the information in the context window is very crisp, because you haven't mixed it with anything else.

训练数据是搅进几千亿参数里的糊状物;上下文窗口里的东西清晰,因为没和别的混过。

模型规格上他们立了条规矩:每一代的 Flash,都要比上一代的 Pro 更好。这条已连续维持三四代——今天最贵最慢的能力,六个月后会以便宜得多的形式出现。

IMO 金牌:从「Fred 有五只兔子」到 bonza 函数

2025 年 7 月 IMO 金牌水平表现幻灯片

2025 年 7 月 IMO:六题解对五题,35/42 分,金牌水平。题目以非形式化数学输入,全部在 4.5 小时内完成

幻灯片引了 IMO 主席 Gregor Dolinar 的话:

We can confirm that Google DeepMind has reached the much-desired milestone, earning 35 out of a possible 42 points — a gold medal score. Their solutions were astonishing in many respects. IMO graders found them to be clear, precise and most of them easy to follow.

Jeff 更在意用什么打的。前一年参赛用的是一套专门拼装的系统:数学专用模型、Lean 和定理证明器,几何题另配一个模型。这次用他的话说就是开箱即用的 Pro 规模 Gemini,只是给了很高的思考预算(幻灯片标注为 Gemini Deep Think 进阶版)。

We were happy to have a single general-purpose model — the same one we offered to users — able to get a gold medal at the IMO.

IMO 第 3 题完整证明幻灯片

IMO 2025 第 3 题:求最小实常数 c 使 f(n) ≤ cn 对所有 bonza 函数成立。模型输出含引理、分类讨论、上下界证明,最终证出 c = 4

放这张图时他刚讲完 GSM8K 上「Fred 有五只兔子又得到两只」那种题:

Remember back to "Fred had five rabbits and then he got two more." …This is now quite a bit beyond GSM8K, I would say.

他随即自己踩了刹车:「这还不是研究级数学。」紧接着补了半句——「不过你能看出来,两年里的坡度相当陡。」

九、一千多个作者是怎么协作的

结构:整体负责人 + 项目与产品管理,下分若干子领域——预训练、后训练与 RL、跑在 Pixel 上的端侧版本、安全、视觉、音频、代码、agent、国际化,加几个横向核心:训练数据(给定 token 预算下怎么拿到最高质量数据)、评测基础设施、代码库,以及给 Gemini N+2、N+3 输送想法的长期研究

地理:约三分之一在湾区,三分之一在伦敦,三分之一散在纽约、巴黎、波士顿、苏黎世、班加罗尔等地。

Time zones are super annoying. Not much we can do about it. But the golden hours between California and London — there's about three hours a day that are not too terrible for anyone.

Gemini Structure & Ways of Working 幻灯片

协作方式:Chat Spaces、编号递增的内部 RFC,以及围绕公共基线的排行榜

剩下时间只能靠异步协作撑住。机制三层:

1. 聊天空间——大大小小的讨论组,Jeff 本人在 200 多个里。

2. Gemini RFC——半正式的内部征求意见文档,篇幅从「我有个想法想听听意见」的一页纸,到「我把这想法的十个变体都跑了一遍,该把哪个放进下一版」的完整技术报告。它们按顺序编号

I just looked — we now have more than 5,000 of these.

3. 排行榜与公共基线——让决策基于数据而非嗓门。流程是个固定循环:小规模上跑大量实验 → 只把有希望的推进到中等和大规模 → 每隔几周,把在最大实验规模上验证成功的并入新的候选基线 → 重复。

十、往前看:一个人指挥一百个 agent

展望三件事。第一件是人机协作的形态会变:

Currently a lot of the uses of these models are a single person sitting down with an interactive chatbot interface. But in the future it seems like more work is going to happen where the human is coordinating the activities of a dozen or a hundred AI agents doing stuff on their behalf — where the human has probably weakly specified what it is they want.

注意 weakly specified:人给的是模糊意图,不是精确规格。由此他抛出三个没答案的问题:

How can we give the right HCI paradigm for managing a team of 50 virtual assistants? How can the agents themselves cooperate to accomplish things? What will this enable?

第二件是上下文。幻灯片标题里那个词很关键——不是「关注所有信息」,而是「关注所有信息的错觉

Forward Looking: Illusion of Attending to All Information 幻灯片

百万 token 已能覆盖约 1000 页文本、数小时视频或数十小时音频。下一步目标是万亿级

路径是混合系统:在超大语料上跑学习出来的检索算法 → 用轻量模型评估「检索回来的三万篇文档有多相关」→ 把最重要的约一百篇放进上下文窗口。用途四类:个性化 Gemini(「我很希望它能在我授权下关注我所有的邮件和照片」)、网页搜索、多模态检索,以及编程 agent——「Google 每个开发者的 agent 都应该能关注整个 Google 代码库。」

第三件是推理效率,他认为会成为关键约束:

The training cost of these models is very large and you need a lot of chips. But going forward, more and more inference is going to happen, and more and more agents using these things in sophisticated ways and interacting with other agents that themselves are doing inference.

对策四条:为推理专门设计的硬件、模型与算法的效率改进、低延迟(「响应 100 毫秒的东西比 5 秒的舒服太多」),以及用 AI 自动化芯片设计——「我有一整场演讲讲这个,核心就是尽可能用学习和 RL。」

最后一块是跨领域影响研究 Shaping AI:他和合作者选了七个会被 AI 显著改变的领域——就业、教育、医疗、错误信息、媒体与娱乐、治理与国家安全、AI for science,访谈各领域专家写成报告。完整版是篇很长的 arXiv 论文「没多少人读过」,短版发在 CACM,全在 shapingai.com——「这是我唯一一篇有自己网站的论文。」

十一、问答:恐惧、幻觉、世界模型、小算力

「你对 AI 最大的恐惧是什么?」

I'm sort of of the view that those are a little overblown. I think careful engineering of what we allow AI systems to do will enable us to have safe deployment of these systems, even though they are quite capable.

他认为通常意义上的 AI 安全担忧「有点被夸大了」,真正让他短期担心的是错误信息:现在可以生成极其逼真的视频和音频,连很有经验的人花很多时间去看都难以分辨。第二个担心是转型——怎么让人们学会用这些工具,而不是某天发现自己的活被自动化掉了。

长上下文里的幻觉怎么办

一位大四学生问:即便号称百万上下文,接近上限时质量也会下降,除了接搜索还有什么办法?关键技术是:不只生成一个答案,而是做多次 rollout,再让模型自己评估哪个或哪些片段最可能正确。IMO 用的就是这个思路:

You really can't afford to hallucinate when you need to prove one of these six problems.

但他马上把话绕回推理效率:「你其实很希望每个答案都生成 16 个候选。」——这正是推理成本压力的来源。

大语言模型 vs 世界模型

他的回答是:世界模型无非就是「你是否理解多种模态、以及世界在物理层面怎么运作」,而 Gemini 已经相当不错。Genie 3 就建立在 Gemini 之上,能用文本提示生成想象世界并交互,而且保持一致性:向左转再转回来,原来的东西还在。最实际的应用是和 Waymo 合作在仿真里造长尾场景

You can say, "please make a scenario where an elephant appears in the middle of the road," and that enables you to create dozens and dozens of test cases that are really hard to actually have occur in the real world.

没有一千块 TPU 的人该做什么研究

最后一个问题来自学生:我们大概拿不到一千块 TPU,很多方向又吃数据和算力,那该做什么?他说 Google 内部的做法是把实验跑在三个极小的尺度上——原话是 「extremely extremely small, extremely small, and small」——然后看趋势

We look at the trend of those things, because that trend is often more indicative of importance than exactly where it falls relative to the current baseline state-of-the-art.

If it's below the baseline but the slope looks good, that's a really interesting idea. If it's above the baseline at the absolute smallest scale but rapidly plummeting below the baseline even at the small scale — that's less interesting.

然后他把话说给整个学术界:

I think we as a community should say "this is very different and unique and doesn't achieve state-of-the-art results, but it looks interesting at small scale" — we should celebrate that kind of thing, rather than something that gets an incremental improvement on state-of-the-art by tweaking one little thing that is actually not that interesting.

尾声:坡度比位置重要

演讲结论幻灯片

收尾:「做得好的话,我们这个有 AI 协助的未来会相当明亮。」

整场演讲没有一句关于「AGI 什么时候到来」。它从头到尾在讲一件更朴素的事:今天所有看起来突然出现的能力,都能拆回一串具体的工程决定——把词存成向量、把中间向量都留下来、让芯片只做线性代数、让训练系统假装自己是一台大电脑、在梯度尖峰时重放最近几步。

这条时间线的两端站着同一个人:1990 年那个把 32 台电脑连起来、却忘了同步把模型做大的本科生,和 2026 年问「一个人要怎么管理 50 个虚拟助手」的首席科学家,中间隔着被搁置的 25 年。如果只带走一句,大概是他给学生的那句:看坡度,不要只看你此刻落在基线的哪一侧。

Princeton CS Distinguished Colloquium 演讲海报

普林斯顿大学计算机系 Distinguished Colloquium 演讲海报

📺 原始视频Important Trends in AI: How Did We Get Here, What Can We Do Now, and Where are We Headed? · 普林斯顿大学计算机系 · 2026-02-10 · 1:18:39
📄 延伸阅读shapingai.com——他与合作者关于 AI 在七个领域影响的研究
📝 本文基于演讲英文转写整理,英文引文未改动语义,中文为编译;配图为幻灯片截帧

链接已复制