《Important Trends in AI: How Did We Get Here, What Can We Do Now, and Where are We Headed?》
Princeton CS Distinguished Colloquium · 2026 年 2 月 10 日 · 15 张速读卡片
完整笔记 →
"I saw these as an undergrad in 1990 and I got super excited... but then I ignored it for the next 25 years."
1990 年他的本科毕业论文做的就是"怎么并行训练神经网络"——在那批"弱得可怜"的机器上。他把这个想法归档成"看起来值得关注",然后搁了 25 年。整场演讲讲的,就是这条被搁置的线索后来长成了什么。
"I bumped into Andrew Ng in one of our micro kitchens. He said 'I'm not sure yet, I just started a week ago.' I said, 'We should train really big neural networks.'"
Google Brain 起源于茶水间的一次偶遇。没有立项书,没有路线图,理由朴素到好笑:"因为那时候我们手上确实有很多台电脑。"他们随后搭出的分布式训练系统,训得动比当时公开可见的最大模型还大 50–100 倍的网络。
"If we wanted to deploy this to a scenario where we had a billion users talking to this model 3 minutes a day, we would need to double the number of computers Google had."
2013 年 5 月,内部系统基础设施评审会上的一页纸估算:10 亿用户 × 每天 3 分钟语音 × 每 10 毫秒 1 亿次乘加 ≈ 每天 2000 万核·天。结论是这条路铺不开。这张餐巾纸背面的算术,直接催生了整个 TPU 项目。
"TPUv1 turned out to be 15 to 30x faster than contemporary CPUs and GPUs, and 30 to 80 times more energy efficient."
TPU 吃的是神经网络的两个特性:推理时七八位精度就够,且几乎全是线性代数。六代之后,以 TPUv2 的单 pod 峰值性能为 1x,第六代 Ironwood 约 3600 倍,每瓦算力约 30 倍。TPUv1 那篇论文如今是 ISCA 五十年历史上被引用最多的一篇。
"If one of these things flips one of the bits in the exponent field of your gradient, all of a sudden you'll get 10²⁰ propagating as a gradient instead of 0.2. And that makes you very very sad."
芯片会撒谎。几万块芯片当一台机器同步训练时,一次静默数据损坏就顺着梯度扩散到全局。团队的应对是全程盯着每一层梯度范数的曲线:看到尖峰就回滚到上一个检查点,隔离掉可疑机器再续训。
同等质量下,算力少 10–100 倍,模型小 10 倍。
一个词一个词地串行处理,整句话的信息压进一个状态向量。序列越长越难并行,前面的细节也越容易糊掉。
保留每个词的向量,用可学习的注意力机制回看全部内容。计算天然可并行,长距离依赖不再靠一个瓶颈向量传递。
这是整条技术线上性价比提升最大的一次结构替换:同样的测试损失,Transformer 只要 LSTM 十分之一到百分之一的算力。
"While I'm worried about the garbage truck backing up at my car, some parts of my brain are active and the part that thinks about Shakespearean poetry is not active."
稀疏模型的直觉就来自这里:给模型很大的容量(很多专家),但每个 token 只激活其中几个,而且"该路由到哪个专家"也一起学出来。幻灯片上的结论是两选一——同等准确率下训练算力约降 8 倍,或者同等算力下准确率大幅提升。
"Some tokens are a lot easier to predict than others. 'The square root of seven is ___' — that last token is really really hard, but a lot of the others are very easy."
投机解码就吃这个不均匀:一个便宜的小模型一口气草拟 8 个 token,大模型并行校验,只接受和自己分布一致的那段前缀——平均能收下 4.5 个。不改架构、不重新训练,输出分布和原模型完全一致,纯赚。
"This is what your fourth grade math teacher told you. Show your work."
同一道题(10 条狗,每条每天 0.5 小时,一周多少小时):标准提示直接甩出 50,错;让模型把步骤写出来,答对 35 小时。本质是把答案长度变成推理时的算力预算——每多生成一个 token,就多过一次模型。
"Rejected from NeurIPS 2014. Published in workshop & put on Arxiv. 24,000+ citations."
Hinton、Vinyals 和 Dean 三个人的蒸馏论文,当年被主会拒了。论文里的语音实验:100% 训练数据的测试准确率 58.9%,只用 3% 数据掉到 44.5%,但 3% 数据 + 教师模型的 soft target 能拉回 57.0%。今天几乎所有小模型都是这么造出来的。
"I sort of said 'this is stupid — why don't we all work together?'"
Gemini 立项前,Google 内部好几个组各做各的语言模型和多模态模型,算力和想法都在分散。2023 年 2 月,DeepMind、Google Research 和其他团队并成一支,目标是训一个从第一天起就原生多模态的模型。
"The information in the context window is very crisp because you haven't mixed it with anything else — unlike the training data, which is all a bit muddled and fuzzy."
训练数据是把几万亿 token 搅进几千亿参数里,糊掉了;上下文窗口里的东西则是清清楚楚摊在那儿,可以随时翻回去看某一段。所以百万 token 只是起点——他想要的是能对上万亿 token 做检索式注意力的混合系统。
"Their solutions were astonishing in many respects. IMO graders found them to be clear, precise and most of them easy to follow."
2025 年 7 月的国际数学奥林匹克:6 题做对 5 题,35/42 分,金牌线,全部在 4.5 小时限时内完成。关键不在分数——前一年那套是拼装的数学专用系统(Lean、定理证明器、外加一个专做几何的模型),这一年用的是和普通用户同款的通用 Gemini,只是给了它更长的思考预算。上面这段话出自 IMO 主席 Gregor Dolinar。
"They're numbered sequentially and I just looked — we now have more than 5,000 of these."
Gemini 团队三分之一在湾区、三分之一在伦敦、其余散在纽约、巴黎、波士顿、苏黎世、班加罗尔——每天只有约 3 小时是所有人都不太痛苦的重叠时段。于是一切靠异步:顺序编号的内部 RFC,小到一页纸的早期想法,大到完整技术报告。Jeff 本人同时待在 200 个 Google Chat 群里。
"If it's below the baseline, but the slope looks good, that's a really interesting idea."
给没有大算力的学生的建议:在 extra-extra-small 到 small 的规模上跑实验,看趋势而不是绝对值。反过来,在最小规模上压过基线、一放大就迅速跌下去的想法,反而不值得追。他补了一句:"我们作为一个社区,应该去褒奖这种东西"——而不是奖励那些在 SOTA 上拧一颗螺丝、涨零点几个点的工作。
1990 年被搁置了 25 年的一个想法,
长成了单 pod 性能 3600 倍的超级计算机、
金牌级的数学推理,
和一个人指挥上百个 agent 的工作方式。
路上最重要的一课:异步梯度更新在数学上"明显是错的",
但它管用,所以就这么用了。