100 分钟深度对话 · 15 个关键判断

杨植麟:
K2、缸中之脑与文明的放大器

Zhang Xiaojun Podcast(张小军播客)· 2025.08.30 发布 · 约 100 分钟
YouTube · 完整笔记 →

🧑‍💻 杨植麟
🏢 月之暗面
🤖 Kimi K2
📖 The Beginning of Infinity
🏔️ 雪山没有顶
1
洞察
"AI一天人间一年嘛,所以可能AI的一年我不知道在人间是多少天。"
AI一天人间一年
一年前是"向延绵而未知的雪山前进",一年后这个比喻还成立吗?他的判断是模型进步很大——两年前一篇文章都写不明白的模型,现在已经能连续工作几小时、完成复杂代码任务,但爬雪山这件事本身没变。
2
对比
"它还是一个缸中之脑——它并不需要跟外界交互,它就能解一道题。"

缸中之脑 · 强推理模型

  • 不需要跟外界交互
  • 猜想→隐式自我验证
  • 把pass k变成pass one
  • 以o1为代表

走出鱼缸 · Agent强化学习

  • 持续跟外界交互
  • 调用搜索、浏览器、写代码
  • 下一步依赖环境反馈
  • 多轮操作端到端解决任务
两条路径表面相反,但本质都是同一件事——test-time scaling。"不管是把轮数打得更多,还是在每一轮里有更多思考的token,它都是一种去规模化token的方式,使得你能完成更复杂的任务。"
3
洞察
"有两句话要刻在石头上:一句话叫'那个问题是不可避免的',但第二句话是说'问题是可以解决的'。"
非常有意思的一个点
他反复提到《The Beginning of Infinity》——解决一个问题就往上攀登几百米,同时会产生新问题,"这本身是非常有意思的一个点"。他希望这座雪山一直没有尽头。
⚙️ K2怎么炼成的
4
技术
"如果是在compute optimal的情况下,你基本上会有一个两倍的提升——学一份数据就等于别人学两份数据。"
Muon优化器(Keller提出,月之暗面率先大规模验证)不把参数当独立元素处理,而是考虑矩阵参数间的dependency。但规模上去后会"炸"——max logit异常飙高,这类稳定性问题小规模实验完全无法预测,靠新的clipping方式才解决。
5
犀利
"Scaling Law就是有数据墙了,这肯定是一个客观的事实……但模型变好的速度并没有减少,甚至在加速。"
Scaling Law并没有放缓,甚至在加速
突破数据墙要靠提高token efficiency——先scale预训练,再scale RL,RL的scaling效率比预训练更高,因为它是on policy带负梯度的训练。效率足够高时,直接砸compute带来的提升会非常大。
6
洞察
"一方面是基于算力的scaling太强大了。另一方面,所谓的数据飞轮它很依赖于外界环境的feedback。"
大模型对噪声比传统推荐系统敏感得多,现在基于flops的scaling仍是更确定、更有效的方法——除非某天新的交互方式能把信号里的噪声降下来,而且这个交互还得适配模型能力的发展。
🤖 Agent的边界
7
对比
"它本质上在做的一件事情,就是去逆向工程这个模型的训练过程。"

脚手架产品 · 如Manus

  • 逆向工程模型的训练分布
  • 拟合"什么工具、prompt效果好"
  • 更接近去拟合模型分布
  • 上限受限于拟合精度

一方产品 · 如Claude Code

  • 先设计好工具与context engineering
  • 模型在自己的环境里训练
  • 正向做法,不需要逆向
  • 可端到端优化,上限更高
"第二种它的上限也许会更高——你可以更好地整合工具和模型……同时又可以端到端地去做训练。"月之暗面自己在一方产品上投入还不算多,主线仍是模型本身。
8
犀利
"今天你的agent泛化不够,所以你要用innovation的方式去解决它,就是你用L4的技术去解决一个L3。"
agent当前最大的挑战是泛化——训练任务和评价指标大多是单点的,某个benchmark分数涨了不代表模型泛化真的变好。这也是他给出的"当下认知最关键的一个bet"。
9
洞察
"它是被分布所制约的一个东西,所谓就是种瓜得瓜种豆得豆。"
数学竞赛做到99分,不代表别的数学问题能直接泛化到99分,除非对应的RL任务真的做进去。强化学习泛化性比SFT好,但仍然有限度。
10
洞察
"当你模型训完之后,你的产品已经做完了。"
"模型级产品"哲学——训练agent模型时,工具和context engineering这套已经要全部搭好才能训练。模型训好之后再做的交互设计,只是锦上添花的最后一步。
🌱 开源与组织:这一年的转向
11
犀利
"你去年说开源会落后闭源……因为我们还没有做到非常,就是完全的领先。"
去年他判断开源会落后闭源,理由是开源的贡献机制已经失效,只有落后者才会开源。今年K2开源,他没有回避这个转变。Base model层面社区能帮的有限,但agentic post-training层面能催生真正的下游新机会。
12
组织
"管理一个团队它也是这样的方法——你要用RL的方式去管理,而不是用SFT。"
这个类比来自朋友Tim。他把"猜想—验证"的科研方法论、认识论和公司管理三件事连在了一起——SFT是直接告诉该怎么做,RL是给一个自上而下的奖励目标。
13
组织
"你不能SFT太多,SFT太多,这些同学就会失去主观能动性,然后就没有办法创新了。"
纯RL式管理最大的风险是reward hacking——只盯着把benchmark做高,所有人都会不择手段刷分,模型却未必真的变好。他的应对办法是建立更多观测指标,避免优化目标过窄。
💭 文明的放大器
14
洞察
"它跟我说,这个东西是人类文明的放大器……AI它会成为一个Meta Science。"
这是他问Kimi"AI对人类文明意味着什么"得到的回答。任何前沿学科要花几十年才能学到最前沿知识,AI可能一夜之间学会,然后继续往下突破。风险他也承认存在,但放弃这件事等于放弃了人类文明的上限。
15
洞察
"人的一生可能有几个不同的意义——创造、体验和爱……有一天可能会有很多创造性的工作是AI去做。"
他坦承"创造"这一条未来可能大部分让位给AI,但体验和爱仍会以人为中心。快问快答里他推荐的书依然是《The Beginning of Infinity》;被问到"最近的动物是什么",他说:"我已经把一年的话都讲了,没有办法,碳基生物的局限性。"

雪山可能真的没有顶——
但"问题不可避免,问题可以解决",
构成了他这一年从技术决策、团队管理到个人心态的统一逻辑。