101 分钟访谈 · 20 个核心判断

杨植麟:
站在无限的开端

「张小珺商业访谈录」EP113 · 2025.08.27 发布 · 101 分钟
YouTube · 完整笔记 →

🧑‍💻 杨植麟
🌙 月之暗面 创始人 & CEO
🏔️ Kimi K2
📖 The Beginning of Infinity
🧗 技术世界观
1
世界观
"两句话要刻在石头上:问题是不可避免的,问题是可以解决的。"
杨植麟反复读《The Beginning of Infinity》:启蒙运动之后,社会从静态变成动态——每个知识解决一个问题,又展开新的问题。研发 AI 恰好也是这样的过程:RL 的问题解决了,评估和验证的新问题又冒出来。
2
世界观
一座没有顶的雪山
"也许这座雪山没有尽头,我希望它一直没有尽头——它就是一座无限的山。"
爬到后来不一定是自己在爬,而是用 AI 来爬。如果雪山无尽,追求的就是攀登本身:每往上几百米,看到的景色就不一样。
3
判断
"AGI 是个方向,不是某一级台阶——登月站上去就是终点,AGI 不是。"
虽然公司叫"月之暗面",但 AGI 和登月不同:不是爬到某级台阶就能喊"实现了"。很多领域里模型已经比 99% 的人类做得更好,但很难指着某个时间点说"此时此刻实现 AGI"。
4
技术
缸中之脑长出了手
"长思考的 RL 还是一个缸中之脑——鱼缸里放个脑子,跟外界没有联系。"
o1 式推理是"猜想—验证"循环,把 pass@k 变成 pass@1,但它不需要跟外界交互。Agent RL 则边思考边操作:调搜索、用浏览器、写代码——它长出了"手"。两者指向同一个东西:test-time scaling。
5
对比

长思考 RL(o1 范式)

  • 缸中之脑
  • scale 单轮思考 token
  • 不与外界交互
  • 猜想 → 自我验证

Agent RL

  • 长出"手"的脑
  • scale 多轮交互轮次
  • 搜索 / 浏览器 / 代码
  • 环境反馈驱动下一步
两种都是 test-time scaling 的方式:推理时花更多 token、更长时间,端到端完成复杂任务——比如把代码仓库克隆下来、翻译语言、修完所有 bug。
6
反共识
"L1 到 L5 不是串行的——Claude 就 bet 这一点:reasoning 做得不多,Agent 做得非常好。"
Reasoning 和 Agent 是两种不同的 scaling 维度,研发上没有必然顺序。但要做最好的 Agent,最终 reasoning 也得做到最好——"要往山顶再爬几步,两个都要"。
7
反共识
"今天 Agent 泛化不够,所以你要用 innovation 的方式解决它——用 L4 的技术解决 L3 的问题。"
Innovation 的标志:模型什么时候能参与模型本身的开发——"我们希望 K2 参与 K3 的开发"。用 AI 训练 AI、用 AI 对齐 AI,是突破 Agent 泛化的关键路径,也是杨植麟"当下最关键的一个 bet"。
🏔️ K2 研发内幕
8
技术
"高质量数据接近是一个常数——所以要最大化使用每一份数据,喂一样多的数据,'脑子'长得更多。"
K2 的核心是 token efficiency,而非 compute efficiency:训得更快不能提升智能上限,把一份数据当好几份用才可以。手段包括 Muon 优化器、数据 rephrase、更大稀疏度加参数。
9
技术
"Muon 基本是两倍提升——你学一份数据,等于别人用 Adam 学两份。30T token 等价 60T。"
Adam 用了十年,token efficiency 并不好;Muon 考虑矩阵参数间的 dependency,学习效率更高。"至少在公开资料里,我们是第一个用非 Adam 的优化器在这么大规模上训练的。"
10
内幕
"Muon 你去训的时候,它会炸——max logit 长得非常高,小规模实验根本复现不了。"
K2 训练中最大的坑:爆炸只在大规模出现,小规模无法预测,只能在 scale 过程中临场解决——最终用新的 clipping(Muon clip)修复。"其他技术都能小规模验证再迁移,唯独这个不行。"
11
方法论
"结果没有什么惊喜——模型训得怎么样,过程中就已经知道了。"
训一次模型一要周期二要成本,所以早期尽可能把所有能预测的都预测到。"所有东西都验证清楚再 scale,成功率就比较高。"最重要的 know-how?"写在 paper 里了,我们都很 open。"
12
判断
"整个行业面临的是 benchmark 不够用、benchmark 失效 的阶段。"
RL 的任务和指标大多是单点的:刷 SWE-bench 的分,用户在 OOD 场景里体感就是不好。Agent 最大的挑战是泛化——"种瓜得瓜、种豆得豆",而解法是更 AI native 的训练:让模型参与训练过程本身。
13
技术
"不能一上来就让它证明没人证明过的数学问题——RL 搭配好的 sample 策略,本质是隐式的课程学习。"
为什么 K2 用中等难度任务:一上来就学最难的,sample efficiency 会非常低,算力全被浪费。从合适难度开始,学完逐渐提升难度。
🌐 行业与商业
14
商业
"你去年说领先者不会开源,但你今天开源了呀?——因为我们还没有做到非常完全的领先。"
社区能在推理侧贡献、免费 serve、带来用户;基于开源模型做 Agentic post-training 会催生垂直 specialized agent 的机会。开源是技术信仰还是市场博弈?"客观地说,都有,而且可能都有好处。"
15
商业
"当你模型训完,你的产品已经做完了——交互改进是锦上添花的最后一步。"
"模型即产品"今天依然成立:训练时就要把工具和 context 全套搭好,模型性能在训练中已经打磨完成。系统因此既简单又复杂——简单在不用维护一堆模型和 routing,复杂在"通用"本身。
16
洞察
"数据飞轮没转起来,是因为基于算力的 scaling 太强大了。"
两层原因:RL 是 on-policy 带梯度的训练,scale FLOPs 的提升太大,显得其他提升很小;大模型对 feedback 噪声敏感,噪声问题还没解决好。但模型变好的速度没在放缓——"我觉得甚至在加速"。
🧭 管理与创始人
17
管理
"要用 RL 的方式去管理,而不是用 SFT——SFT 太多,同学就会失去主观能动性。"
Tim(周昕宇)的建议:SFT 是直接告诉他该怎么做,RL 是给他一个奖励、反映在目标上。以 RL 为主,用少量 SFT 当先验、防止"飞太远"——"核心就是掌握 SFT 和 RL 的平衡"。
18
管理
"用 RL 管理团队最大的问题是容易被 hack——reward hacking。"
只定"把 benchmark 做高",所有人都会不择手段把分弄上去,但模型并没有变好。"我对 CEO 这个身份最新的理解就是:怎么把握 RL、SFT 和 reward hacking 之间的平衡。"
19
使命
"Kimi 跟我说,AI 是'人类文明的放大器'——放弃它,就等于放弃了人类文明的上限。"
为什么做 AI?前沿学科要花二三十年才能学到最前沿,AI 一夜之间就能学会,成为一种 meta-science。风险不能说没有,"但我们有很多事情可以去做"。
20
心态
"肯定有恐惧。但更多要关注的是你当前这一步能做什么。"
成功概率比一年前增大了——"你只要往上爬,成功概率都会变大,因为会有一些人不再继续爬了"。而 Kimi 告诉他:任何中间状态都有可能成为被批评的对象。

问题是不可避免的,但问题是可以解决的。
雪山也许没有尽头——我希望它一直没有尽头。
泛化的 Agent,用 L4 做 L3。