← 播客精读
Introducing Kimi K2.5

杨植麟亲自出镜:Kimi K2.5 — 从万亿参数到 Agent 群体智能

Moonshot AI 创始人 · 2026 年 1 月 · 3 分钟产品发布

杨植麟是 Moonshot AI(月之暗面)创始人兼 CEO,Kimi 系列模型的缔造者。这是他首次以出镜方式亲自介绍新模型。视频仅 3 分 41 秒,但信息密度极高——从万亿参数预训练到 Agent Swarm 群体智能,从编码设计到 Office 全家桶,K2.5 试图证明一件事:一个开源模型可以同时做好所有事约 20 分钟 ·

一、从 K2 到 K2.5:开源模型的进化路径

杨植麟开场直接回顾了 Kimi 模型的演进路线——这不是一个单点发布,而是一条清晰的技术阶梯。

六个月前发布的 Kimi K2,是第一个将预训练规模扩展到一万亿参数的开源模型。随后推出的 K2-Thinking,把 Agent 的思考时间(thinking time)拉长到了极致:

"It scaled the thinking time of agents for solving long-horizon tasks. It performed interleaved thinking with tool calling for up to 300 steps — all on its own."

Up to 222 Sequential Tool Calls

K2-Thinking 的交错思考与工具调用能力,最高可达 222 次连续调用

这个数字是什么概念?大多数 Agent 框架在 10-20 步就开始退化;K2-Thinking 把这个上限推到了 300 步,且全程无需人工干预。

今天的 K2.5,则是把这些能力合而为一——Agent、编码、视觉、通用能力,全部装进一个开源模型里。


二、基准测试:Agent 与视觉双线领先

K2.5 的基准成绩是整个视频里信息密度最高的部分。杨植麟用一张对比图展示了 K2.5 与 GPT-5.2 (xhigh)、Claude Opus 4.5、Gemini 3 Pro 四家的正面碰撞:

Kimi K2.5 Benchmarks

K2.5 vs GPT-5.2 / Claude Opus 4.5 / Gemini 3 Pro 全维度基准对比

类别基准测试K2.5对比
AgentHumanity's Last Exam (Full)50.2GPT-5.2: 45.5 / Claude: 43.2 / Gemini: 45.8
BrowseComp74.9GPT-5.2: 65.8 / Claude: 57.8 / Gemini: 59.2
DeepSearchQA77.1GPT-5.2: 71.3 / Claude: 76.1 / Gemini: 63.2
CodingSWE-bench Verified76.8GPT-5.2: 80.0 / Claude: 80.9 / Gemini: 76.2
SWE-bench Multilingual73.0GPT-5.2: 72.0 / Gemini: 65.0 / Claude: 77.5
ImageMMMU Pro78.5同级(79.5 / 74.0 / 81.0)
MathVision84.2GPT-5.2: 83.0 / Claude: 77.1 / Gemini: 86.1
OmniDocBench 1.588.8GPT-5.2: 85.7 / Claude: 87.7 / Gemini: 88.5
VideoVideoMMU86.6GPT-5.2: 85.9 / Claude: 84.4 / Gemini: 87.6
LongVideoBench79.8GPT-5.2: 76.5 / Claude: 67.2 / Gemini: 77.7

最引人注意的是 Agent 三项全部登顶:Humanity's Last Exam 50.2 分(比 GPT-5.2 高近 5 分)、BrowseComp 74.9(领先超 9 分)、DeepSearchQA 77.1。这三个基准专门测试模型的长程推理、网页浏览和深度搜索能力——恰恰是 Agent 场景的核心。

编码方面 K2.5 和头部选手基本持平(SWE-bench Verified 76.8),但在视觉和视频维度表现突出,尤其 OmniDocBench 88.8LongVideoBench 79.8 都是同级最高。


三、代码与设计:不只是写代码,还要有审美

杨植麟在这部分强调了一个有意思的差异化定位——K2.5 不只要能写代码,还要有设计感

"We didn't just want Kimi to code. We wanted it to have an eye for design. It weaves designer-grade websites that flow with grace and visual poetry."

Scroll Trigger Effects

K2.5 生成的设计师级网页效果:Scroll Trigger 动画

视频展示了 K2.5 的视觉理解→代码生成流水线:用户只需上传一段屏幕录制,K2.5 就能从零开始重建,输出干净、专业的代码。

Kimi Code

杨植麟在 Moonshot AI 办公室介绍 Kimi Code

与此同时,杨植麟宣布了新产品 Kimi Code——一个独立的编码工具。它支持图片和视频作为输入,并且能自动发现工作环境中已有的 skill(技能包),融入 Agent 的工作流。


四、Office 全家桶:从 10 天到 10 分钟

K2.5 的另一个重要方向是办公场景。杨植麟用了一个很实在的表述——"mastered the core skills of the Office suite":

Office Suite Skills

K2.5 的 Office 全家桶能力:Word、PowerPoint、PDF、Excel

视频里展示了几个具体场景:构建复杂的财务模型、排版专业级 PDF、制作咨询级 pitch deck。但最打动人的不是单项能力,而是效率跃迁的倍率

"Tasks that used to take days — like merging 50 different department reports, or turning a 30,000-word paper into a precise pitch deck — now happen in 10 minutes."

Pitch Deck Demo

将学术论文自动转化为精准的 Pitch Deck

合并 50 个部门报告、三万字论文转 deck——这些真正消耗知识工作者时间的任务,从"天"级压缩到"分钟"级。如果这个承诺能在实际使用中兑现,对白领生产力的冲击比纯编码能力更直接。

Spreadsheet Demo

K2.5 自动生成的公司分析电子表格(Luma AI 案例)


五、Agent Swarm:从单 Agent 到群体智能

K2.5 发布里最具架构意义的概念是 Agent Swarm——从单个 Agent 升级到 Agent 群体。

"Instead of asking one agent to do everything, K2.5 creates and coordinates a swarm of specialized agents to work in parallel."

Agent Swarm

K2.5 的 Agent Swarm 架构:数十个专业化角色并行协作

关键设计点:这些专业化 Agent 本质上都是 K2.5 的副本,但被分配了不同的角色和子任务。而且——

"Nothing is predefined. The roles and subtasks are created on the fly by K2.5."

角色和任务不是预定义的,而是由 K2.5 自己动态生成。这意味着面对不同的任务,模型会自行规划分工方案,然后并行执行。杨植麟给了三个具体场景:

场景传统方式K2.5 Agent Swarm
100 家公司市场调研团队周级工作一群分析师 Agent 并行,分钟级完成
300 页复杂翻译多人协作数天语言学家 Agent 团队协同,快速精准交付
50 篇论文文献综述研究者数周10 位高级研究员 Agent 并行分析,即时生成综述

并行化能力直接缩短了复杂任务的耗时——不是通过让单个 Agent 更快,而是通过数量和分工。杨植麟坦言,要在规模上训练 Agent Swarm 在技术上非常具有挑战性:

"Training the agent swarms at scale is technically challenging. We rebuilt our reinforcement learning infrastructure and optimized the training algorithms to ensure the best efficiency and performance."

Moonshot AI 为此重建了强化学习基础设施。这句话的信息量不小:Agent Swarm 不只是推理时的 prompt 编排,而是在训练层面就做了专门优化——模型本身被训练成擅长协调多个并行任务的"指挥官"。


六、如何体验 K2.5

Kimi K2.5 Available Today

K2.5 的四个使用入口:kimi.com、Kimi App、Kimi API、Kimi Code

K2.5 开放了四个使用入口:

杨植麟的结尾简洁有力:

"Go play with it and tell us what you think."


本文基于 Moonshot AI 官方 YouTube 频道发布的产品介绍视频完整转录整理。原视频由创始人杨植麟出镜,时长 3 分 41 秒。原始发布日期:2026 年 1 月 27 日。
视频观看:YouTube · Kimi AI

Kimi K2.5 Cover
链接已复制