🧬 模型进化
1
技术
"K2-Thinking performed interleaved thinking with tool calling for up to 300 steps — all on its own."
从 K2(首个万亿参数开源模型)到 K2-Thinking(300 步自主推理),再到 K2.5(全能整合)——不是单点突破,而是一条清晰的技术阶梯。大多数 Agent 框架在 10-20 步就开始退化,K2-Thinking 把上限推到 300 步且无需人工干预。
2
数据
"K2.5 sets new records on the most challenging agentic benchmarks."
Agent 三项全球第一:Humanity's Last Exam 50.2(vs GPT-5.2 的 45.5)、BrowseComp 74.9(领先超 9 分)、DeepSearchQA 77.1。视觉也是同级最强——OmniDocBench 88.8、LongVideoBench 79.8。编码持平头部。一个开源模型,全维度对标闭源顶配。
⚡ 产品能力
3
洞察
"We didn't just want Kimi to code. We wanted it to have an eye for design."
差异化定位:不只是 SWE-bench 跑分,而是要能生成"designer-grade websites that flow with grace and visual poetry"。上传一段屏幕录制,K2.5 从零重建、输出干净代码。审美驱动的编码,是对"AI 只能写丑代码"的直接回应。
4
效率
"Tasks that used to take days — merging 50 department reports, turning a 30,000-word paper into a pitch deck — now happen in 10 minutes."
Office 全家桶不是锦上添花——合并 50 个部门报告、三万字论文转 deck,从"天"压缩到"分钟"。比纯编码能力更直接地冲击白领生产力。
🐝 Agent Swarm
5
架构
"Instead of asking one agent to do everything, K2.5 creates and coordinates a swarm of specialized agents to work in parallel."
核心架构升级:专业化 Agent 本质是 K2.5 副本 + 不同角色。不通过让单个 Agent 更快,而是通过数量和分工实现并行化。这才是"Model as Agent"口号的真正含义。
6
洞察
"Nothing is predefined. The roles and subtasks are created on the fly by K2.5."
传统 Agent
- 预定义角色和工具
- 单 Agent 串行执行
- 100 家公司调研→数周
- 50 篇论文综述→数周
K2.5 Agent Swarm
- 动态生成角色和子任务
- 多 Agent 并行协作
- 100 家公司调研→分钟
- 50 篇论文综述→即时
不是框架编排,而是模型自己决定怎么分工——角色、任务、并行策略全部动态生成。300 页翻译→语言学家团队;50 篇论文→10 位研究员并行分析。
7
工程
"Training the agent swarms at scale is technically challenging. We rebuilt our reinforcement learning infrastructure."
关键信号:Agent Swarm 不只是推理时的 prompt 编排,而是在训练层面做了专门优化——重建 RL 基础设施。模型本身被训练成擅长协调多个并行任务的"指挥官"。这是 Moonshot AI 的技术护城河叙事。