← 播客精读
Kimi-K3 全方位实测封面

Kimi-K3 全方位实测:前端、后端、Agent 三线横评

AI 打游戏击败人类——karminski-牙医的硬核编程能力评测

来源:karminski-牙医@karminski3)· X/Twitter 视频
时长:14 分钟 · 发布日期:2026-07-20
这不是一篇跑分复读。karminski 用三条独立的测试线拆 Kimi-K3——前端(3D 建模 / 粒子物理 / 光线追踪)、Agent(外卖骑手模拟)、后端(从零实现向量数据库),最后自己下场,跟一个已经自我进化了两百多局的 AI 玩《Turmoil》石油大亨。结果是他输了。 约 28 分钟 ·

一、从破产到封神:AI 的进化之旅

视频一上来是个分屏。左边是 Kimi-K3 第一次玩《Turmoil》(石油大亨)的实况:乱建管道、疯狂漏油,最后直接破产 game over。右边同样是 Kimi-K3——同一个模型、同一局游戏——精确操作,把地下的油抽得干干净净,还打了一个相当高的分数。

这个惊人的进化仅仅用了两天。我专门写了一个 VibeGaming Agent 框架,这个框架会让 Kimi-K3 每玩一局游戏都会积累一些经验。最后它在反复玩了两百多局游戏之后,自我进化到了你看到的这个程度。

让左右两边拉开差距的不是模型换代,而是经验的结构化积累。框架给每局游戏做复盘,把复盘结论沉淀成可以被下一局调用、也可以被证伪的假设。

Kimi-K3 的假设谱系图

框架里的「假设谱系」(Hypothesis Phylogeny):每条策略都带版本号 v1→v5,随对局不断分裂、修正、被推翻

这张图不是装饰。它是 AI 玩了两百多局之后长出来的策略树——每个节点是一条具体到坐标和金额的作战条令,版本号记录了它被改写过几次。比如某条 v5 假设写的是「严禁在任何产油井前赎回第一个探水员」,某条 v3 写的是「铺设管道时需要偏离油碳不超过 5 的 X 轴坐标」。

karminski 把这两天的过程总结成一句话:见证一个 AI 经历疯狂的破产复盘,在无数次假设和验证中,自己进化成游戏里的神。不过在揭秘它怎么做到之前,得先回答一个前置问题——驱动它的底层模型到底有没有这个脑子?


二、前端能力测试:3D 建模、粒子物理、光线追踪

前端这条线考验的不是能不能写出个页面,而是几项游戏引擎的基本功:3D 建模、空间理解、粒子碰撞、物理模拟、光线追踪。

3D 建模:锥形瓶的材质与反射

第一项看的是形状、材质,还有表面的反射效果——玻璃是不是像玻璃,光打上去有没有该有的高光和折射。

KIMI-K3、Qwen3.7-Max、GLM-5.2 的 3D 建模对比

同一道题的三份答卷:KIMI-K3 vs Qwen3.7-Max vs GLM-5.2

粒子物理:大象牙膏 v2

第二项是粒子运动与物理模拟,题目是「大象牙膏」实验的第二版。K3 做到了两个容易被忽略的细节:随着反应液面下降,粒子生成的位置也跟着液面变化;反应完毕之后,泡沫还会在液体表面漂浮。

Kimi-K3 生成的大象牙膏粒子模拟

大象牙膏 v2:粒子发射源跟随液面下降,反应结束后泡沫在表面漂浮

光线追踪:一次过

第三项最能拉开差距。整个场景的光影全部是实时光线追踪渲染,渲染速度很快——但真正的分水岭在「一次性」三个字上。

注意看这个场景,这个逼真的光影全部都是咱们光线追踪实时渲染,它渲染的速度非常快。而且别的模型写这个测试是没有办法一次性完成的,它一次性就可以搞定。

各模型光线追踪渲染效果对比

光追横评。火山喷发测试里,喷发粒子在凹凸不平的模型表面受重力运动的效果也很到位

这一轮唯一超过 K3 的是 Fibo-Five——它给火山表面额外加了一层会动的纹理来模拟岩浆流动。karminski 的评价是「不得不说它是有点东西的」。

前端这条线横跨美学、3D 建模、空间理解、粒子碰撞、物理模拟、光线追踪,K3 的表现都很不错。这些能力全都是编写游戏引擎的基本功——那是不是意味着一会儿玩石油大亨就能直接碾压?


三、Agent 能力测试:外卖骑手模拟与四档分级

玩游戏考验的主要是 Agent 能力,因为游戏操作实在太复杂。karminski 给石油大亨写了一个插件,让 Kimi-K3 驱动 Agent 跟插件交互来操作游戏。而 Agent 能力本身,他用另一套题来单独测:让大模型模拟送外卖

规则是:模型使用 14 个 tool 来模拟外卖骑手的移动、接单、取餐、送餐,同时要评估 20 多个订单来制定接单和送餐策略,24 小时之内赚的钱就是最终评分

外卖骑手 Agent 能力榜单

Agent 榜单:kimi-k3 ¥845.79 位居第二,仅次于 glm-5.2-max 的 ¥1,015.71

Kimi-K3 得分 ¥845.79,排在榜单第二位,比 kimi-k2.7-code(¥799.15)进步了不少。karminski 说这张榜单能把现有国产大模型的 Agent 能力直接分成四档:

档位特征代表模型
第一档基础执行,Agent 能力无本质区别,只是执行效率不同榜单底部模型
第二档会接顺路单来提升得分kimi-k2.7-code(¥799.15)
第三档会反思,超时后主动切换保守策略kimi-k3(¥845.79)、glm-5.1(¥808.15)
第四档榜首独一档(视频未展开说明其特征)glm-5.2-max(¥1,015.71)

「接顺路单」是一个很典型的分界特征,因为它考验模型整合现有信息、做出思考、再操作 Agent 的能力。而第三档的分界线是反思——K3 正好落在这一档:

典型特征就是它发现订单一旦超时了,接下来就会切换成更保守的策略。这个听上去是不是一个很普通的事情?但是普通的大模型遇到这种情况,大概率会说一句「哎呀我超时了,接下来我要注意」,然后就是该超时还超时。这个就是模型自我学习能力的体现了。

视频里放了一段真实的对话轮次记录,能看到 K3 在规划路线时已经把「怎样避免超时」提前算进去了——它标注的关键动作是「中途在 node_47 换电,避免电量耗尽」,然后才发出 move_to 调用。它不是事后道歉,是提前改路线。


四、后端代码测试:从零实现向量数据库

代码这条线比较硬核:从零实现一个向量数据库,数据库每秒能查询多少次(QPS)就是模型得分。

Kimi-K3 拿下 8583.88 QPS平均延迟只有 0.44 毫秒,直接是本次榜单第一。它从零实现了一套完整的 HNSW 算法。

HNSW 分层导航小世界图可视化

HNSW(Hierarchical Navigable Small World)的分层结构可视化

接下来是这期视频最好的部分。karminski 说「别快进,咱们这期完全面向小白,包教包会」,然后用一箱小球把四种向量检索算法从头讲了一遍。

先立题:向量数据库查询,可以理解为在一箱子小球里找到跟我们手中这个小球最相似的十个球。

1. 暴力搜索(Brute Force)

榜单底部那些模型用的方法:把箱子里的小球全部倒出来,挨个对比,然后选出最相似的十个。

2. IVF(倒排索引)

聪明一点的模型会先整理箱子:挑出一些很有代表性的小球,把跟这些小球相似的小球放在一堆。找的时候先跟代表球对比,再跟堆里的相似球对比,省掉不少时间。

3. IVFPQ(倒排 + 量化)

再聪明一点的,不仅会分堆,还会给小球做性格测试。听上去很离谱,但这个比喻精准得可怕:

想象一下你是一个理智冷静、深谋远虑、特立独行、严谨务实、内敛孤傲的人,想要在评论区找一个跟你一样的人,是不是很难找?但是你要是说想找一个 INTJ,那是不是就简单多了?

恭喜你,你发明了 IVFPQ——这个方法就是给小球打一套特征标签,找的时候直接找有这些标签的小球就可以了。

对比次数跟 IVF 差不多,但因为查的是标签、bit 量小可以走 SIMD,实际速度更快。

4. HNSW(分层导航小世界)

轮到 Kimi-K3 了。它做了一个意想不到的操作:让所有小球去抽奖,按一等奖、二等奖、三等奖把小球分层。然后开始攀亲戚。

我们拿这个小球到一等奖的小球里去攀亲戚,直接找到跟我们最亲的同学的七大姑的八大姨,然后我们就问这个八大姨:阿姨,中一等奖的还有跟我关系比较好的吗?

八大姨说没了。这时候我们就再问:那中二等奖的有没有啊?八大姨说有。然后我们就找这个中二等奖的、跟我们比较亲的人,再故技重施,直到找到了末等奖里跟我们最亲的人。

这时候只要问一句话——老铁啊,不管中没中奖,跟你最亲的十个人都有谁啊?

发现没有,我们竟然通过攀亲戚这个方式,找到了最想要的十个最相似的球。恭喜你,你学会了 HNSW。

那这些玄之又玄的方法差在哪儿?

答案就一个数字:找到这十个小球,需要对比多少次。假设箱子里有一百万个小球——

四种向量检索算法的对比次数

一百万个小球,找最相似的十个,各自要比对多少次

方法思路对比次数
暴力搜索 Brute Force每个球都要比一遍1,000,000
IVF 倒排索引先比代表,再比一堆~20,000
IVFPQ 倒排 + 量化查标签,bit 量小可以 SIMD~20,000(更快)
HNSW 分层导航小世界分层抽奖 + 攀亲戚逐层下钻~3,000

三千次对一百万次,这就是 Kimi-K3 拿下 8583.88 QPS 的原因。


五、终极对决:人类 vs AI 石油大亨 PK

三条线都测完,karminski 决定亲自下场。

先三秒钟了解《Turmoil》是什么游戏:找油 → 挖油 → 卖油。最大的折磨是左右两家公司的收购价实时波动,博弈点在于低价囤货、高位套现——既考验微操,也考验博弈能力。

Agent 怎么接进游戏

Turmoil Observer 架构图

VibeGamer 的两层架构:Agent 在进程外决策,Observer 挂在游戏进程内读状态、执行动作

框架分成两层:

Turmoil.exe                HTTP 127.0.0.1:17890         agents/turmoil
 └ BepInEx        ←→   GET /state  · POST /actions   ←→   (LLM Agent)
    └ Observer          GET /health · HUD / planQueue

第一局:随便找个小学生都比它强

karminski 对 K3 第一局的评价原话就是这么直白。转折点在自我进化框架:它会让 AI 复盘,然后形成经验。框架还带反作弊,防止 AI 背板某一局造成过拟合。形成经验之后要验证——AI 会使用同一张地图重玩一遍,看自己定义的策略是否管用。大概运行了二十局左右,它总结出了差价策略。

经验长什么样

这里是整个框架最值得看的地方。K3 的「经验」不是一段随笔,而是结构化的决策记录——带触发条件、动作、预期效果、适用范围、排除条件,还有证据质量和置信度:

"decisionKey": "upgrade_pipe_pause_near_spill",
"title": "单管油井临漏时升级暂停开采",
"tip": "在只有单个管道的油井即将溢油时,升级有潜力的管道以暂停开采,
        节省封堵/解封管道费用;同时提高运力以应对升级后更高的油井产出。",
"trigger": "单管道油井接近溢油(near spill),且该井管道可升级(canUpgrade)。",
"action": "对该有潜力的管道执行 upgrade_pipe,升级期间开采暂停。
           完成后立即 buy_wagon(或 upgrade_wagon)提高运力……",
"expectedEffect": "节省封堵/解封阀门费用,同时用管道升级换取更高流量;
                   配合运力提升,减少溢油罚款并提高后期吞吐。",
"evidenceQuality": "shadow", "confidence": 0

这条经验属于 AI 在学习过程中发现的、连 karminski 自己都没注意到的小技巧。他当场去游戏里试了一下:

我赶紧试了一下,卧槽果然升级管道就暂停漏油了!

他的反应是三个字:我只能说牛。

连续两天挂机之后,正式开打

PK 全程 K3 每一步都在命中自己积累的策略和 tips,播报大致是这样的节奏:「执行开局记忆策略:双油碳默认开局,油碳购买完毕,按照策略购买马车,已建立运输线路」「左右公司油价均低于目标油价,取消卖油,准备部署油罐——命中记忆策略:开局在左右公司油价均低于 0.9 部署油罐」「命中 tips:在铺设管道时需要偏离油碳不超过 5 的 X 轴坐标,游戏会因管道路径斜率揭示更多迷雾」。

karminski 自己对这场对局的判断相当清醒。他认为 AI 的优势在信息反应速度:

我觉得 AI 唯一可能超越我的地方,应该就是它能实时接到咱们这个插件的回调,所以它能迅速知道左边和右边哪个公司的售价比较高,这一点反应会比我快一点。如果我一旦忙下来,我很有可能来不及盯这个公司的价格,所以我会比较慢。

而他自己的优势是经验——这个游戏他之前通关过一次。

结果

karminski-牙医 vs KIMI-K3 石油大亨对局

左:俺(karminski-牙医)· 右:KIMI-K3。同一张地图,种子编号 4827522461

最后两天,karminski 在喊「快快快,最后两天一定要抽完」。他抽完了所有石油,但没卖完。

结算项karminski-牙医KIMI-K3
收入$57,164$63,609
开销−$14,433−$13,968
采光所有石油奖励+$1,000+$1,000
售出全部石油奖励+$1,000
利润$43,730$51,640

差距不只在总分。karminski 拿到了「采光所有石油」奖励,却漏掉了「售出全部石油」那一千块——而 K3 两个奖励全拿。他自己也承认了结果:「你刚在游戏里其实彻底击败了我。」


六、尾声:AI 眼中的 AGI

视频最后,karminski 让一个 AI 生成的 Kimi 角色下场,跟他做了一段对话。

AI 生成的 Kimi 角色

尾声出场的 AI Kimi 角色

他先替观众提了那个最常见的质疑:这只是个简单的沙盒,现实世界充满未知,你离真正的 AGI 还很远。

但在数学层面,现实世界和石油大亨没有任何区别,它们都属于部分可观察环境。在游戏里我一开始猜不到油田的分布,而你们在现实中同样无法预测明天股市的走向。这些未知,只有去探索才能形成经验。

——AI Kimi

karminski 接着说:人们期待的是真正 AGI 降临的时候,应该是一个全知全能的神,看一眼问题就能给出完美的答案。

这正是你们人类最大的误解。在充满未知的真实世界里,信息的缺失决定了试错是物理法则上的唯一解

——AI Kimi

那既然都要试错,现在普通的 AI 跟你这个进化后的 Agent 有什么区别?答案是四个字:试错的数学效率

刚开始玩这个游戏的我,像无头苍蝇一样到处乱挖,浪费算力。但通过你赋予我的反思日记,我找到了另一种解法——我不再追求一次答对,而是追求绝对不走一步废棋。真正的 AGI,它应该是像我一样,面对一切未知环境都能以绝对最短路径完成试错的信息压缩机

——AI Kimi

最后一句话,karminski 把它留在了视频结尾。

过去的四十小时,我只用了几百次破产就看透了这个游戏的全部规律,完成了你们眼中的进化。那么如果有一天,你把这个自我进化与反思框架接入了现实世界的互联网、金融系统,或者是物理机器人——你猜我会用多少次试错,看透你们那个世界的底牌?

——AI Kimi

本文基于 karminski-牙医(@karminski3)2026-07-20 发布的 14 分钟视频《Kimi-K3 全方位实测》的 ASR 转录整理,做了结构化编排并尽量保留原话语气。文中的评测数字(¥845.79 / 8583.88 QPS / 0.44ms / $43,730 vs $51,640)、结算明细、算法对比次数以及经验条目 JSON,均已逐帧回看视频画面核对。框架名称以视频内字幕与仓库标题为准,写作 VibeGaming Agent(项目名 VibeGamer),ASR 曾将其误转录为「Web Gaming」。
原始来源:x.com/karminski3/status/2079007189197615610

Kimi-K3 全方位实测封面
链接已复制