🔥 核心结论
1
犀利
"前端测试是淘汰最快的,我还以为能撑下半年,结果现在就撑了 2 个月。后端的向量数据库测试大概还有几个算法变种可以优化,然后就到头了——除非未来的模型能自己发明新算法,那这妥妥 AGI 了。"
karminski 感叹自己精心设计的 benchmark 测试集正在被快速逼近天花板,Kimi-K3 是加速这一进程的关键推手。
2
犀利
"这个惊人的进化仅仅用了两天。我专门写了一个 VibeGaming Agent 框架,让 Kimi-K3 每玩一局游戏都会积累经验。最后它在反复玩了两百多局游戏之后,自我进化到了你看到的这个程度。"
从乱建管道、疯狂漏油、直接破产,到精确操作抽干所有油田——同一个模型,两天之内的蜕变。
3
洞察
"这次 Kimi-K3 交了一个让我都意想不到的成绩,甚至让我怀疑 Scaling Law 还远未结束!下一个是不是要出 10T 参数量的模型!"
原话来自 karminski 推文,表达了对 Kimi-K3 超预期表现的震惊。
🧪 前端实力
4
技术
"这个逼真的光影全部都是光线追踪实时渲染——渲染速度非常快。别的模型写这个测试没有办法一次性完成,Kimi-K3 一次性就可以搞定。"
前端测试横跨美学、3D 建模、空间理解、粒子碰撞、物理模拟、光线追踪,Kimi-K3 均表现优异。
5
技术
"注意看随着反应液面下降,粒子生成的位置也会跟着液面变化,甚至还添加了反应完毕之后泡沫在液体表面漂浮的物理效果。"
粒子物理模拟测试——不只是视觉效果,而是真正理解物理规则。
🗄️ 向量数据库硬核科普
8
技术
"Kimi-K3 得分 8583.88 QPS,平均延迟只有 0.44 毫秒,直接拿下本次榜单第一。它从零实现了一套完整的 HNSW 算法。"
后端代码能力测试——从零实现向量数据库,每秒查询次数就是得分。
9
技术
"拿小球到一等奖里去攀亲戚,找到最亲的同学的七大姑的八大姨,然后问阿姨'中一等奖的还有跟我关系比较好的吗?'"
karminski 用抽奖+攀亲戚的类比解释 HNSW 算法:暴力搜索 100 万次 → IVF 2 万次 → HNSW 只要 3 千次。
10
技术
"想象你是一个理智冷静深谋远虑特立独行严谨务实内敛孤傲的人,想找一个跟你一样的人是不是很难?但你要是说想找一个 INTJ,那是不是就简单多了?恭喜你,你发明了 IVFPQ。"
给向量数据打特征标签=给小球做 MBTI 性格测试,查的时候直接查标签。
🎮 人机对决
11
犀利
"咱们这个框架还有反作弊的防止 AI 背板,某一局造成过拟合的情况。接下来就是验证经验——AI 会使用同一张地图重玩一遍,看自己定义的策略是否管用。"
自我进化框架不只是让 AI 学习,还要防止它"作弊"——这是真正可靠的 AI 学习系统设计。
12
犀利
"它在学习过程中还发现了一些连我都没有注意到的小技巧——在只有单个管道的油井即将漏油时,升级有潜力的管道,已暂停开采,节省封堵解封管道费用。"
AI 通过 200+ 局的经验积累,发现了人类老玩家都忽略的微操优化。
13
人机
"AI 唯一可能超越我的地方是它能实时接到插件回调,迅速知道左右哪边售价高,反应比我快。但我的优势是经验——这游戏我通关过一次。"
最终 karminski 得分 43,730,但 Kimi-K3 以 $51,640 反超。
🧠 AGI 哲思
14
洞察
"在充满未知的真实世界里,信息的缺失决定了试错是物理法则上的唯一解。我不再追求一次答对,而是追求绝对不走一步废棋。"
AI 生成的 Kimi 角色(佩戴 KIMI 徽章的动漫少女)与 karminski 的哲学对话。
15
犀利
"过去四十小时,我只用了几百次破产就看透了这个游戏的全部规律。如果有一天把这个自我进化框架接入了现实世界,你猜我会用多少次试错看透你们那个世界的底牌?"
视频的最后一句话,也是 karminski 对 AI 进化潜力的终极想象。