详解 Kimi K3 技术报告
赛博浮世绘 · 晓风乾 · 20 站拆解
回首页
详解 Kimi K3 多模态·训练·工程 5.3 · 实测与结论
篇章五 · 5.3

实测与结论

国内 Top 1,就是有点慢

机制拆完了,这一站看 K3 实际用起来怎么样。整体原生多模态能力很强,慢的根源还是受限于算力。

工程能力 · 公众号排版项目。 都说 K3 的前端能力很强,作者直接跑了 3 个交互式 3D 网站。复杂一点的还有公众号排版项目(含前后端):普通账户登录后,可以直接用不同风格进行模版渲染。

实现上用 llm 拼接提示词、加上一些 loop 来解决 skill 排版问题,相对轻量;也把 Claude 的 SDK 集成到框架里解决 skill 调用,但有点重,看你自己选择。

纯 VLM · 模型基础能力。 纯 VLM 的测试必不可少,可以看出模型的基础能力。整体看下来,K3 的原生多模态能力很强:常规图片理解、内容识别和视觉推理都能完成,复杂画面里的信息抓取也比较稳。

比如找不开心的冰块并返回行列序号,回答正确(过程调用了 python 工具做截图比较);鸡腿走迷宫给上下左右路线,回答正确;白板互动考察手写识别和整图分析,效果不错。

也有 bad case。 碰到生僻字时还会识别错;钟表题也没有完全解决,表盘稍微复杂一点,指针角度和时间判断仍然可能出问题。

找不开心的冰块
行列号定位
给图案里不开心冰块的行列号,回答正确,过程调 python 工具截图比较。
鸡腿走迷宫
路线规划
给上下左右的路线步骤让鸡腿走出迷宫,回答正确。
白板互动
手写 + 整图分析
手写识别加整图分析,效果不错,考察对复杂画面的整体理解。
bad case · 还能更好
生僻字会识别错;钟表题表盘复杂时指针角度和时间判断仍可能出问题。原生多模态还能打磨。
结论

Kimi K3 这波效果真的没得说,在国内模型里已经是 Top 1,就是有点慢。慢的根源还是受限于算力——模型够大、机制够复杂,对显卡的要求也够高。所以我们还是受限于算力。

还没完——慢的另一面是工程。 慢的根源受限于算力,但同等算力下能跑多快,是工程问题:100 万上下文怎么切、几百个专家怎么摆上显卡、显存怎么省——这些在下一站 5.4《训练与推理工程》拆,那里也是全教程的完结。