详解 Kimi K3 技术报告
赛博浮世绘 · 晓风乾 · 20 站拆解
回首页
详解 Kimi K3 规模 1.4 · 工程现实
篇章一 · 1.4

工程现实

规格表看完了,落到地面:用什么精度存、要多少显存才跑得动、比上一代强多少。第一站在这里收尾。

省到 4 位,仍要 1.4TB 显存

MXFP4 把每个参数压到 4 个二进制位,部署门槛依然是「一般人部署不起」——这就是 K3 规模的另一面。

精度 MXFP4 与部署显存

精度指存储一个参数用多少个二进制位。位数多则数值精确但占空间大,位数少则省空间但数值不够精确。

MXFP4 是用 4 个二进制位存储一个参数的格式。K3 从训练阶段起就用这个格式,让训练和推理使用同一套精度,避免训练时看高精度、推理时换低精度造成的行为偏差。用 4 位存储,参数占用空间大幅缩小,这是 K3 能被部署的前提。

显存门槛。 显卡上用于存放运行数据的存储空间,常用单位 GB。模型必须整体放进显存才能运行。K3 用 MXFP4 存储时,参数本身约占 1.4 到 1.5TB。一张 H200 单卡 144GB,8 张共 1.15TB 装不下;需要单卡显存更大的 B300,8 张共 2.3TB 才够,这样一台机器大约 700 万人民币。这就是文章说一般人部署不起的原因。
相比 K2 的增长

三项规格相对上一代 K2 全部上涨,其中激活参数涨幅最大,意味着 K3 不仅总量更大,每次实际计算量也重得多。

+167%
总参数
+220%
激活参数
+52%
层数

Scaling Efficiency 2.5×。 不只是参数变大——Kimi 团队给出 K3 相对 K2 的 scaling efficiency 是 2.5 倍量级。注意它不是固定数据集下测的:K2、K3 的数据配方不可能相同,这个数是「架构 + 训练配方 + 数据策略」一起换代的综合结果(5.4 展开)。

篇章一小结。 K3 是一个总参数 2.78 万亿、每次激活 1042 亿的混合专家模型,93 层、隐藏维度 7168、词表 16 万、上下文 100 万 token,外加一个 4.01 亿参数的视觉编码器。它用 4 位精度存储,仍要 1.4TB 以上显存才能跑起来。抓住规模只需记两个数:总参数看知识上限,激活参数看每次算力。
© 2026 晓风乾 · 赛博浮世绘