篇章一 · 1.4
工程现实
规格表看完了,落到地面:用什么精度存、要多少显存才跑得动、比上一代强多少。第一站在这里收尾。
省到 4 位,仍要 1.4TB 显存
MXFP4 把每个参数压到 4 个二进制位,部署门槛依然是「一般人部署不起」——这就是 K3 规模的另一面。
精度 MXFP4 与部署显存
精度指存储一个参数用多少个二进制位。位数多则数值精确但占空间大,位数少则省空间但数值不够精确。
MXFP4 是用 4 个二进制位存储一个参数的格式。K3 从训练阶段起就用这个格式,让训练和推理使用同一套精度,避免训练时看高精度、推理时换低精度造成的行为偏差。用 4 位存储,参数占用空间大幅缩小,这是 K3 能被部署的前提。
显存门槛。 显卡上用于存放运行数据的存储空间,常用单位 GB。模型必须整体放进显存才能运行。K3 用 MXFP4 存储时,参数本身约占 1.4 到 1.5TB。一张 H200 单卡 144GB,8 张共 1.15TB 装不下;需要单卡显存更大的 B300,8 张共 2.3TB 才够,这样一台机器大约 700 万人民币。这就是文章说一般人部署不起的原因。
相比 K2 的增长
三项规格相对上一代 K2 全部上涨,其中激活参数涨幅最大,意味着 K3 不仅总量更大,每次实际计算量也重得多。
+167%
总参数
+220%
激活参数
+52%
层数
Scaling Efficiency 2.5×。 不只是参数变大——Kimi 团队给出 K3 相对 K2 的 scaling efficiency 是 2.5 倍量级。注意它不是固定数据集下测的:K2、K3 的数据配方不可能相同,这个数是「架构 + 训练配方 + 数据策略」一起换代的综合结果(5.4 展开)。
篇章一小结。 K3 是一个总参数 2.78 万亿、每次激活 1042 亿的混合专家模型,93 层、隐藏维度 7168、词表 16 万、上下文 100 万 token,外加一个 4.01 亿参数的视觉编码器。它用 4 位精度存储,仍要 1.4TB 以上显存才能跑起来。抓住规模只需记两个数:总参数看知识上限,激活参数看每次算力。
© 2026 晓风乾 · 赛博浮世绘