详解 Kimi K3 技术报告
赛博浮世绘 · 晓风乾 · 20 站拆解
回首页
详解 Kimi K3 KDA 炼成记 3.6 · 混合注意力
篇章三 · 3.6

混合注意力

KDA 省成本,但不能全用它

KDA 压住了长度成本,但属于线性注意力,全局交互能力弱。全用模型会变笨——所以 K3 每 3 层 KDA 配 1 层标准注意力(MLA)。

93 层的 KDA / MLA 排列
层 1层 2 层 3层 4 层 5层 6 层 7层 8 层 93 末尾全局 MLA KDA · 69 层 管长序列效率 MLA · 24 层 管全局 token 交互 3:1 配比 每 3 KDA 配 1 MLA MLA 用 NoPE 不用 RoPE · 扩 100 万免调参
蓝 KDA、紫 MLA,3 比 1 循环,末尾补一层全局 MLA。MLA 用 NoPE 把位置交给 KDA,扩到 100 万不用调 RoPE 也不用套 YaRN。

为什么是 3:1。 全注意力比例越低加速越高,但业界公认的极限是保留约 1/4——再低就开始伤长上下文能力。这也定了混合架构的天花板:加速比最多是混合比的倒数,4 倍封顶。而实测保持这个比例,长上下文表现无损甚至更好——混合不是妥协,是白赚。

MLA 还加了门控。 gating 源自千问团队,卖点不是性能而是被广泛验证的训练稳定性——大 run 一旦训崩,整段 checkpoint 作废,稳定性永远排在单点最优前面。它与 MLA 正交。DeepSeek V4 弃 MLA 改用「大号 MQA」是为了配合稀疏注意力,不是 MLA 被淘汰。

为什么敢不用 RoPE(NoPE)
RoPE 的本质是 recency bias——越近的 token 权重越高。它对短上下文有效,对长上下文没有帮助甚至有害(「RoPE 带来长文能力」是误解)。hybrid 里 KDA 的衰减已经携带位置信息,全注意力层去掉位置编码(NoPE)直接外推:扩到 100 万免调参,效果不降甚至更好。

为什么不是稀疏注意力。 另一条省成本的路是推理时挑着算(DeepSeek DSA)。但它有个硬伤:决定「看哪些 token」的 index 求解本身就很贵,硬件越先进(Blackwell)相对开销越大,decode 阶段几乎不加速;而且稀疏注意力基本没法 from scratch 预训练——都是从训好的全注意力转化,配 MLA 更难。K3 的选择是从架构层面(KDA)省,而不是推理时挑着算。

KDA 六步炼成谱系
线性注意力 2020 固定状态、只累加——但位置无关,谁来了权重都一样 RetNet 2023 +位置衰减:旧信息打折,近的更重 → 3.3 Mamba 2023 +选择性:衰减随内容变,该记的记该忘的忘 → 3.3 DeltaNet 2024 +状态改写:不只累加,还能擦掉重写(读擦写) → 3.2 Gated DeltaNet 2025 +写入门控,且做到 GPU 分块并行训练 → 3.4 KDA 2025 衰减细化到逐通道,数值关回 BF16——全程 Tensor Core → 3.3 · 3.5
KDA 的公式之所以长,是因为每一项都是前人验证过的增量——篇章三的各节正好各讲一步。炼成记到此完成。