详解 Kimi K3 技术报告
赛博浮世绘 · 晓风乾 · 20 站拆解
回首页
详解 Kimi K3 三维度架构 2.1 · 长度维度 KDA
篇章二 · 2.1

长度维度 · KDA

长度方向,成本不该跟着序列一起涨

标准注意力每个 token 要和前面所有 token 两两算关联,计算量随序列近似平方增长。KDA 把历史收进固定大小的记忆状态,每步计算量固定。

K3 改的三个方向,长度是其中之一
长度 · 序列方向 → KDA 压住长上下文成本 深度 · 层数方向 → AttnRes 让深层检索前面层 宽度 · 参数方向 → LatentMoE 大专家池稀疏 + 均衡
三个方向各一个解法。本节聚焦左边的长度方向。
token 一条条流入,两边各发生了什么 流式模拟 · 示意
标准注意力 · KV 缓存越堆越高
0份 KV · 每个 token 存一份
KDA · 记忆状态大小不变
36格 · 新内容改写旧内容
同一个 token 流,看左右两边的差别
36 个 token 依次流入,播完自动停
KDA 的代价。 它属于线性注意力,全局 token 之间的交互能力弱——所以 K3 不是全用 KDA,而是每 3 层配 1 层标准注意力(MLA)补全局交互,详见 3.6。