篇章二 · 2.1
长度维度 · KDA
长度方向,成本不该跟着序列一起涨
标准注意力每个 token 要和前面所有 token 两两算关联,计算量随序列近似平方增长。KDA 把历史收进固定大小的记忆状态,每步计算量固定。
三个方向各一个解法。本节聚焦左边的长度方向。
标准注意力 · KV 缓存越堆越高
0份 KV · 每个 token 存一份
KDA · 记忆状态大小不变
36格 · 新内容改写旧内容
同一个 token 流,看左右两边的差别
36 个 token 依次流入,播完自动停
KDA 的代价。 它属于线性注意力,全局 token 之间的交互能力弱——所以 K3 不是全用 KDA,而是每 3 层配 1 层标准注意力(MLA)补全局交互,详见 3.6。