详解 Kimi K3 技术报告
赛博浮世绘 · 晓风乾 · 20 站拆解
回首页
详解 Kimi K3 KDA 炼成记 3.2 · 关联记忆的读擦写
篇章三 · 3.2

关联记忆的读擦写

无限长的历史,装进一块固定大小的记忆

标准注意力把每个历史 token 都存下来(随长度涨)。KDA 用一块固定矩阵承载全部历史,靠读擦写循环更新——无论序列多长,大小不变。

读擦写循环 · 亲手推一步 1 个 token
S ← ① 擦 · α ⊙ S旧信息整体衰减 + ② 写 · β k vᵀ新 token 写入
③ 读 · o = Sᵀ q查询检索,状态不变
新 TOKEN 的 KEY
查询 QUERY
读出输出
点 ① 开始
按下方按钮亲手走一遍:擦 → 写 → 读,是一个 token 的完整循环
固定大小 ≠ KV cache。 这是和标准注意力的根本区别——矩阵大小不随长度变,每步计算量也固定。注意 ③ 读不改变状态:同一块记忆,谁查都行,查多少次都行。下一节看遗忘门怎么从一刀切变成逐通道。