篇章三 · 3.2
关联记忆的读擦写
无限长的历史,装进一块固定大小的记忆
标准注意力把每个历史 token 都存下来(随长度涨)。KDA 用一块固定矩阵承载全部历史,靠读擦写循环更新——无论序列多长,大小不变。
S ← ① 擦 · α ⊙ S旧信息整体衰减 + ② 写 · β k vᵀ新 token 写入
③ 读 · o = Sᵀ q查询检索,状态不变
新 TOKEN 的 KEY
查询 QUERY
读出输出
点 ① 开始
按下方按钮亲手走一遍:擦 → 写 → 读,是一个 token 的完整循环
固定大小 ≠ KV cache。 这是和标准注意力的根本区别——矩阵大小不随长度变,每步计算量也固定。注意 ③ 读不改变状态:同一块记忆,谁查都行,查多少次都行。下一节看遗忘门怎么从一刀切变成逐通道。