篇章三 · 3.1
长上下文困境
100 万 token,标准注意力撑不住
篇章三开始拆 KDA。先看清标准注意力在长上下文下的两个痛点——这是后面每一步设计都在对症下药的根本。
红色越往右越陡(平方):n 个 token 两两组合 n×(n−1)/2。琥珀匀速往上(线性):每步读全部历史。到 100 万都很夸张。
这就是 KDA 要换掉标准注意力的理由。 两种成本一起爆,100 万上下文下 Prefill 和 KV cache 都吃不消。后面 5 节看 KDA 怎么一步步对症下药。