篇章三 · 3.4
Chunkwise 算法
递归串行,把并行关进块里
KDA 的记忆更新是递归的,每个 token 都得等上一个状态。Chunkwise 把序列切成多个 Chunk,块内并行算、块间顺序传。
上面:每块同时算(块内并行)。下面:块间用状态顺序传(块间递归)。
逐 token 递归后一个必须等前一个
0 / 12 拍
Chunkwise · 切 4 块块内 3 个一拍算完
0 / 4 拍3× 加速
同一个节拍器计时,听下方的节拍数
每拍 0.45 秒 · 下道一拍算一整块,上道一拍只算一个
吞吐上来,依赖不丢。 块内互不依赖组矩阵一次算(GPU 最擅长),块间终态作初态顺序传。串行压缩到块间,并行还给块内——12 步变 4 步,就是 3 倍吞吐。