详解 Kimi K3 技术报告
赛博浮世绘 · 晓风乾 · 20 站拆解
回首页
详解 Kimi K3 KDA 炼成记 3.4 · Chunkwise 算法
篇章三 · 3.4

Chunkwise 算法

递归串行,把并行关进块里

KDA 的记忆更新是递归的,每个 token 都得等上一个状态。Chunkwise 把序列切成多个 Chunk,块内并行算、块间顺序传。

序列切成 Chunk
序列 · 递归依赖(GPU 难并行) Chunk 1 · 同时算 Chunk 2 · 同时算 Chunk 3 · 同时算 Chunk 4 · 同时算 S0 S1 S2 S3 块间递归 · 状态顺序传递
上面:每块同时算(块内并行)。下面:块间用状态顺序传(块间递归)。
两条道跑同一个序列 1 拍 = 1 个 GPU 时间步
逐 token 递归后一个必须等前一个
0 / 12 拍
Chunkwise · 切 4 块块内 3 个一拍算完
0 / 4 拍3× 加速
同一个节拍器计时,听下方的节拍数
每拍 0.45 秒 · 下道一拍算一整块,上道一拍只算一个
吞吐上来,依赖不丢。 块内互不依赖组矩阵一次算(GPU 最擅长),块间终态作初态顺序传。串行压缩到块间,并行还给块内——12 步变 4 步,就是 3 倍吞吐。