篇章一 · 1.3
架构规格
参数多少解决了「用多少」,这一节看「多深、多宽、记多少」——层数、隐藏维度、词表、上下文长度和视觉编码器。
93 层深处,一口气读 100 万 token
剩下的规格逐个看懂:深度、宽度、词汇量、记忆容量,加上一双眼睛。
层 93 与隐藏维度 7168
层 · 93
模型把整个处理过程分成 93 个顺序执行的步骤,每个步骤叫一层。token 的信息从第一层进入,一层层往后传,每层用自己的参数对信息做一次计算和改写,传到第 93 层算完,输出结果。层数越多处理越深,计算成本也越高。
隐藏维度 · 7168
每一层在处理时,用一个包含若干数字的列表来表示当前 token 携带的信息。K3 里这个列表的长度是 7168,这就是隐藏维度。数字越大,能记录的细节越多,单次计算量也越大。
词表 160K 与上下文 1M
词表 · 160K(16 万)
模型能识别和输出的全部 token 种类的集合,覆盖多种语言的字、词、标点和代码符号。输入输出都只能由这些符号组合而成。词表大,对多语言、专业术语和代码更友好。
上下文 · 1M(100 万 token)
一次运行中能同时保留和参照的最大 token 数。超出长度的更早内容不再保留。100 万 token 大约相当于几百万字,能容纳多本长书或一个大型代码库。
视觉编码器 MoonViT-V2
K3 能处理图片和视频。负责把图片转成 token、再交给语言部分处理的那段程序叫视觉编码器。K3 用的是 MoonViT-V2,约 4.01 亿参数,27 层。它把一张图切成小块,每一块编码成一个 token,再把这串 token 送进后面的语言模型。这部分规模相对语言部分小很多。
下一节 1.4 · 工程现实。 规格都看完了,跑起来要多大代价?MXFP4 的 4 位存储、约 1.4TB 的显存门槛、以及相比 K2 各项涨了多少——第一站在下一节收尾。