Kimi K3 模型结构(0):一张图看懂 Kimi K3

Kimi K3 模型结构(0):一张图看懂 Kimi K3

💡 原文中文,约10500字,阅读约需25分钟。
📝

内容提要

Kimi K3是2.78T参数、104.2B激活的93层MoE模型,支持1M上下文及图像视频输入。其结构创新分三方面:序列用KDA与Gated MLA混合,深度引入Attention Residuals,宽度采用Stable LatentMoE,并配视觉编码器MoonViT-V2。相比K2,扩展效率提升约2.5倍。文章详解层排布、维度配置及前向流程,为后续技术解读奠定基础。

🔎

延伸解读

K3 的“三明治”式结构:混合注意力与分块残差

K3 的 93 层并非简单堆叠,而是按“3 层 KDA + 1 层 Gated MLA”的规律重复 23 次,再额外加一层全局注意力收尾。这种设计让 KDA 负责局部、高效的序列建模,而 Gated MLA 每隔几层提供全局信息。同时,每 12 层被划分为一个 AttnRes 块,块内使用普通残差,块间通过 Attention Residuals 连接,形成“局部残差 + 全局残差”的混合结构,既保持了训练稳定性,又增强了信息流动。

从 K2 到 K3:参数翻倍,效率提升 2.5 倍

K3 相比 K2,层数从 61 增至 93(+52%),总参数从 1.04T 增至 2.78T(+167%),激活参数从 32.6B 增至 104.2B(+220%)。尽管规模大幅增长,论文称其扩展效率相对 K2 提升约 2.5 倍,这得益于 KDA、Attention Residuals、Stable LatentMoE 等结构创新,以及数据和训练配方的改进。这意味着 K3 在相同计算预算下能获得更好的性能,但具体收益仍需等待后续评测。

视觉输入:MoonViT-V2 与文本共享主干

K3 原生支持图像和视频输入,通过新增的 MoonViT-V2 视觉编码器(0.4B 参数,27 层)将视觉信息转换为 token,再经投影层与文本 token 交错后进入同一主干网络。这种设计让模型能够处理多模态任务,但视觉编码器的引入也增加了计算开销。值得注意的是,视觉编码器是从零训练的,而非复用已有模型,这可能意味着 K3 在多模态能力上进行了专门优化。

Q&A

Kimi K3 模型的基本参数是什么?

Kimi K3 是一个总参数 2.78T、激活参数 104.2B 的 MoE 模型,共 93 层,训练上下文长度为 1M token,原生支持图像和视频输入。

Kimi K3 在结构上有哪些主要创新?

Kimi K3 的结构创新分为三个维度:序列维度采用 Kimi Delta Attention(KDA)与 Gated MLA 按 3:1 混合;深度维度引入 Attention Residuals(AttnRes);宽度维度采用 Stable LatentMoE。此外,输入端配有视觉编码器 MoonViT-V2 和投影层,优化器使用 Per-Head Muon。

Kimi K3 的 93 层是如何排列的?

Kimi K3 的层排列遵循 [KDA, KDA, KDA, MLA] 的模式重复 23 次(共 92 层),最后第 93 层额外加一个 Gated MLA。因此 KDA 共 69 层,Gated MLA 共 24 层。第 1 层的 FFN 是稠密的,其余 92 层使用 Stable LatentMoE。

Kimi K3 相比 Kimi K2 有哪些主要变化?

相比 K2,K3 层数从 61 增至 93(+52%),总参数从 1.04T 增至 2.78T(+167%),激活参数从 32.6B 增至 104.2B(+220%),训练上下文从 128K 增至 1M(×8),注意力机制从 MLA 变为 KDA 与 MLA 混合,并新增视觉编码器 MoonViT-V2。整体 scaling efficiency 提升约 2.5 倍。

Kimi K3 的 Attention Residuals 是如何工作的?

Attention Residuals(AttnRes)是深度维度上的创新,每个子层前有一个 α 算子,它使用本子层专属的可学习向量 w_l 作为 query,对来源(词嵌入、之前每个块的输出之和、当前块已算完的部分)进行 softmax 加权求和,得到子层的输入。AttnRes 将残差流分块,每 12 层为一个块,块与块之间通过 AttnRes 连接。

Kimi K3 的 Stable LatentMoE 与普通 MoE 有何不同?

Stable LatentMoE 在宽度维度上创新,它在 latent 空间(3584 维)中运行 expert,而不是直接在隐藏维度上。具体流程:token 先被共享下投影压到 3584 维,16 个 expert 在 latent 空间计算,加权求和后过 RMSNorm,再由共享上投影回到 7168 维。此外,它包含三个稳定化改动:latent 求和后加 RMSNorm、使用 SiTU-GLU 激活函数、采用无辅助损失的路由(Quantile Balancing)。

Kimi K3 如何处理图像和视频输入?

图像和视频输入通过视觉编码器 MoonViT-V2(27 层、0.4B 参数、patch 14、12 头)处理,然后经过 2×2 pixel-shuffle 将 token 数除以 4,再由一个两层 MLP 投影到 7168 维,与文本 token 交错后进入同一条主干残差流。

Kimi K3 的注意力机制有哪些特点?

K3 的注意力机制包括 KDA 和 Gated MLA 两种。KDA 是 Kimi Linear 中的线性注意力,使用逐通道衰减和满秩输出门;Gated MLA 是 DeepSeek 式 MLA,无位置编码,使用满秩 sigmoid 输出门。两者均使用 96 头、头维 128,且 MLA 的 KV cache 每 token 每层仅存 576 个数。

🏷️

标签

➡️

继续阅读