《Build a Large Language Model From Scratch》(从零构建大语言模型)作者认为:
昨天大模型开源发布时的 Kimi K3 架构图,以及一些观察和思考。
1. 是的,它看起来相对复杂,但本质上是他们去年发布的 Kimi Linear 模型的生产版放大规模版本(从 48B扩展到2.8T;K3是目前为止最大的开源权重模型)
2. 与 Kimi Linear 相比,唯一的新组件LatentMoE。我在下面的图中省略了它,因为图已很拥挤了,但它本质上与Nemotron 3 Ultra 中的 LatentMoE 相同(如果你好奇,可以在我的 LLM 架构画廊中找到它)。这里的想法是压缩(下投影)大型线性层,类似于多头潜在注意力。
3. Kimi K3整体趋势(类似 Nemotron 3、DeepSeek V4等)也是朝着更好的推理效率发展。也就是说,有许多组件用效率调整过的版本替换了现有组件。例如,MoE -> LatentMoE,常规注意力 -> 多头潜在注意力 Kimi Delta Attention。
4. 唯一不是效率调整的组件变化是注意力残差。像 DeepSeek V4 用mHC(流形约束超连接)改进了残差路径一样,注意力残差是一种改进残差路径的方式,但它的工作方式略有不同。例如,mHC使残差路径更宽。注意力残差(也是Kimi Linear的一部分)在层间连接残差;连接本身使用注意力分数作为重要性/贡献权重。根据报告,它一致地改善了验证损失和下游性能(略微),并增加了约4%的训练成本和 2% 的推理成本。
5. 有趣的是,Kimi K3去掉所有RoPE层,而是到处使用 NoPE(无位置嵌入)。(这也是从Kimi Linear 继承的)。在其他架构中,最近的趋势是在局部注意力层(像滑动窗口注意力)中使用RoPE,在全局层中使用NoPE。有少数架构只到处使用NoPE,但据我所知,这是第一个前沿级别的。
6. Kimi K3现在还具有原生多模态支持,这很棒。
技术报告中还有几个其他有趣的训练细节,但目前架构方面就是这些了。总体上是一个非常棒的发布。