Kimi K3 架构拆解——本质上是 Kimi Linear 的规模化生产版本 文章

开源中国2026-07-29NEWSzh作者:

详细信息

来源站点
开源中国
作者
文章类型
NEWS
语言
zh
发布日期
2026-07-29

摘要

Kimi K3 开源完整权重之后,社区的动作比预想的快。不到 48 小时,Sebastian Raschka 就发了一篇架构拆解笔记。 如果你不知道 Raschka 是谁——他写过《Build a Large Language Model (From Scratch)》,在 Lightning AI 做研究,长期以独立视角分析各家模型架构。他的判断通常不站队,只讲技术。这篇 K3 笔记也不例外,短、干净、没有废话。 他上来第一句就给 K3 定了性:「本质上是 Kimi Linear 的规模化生产版本。」Kimi Linear 是 Moonshot 去年的工作,当时只有 48B 参数。现在 K3 把它放大到了约 2.8 万亿——Raschka 说这是「目前最大的开源权重模型」。 从 48B 到 2.8T,加了一个关键组件:LatentMoE。 这个概念不是 Kimi 首创。NVIDIA 的 Nemotron 3 Ultra 也用了类似方案。核心思路是把标准 MoE 里的大线性层压缩——通过下投影(down-projection)的方式——类似于多头 latent attention 的做法。Moonshot 把它叫做 Stable LatentMoE 框架,在 K3 的技术报告里有详细展开。 但 Raschka 的关注点不止于这一个组件。他指出了一个更宏观的趋势:推理效率正在成为架构设计的驱动力量。MoE → LatentMoE,常规注意力 → 多头 latent attention + Kimi Delta Attention(KDA)。每一步替换都在牺牲一点表达能力,换取更低的推理成本。这套思路在 Nemotron 3、DeepSeek V4 身上也能看到,不是 Kimi 一家在走。 然后是 Attention Residuals。Raschka 特意强调这不是效率优化,而是对残差路径的结构性改良。DeepSeek V4 用流形约束的超连接(mHC)来拓宽残差路径,K3 的做法不同——它用注意力分数来学习跨层残差的贡献权重。技术报告里的原话是「持续改善验证损失和下游性能」,代价是训练成本增加约 4%,推理成本增加约 2%。这个设计其实继承自 Kimi Linear,不是新东西,但 Raschka 觉得值得单独拿出来讲。 最让他意外的是 NoPE。