摘要
月之暗面开源 Kimi K3 完整权重的第二天,Hacker News 上最热的那条评论不是 "恭喜" 也不是 "历史性时刻"—— 是一条算数题。 "MXFP4 原生精度,光权重就要 1.5TB 显存。8 块 B200 勉强装下,实际部署至少 16 块。" 下面立刻有人接着算:一台二手四路至强服务器,插满 3TB DDR5 内存,不到三万美元,能不能跑?回答是大概能到每秒五六个 token。另一个评论说没戏,"K3 想得特别多才会回复",思考阶段就耗掉几分钟,实际可用速度得按天算,不是按秒。 有人在认真讨论 SSD offload。结论更悲观 —— 低于 700B 的模型用 Colibri 勉强能跑 0.1 tok/s,3T 级别 "可能慢到无法使用"。 这就是开源 3T 模型的技术现实。Kimi 把权重交出来了,但怎么跑、跑多快、花多少钱,是社区接下来要自己解决的问题。 先看 Kimi 官宣了什么。 7 月 27 日,Kimi 在官网博客正式发布 K3 的技术细节。2.8 万亿参数,MoE 架构,896 个专家每次激活 16 个,原生支持视觉和 100 万 token 上下文窗口。三项核心技术:Kimi Delta Attention(KDA,一种线性注意力机制的基础设施),Attention Residuals(选择性跨层检索而非均匀累积),以及 Stable LatentMoE 框架。配合 MXFP4 权重量化训练,宣称整体规模效率比前代 K2 提升约 2.5 倍。 基准测试的成绩单很有意思。Kimi 很坦诚地写了一句:"整体性能仍落后于 Claude Fable 5 和 GPT-5.6 Sol。" 但同时列出了一系列 K3 的实际产出:用 48 小时自主设计了一颗芯片(146 万标准单元、0.277MB SRAM、INT4 MAC 阵列),从头搭建了一个名为 MiniTriton 的紧凑型 Triton 式编译器且性能持平甚至超越原版,复现了计算天体物理中的 I-Love-Q 普适关系研究(阅读 20 多篇论文、生成 3000+ 行代码)。 这些不是 benchmark 分数,是可验证的产出。 定价方面:缓存命中输入 $0.30 / 百万 token,未命中 $3.00 / 百万 token,输出 $15.