摘要
月之暗面放出 Kimi K3 完整权重之后,社区的动作比预想快——「在 M1 Max 上跑 Kimi K3」的帖子今天登上了 Hacker News 首页。 具体来看,这是一个名为「Deltafin」的小型研究项目,支持在 Apple Silicon Mac 上本地运行 Kimi K3(2.8 万亿参数)。 HN 讨论帖的评论两极分化得很厉害。一边说「0.3 token 每秒,这东西有什么意义?」另一边说「你想想,2.8 万亿参数,在你的桌面电脑上跑。」两边都对,但这个争论本身跳过了更有意思的问题——K3 能在 Mac 上跑起来,不是因为有人想方设法去压缩它,而是这件事从一开始就写在了架构里。 Raschka 在 K3 开源完整权重 48 小时内就出了一篇架构笔记。他的第一句判断很简单:「本质上是 Kimi Linear 的规模化生产版本。」Kimi Linear 是 Moonshot 去年的工作,只有 48B 参数。现在 K3 把它放大到了约 2.8 万亿,加了一个关键组件:LatentMoE。 这个概念不是 Kimi 首创——NVIDIA 的 Nemotron 3 Ultra 也用了类似方案——但 K3 是第一个把它做到这个体量的。核心思路是把标准 MoE 里的大线性层通过下投影压缩。说人话就是:模型虽然整体巨大,但每次推理只激活一小部分专家,其余老老实实待在磁盘或网络存储上。一个 MoE 模型对本地推理天然友好,不是靠事后裁剪,是架构生来如此。 第二个设计是 MXFP4 原生训练。K3 从训练第一天起就是 MXFP4 格式。这意味着你下载下来的权重不需要经历一次额外的量化步骤——下载即用。对服务器这不重要,对一台 Mac 很重要。1.6TB 的权重文件,如果还需要再转换一轮格式,大多数人连试都不会试。K3 把这个步骤省了。 第三个更激进:NoPE。K3 移除了全部 RoPE 位置编码,全模型不用任何位置嵌入。Raschka 说据他所知,这是第一个在「前沿级别」模型上这么干的。其他架构的做法更保守——Gemma-4 在滑动窗口注意力层用 RoPE,全局注意力层用 NoPE。K3 一刀切。 为什么这跟本地推理有关?因为去掉 RoPE 意味着计算路径更短。HN 上有人解释了这怎么 work 的:因果掩码本身就隐含位置信息;
相关事件
暂无数据
相关公司
暂无数据
相关人物
暂无数据