谷歌开源26B文本扩散MoE,劈柴:生成速度像赛马一样快 文章

36kr 资讯2026-06-11NEWSzh作者: 机器之心

详细信息

来源站点
36kr 资讯
作者
机器之心
文章类型
NEWS
语言
zh
发布日期
2026-06-11

摘要

今天一早,谷歌又发新模型了! Gemmna 家族有了新成员 ——DiffusionGemma,一个探索文本扩散的实验性开源模型,在文本生成任务上速度极快。 根据官方介绍,DiffusionGemma 采用了 Apache 2.0 许可证发布,是一个 26B 规模的混合专家模型(MoE)。 该模型没有沿用典型自回归大语言模型(LLM)那种按顺序、逐 token 生成的方式,而是可以同时生成整块文本,在 GPU 上,文本生成速度最高可提升至 4 倍。 DiffusionGemma 建立在 Gemma 4 家族业界领先的「每参数智能水平」之上,同时吸收了 Gemini Diffusion 的前沿研究成果。它引入了一种全新的扩散式输出头,目标很明确:尽可能提高生成速度。 需要说明的是,自回归版本的 Gemma 4 仍然是高质量生产级输出的首选。而 DiffusionGemma 更适合研究人员和开发者探索那些对速度要求极高、强调本地交互体验的工作流,比如行内编辑、快速迭代,以及生成非线性的文本结构。 谷歌 CEO 皮查伊表示,「DiffusionGemma 是一款开放的实验性模型,它把我们的文本扩散研究带到了 Gemma 4 上。速度像赛马一样快 🏇:通过一次性生成整块文本,而不是逐 token 预测输出,推理速度最高可以提升至 4 倍。」 为开发者创造新的价值 对实时交互式 AI 应用开发者来说,本地推理最大的痛点之一就是延迟。DiffusionGemma 正是针对这个问题而来,但也做出了一些取舍。 首先是推理速度非常快。 DiffusionGemma 将解码瓶颈从内存带宽转向计算本身,因此在专用 GPU 上,token 输出速度最高可提升至 4 倍。在单张 NVIDIA H100 上,它可以达到每秒 1000+ tokens;在 NVIDIA GeForce RTX 5090 上,也能达到每秒 700+ tokens。 其次是硬件门槛相对友好。 DiffusionGemma 是一个总规模为 26B 的 MoE 模型,但推理时只激活 3.8B 参数。经过量化后,它可以比较轻松地运行在 18GB 显存以内的高端消费级独立显卡上。 第三,它支持双向注意力。