Mythos阴影里谷歌悄悄发模型,速度暴涨4倍 文章

36kr 资讯2026-06-11NEWSzh作者: 量子位

详细信息

来源站点
36kr 资讯
作者
量子位
文章类型
NEWS
语言
zh
发布日期
2026-06-11

摘要

别再只盯着“AO”两家的新模型大战了! 就在刚刚,谷歌闷头干了件大事: 把生成图片的扩散模型,拿来写文字了,而且一出手就是4倍加速。 新模型名为DiffusionGemma,它直接抛弃了传统自回归那套“逐Token生成”的打字机模式,而是像“印刷机”一样工作—— 一次铺开256个token的“画布”,从随机噪声出发,多轮去噪,整段文字同时浮现。 靠这套新模式,DiffusionGemma在生成速度方面交出了亮眼的成绩: 单块H100上每秒1000+ tokens,消费级RTX 5090上700+,比同规格自回归模型快了4倍。 更关键的是,这个26B参数的MoE模型,推理时只激活3.8B参数,量化后18GB显存就能装下。 翻译过来就是,一张4090就能本地跑。 目前DiffusionGemma采用允许商用的Apache 2.0开源协议,权重可在Hugging Face直接下载。 天下武功,唯快不破 说到这估计大家都明白了,DiffusionGemma身上最大的标签无疑就是“快”。 有多快呢?成绩单说话。 在同一块H100上(fp8,batch size=1),DiffusionGemma跑出了1000+ tokens/s,而采用标准自回归的Gemma 4 26B A4B加上MTP加速也只有300+ tokens/s—— 速度拉开近4倍。 而要理解DiffusionGemma为什么快,咱得先说说当前大模型为什么“慢”。 今天的主流大模型,不管是GPT、Claude还是Gemini,底层都是自回归架构——就像一台打字机,从左到右,一个token一个token地敲出来。每生成一个新词,都要重新加载一遍几十亿参数的模型权重。 在云端,这不是大问题。服务器可以同时处理上千个用户请求,把硬件利用率拉满。 但如果你在本地跑模型,场景就完全不同了—— 只有你一个人在用,GPU的大量算力其实在空转,等着一个字一个字地往外蹦。 工程师管这叫“内存带宽瓶颈”(memory-bandwidth bound)。 而为了解决这一问题,DiffusionGemma就盯上了扩散模型。 回想一下,扩散模型在生成图片时,是不是直接对整张图的所有像素同时去噪——…

摘要可能不完整,可查看原文