谷歌掀桌:文本生成从此告别逐词预测
你有没有想过,为什么今天的AI写文章要一个字一个字往外蹦?

自GPT诞生以来,几乎所有的语言模型都在做同一件事:从左到右,逐个token预测下一个词。这种”串行思考”在云端集群上跑得还算顺畅,可一旦落到本地设备——受限于内存带宽——大量计算资源就开始空转。
谷歌今天给出的答案是:别一个一个来了,一起上。
6月11日,谷歌正式发布DiffusionGemma,一个基于文本扩散机制的开放AI模型,在本地推理速度上直接飙到自回归模型的4倍。它把图像生成领域已经验证过的”扩散”技术搬到了文本生成上,用”并行去噪”替代了”逐词预测”,让AI写作从打字机模式切换到了印刷机模式。
这个实验性模型基于Gemma 4系列构建,参数规模26B(MoE架构),采用Apache 2.0许可证开源,模型权重已上架Hugging Face,开发者可以直接下载使用。
从”打字机”到”印刷机”:文本扩散到底怎么工作?
理解DiffusionGemma,首先要打破一个思维惯性:文字生成不一定非得按顺序来。
传统自回归模型(如GPT、Gemini)的生成过程像一个打字机——必须敲完上一个字符,才能敲下一个。这种”因果链”意味着每一步都在等前一步的结果,无法并行。在云端做批量推理时,GPU可以同时服务多个请求来掩盖这个瓶颈;但在本地设备上,单个请求的串行延迟就暴露无遗。
扩散模型的思路完全不同。它从一段随机噪声出发,通过逐步”去噪”来重建目标文本——整个过程对所有token并行处理,每一步都在优化整段输出的全局质量。就像冲洗一张照片:不是从左到右一列列像素显影,而是整张画面同步清晰起来。
DiffusionGemma为此配备了一个专用的扩散头(Diffusion Head),专门优化生成速度。实测数据相当惊人:
– 采样速度:1479 tokens/秒
– 推理开销:仅0.84秒
这是什么概念?一段约1000字的文章,DiffusionGemma不到1秒就能生成完毕。而在硬件实测中,单块H100 GPU上达到每秒1000 tokens,DGX Station上更是冲到每秒2000 tokens——大约是同条件下自回归模型的4倍。
用Google DeepMind官方的说法,这个模型专为”对延迟敏感的本地交互场景”设计,比如实时内联编辑、快速迭代写作、以及非线性文本结构的生成。
代码能打、数学出彩,但短板同样明显
再快的速度,如果生成质量跟不上,也只是个花架子。DiffusionGemma在基准测试上的表现,可以说是有惊喜也有遗憾。
代码能力方面,DiffusionGemma交出了一份不错的答卷:
– HumanEval:89.6%——人类程序员水平的代码生成
– BigCodeBench:45.4%
– LiveCodeBench:30.9%
整体上与Gemini 2.0 Flash-Lite互有胜负,考虑到这是一个全新的架构方向,这个成绩已经足以说明扩散模型在代码生成领域的可行性。
数学推理更是意外之喜。 在AIME 2025上,DiffusionGemma拿到23.3%,超越了对比模型的20.0%。扩散架构在推理任务上展现的潜力,开始让研究者重新审视”因果链必要论”——是不是非得从左到右挨个想,才能解出数学题?
但短板同样不容回避:
– 科学推理GPQA Diamond:仅40.4%,对比模型56.5%,差距明显
– 复杂推理BIG-Bench Extra Hard:15.0%,落后于21.0%
谷歌也坦诚表示,DiffusionGemma在生成质量上暂未超越自回归版Gemma 4,后者仍是生产环境的首选。这个模型目前定位为实验性研究模型,更多是向社区展示一条新路,而非立刻取代现有方案。
不过话说回来——谁家第一代产品就能全面碾压成熟方案呢?
为什么英伟达比谷歌还兴奋?
DiffusionGemma发布的同一天,英伟达也在官方博客中同步站台。这并不意外——扩散模型的结构特点,恰好打在了英伟达GPU的”甜蜜点”上。
自回归模型的推理瓶颈在于内存带宽:每次生成一个token,GPU的计算核心大部分时间都在等待数据搬运,Tensor Core的并行算力根本使不上劲。
扩散模型则完全不同。一次处理所有token意味着巨大的并行矩阵运算——这恰好是Tensor Core最擅长的活。英伟达在官方博文中明确指出,DiffusionGemma的扩散设计”能充分发挥英伟达GPU的Tensor Core并行计算能力”。
实测数据也验证了这一点。在不同硬件上的表现:
– DGX Station(工作站):2000 tokens/秒
– H100(单卡):1000 tokens/秒
– DGX Spark(桌面设备):150 tokens/秒
从数据中心到桌面工作站再到个人开发者设备,扩散模型的并行特性让GPU终于不再”干等”。
更有趣的是,扩散模型的生成机制天然支持迭代优化——你可以在生成过程中随时回头修正前面的内容,而不是像自回归模型那样覆水难收。这对需要”边写边改”的创作场景来说,是一个结构性优势。
新范式的起点,不是终点
关于DiffusionGemma,有两点值得特别注意。
第一,它是开源的。 Apache 2.0许可证,模型权重直接放在Hugging Face上,任何人都可以下载、修改、商用。谷歌选择将这一实验性技术完全开放,意味着它希望吸引更多研究者进入”文本扩散”这个赛道,共同探索这条技术路线的边界。
第二,它指向的不是替代,而是融合。 业内人士的判断趋于一致:未来的语言模型很可能走向”扩散+自回归”的混合架构——由扩散模型快速生成初稿,再由自回归模型精修;或者在简单任务上用扩散模式极速响应,复杂推理时切换回逐词推演。这种”快慢结合”的策略,可能比单一架构更接近人类写作的真实过程。
从2025年5月Google DeepMind推出Gemini Diffusion实验演示,到2026年6月DiffusionGemma正式开源——一年的时间,文本扩散从一个实验室概念走到了开发者可以上手实测的阶段。速度提升4倍只是开始,更重要的是,它证明了”AI写文章不一定要一个字一个字来”这件事,是行得通的。
打破”逐词预测”的惯性,或许才是DiffusionGemma最大的价值。
— END —
LC 智趣厅 · 科技与生活的交点
ihygg.cn
