DiffusionGemma:Google DeepMind用扩散模型重写文本生成规则

· 科技资讯
DiffusionGemma:Google DeepMind用扩散模型重写文本生成规则

大语言模型逐字生成的范式,正在被 Google DeepMind 用一种全新的方式挑战。

6 月,Google DeepMind 开源了一个实验性模型 DiffusionGemma——它不按照传统自回归(autoregressive)方式一个字一个字地生成文本,而是采用离散扩散(discrete diffusion)技术,一次性并行生成 256 个 Token 的文本块。简单地说:它不是”边想边写”,而是”整体构思后批量输出”。

四倍生成速度从何而来?

传统大语言模型的生成过程是串行的:生成第 N 个 Token 后才能生成第 N+1 个。这种方式虽然保证了输出的连贯性,但在推理速度上存在天然瓶颈——无论 GPU 多强,都得一个字一个字排队。

DiffusionGemma 的核心创新在于打破了这种串行依赖。它单次可以并行生成 256 个 Token,理论上最高实现 4 倍生成提速。这背后的数学原理是:扩散模型不预测”下一个词是什么”,而是预测”整个文本块应该长什么样”,然后从噪声中逐步”去噪”成形。

26B 参数,18GB 显存就能跑

DiffusionGemma 采用 26B 总参数、3.8B 激活参数的 MoE(混合专家)架构。经过量化优化后,仅需 18GB 显存就能完成本地部署——这意味着个人用户的 RTX 4090 或 A5000 显卡就足以运行。

模型的另一大特点是原生支持文本、图像、长视频多模态输入,这意味着它的应用场景远超单纯的文本生成。更关键的是,它内置了逻辑推演思考模式,可以通过全局自我纠错机制在生成过程中修正错误——这在传统自回归模型中几乎不可能实现,因为自回归模型一旦”写错”就无法回头。

Apache 2.0 开源,已适配主流框架

DiffusionGemma 采用 Apache 2.0 开源协议,已兼容 vLLM、Unsloth 等主流推理框架。虽然它不适用于高并发云端场景(在这类场景下传统自回归模型仍占优势),但在单用户本地运行、低延迟智能体开发和实时人机交互等场景中,它的性价比优势是巨大的。

范式之争才刚刚开始

自回归模型已经统治自然语言处理领域近十年,从 GPT 到 Gemini 到 Claude,几乎所有主流模型都建立在”预测下一个 Token”的基础之上。DiffusionGemma 的出现并不意味着自回归范式的终结——它在生成质量上还无法与同规模的顶级自回归模型抗衡——但它证明了一件事:文本生成还有其他可能的技术路径。

如果扩散模型在文本领域的表现能复制其在图像生成领域的成功轨迹(Stable Diffusion 最初同样不被看好),那么未来 2-3 年,我们可能会看到一场文本生成范式的重构。

值得注意的是,DiffusionGemma 还内置了逻辑推演思考模式,可以通过全局自我纠错机制在生成过程中修正错误——这在传统自回归模型中几乎无法实现,因为自回归模型一旦”写错”就无法回头。这种”先打草稿再修改”的生成方式,其实更接近人类写作的真实过程。也许这才是 DiffusionGemma 最值得关注的地方:它不仅是一个更快的文本生成器,更是一种更接近人类思维方式的机器写作尝试。

— END —

LC 智趣厅 · 科技与生活的交点

ihygg.cn

— END —
LC 智趣厅 · 科技与生活的交点
ihygg.cn

滚动至顶部
微信公众号:LC智趣厅

扫码关注微信公众号
LC智趣厅