DiffusionGemma:告别逐词生成的速度革命
DiffusionGemma Technical Report

DiffusionGemma 团队推出了一款实验性开源语言模型,彻底改变了文本生成的逻辑。它不再像传统自回归模型那样逐词解码,而是利用离散扩散技术,并行迭代优化 256 个 token 的文本块,从而突破了速度瓶颈。该模型基于 Gemma 4 微调,仅需不到 10% 的训练算力预算。在单张 NVIDIA H100 GPU 上,其生成速度可达每秒 1500 个 token,远超配备最先进投机解码的自回归模型。更令人惊喜的是,它在保持高速的同时,依然支持思维模式、多模态输入和长上下文,甚至保留了自回归生成能力,为混合解码架构开辟了新路径。
DiffusionGemma 在生成速度与模型能力之间的权衡上确立了新的帕累托前沿。