论文推荐|DiffusionGemma:基于离散扩散的超高速语言模型,单卡H100每秒生成1500 Token
thinkindev • 2026-08-05
2033 views
来自Google的研究团队发布了DiffusionGemma技术报告,提出了一种实验性的开源权重语言模型,通过离散扩散生成文本,速度远超传统自回归模型。DiffusionGemma并未从零训练,而是在专家混合架构Gemma 4(激活参数38亿,总参数252亿)上进行微调,采用两阶段高效训练流程,仅消耗原始模型总训练令牌量的不到10%。第一阶段通过监督微调教会模型双向去噪能力,第二阶段结合强化学习与采样器蒸馏,同步提升生成质量与推理效率。该模型一次并行精炼256个令牌块,绕过逐令牌解码的瓶颈,平均每次前向传递可生成约20个令牌,在单块NVIDIA H100 GPU上达到约每秒1500个输出令牌,显著快于配备最先进推测解码的自回归模型。DiffusionGemma在生成速度与模型能力之间建立了新的帕累托前沿,同时保留了原模型的思考模式、多模态输入和长上下文支持,且经扩散微调后仍能以轻微性能代价进行自回归生成,为混合扩散-自回归解码路径提供了可能。
核心要点
- DiffusionGemma通过离散扩散并行精炼256个令牌块,单卡H100生成速度达约1500 tokens/s。
- 在Gemma 4上进行两阶段高效微调,仅用不到10%的训练令牌预算即完成扩散生成训练。
- 模型同时保持思考模式、多模态输入和长上下文能力,并可回退至自回归生成,开辟混合解码新方向。