DiffusionGemma: Open-Weight-Sprachmodell erzeugt 1.500 Tokens pro Sekunde

DiffusionGemma Technical Report

DiffusionGemma: Open-Weight-Sprachmodell erzeugt 1.500 Tokens pro Sekunde

Das DiffusionGemma-Team von Google stellt ein experimentelles Open-Weight-Sprachmodell vor, das Text per diskreter Diffusion statt autoregressiv erzeugt. Statt Token für Token zu dekodieren, verfeinert das Modell Blöcke von 256 Tokens parallel und erreicht so auf einer einzelnen NVIDIA H100 GPU etwa 1.500 Ausgabe-Tokens pro Sekunde. Das Modell entsteht durch Fine-Tuning des Mixture-of-Experts-Modells Gemma 4 mit 3,8 Mrd. aktiven und 25,2 Mrd. Gesamtparametern und benötigt dafür weniger als 10 % des Trainings-Token-Budgets des Ausgangsmodells. Die zweistufige Pipeline kombiniert überwachtes Fine-Tuning mit Reinforcement Learning und Sampler-Destillation. DiffusionGemma unterstützt weiterhin Denkmodus, multimodale Eingaben und lange Kontexte.

DiffusionGemma etabliert eine neue Pareto-Grenze für den Kompromiss zwischen Erzeugungsgeschwindigkeit und Modellfähigkeit.

Mehr von diesem Tag

2026-08-20