DiffusionGemma: el modelo de difusión de Google genera 1.500 tokens por segundo en una H100

DiffusionGemma Technical Report

DiffusionGemma: el modelo de difusión de Google genera 1.500 tokens por segundo en una H100

El equipo de Google ha publicado el informe técnico de DiffusionGemma, un modelo de lenguaje experimental de código abierto que utiliza difusión discreta para generar texto a gran velocidad. En lugar de decodificar token a token, DiffusionGemma refina bloques de 256 tokens en paralelo, evitando el cuello de botella de los modelos autoregresivos. El modelo, obtenido ajustando Gemma 4 (3.8B activos, 25.2B totales), alcanza alrededor de 1.500 tokens por segundo en una NVIDIA H100, superando a los modelos AR incluso con decodificación especulativa. El entrenamiento en dos etapas usa menos del 10% del presupuesto de tokens del modelo original.

DiffusionGemma establece una nueva frontera de Pareto en el equilibrio entre velocidad de generación y capacidad del modelo.

Más de este día

2026-08-20