Diffusion-Sprachmodelle: Wie man sie baut und warum sie autoregressive Modelle herausfordern
How to build a diffusion language model

Dieser Artikel der Kuleshov Group erklärt Schritt für Schritt, wie man Diffusions-Sprachmodelle aufbaut – von den Grundlagen der Gaußschen Diffusion über Masked Diffusion bis hin zu Block Diffusion, Architekturen und Beschleunigung durch Distillation. Er zeigt, wie Diffusionsmodelle im Gegensatz zu autoregressiven Modellen die gesamte Sequenz parallel generieren, Fehler korrigieren können und bidirektionale Aufmerksamkeit nutzen. Mit Beispielen wie Mercury 2, Gemma Diffusion und Nemotron Diffusion wird deutlich, dass Diffusions-LLMs 2026 Realität sind. Der Beitrag beleuchtet auch Anwendungen in Biologie und Wissenschaft sowie die Frage, ob Diffusion ein Weg zu intelligenteren Modellen ist.
Anstatt Text Token für Token zu erzeugen, generieren Diffusionsmodelle die gesamte Sequenz auf einmal, ausgehend von einer ersten Schätzung, die sie über mehrere Schritte hinweg iterativ verfeinern.