Диффузионные языковые модели: как они работают и почему бросают вызов автогрессии

How to build a diffusion language model

Диффузионные языковые модели: как они работают и почему бросают вызов автогрессии

Статья из блога Kuleshov Group объясняет, как строить диффузионные языковые модели — альтернативу автогрессивным LLM. Вместо генерации токенов по одному, диффузионные модели создают последовательность целиком, итеративно улучшая её. Рассматриваются masked diffusion (BERT-подобный подход), block diffusion для генерации переменной длины, архитектуры, ускорение через дистилляцию, контролируемая генерация и пост-обучение. Авторы упоминают реальные модели 2026 года: Mercury 2, Gemma Diffusion и Nemotron Diffusion, а также обсуждают перспективы диффузии с точки зрения scaling laws.

Каждый шаг генерации в диффузионной модели может исправлять ошибки, сделанные на предыдущих шагах, что принципиально невозможно в автогрессивных моделях.

Ещё за этот день

2026-08-31