Возвращение непрерывных диффузионных языковых моделей: почему они вымерли и как воскресли

Continuous Diffusion Language Models (CDLM's)

Возвращение непрерывных диффузионных языковых моделей: почему они вымерли и как воскресли

После нескольких лет затишья непрерывные диффузионные модели для языка (CDLM) переживают ренессанс. Автор, работавший над Imagen и Veo, объясняет, почему в 2023 году они уступили место дискретным методам: ключевым фактором стала 64-кратная неэффективность обучения, измеренная в Plaid-1B. Затем он разбирает технические компоненты CDLM — стратегии эмбеддингов, функции потерь, шумовые расписания и самокондиционирование — и анализирует, что изменилось сейчас, чтобы подход снова стал конкурентоспособным.

В 2023 году практически все новые исследования в этой области использовали дискретную диффузию, и непрерывная диффузия для языка вымерла.
  1. janalsncm

    > [в 2020/2021] доминирование авторегрессии не было таким устоявшимся, как сегодня: GPT-3 привлекла внимание, но «момент ChatGPT» наступил только в конце 2022 года

    Не согласен с этим. Декодеры абсолютно доминировали в 2020 году в чатах. GPT-2 считалась слишком опасной для публикации, и я помню, как изо всех сил пытался попасть в лист ожидания GPT-3. Это сработало.

    (Единственное исключение, которое я сделаю, — это модели кодер-декодер, которые сейчас часто реализуются только декодером.)

    Но массовым это сделало RL. Сначала RLHF, затем другие улучшения, такие как DPO, которые было менее мучительно настраивать. Добавление диффузии поверх этого было бы еще большей морокой.

    До ChatGPT по сути не было понятия предобучения и постобучения. Всё было предобучением. Постобучение сделало ботов разговорчивыми, а не просто «продолжающими то, что вы им написали».

    Короче говоря, диффузия так и не взлетела, потому что это был просто более сложный способ генерации токенов, а настоящая проблема заключалась в получении токенов в правильном распределении.

  2. 2001zhaozhao

    Мне бы хотелось увидеть модели, которые могут думать с разной скоростью, а также выводить черновик размышлений вместе с выходным текстом, а не перед всем выводом.

    Сейчас моделям приходится полагаться на менее читаемый сжатый CoT, чтобы достичь высокой интеллектуальности на токен/шаг, но с диффузией им просто нужно было бы выдавать больше токенов за шаг.

  3. p1esk

    Приятно читать что-то, не сгенерированное ИИ.

  4. vatsachak

    Я чувствую, что на авторегрессионных LLM еще есть низко висящие фрукты; энкодер

  5. Marchant_hq

    CDLM звучат многообещающе для более плавной и связной генерации текста. Интересно посмотреть, как они справятся с разрывами на уровне токенов.

Ещё за этот день

2026-08-30