Pyramid-JiT обучает генерацию изображений без VAE, обгоняя прежние модели в 11 раз
Training Text-to-Image Models Without a VAE
Linum представила Pyramid-JiT — decoder-only архитектуру в пиксельном пространстве, которая предсказывает изображение на нескольких разрешениях вдоль ствола DiT. Без VAE и с несколькими readout-головами модель достигает качества Linum v2 на 11,3× меньшем числе обучающих примеров и обучается в 4,3× быстрее при 4× большем разрешении. Код и веса открыты под лицензией Apache 2.0.
Мы надеемся, что, поделившись нашими находками с широким сообществом, мы сможем побудить других также исследовать более эффективные методы обучения.
- joefourier
Интересно, насколько это связано с использованием неоптимального VAE? Те же оптимизации можно было бы применить и к нему, и моя интуиция подсказывает, что общие затраты на вычисления были бы ещё оптимальнее, если бы вы сами переобучили VAE с лучшим подходом (особенно обеспечив инвариантность к переносу и повороту, + возможность масштабирования/размытия латентов).
Вы также могли бы получить те же преимущества от черновика в низкоразмерном латентном пространстве с более простым для изучения распределением данных, более устойчивым к возмущениям, но вместо 512x512 вы могли бы получить выход 4096x4096 за те же вычисления (при условии 8x VAE).
Есть ещё преимущество: можно использовать большое количество шагов диффузии/flow matching для основного LDM, в то время как VAE может быть одношаговым и гораздо меньшим, поскольку ему не нужно обрабатывать язык или значительное понимание сцены, только перцептивное сжатие. Это звучит особенно важно для видеомодели, где я бы крайне неохотно обучал генеративную модель без опоры на межкадровое сжатие.
- schopra909
Привет, HN, я автор!
Для контекста: мы — лаборатория из двух человек, обучающая генеративные видеомодели. Цель — новый набор управляемых инструментов для анимации (подробнее можно почитать здесь https://www.linum.ai/about, если интересно).
Самое узкое место нашей последней модели текст-в-видео с точки зрения затрат на обучение и инференс — это внимание. Видеомодели невероятно плотны по токенам (например, 110K токенов для нескольких секунд клипа). Если мы сможем сжимать это контекстное окно более агрессивно, мы сможем обучать более крупные модели за гораздо меньшие деньги и предлагать их просьюмерам по разумным ценам (в отличие от больших моделей вроде Seedance, которые стоят целое состояние в запуске).
Традиционно модели изображений и видео имеют два разрозненных компонента: VAE (вариационный автоэнкодер) и Diffusion Transformer (DiT). Они обучаются отдельно, и эмпирически VAE, похоже, с трудом преодолевают сокращение токенов в 16x16.
Здесь мы переходим к пиксельному пространству, отказываемся от VAE и достигаем сокращения токенов в 32x32 (в 4 раза меньшие контекстные окна), при этом изучая лучшую общую модель за долю обучающих примеров.
Центральный тезис — «проще значит лучше». Если мы сможем переложить проблему сжатия на более мощный Diffusion Transformer (DiT), мы должны быть в состоянии выучить «латентное пространство», оптимизированное для генерации, и получить лучшее сжатие без ущерба для качества генерации.
Я буду время от времени проверять этот пост в ближайшие пару часов, так что не стесняйтесь задавать вопросы ниже. И я постараюсь ответить на них как можно лучше […]
- bitpush
Есть ли способ использовать это в ComfyUI уже сегодня?