Linum ускорила обучение text-to-image моделей в 3.6 раза

Training Text-to-Image Models 3.6× Faster

Linum ускорила обучение text-to-image моделей в 3.6 раза

Linum v2 страдала от огромного окна внимания: 5-секундный клип 720p требовал 110K токенов. Исследователи предлагают архитектуру JiT-DDT, которая отказывается от VAE и переносит сжатие в DiT, используя x-предсказание вместо v-предсказания. Это позволяет обучать модель в 3.6 раза быстрее по GPU-часам, хотя она генерирует изображения с в 4 раза большим числом пикселей. Код и веса доступны под лицензией Apache 2.0.

Против нашего базового уровня Linum v2, JiT-DDT обучает text-to-image модель с 3.6× меньшим количеством GPU-часов, даже несмотря на то, что генерирует изображения с 4× большим количеством пикселей.

Ещё за этот день

2026-09-16