Linum、VAEを捨ててテキスト画像生成の学習を3.6倍高速化
Training Text-to-Image Models 3.6× Faster
Linum v2は720p・5秒のクリップを110Kトークンとして扱い、アテンションの二次コストが学習のボトルネックになっていた。同社はVAEを排除し圧縮をDiTに統合するJiTを拡張した新アーキテクチャJiT-DDTを提案。x-predictionとv-lossの組み合わせで高次元入力の学習不安定性を回避し、4倍の画素数の画像を生成しながらGPU時間を3.6倍削減。コードと重みはApache 2.0で公開。
ノイズはランダムなガウス分布であり、D次元空間全体を覆う。したがってDを大きくするにつれて、ノイズ(速度項内)を適合させる問題は指数関数的に難しくなる。