VAEを捨てたピクセル空間モデル、Pyramid-JiTが少ない学習で高画質を実現
Training Text-to-Image Models Without a VAE
Linumが提案するPyramid-JiTは、VAEを使わずピクセル空間で直接画像を生成するデコーダのみのアーキテクチャだ。DiTの中間層に複数の出力ヘッドを置き、128²から512²へと解像度を段階的に上げて予測することで、構造と細部を効率的に学習する。従来のLinum v2と同等の品質を11.3分の1の学習サンプルで達成し、GPU時間も4.3分の1に削減。Apache 2.0でコードと重みが公開された。
VAEを捨てることで、トークンをより積極的に圧縮できた。その結果、attentionのコストが削減され、トレーニングと推論の高速化に直結した。
- schopra909
HNの皆さん、著者です!
文脈として、私たちは生成ビデオモデルを訓練している2人組のラボです。目標は、新しい制御可能なアニメーションツールのセットです(興味があれば、詳細はこちら https://www.linum.ai/about で読めます)。
私たちの前回のテキスト-to-ビデオモデルにおける訓練と推論コストの最大のボトルネックはアテンションです。ビデオモデルは信じられないほどトークン密度が高く(例えば、数秒のクリップで110Kトークン)、そのコンテキストウィンドウをより積極的に凝縮できれば、はるかに少ない費用でより大きなモデルを訓練し、今日のSeedanceのような大規模モデル(実行に莫大なコストがかかる)とは異なり、プロシューマーに手頃な価格で提供できます。
従来、画像とビデオのモデルには2つの分離したコンポーネントがあります:VAE(Variational Autoencoder)とDiffusion Transformer(DiT)です。それらは別々に訓練され、経験的にVAEは16x16のトークン削減を超えるのに苦労しているようです。
ここでは、ピクセル空間に切り替え、VAEを捨て、32x32のトークン削減(コンテキストウィンドウが4分の1)を達成しつつ、訓練サンプルのほんの一部でより良い全体的なモデルを学習しています。
中心的なテーゼは「シンプルな方が良い」です。圧縮問題をより強力なDiffusion Transformer(DiT)に組み込むことができれば、生成に最適化された「潜在空間」を学習し、生成品質を損なうことなくより良い圧縮を得られるはずです。
次の数時間、この投稿を時々チェックしますので、以下に質問をどうぞ。できる限り答えようと思います […]
- bitpush
今日、これをComfyUIで使う方法はありますか?