JiT-DDT trainiert Text-zu-Bild-Modelle 3,6-mal schneller
Training Text-to-Image Models 3.6× Faster
Linum stellt JiT-DDT vor, eine neuartige Encoder-Decoder-Architektur, die Text-zu-Bild-Modelle mit 3,6-mal weniger GPU-Stunden trainiert – und das bei vierfacher Pixelzahl. Der Trick: Statt auf einen separaten VAE setzt das Modell auf pixelraumbasierte Diffusion und x-Vorhersage, um den Fluch der hohen Dimensionen zu umgehen. Der Code und die Gewichte stehen unter Apache 2.0 bereit.
Gegen unsere Linum v2-Basis trainiert das JiT-DDT ein Text-zu-Bild-Modell mit 3,6-mal weniger GPU-Stunden, obwohl es Bilder mit 4-mal so vielen Pixeln erzeugt.