Linum, 텍스트-이미지 모델 훈련을 3.6배 더 빠르게 하다
Training Text-to-Image Models 3.6× Faster
Linum이 새로운 인코더-디코더 아키텍처인 JiT-DDT를 공개했다. 기존 Linum v2 대비 GPU 시간을 3.6배 절감하면서도 4배 더 많은 픽셀의 이미지를 생성한다. JiT-DDT는 VAE를 제거하고 DiT에 압축을 통합해 32x32 토큰 축소를 달성했으며, x-예측과 v-손실을 사용해 고차원 입력 학습 문제를 해결했다. 코드와 모델 가중치는 Apache 2.0 라이선스로 공개되었다.
우리는 JiT-DDT가 LDM보다 훨씬 효율적으로 훈련하면서도 세부 디테일을 복원하는 새로운 인코더-디코더 아키텍처를 제안한다.