JiT-DDT:文生图模型训练提速3.6倍
Training Text-to-Image Models 3.6× Faster
Linum v2 曾受限于巨大的注意力上下文窗口,导致训练效率低下。我们提出了一种名为 JiT-DDT 的新型编码器 - 解码器架构,它摒弃了传统的 VAE 压缩方案,将压缩任务直接整合进 DiT 模型中。通过从 v-prediction 转向 x-prediction,我们成功规避了高维空间中的“维度灾难”,实现了激进的 token 压缩。实验表明,JiT-DDT 在生成像素数量翻四倍的同时,训练所需的 GPU 小时数减少了 3.6 倍。这一发现不仅打破了 VAE 压缩的瓶颈,也为未来更高效的生成式模型训练开辟了新路径。
通过切换到 x-prediction,我们可以尝试绕过维度灾难,让模型即使在高维空间下也能专注于低维信号。