抛弃 VAE:Pyramid-JiT 如何重塑图像生成
Training Text-to-Image Models Without a VAE
我们提出了一种名为 Pyramid-JiT 的新型纯解码器像素空间架构,彻底摒弃了传统 LDM 中昂贵的 VAE 组件。通过在 DiT 主干的多个层级预测不同分辨率的图像,该模型在训练样本减少 11.3 倍、GPU 耗时降低 4.3 倍的情况下,实现了与 Linum v2 相当甚至更优的 FD-DINOv2 评分。这种架构不仅解决了编码器 - 解码器在参数量分配上的瓶颈,还通过多分辨率预测机制显著提升了细节还原能力。我们开源了相关代码和模型权重,旨在为构建更高效的视频生成工具铺平道路。
直觉上,视频模型需要先学会名词(静态的人、地点、事物),然后才能学会动词(动作、运动等)。
- schopra909
Hi HN,作者在此!
简单交代一下背景:我们是一个两人实验室,正在训练生成式视频模型。我们的目标是打造一套新的可控动画工具(如果你感兴趣,可以点这里了解更多:https://www.linum.ai/about)。
对于我们上一个文生视频模型来说,训练和推理成本最大的瓶颈在于注意力机制(attention)。视频模型的 token 密度极高(例如,几秒的片段就包含 11 万个 token)。如果我们能更激进地压缩上下文窗口,就能以更低的成本训练更大的模型,并以合理的价格提供给专业消费者(不像目前那些大型模型如 Seedance,运行起来贵得要命)。
传统上,图像和视频模型包含两个独立的组件:VAE(变分自编码器)和 Diffusion Transformer(DiT)。它们是分开训练的,经验表明 VAE 很难突破 16x16 的 token 压缩率。
在这里,我们转向像素空间,抛弃 VAE,实现了 32x32 的 token 压缩(上下文窗口缩小 4 倍),同时用少得多的训练样本就学到了整体更好的模型。
核心论点是“越简单越好”。如果我们能把压缩问题交给更强大的 Diffusion Transformer(DiT),它应该能学会一个专为生成优化的“潜在空间”,从而在不损害生成质量的前提下获得更好的压缩效果。
未来几个小时我会时不时查看这个帖子,欢迎在下面提问。我会尽力回答……
- bitpush
今天有没有办法在 ComfyUI 里用上这个?