Linum entrena modelos de texto a imagen 3.6 veces más rápido con JiT-DDT

Training Text-to-Image Models 3.6× Faster

Linum entrena modelos de texto a imagen 3.6 veces más rápido con JiT-DDT

Linum presenta JiT-DDT, una arquitectura unificada que combina compresión y generación en un solo modelo. Al eliminar el VAE y adoptar la predicción x en lugar de la predicción v, logra una reducción de tokens de 32×32. El resultado: entrenamiento 3.6 veces más rápido que su baseline Linum v2, generando imágenes de 512×512 con solo 320 tokens. El código y los pesos están disponibles bajo licencia Apache 2.0.

La velocidad es ε - x₀. Cuando hacemos predicción v, nuestra red neuronal tiene que aprender implícitamente la señal (x₀) y el ruido (ε). El ruido es un gaussiano aleatorio que cubrirá todo el espacio D-dimensional. Así que, a medida que escalamos D, el problema de ajustar el ruido (dentro del término de velocidad) se vuelve exponencialmente más difícil.

Más de este día

2026-09-16