LAION libera un dataset abierto con 80 millones de videos y 10 millones de horas para investigación multimodal
Laion Big Video Dataset
LAION presenta LAION-BVD, un dataset de video a gran escala con 1.3 mil millones de URLs de video de CommonCrawl, de las cuales se descargaron 80 millones de videos, sumando 10 millones de horas. Incluye clips anotados con subtítulos generados sintéticamente y frames extraídos para pre-entrenamiento de imagen-texto. Los modelos entrenados con estos datos alcanzan resultados competitivos en benchmarks de video-texto, audio-texto e imagen-texto, superando a los entrenados con InternVid en hasta 2.1%. El dataset está disponible exclusivamente para investigación, con el objetivo de democratizar el acceso a datos multimodales a gran escala.
Los modelos entrenados con LAION-BVD alcanzan un rendimiento competitivo en benchmarks estándar de video-texto y audio-texto, con mejoras consistentes a medida que aumenta la escala de entrenamiento o del modelo.