Cómo Linum filtra datos para que los modelos de video aprendan mejor y más rápido

Getting video models to learn better, faster

Cómo Linum filtra datos para que los modelos de video aprendan mejor y más rápido

Los modelos de video han mejorado gracias a mejoras en los datos, no en la arquitectura. Linum comparte su evolución en el filtrado de datos para preentrenamiento: desde técnicas clásicas de visión por computador en CPU (detección de escenas, OCR, vectores de movimiento) hasta LLMs afinados en GPU y, finalmente, aprendizaje por refuerzo con recompensas verificables. Explican cómo eliminar datos ruidosos y rebalancear el conjunto mejora la eficiencia del aprendizaje, y detallan sus pipelines de 2024 y 2025, incluyendo el uso de Qwen-VL y WAFT.

Si lanzas un montón de datos de baja calidad (por ejemplo, JPEG muy comprimidos) en el preentrenamiento, tu modelo va a desperdiciar una cantidad significativa de su capacidad aprendiendo a imitar esa porción de datos.
  1. schopra909

    Hola HN, uno de los autores aquí. Si tenéis alguna pregunta, ¡haré todo lo posible por responderlas!

  2. smurf9852

    ¡Muy bonito!

Más de este día

2026-08-27