Cómo hicimos nuestro lector de videos LeRobot hasta 15× más rápido

How we made our LeRobot video reader up to 15× faster

Cómo hicimos nuestro lector de videos LeRobot hasta 15× más rápido

LeRobot se ha convertido en el formato abierto dominante para datos de aprendizaje robótico, pero decodificar sus videos es costoso y lento. Presentamos un lector nativo LeRobot en Daft que procesa los fotogramas por lotes en lugar de uno a uno, agrupando las filas por archivo, ordenando los objetivos por tiempo y decodificando en ráfagas. El resultado: decodificar 632 fotogramas de un dataset remoto 1080p pasó de 29 minutos a menos de 2, una mejora de 15×, con salida idéntica y coste que ya no crece linealmente con el número de fotogramas.

Decodificar los 632 fotogramas de un dataset 1080p cae de 29 minutos a menos de 2 — 15× más rápido — porque el coste por lotes crece con los lotes, no con los fotogramas.

Más de este día

2026-07-22