Seleccionar fotogramas lo es todo: cómo lograr que los LLM vean vídeo

Frame selection is the whole game: notes on making LLMs watch video

Un artículo técnico explica por qué alimentar a un modelo de lenguaje con el vídeo completo, en lugar de un resumen escrito, le permite captar detalles que el autor humano omitiría. El reto es el presupuesto de tokens: solo caben entre 100 y 150 fotogramas. El autor detalla un sistema de selección en tres canales: detección de escenas con umbral adaptativo, deduplicación por similitud global, acción local y cambios sutiles, y fusión con la transcripción. El resultado se sirve mediante MCP y la herramienta es de código abierto (MIT).

Dar al modelo el vídeo traslada el paso de compresión al propio modelo: ve cómo era realmente la demo, no cómo dijo el crítico que era.

Más de este día

2026-08-04