Как мы фильтруем данные для генеративного видео: от CPU-эвристик к RL

Getting video models to learn better, faster

Как мы фильтруем данные для генеративного видео: от CPU-эвристик к RL

В Linum рассказывают, как за два года эволюционировал их подход к фильтрации данных для претрейна генеративных видео-моделей. Начав с дешёвых CPU-алгоритмов (PySceneDetect, EAST, H.264 motion vectors, Haar cascades), они перешли к тонконастроенным LLM (Qwen-2-VL, Qwen-2.5-VL) и, наконец, к reinforcement learning для эстетической фильтрации. Авторы делятся практическими уроками: почему важно вручную просматривать данные, как бороться с перекосом в сторону talking head и текстовых видео, и как фильтрация влияет на качество модели. Статья — кладезь инженерных деталей и подводных камней.

Если вы хорошо отфильтруете свой набор данных, вашей модели будет гораздо легче научиться тому, чему вы хотите её научить.
  1. schopra909

    Привет, HN, я один из авторов. Если есть вопросы — задавайте, постараюсь ответить!

  2. smurf9852

    Очень круто!

Ещё за этот день

2026-08-27