视频模型加速:数据过滤的三年进化
Getting video models to learn better, faster
过去几年,图像和视频模型的性能飞跃主要归功于数据策略的优化,而非架构的颠覆。我们回顾了从2024年依赖CPU运行传统计算机视觉算法,到2025年初利用微调的LLM进行内容过滤,再到引入强化学习进行美学评分的完整演进路径。通过剔除低质量数据、重采样过度代表的类别(如对着镜头说话的视频),以及利用H.264运动向量过滤难以描述的动作,我们显著提升了模型的学习效率。与其盲目堆砌海量数据,不如精心筛选,让模型专注于真正有价值的学习信号。
如果将一堆低质量数据(例如严重压缩的JPEG图片)投入预训练,你的模型将浪费大量算力去模仿这些数据的特征。