動画モデルの学習効率を上げるデータフィルタリングの実践
Getting video models to learn better, faster
Linumのエンジニアが、生成動画モデルの事前学習に使うデータのフィルタリング手法を2024年から2025年にかけてどう進化させてきたかを解説。CPUで動く古典的なCV(シーン検出、OCR、モーションベクター、Haarカスケード)から、ファインチューニングしたLLM(Qwen-2-VL、Qwen-2.5-VL)によるカテゴリ分類や美的フィルタリング、さらに強化学習(RLVR)を活用した手法へと移行した経緯を、具体的なツール名や判断基準とともに紹介。低品質データがモデルの学習を妨げるという基本原則を実践的に示す。
データセットをうまくフィルタリングすれば、モデルは学習させたいことをずっと簡単に学習できるようになる。
- schopra909
HNの皆さん、こんにちは。著者の一人です。ご質問があればどうぞ。できる限りお答えします!
- smurf9852
とても素晴らしい!