Bessere Video-Modelle durch klügere Datenfilterung
Getting video models to learn better, faster
Linum zeigt, wie sich die Qualität generativer Video-Modelle durch gezielte Datenfilterung und -ausbalancierung steigern lässt. Der Beitrag verfolgt die Entwicklung von klassischen CPU-basierten Methoden (PySceneDetect, EAST, Haar-Kaskaden) über feinabgestimmte LLMs bis hin zu Reinforcement Learning. Im Mittelpunkt stehen praktische Erfahrungen, etwa die Erkennung von Schnitten, das Entfernen von textlastigen oder unbeschreibbaren Szenen sowie das Unterabtasten von Talking-Head-Clips. Das Ziel: dem Modell beibringen, sich auf Wesentliches zu konzentrieren und langweilige Daten zu vermeiden.
Wenn Sie eine Menge minderwertiger Daten (z. B. stark komprimierte JPEGs) in das Pre-Training werfen, verschwendet Ihr Modell einen erheblichen Teil seiner Kapazität darauf, diese Datenscheibe nachzuahmen.
- schopra909
Hallo HN, einer der Autoren hier. Fragt mich ruhig, wenn ihr Fragen habt, und ich werde mein Bestes geben, sie zu beantworten!
- smurf9852
Sehr schön!