Daten-Gewichtung: Warum kleine Modelle anders lernen als große

A study of sequence weighting at scale

Daten-Gewichtung: Warum kleine Modelle anders lernen als große

Jane Street untersucht, wie sich die Gewichtung von Sequenzen beim Training von Sprachmodellen über Skalen hinweg auswirkt. Der effektive Sequenzgewichtungs-Exponent p* steigt zunächst mit der Modellgröße an, erreicht bei mittleren Modellen ein Maximum und fällt bei großen Modellen wieder ab. Das bedeutet: Kleine Modelle lernen allgemeine Muster unabhängig vom Gewicht, mittlere Modelle lernen datenspezifische Muster proportional zum Gewicht, und große Modelle lernen schließlich alle Muster wieder unabhängig vom Gewicht. Die Ergebnisse basieren auf Experimenten mit hauseigenen dichten und MoE-Modellen sowie Qwen 2.5.

Unsere Ergebnisse deuten auf einen nicht-monotonen Verlauf des effektiven Sequenzgewichtungs-Exponenten hin: Kleine Modelle lernen Muster im gesamten Datensatz unabhängig vom Datengewicht, mittlere Modelle lernen Muster proportional zu ihrem Datengewicht, und große Modelle lernen wieder alle Muster unabhängig vom Gewicht.

Mehr von diesem Tag

2026-09-22