Ring-Zero: Skalierung von Zero RL auf eine Billion Parameter für emergentes Denken
Ring-Zero: Scaling Zero RL to a Trillion Parameters for Emergent Reasoning

Reinforcement Learning mit verifizierbaren Belohnungen ohne menschlich annotierte Daten (Zero RL) hat sich als leistungsfähiges Paradigma zur Förderung von Chain-of-Thought-Denken etabliert. Bisherige Studien beschränken sich jedoch auf kleine Modelle. Diese Arbeit präsentiert eine stabile und effiziente Trainingspipeline mit Optimierungen wie gekürztem Importance Sampling und Mixed-Precision-Kontrolle, um Zero RL auf eine Billion Parameter zu skalieren. Die Experimente zeigen: Skalierung verbessert Stichprobeneffizienz und Leistungsgrenzen erheblich, der Trainingsprozess durchläuft eine Entdeckungs- und eine Schärfungsphase, und das Modell entwickelt spontan fortgeschrittene kognitive Verhaltensweisen wie Selbstverifikation und paralleles Denken. Auf sieben mathematischen Benchmarks erreicht Ring-2.5-1T-Zero wettbewerbsfähige Ergebnisse. Zusätzlich wird ein Framework zur Bewertung der CoT-Qualität vorgeschlagen.
Skalierung auf 1T Parameter verbessert die Stichprobeneffizienz und Leistungsgrenzen erheblich; der Trainingsprozess schreitet sequenziell durch eine anfängliche Entdeckungsphase gefolgt von einer Schärfungsphase fort.