Ring-Zero: Skalierung von Zero RL auf eine Billion Parameter für emergentes Denken

Ring-Zero: Scaling Zero RL to a Trillion Parameters for Emergent Reasoning

Ring-Zero: Skalierung von Zero RL auf eine Billion Parameter für emergentes Denken

Reinforcement Learning mit verifizierbaren Belohnungen ohne menschlich annotierte Daten (Zero RL) hat sich als leistungsfähiges Paradigma zur Förderung von Chain-of-Thought-Denken etabliert. Bisherige Studien beschränken sich jedoch auf kleine Modelle. Diese Arbeit präsentiert eine stabile und effiziente Trainingspipeline mit Optimierungen wie gekürztem Importance Sampling und Mixed-Precision-Kontrolle, um Zero RL auf eine Billion Parameter zu skalieren. Die Experimente zeigen: Skalierung verbessert Stichprobeneffizienz und Leistungsgrenzen erheblich, der Trainingsprozess durchläuft eine Entdeckungs- und eine Schärfungsphase, und das Modell entwickelt spontan fortgeschrittene kognitive Verhaltensweisen wie Selbstverifikation und paralleles Denken. Auf sieben mathematischen Benchmarks erreicht Ring-2.5-1T-Zero wettbewerbsfähige Ergebnisse. Zusätzlich wird ein Framework zur Bewertung der CoT-Qualität vorgeschlagen.

Skalierung auf 1T Parameter verbessert die Stichprobeneffizienz und Leistungsgrenzen erheblich; der Trainingsprozess schreitet sequenziell durch eine anfängliche Entdeckungsphase gefolgt von einer Schärfungsphase fort.

Mehr von diesem Tag

2026-07-16