Ring-Zero escala el Zero RL a un billón de parámetros y desata un razonamiento emergente
Ring-Zero: Scaling Zero RL to a Trillion Parameters for Emergent Reasoning

El aprendizaje por refuerzo con recompensas verificables y sin datos anotados por humanos —el llamado Zero RL— ha demostrado su potencial para generar razonamiento encadenado, pero hasta ahora solo se había probado en modelos pequeños. Este trabajo presenta un pipeline estable y eficiente que lleva el Zero RL a la escala de un billón de parámetros, superando problemas como la mala legibilidad y la redundancia. Los resultados revelan tres hallazgos clave: escalar mejora la eficiencia de muestra y el rendimiento; el entrenamiento progresa en dos fases (descubrimiento y refinamiento); y el modelo desarrolla espontáneamente comportamientos cognitivos avanzados como autoverificación, razonamiento paralelo y ansiedad de contexto, haciendo obsoletas las heurísticas manuales. En siete benchmarks matemáticos, Ring-2.5-1T-Zero logra un rendimiento competitivo y produce trazas de razonamiento más estructuradas y concisas.
El modelo desarrolla espontáneamente comportamientos cognitivos avanzados, incluyendo antropomorfismo, formato estructurado, autoverificación, razonamiento paralelo y ansiedad de contexto, lo que hace redundantes las heurísticas artesanales.