Ring-Zero, 1조 파라미터로 확장되며 스스로 추론 능력을 깨우다
Ring-Zero: Scaling Zero RL to a Trillion Parameters for Emergent Reasoning

검증 가능한 보상만으로 강화학습을 수행하는 zero RL은 인간의 주석 없이 사고 사슬 추론을 이끌어내는 강력한 패러다임으로 부상했지만, 계산 비용 때문에 대부분 소규모 모델에 국한되어 왔습니다. 이 논문은 1조 파라미터 규모로 zero RL을 확장한 Ring-Zero를 소개하며, 단순한 확장이 가독성 저하, 토큰 중복, 적응적 추론 깊이 부족을 초래한다는 문제를 해결하기 위해 클리핑된 중요도 샘플링, 훈련-추론 비율 보정, 혼합 정밀도 제어 등의 최적화를 포함한 안정적이고 효율적인 훈련 파이프라인을 제시합니다. 실험을 통해 1조 파라미터 규모에서 샘플 효율성과 성능 상한이 크게 향상되고, 훈련 과정이 초기 발견 단계와 후속 정교화 단계로 진행되며, 모델이 의인화, 자기 검증, 병렬 추론, 맥락 불안 등의 고급 인지 행동을 자발적으로 발달시킨다는 세 가지 핵심 발견을 보고합니다. Ring-2.5-1T-Zero는 7개 수학 벤치마크에서 경쟁력 있는 성능을 달성했으며, 최종 답변 정확도를 넘어 이해 가능성, 재현성, 효율성의 세 차원에서 CoT 품질을 평가하는 구조화된 프레임워크도 제안합니다.
모델은 의인화, 구조화된 형식, 자기 검증, 병렬 추론, 맥락 불안을 포함한 고급 인지 행동을 자발적으로 발달시켜, 수작업으로 설계된 휴리스틱을 불필요하게 만듭니다.