Ring-Zero:1兆パラメータへのスケーリングで創発的推論を実現

Ring-Zero: Scaling Zero RL to a Trillion Parameters for Emergent Reasoning

Ring-Zero:1兆パラメータへのスケーリングで創発的推論を実現

検証可能な報酬を用いた強化学習(ゼロRL)は、人間のアノテーションなしで推論能力を引き出す手法として注目されていますが、計算資源の制約から大規模モデルでの研究は進んでいませんでした。本論文では、安定かつ効率的なトレーニングパイプラインを構築し、1兆パラメータのモデルでゼロRLを実現。その結果、サンプル効率と性能の上限が大幅に向上し、トレーニングは初期の発見フェーズとその後の研ぎ澄ましフェーズを経て進行。さらに、モデルは擬人化、自己検証、並列推論、文脈不安などの高度な認知行動を自発的に獲得し、手作業によるヒューリスティックが不要になることを示しました。7つの数学ベンチマークで競争力のある性能を達成し、推論の質を評価するための構造化フレームワークも提案しています。

スケーリングの「苦い教訓」を裏付ける3つの重要な発見として、1兆パラメータへのスケーリングはサンプル効率と性能の上限を大幅に向上させ、トレーニングは初期の発見フェーズとその後の研ぎ澄ましフェーズを経て進行し、モデルは擬人化や自己検証などの高度な認知行動を自発的に獲得します。

この日のほかの記事

2026-07-16