ByteDanceとTsinghuaのDAPO、Qwen2.5-32BでAIME 2024 50点を達成
DAPO: An Open-Source RL System from ByteDance Seed and Tsinghua Air

ByteDance SeedとTsinghua AIRが共同で、大規模LLMの強化学習システムDAPOを完全オープンソース化した。アルゴリズムのDecoupled ClipとDynamic Sampling Policy Optimizationを提案し、Qwen2.5-32BをベースにAIME 2024で50点を達成。これはDeepSeek-R1-Zero-Qwen-32Bの記録を半分の学習ステップで上回る。コード、データセット、モデル重み、学習記録まで公開し、再現性を重視している。
DAPOはQwen2.5-32BベースモデルでAIME 2024において50点を達成し、以前のSoTAであるDeepSeek-R1-Zero-Qwen-32Bを50%の学習ステップで上回った。