ByteDance Seed와 Tsinghua AIR, DAPO로 AIME 2024에서 50점 달성
DAPO: An Open-Source RL System from ByteDance Seed and Tsinghua Air

ByteDance Seed와 Tsinghua AIR가 공개한 오픈소스 강화학습 시스템 DAPO는 Qwen2.5-32B 기반으로 AIME 2024에서 50점을 기록하며 기존 최고 성능 모델을 절반의 학습 단계로 앞섰다. 알고리즘, 코드, 데이터셋을 모두 공개해 대규모 LLM RL 연구의 재현성을 높였다.
DAPO는 Qwen2.5-32B 기반 모델로 AIME 2024에서 50점을 달성하며, 이전 최고 성능인 DeepSeek-R1-Zero-Qwen-32B를 50%의 학습 단계만으로 능가했다.