DAPO:字节与清华开源的RL系统

DAPO: An Open-Source RL System from ByteDance Seed and Tsinghua Air

DAPO:字节与清华开源的RL系统

字节跳动Seed与清华大学AIR联合推出了DAPO,一个完全开源的大规模LLM强化学习系统。该系统基于verl框架,提出了Decoupled Clip和Dynamic Sampling Policy Optimization算法。在AIME 2024数学竞赛中,DAPO-Qwen-32B模型取得了50分的优异成绩,仅用50%的训练步骤就超越了之前的SOTA模型DeepSeek-R1-Zero-Qwen-32B。项目不仅公开了算法细节和代码基础设施,还发布了精心整理的DAPO-Math-17k数据集及训练记录,旨在让更广泛的研究社区和社会能够利用可扩展的强化学习技术,推动AI能力的共同进步。

通过开源,我们为更广泛的研究社区和社会提供了接触可扩展强化学习的实际途径,让所有人都能从这些进步中受益。

同日更多故事

2026-09-21