ByteDance und Tsinghua veröffentlichen DAPO: Open-Source-RL-System erzielt 50 Punkte auf AIME 2024
DAPO: An Open-Source RL System from ByteDance Seed and Tsinghua Air

ByteDance Seed und Tsinghua AIR haben DAPO vorgestellt, ein vollständig quelloffenes Reinforcement-Learning-System für große Sprachmodelle. Der neue Algorithmus Decoupled Clip and Dynamic Sampling Policy Optimization erreicht mit dem Basismodell Qwen2.5-32B 50 Punkte auf dem Mathematik-Benchmark AIME 2024 – und übertrifft damit den bisherigen Bestwert von DeepSeek-R1-Zero-Qwen-32B bei nur 50 % der Trainingsschritte. Code, Datensatz und Modellgewichte sind frei verfügbar.
DAPO erreicht 50 Punkte auf AIME 2024 basierend auf dem Qwen2.5-32B-Basismodell und übertrifft damit den bisherigen SoTA DeepSeek-R1-Zero-Qwen-32B mit 50 % der Trainingsschritte.