DAPO de ByteDance y Tsinghua supera a DeepSeek-R1-Zero en AIME 2024

DAPO: An Open-Source RL System from ByteDance Seed and Tsinghua Air

DAPO de ByteDance y Tsinghua supera a DeepSeek-R1-Zero en AIME 2024

DAPO es un sistema de RL de código abierto para LLMs a gran escala, desarrollado por ByteDance Seed y Tsinghua AIR. Con el algoritmo Decoupled Clip and Dynamic Sampling Policy Optimization, alcanza 50 puntos en AIME 2024 con el modelo base Qwen2.5-32B, superando al anterior SoTA DeepSeek-R1-Zero-Qwen-32B con la mitad de pasos de entrenamiento. Incluye pesos, dataset y scripts de reproducción.

DAPO alcanza 50 puntos en AIME 2024 basado en el modelo Qwen2.5-32B, superando al anterior SoTA DeepSeek-R1-Zero-Qwen-32B con un 50% de pasos de entrenamiento.

Más de este día

2026-09-21