DAPO от ByteDance и Tsinghua обходит DeepSeek-R1 на AIME 2024

DAPO: An Open-Source RL System from ByteDance Seed and Tsinghua Air

DAPO от ByteDance и Tsinghua обходит DeepSeek-R1 на AIME 2024

ByteDance Seed и Tsinghua AIR выложили в открытый доступ систему RL для обучения больших языковых моделей, включая алгоритм DAPO, код и датасет. На модели Qwen2.5-32B она набирает 50 баллов на AIME 2024, превзойдя DeepSeek-R1-Zero-Qwen-32B и затратив вдвое меньше шагов обучения. Все веса, данные и скрипты для воспроизведения доступны на GitHub и Hugging Face.

DAPO достигает 50 баллов на AIME 2024 на базовой модели Qwen2.5-32B, превосходя предыдущий SoTA DeepSeek-R1-Zero-Qwen-32B за 50% шагов обучения.

Ещё за этот день

2026-09-21