Matthew Effect в RL для LLM: почему модели сдаются на сложных задачах

Learning to solve hard problems in RL for LLMs by never giving up

Майкл Ноухович исследует Matthew Effect в RL-дообучении LLM: модели, единожды ошибившись на сложной задаче, перестают получать сигнал и застревают. Он предлагает метод Never Give Up, который заставляет модель продолжать попытки, и демонстрирует его на математике и коде, а также разбирает staleness в async RL и ограничения подхода.

Каждый хороший RL-практик, несомненно, видел, как кривая eval растёт. Вот кривая AIME 2025 во время нашего RL-обучения Olmo 3.1 RL-Zero Math. Обучение Olmo 3 7B base с RL на Dolci RL-Zero math улучшает его общие математические способности. Или нет?

Ещё за этот день

2026-09-15