LLM 강화학습, '포기하지 않기'로 어려운 문제를 푼다
Learning to solve hard problems in RL for LLMs by never giving up
Michael Noukhovitch가 LLM의 RL 후속 학습에서 '매튜 효과'를 소개하고, 이를 'Never Give Up(NGU)'로 해결하자고 제안한다. 평가 곡선이 올라가도 실제로 무엇을 측정하는지 의문을 제기하며, AIME 2025 평가와 Olmo 3.1 RL-Zero Math 학습 사례를 통해 어려운 문제를 끝까지 포기하지 않는 전략이 수학과 코드 영역에서 어떤 효과를 내는지 살펴본다. 논문과 코드도 함께 공개했다.
모든 훌륭한 RL 실무자는 평가 곡선이 올라가는 것을 분명히 본 적이 있을 것이다.