El 'efecto Mateo' sabotea el entrenamiento RL de los LLM, y 'nunca rendirse' lo revierte
Learning to solve hard problems in RL for LLMs by never giving up
Michael Noukhovitch describe el efecto Mateo en el post-entrenamiento con RL de LLM: los modelos aprenden primero lo fácil y eso sesga su capacidad para resolver problemas difíciles. Su propuesta, Never Give Up, mantiene el esfuerzo en las preguntas complejas y mejora el rendimiento en matemáticas y código, incluso con RL asíncrono. El artículo acompaña un paper con código en GitHub.
Cada buen practicante de RL sin duda ha visto una curva de evaluación subir. Aquí está la evaluación de AIME 2025 durante nuestro entrenamiento RL de Olmo 3.1 RL-Zero Math. Entrenar la base Olmo 3 7B con RL en Dolci RL-Zero math mejora su habilidad matemática general. ¿O no?