Nie aufgeben: Wie Reinforcement Learning LLMs schwere Probleme lösen lässt
Learning to solve hard problems in RL for LLMs by never giving up
Michael Noukhovitch stellt in seinem Blogbeitrag den Matthew-Effekt beim RL-Post-Training von LLMs vor: Modelle, die früh scheitern, erhalten weniger Lernsignal und bleiben dauerhaft schlechter. Seine Lösung heißt Never Give Up (NGU) – eine Methode, die auch bei harten Aufgaben kontinuierlich Belohnung liefert. Er testet NGU mit Olmo 3.1 RL-Zero auf Mathematik- und Code-Benchmarks und diskutiert Grenzen sowie Async-RL-Herausforderungen.
Jeder gute RL-Praktiker hat zweifellos schon einmal gesehen, wie eine Eval-Kurve nach oben geht.