GRPO verbessert Credit Assignment, ohne jeden Schritt zu bewerten

Fixing GRPO's credit assignment problem without evaluating every step

GRPO verteilt den Vorteil einer Trajektorie gleichmäßig auf alle Tokens und verschleiert so, welche Zwischenentscheidungen zum Erfolg beigetragen haben. ProVer lässt einen agentischen Judge erfolglose und erfolgreiche Rollouts vergleichen, um ein potenziell entscheidendes Segment vorzuschlagen. Statt dem Urteil zu vertrauen, verifiziert ProVer das Segment, indem es den Vorteil aus der Differenz der Erfolgsraten von Fortsetzungen vor und nach dem Segment schätzt. Positive Schätzungen fließen in die GRPO-Vorteile der Tokens im Segment ein. Auf ALFWorld, WebShop und SearchQA erzielt ProVer die beste durchschnittliche Leistung bei beiden Modellgrößen, mit relativen Verbesserungen von 9,91 % bzw. 7,12 % für Qwen3.5-2B und Qwen3.5-4B.

Indem das Modellurteil nur dazu dient, auszuwählen, wo verifiziert wird, verankert ProVer lokalen Credit in beobachteten Ergebnissen, ohne jeden Zwischenzustand erschöpfend zu bewerten.

Mehr von diesem Tag

2026-10-02