GRPOのクレジット割り当て問題を、全ステップ評価なしで解決するProVer
Fixing GRPO's credit assignment problem without evaluating every step
GRPOはtrajectory全体のadvantageを全トークンに均等に割り当てるため、どの判断が成功に寄与したかが見えにくい。ProVerは、成功と失敗のtrajectoryをagentic judgeに比較させて重要と思われる区間を提案させ、その区間の前後で継続をサンプリングし終端成功率の差からadvantageを推定して検証する。judgeは「どこを検証するか」の選択にのみ使い、観測された結果に基づいて局所的なクレジットを与える。ALFWorld、WebShop、SearchQAでQwen3.5-2Bと4Bの両方においてGRPOを上回る平均性能を達成した。
judgeの評価を直接信用するのではなく、ProVerは提案された区間の前後でサンプリングした現在方策の継続間の終端成功率の差からadvantageを推定することで、その区間を検証する。