ProVer учит агентов награждать только ключевые решения, обходясь без оценки каждого шага
Fixing GRPO's credit assignment problem without evaluating every step
GRPO раздаёт одинаковую награду всем токенам траектории и не различает судьбоносные решения. Фреймворк ProVer заставляет агентного судью сравнить успешные и провальные траектории и указать подозрительный отрезок, а затем проверяет его по реальному приросту успеха. На ALFWorld, WebShop и SearchQA ProVer обошёл GRPO на 9,91% и 7,12% для моделей Qwen3.5-2B и Qwen3.5-4B.
ProVer достигает лучшей средней производительности на обоих масштабах модели, с относительным улучшением над GRPO на 9,91% и 7,12% для Qwen3.5-2B и Qwen3.5-4B соответственно.