ProVer учит агентов награждать только ключевые решения, обходясь без оценки каждого шага

Fixing GRPO's credit assignment problem without evaluating every step

GRPO раздаёт одинаковую награду всем токенам траектории и не различает судьбоносные решения. Фреймворк ProVer заставляет агентного судью сравнить успешные и провальные траектории и указать подозрительный отрезок, а затем проверяет его по реальному приросту успеха. На ALFWorld, WebShop и SearchQA ProVer обошёл GRPO на 9,91% и 7,12% для моделей Qwen3.5-2B и Qwen3.5-4B.

ProVer достигает лучшей средней производительности на обоих масштабах модели, с относительным улучшением над GRPO на 9,91% и 7,12% для Qwen3.5-2B и Qwen3.5-4B соответственно.

Ещё за этот день

2026-10-02