GRPO의 신용 할당 문제, 모든 단계 평가 없이 해결한다
Fixing GRPO's credit assignment problem without evaluating every step
GRPO는 궤적 수준의 이점을 모든 토큰에 균일하게 부여해 어떤 중간 결정이 성공에 기여했는지 구분하지 못한다. ProVer는 에이전트 판단으로 성공과 실패 궤적을 비교해 결정적 구간을 제안하고, 해당 구간 전후의 정책 연속 샘플링 성공률 차이로 이점을 검증해 GRPO 이점에 반영한다. ALFWorld, WebShop, SearchQA에서 Qwen3.5-2B와 4B 모델 모두 GRPO 대비 각각 9.91%, 7.12% 향상된 최고 평균 성능을 달성했다.
모델 판단은 어디를 검증할지 선택하는 데만 사용함으로써, ProVer는 모든 중간 상태를 철저히 평가하지 않고도 관찰된 결과에 기반해 국소적 신용을 부여한다.