ProVer corrige la asignación de crédito en GRPO sin evaluar cada paso

Fixing GRPO's credit assignment problem without evaluating every step

GRPO reparte la misma ventaja de trayectoria a todos los tokens, sin distinguir las decisiones que realmente cambian el resultado. ProVer propone un juez agéntico que contrasta trayectorias exitosas y fallidas para señalar un segmento clave, y luego verifica ese segmento comparando las tasas de éxito de continuaciones muestreadas antes y después de él. Solo entonces incorpora esa ventaja a los tokens del segmento. En ALFWorld, WebShop y SearchQA supera a GRPO con mejoras relativas del 9,91% y 7,12% en Qwen3.5-2B y Qwen3.5-4B.

Al usar el juicio del modelo solo para seleccionar dónde verificar, ProVer fundamenta el crédito local en resultados observados sin evaluar exhaustivamente cada estado intermedio.

Más de este día

2026-10-02