ProVer:不评估每一步也能解决GRPO归因难题

Fixing GRPO's credit assignment problem without evaluating every step

Group Relative Policy Optimization(GRPO)在训练大型语言模型智能体时表现优异,但存在一个核心缺陷:它将轨迹级别的奖励均匀分配给所有策略token,无法区分关键决策与普通步骤。新框架ProVer通过引入智能体裁判,对比成功与失败轨迹来定位潜在的关键决策片段,并利用终端成功率的差异进行验证,而非盲目信任裁判。这种方法仅在选定的关键片段上计算细粒度信用分配,避免了评估每一个中间状态的巨大开销。在ALFWorld、WebShop和SearchQA等基准测试中,ProVer显著提升了Qwen3.5-2B和Qwen3.5-4B模型的性能,证明了针对关键决策进行精细归因的高效性与实用性。

ProVer利用模型判断仅用于选择验证位置,从而将局部信用建立在观测结果之上,而无需对每个中间状态进行穷尽评估。

同日更多故事

2026-10-02