RL 训练 LLM:永不放弃硬问题

Learning to solve hard problems in RL for LLMs by never giving up

在 RL 后训练 LLM 时,评估曲线上升未必代表模型真正变强。我发现了导致性能停滞的 Matthew Effect,并提出 Never Give Up 策略来攻克难题。通过异步 RL 技巧,我们在 Math 和 Code 任务上验证了这一方法的有效性。这不仅解决了评估偏差,还揭示了 Primacy Bias 的深层影响。

每个优秀的 RL 实践者无疑都见过评估曲线上升,但这真的意味着模型能力提升了么?

同日更多故事

2026-09-15