ProVer:LLM裁判改进智能体RL信用分配
先了解这件事
AI 综述
2026年10月2日,DAIR.AI 的 Elvis Saravia 在 X 上介绍了 ProVer,一种智能体强化学习信用分配方法。该方法由 LLM 裁判对比成功与失败的 rollout,指出造成差异的关键片段,再通过该片段前后采样续写、以成功率变化作为该片段的优势值。在 ALFWorld、WebShop 和 SearchQA 上,相对 GRPO 分别带来 Qwen3.5-2B 9.91%、Qwen3.5-4B 7.12% 的相对提升,裁判换成更小模型时仍有效。目前该事件仅有这一篇报道,尚无后续进展。
报道时间线
10月2日
- ProVer:用 LLM 裁判定位关键步骤,改进智能体 RL 的信用分配
ProVer 提出一种智能体强化学习信用分配方法:由 LLM 裁判对比成功与失败的 rollout,指出造成差异的关键片段,再通过该片段前后采样续写、以成功率变化作为该片段的优势值。在 ALFWorld、WebShop 和 SearchQA 上,相对 GRPO 分别带来 Qwen3.5-2B 9.91%、Qwen3.5-4B 7.12% 的相对提升,裁判换成更小模型时仍有效。