跳到正文
原文
omarsar0· @omarsar0 · X·· 2 天前AI 评分52

Google 论文提出 VeriHarness:用分歧与共识双重校验提升智能体答案选择

AI 导读

Google 一篇论文提出 VeriHarness,把同一基础模型变成智能体验证器:一处负责在多次 rollout 出现分歧时核对工作区证据解决争议,另一处挑战所有 rollout 都同意的断言、寻找它们共同遗漏的需求。

正文 · AI 翻译

Google 这篇论文太炸了。

采样多次 agent 运行并信任它们一致的答案,是标准做法。

这篇 Google 论文表明,一致可能掩盖共同的错误,而不一致往往指向正确的备选答案。

VeriHarness 将同一个基础模型变成一个具有两项职责的 agentic 验证器。

其中一项负责解决各次运行不一致的主张,通过检查工作区证据来判定。

另一项则挑战所有运行都一致同意的主张,寻找它们全都遗漏的需求。

在五个长程基准上,它在所测试的基线中取得了最佳的选择分数。配合基于证据的修订,使用 Gemini 3.5 Flash 时比单次运行高出 6.2 分,使用 Claude Opus 4.8 时高出 6.4 分。

作者还发布了约 26,000 次运行记录。

论文:arxiv.org/abs/2610.00972

论文讨论:academy.dair.ai/papers/verih…

来源:omarsar0 · x.com