跳到正文
原文
dair_ai· @dair_ai · X·· 1 天前AI 评分68

Salesforce AI Research 论文:31B 开源 Gemma-4 Web Agent 在 WebArena Infinity 达 74.6%

AI 导读

DAIR.AI 转发 Salesforce AI Research 的论文,一个 31B 开源 Gemma-4 web agent 在 9-app WebArena Infinity 上取得 74.6%,高于 Gemini 3 Flash browser use 的 70.1%,且无需在每步或部署时调用前沿裁判。

正文 · AI 翻译

Salesforce AI Research 又出了一篇很棒的论文。

研究发现,一个 31B 的开源 Gemma-4 网页智能体在 9 个应用的 WebArena Infinity 测试集上得分 74.6%,超过了使用浏览器操作的 Gemini 3 Flash(70.1%)。

他们实现这一成绩的过程中,并没有在每一步或部署时调用前沿模型作为评判者。

CLIFT 让智能体针对自身的执行轨迹回答验证问题。

一个保形(conformal)认证器只保留那些答案与训练时评判者一致的问题,按其可信程度加权,并将结果加入逐步奖励中。

在测试时,同一套冻结的问题库用于在贪心执行和几次重试之间做选择,全程无需外部评判者。

训练后的智能体比其基座模型提升了 12.8 个百分点,并在 9 个应用中的 7 个上获胜。该问题库在测试时还能迁移到 VisualWebArena 上的 GPT-5.5,而一个经过翻译的问题库能在 Online Mind2Web 上提升一个在线网页智能体的表现,且无需在该基准上进行任何训练。

论文:arxiv.org/abs/2610.06829

论文讨论:academy.dair.ai/papers/clift…

来源:dair_ai · x.com