跳到正文
原文
omarsar0· @omarsar0 · X·· 10 小时前AI 评分67

NVIDIA VERA 论文:将基准轨迹转为可重启沙盒并协同训练模型与 harness

AI 导读

NVIDIA 的 VERA 论文把基准轨迹转化为 9,000 多个可重启沙盒并加入 rubric 评分,只保留能运行且可从可观测证据打分的环境,同时更新模型权重与 harness。

正文 · AI 翻译

英伟达这篇论文太炸了。

我看到的一个令人兴奋的趋势是:为你的智能体构建可验证的环境,并让运行框架(harness)与模型一起训练。

让运行框架和模型协同演进,是掌握智能技术栈的重要一环。许多前沿 AI 公司已经开始这样做了。

这篇论文展示了其工作原理:

VERA 将基准测试轨迹转化为 9,000 多个可重启的沙箱,配备评分标准(rubric)打分机制,并只保留那些能够运行、且能根据可观测证据进行评分的环境。

随后,它同时更新模型权重和运行框架。

运行框架的修改只有在通过自测、并且在开发集上至少提升 5 分时才会被保留。

如果模型检查点的得分下降超过 20%,系统会将其拒绝。

在 9B 规模上,协同演进的智能体在 AutoCoWorkBench 上比最强的单轴基线高出 10.3 分,在 AutoMedBench 上高出 13.0 分。在 27B 规模上,它在 AutoCoWorkBench 上得分为 71.6,超过了 Claude Opus 4.8。

环境语料库已开源。

论文:arxiv.org/abs/2610.05923

论文讨论:academy.dair.ai/papers/vera-…

来源:omarsar0 · x.com