跳到正文
原文
dair_ai· @dair_ai · X·· 13 小时前AI 评分55

NVIDIA 论文提出为编码智能体挑选 base 模型的新评测方法

AI 导读

DAIR.AI 介绍一篇 NVIDIA 论文,提出为编码智能体挑选 base 模型的方法。作者指出 base 模型在 agentic 编码任务上很难评测,他们在 SWE-bench Verified 上跑了六个 base 模型,其中五个解出零任务。

正文 · AI 翻译

英伟达这篇关于为编码智能体选择基础模型的论文非常有意思。

这实际上是一种巧妙的方法,通过评估每个基础检查点在后训练之后作为编码智能体的可能表现,来对它们进行排名。

他们指出,基础模型在智能体式编码任务上真的很难评估。他们在 SWE-bench Verified 上运行了六个基础模型,其中五个解决的任务数为零。

因此,他们转而关注编码运行过程中真正修复了任务的那一个步骤。

换句话说,他们选取一个强大的后训练智能体已经解决的任务,逐条重放它的代码编辑,并在每次编辑后运行测试。第一个让测试通过的编辑就是决定性的编辑。

然后,他们把该编辑之前发生的所有内容都提供给基础模型,检查它能否想出这个修复方案。

他们用三种方式来打分:检查基础模型写出该修复的可能性、它能否从一组被拒绝的补丁中挑出该修复,以及它自己写出的任何修复能否通过测试。

这三种排名在十组基础模型与后训练模型的配对中,都与后训练模型的 SWE-bench Verified 分数高度吻合。

这有什么用?

如果你要为智能体式后训练挑选检查点,这个方法可以在你投入训练预算之前就给你一个信号。

论文:academy.dair.ai/papers/befor…

来源:dair_ai · x.com