跳到正文
原文
rohanpaul_ai· @rohanpaul_ai · X·· 6 小时前AI 评分57

微软论文提出 CABRA:编码智能体的瓶颈在理解代码而非编辑代码

AI 导读

微软研究人员提出 CABRA,可生成合成编码任务并每次只提升一种难度,对 8 个 LLM 和 6 个智能体在 6,840 个任务上运行,并将每次工具调用标注为阅读、分析、搜索、编辑或测试。

正文 · AI 翻译

微软的一篇新论文发现,编码智能体在需要理解大量代码时会掉链子,而不是在需要编辑大量代码时,因此应该用阅读和比较代码来测试它们,而不是看 diff 的大小。

微软研究人员构建了 CABRA,它能生成合成编码任务,并且每次只提升一种难度。他们在 6,840 个任务上运行了 8 个大语言模型和 6 个智能体,并将每次工具调用标注为阅读、分析、搜索、编辑或测试。

随着任务规模增大,纯大语言模型的表现会变差,但智能体借助 grep 等工具仍能保持近乎完美的水平。在 SWE-bench Verified 上,阅读和分析调用的次数比编辑行数更能反映智能体的失败情况,相关系数分别为 -0.200 和 -0.159。

来源:rohanpaul_ai · x.com