跳到正文
原文
rohanpaul_ai· @rohanpaul_ai · X·· 1 天前AI 评分61

Meta 论文:两个不同编码智能体互审补丁比单智能体加大预算更有效

AI 导读

Meta 新论文发现,让两个不同的编码智能体互相审查补丁,比给单个智能体更大预算能捕获更多静默 bug。在相同预算下,混合使用 Claude Code 和 Codex 处理同一任务,将完全正确的补丁比例从 45.8% 提升到 62.5%。

正文 · AI 翻译

Meta 的一篇新论文发现,让两个不同的编码智能体互相审查对方的补丁,比给单个智能体更多预算能捕捉到多得多的静默 bug。

在相同开销下,将 Claude Code 和 Codex 混用于同一任务,使完全正确的补丁比例从 45.8% 提升到 62.5%。

智能体编辑真实的训练代码时,可能会泄露测试数据、破坏梯度或接错标志位。

代码依然能运行,于是你白白烧掉 GPU 时长,得到的数字看起来还很合理。

原因在于错误是不相关的:同一产品的智能体犯错方式相同,审查时几乎没什么可抓的。该效果在一个无关的训练代码库上也重复出现。

– arxiv. org/abs/2609.39551

标题:"RankEvolve: A Reliable Multi-Agent Auto-Research Harness for Evolving Ranking Models"

来源:rohanpaul_ai · x.com