rohanpaul_ai· @rohanpaul_ai · X·· 1 天前AI 评分
Meta 论文:两个不同编码智能体互审补丁比单智能体加大预算更有效
Meta 新论文发现,让两个不同的编码智能体互相审查补丁,比给单个智能体更大预算能捕获更多静默 bug。在相同预算下,混合使用 Claude Code 和 Codex 处理同一任务,将完全正确的补丁比例从 45.8% 提升到 62.5%。
Meta 的一篇新论文发现,让两个不同的编码智能体互相审查对方的补丁,比给单个智能体更多预算能捕捉到多得多的静默 bug。
在相同开销下,将 Claude Code 和 Codex 混用于同一任务,使完全正确的补丁比例从 45.8% 提升到 62.5%。
智能体编辑真实的训练代码时,可能会泄露测试数据、破坏梯度或接错标志位。
代码依然能运行,于是你白白烧掉 GPU 时长,得到的数字看起来还很合理。
原因在于错误是不相关的:同一产品的智能体犯错方式相同,审查时几乎没什么可抓的。该效果在一个无关的训练代码库上也重复出现。
– arxiv. org/abs/2609.39551
标题:"RankEvolve: A Reliable Multi-Agent Auto-Research Harness for Evolving Ranking Models"
来源:rohanpaul_ai · x.com