跳到正文
热点事件历史事件

AgentBug-Smith 基准发布:编程智能体仅修复 9% 框架 bug

2 篇报道1 个报道来源4 天前更新

先了解这件事

AI 综述

2026 年 10 月 3 日,来自中美顶尖实验室的论文提出 AgentBug-Smith,可将真实 GitHub bug 报告自动转化为可运行测试,构建出持续增长的 200 个 bug 基准。报道称,3 个编程智能体中表现最好的仅修复 9% 的 Agent 框架 bug,而普通软件 bug 的修复率约为 40%。论文指出,这类 harness bug 具有独特特征,当前最先进的软件智能体仍难以修复,现有 benchmark 也进一步阻碍了该方向的进展。同一报道还提到,一份过往修复经验简编让某智能体在 79 个未见 bug 上的正确修复数从 1 提升到 6。

AI 根据报道生成 · 3 天前更新

报道时间线

沿着报道,了解事件的不同侧面。

10月3日
  1. X:Rohan Paul (@rohanpaul_ai)
    AgentBug-Smith:自动复现智能体系统中的真实 harness bug

    论文 AgentBug-Smith 提出自动复现智能体系统中真实 harness bug 的方法,指出这类 bug 具有独特特征,当前最先进的软件智能体仍难以修复。现有 benchmark 也进一步阻碍了该方向的进展。

  2. X:Rohan Paul (@rohanpaul_ai)
    研究:编程智能体仅修复 9% 的 Agent 框架 bug,AgentBug-Smith 基准发布

    来自中美顶尖实验室的论文提出 AgentBug-Smith,可将真实 GitHub bug 报告自动转化为可运行测试,构建出持续增长的 200 个 bug 基准。3 个编程智能体中表现最好的仅修复 9% 的 Agent 框架 bug,而普通软件 bug 的修复率约为 40%。一份过往修复经验简编让某智能体在 79 个未见 bug 上的正确修复数从 1 提升到 6。