AgentBug-Smith 基准发布:编程智能体仅修复 9% 框架 bug
先了解这件事
AI 综述
2026 年 10 月 3 日,来自中美顶尖实验室的论文提出 AgentBug-Smith,可将真实 GitHub bug 报告自动转化为可运行测试,构建出持续增长的 200 个 bug 基准。报道称,3 个编程智能体中表现最好的仅修复 9% 的 Agent 框架 bug,而普通软件 bug 的修复率约为 40%。论文指出,这类 harness bug 具有独特特征,当前最先进的软件智能体仍难以修复,现有 benchmark 也进一步阻碍了该方向的进展。同一报道还提到,一份过往修复经验简编让某智能体在 79 个未见 bug 上的正确修复数从 1 提升到 6。
报道时间线
10月3日
- AgentBug-Smith:自动复现智能体系统中的真实 harness bug
论文 AgentBug-Smith 提出自动复现智能体系统中真实 harness bug 的方法,指出这类 bug 具有独特特征,当前最先进的软件智能体仍难以修复。现有 benchmark 也进一步阻碍了该方向的进展。
- 研究:编程智能体仅修复 9% 的 Agent 框架 bug,AgentBug-Smith 基准发布
来自中美顶尖实验室的论文提出 AgentBug-Smith,可将真实 GitHub bug 报告自动转化为可运行测试,构建出持续增长的 200 个 bug 基准。3 个编程智能体中表现最好的仅修复 9% 的 Agent 框架 bug,而普通软件 bug 的修复率约为 40%。一份过往修复经验简编让某智能体在 79 个未见 bug 上的正确修复数从 1 提升到 6。