omarsar0· @omarsar0 · X·· 12 小时前AI 评分
论文:HERMES harness 将 GPT-5.6 Sol 仓库迁移成功率从 6.5% 提升至 31.0%
作者引述一篇论文指出,在整仓库迁移任务中,同一 GPT-5.6 Sol 模型与相同 effort 设置下,把 Codex 换成 HERMES harness 后成功率从 6.5% 升至 31.0%。
自己动手构建工具链吧,各位。
读了这样的论文,我才意识到工具链工程(harness engineering)的探索程度有多不足。
作者发现,在整个代码仓库迁移任务中,将 Codex 替换为 HERMES 工具链后,GPT-5.6 Sol 的表现从 6.5% 提升到 31.0%,模型和 effort 设置均保持不变。
这一提升来自工具链本身。
HERMES 为仓库的每个组件配备一个常驻 LLM,该 LLM 熟悉自身的代码和依赖。一个依赖感知步骤决定激活哪些组件,另一个诊断步骤将测试失败映射回需要修改的组件。
在四个软件工程基准测试中,它平均比匹配的基线工具链高出 12.4 个百分点。
在激活和诊断模型都很强的情况下,Qwen3-8B 组件与全 GPT-5.6 Sol 配置的差距缩小到 4.5 个百分点以内,同时将 Terminal-Bench 4.0 的推理成本降低 26.2%。
论文:arxiv.org/abs/2610.07832
与论文对话:academy.dair.ai/papers/harne…
来源:omarsar0 · x.com