跳到正文
原文
omarsar0· @omarsar0 · X·· 12 小时前AI 评分62

论文:HERMES harness 将 GPT-5.6 Sol 仓库迁移成功率从 6.5% 提升至 31.0%

AI 导读

作者引述一篇论文指出,在整仓库迁移任务中,同一 GPT-5.6 Sol 模型与相同 effort 设置下,把 Codex 换成 HERMES harness 后成功率从 6.5% 升至 31.0%。

正文 · AI 翻译

自己动手构建工具链吧,各位。

读了这样的论文,我才意识到工具链工程(harness engineering)的探索程度有多不足。

作者发现,在整个代码仓库迁移任务中,将 Codex 替换为 HERMES 工具链后,GPT-5.6 Sol 的表现从 6.5% 提升到 31.0%,模型和 effort 设置均保持不变。

这一提升来自工具链本身。

HERMES 为仓库的每个组件配备一个常驻 LLM,该 LLM 熟悉自身的代码和依赖。一个依赖感知步骤决定激活哪些组件,另一个诊断步骤将测试失败映射回需要修改的组件。

在四个软件工程基准测试中,它平均比匹配的基线工具链高出 12.4 个百分点。

在激活和诊断模型都很强的情况下,Qwen3-8B 组件与全 GPT-5.6 Sol 配置的差距缩小到 4.5 个百分点以内,同时将 Terminal-Bench 4.0 的推理成本降低 26.2%。

论文:arxiv.org/abs/2610.07832

与论文对话:academy.dair.ai/papers/harne…

来源:omarsar0 · x.com