dair_ai· @dair_ai · X·· 2 天前AI 评分
NVIDIA 论文提出 Mid-Harness:终端智能体用验证器提升测试时算力效率
NVIDIA 一篇关于终端智能体测试时算力的论文提出 Mid-Harness 方法:采样多条候选 shell 命令并先验证再执行,把更多算力花在验证器而非增加采样上。
NVIDIA 关于终端智能体测试时计算的论文,非常精彩。
研究发现:应该采样多个候选 shell 命令,在执行前先进行验证,并且在验证器上投入的计算应多于在额外采样上的投入。
使用 GPT-5.6 Sol 作为验证器,从 8 个采样动作中进行选择时,TerminalBench-Lite 的 Pass@1 从 50.0% 提升到 68.0%。而使用较弱的验证器时,增加采样几乎没有带来提升。
Mid-Harness 不改动生成器和运行框架,而是在两者之间工作。当小型 TMAX-9B 模型验证自己的候选动作时,成对比较效果最佳,而将强验证器蒸馏到该模型中还能进一步提升效果。
将动作采样与轨迹采样相结合,相比仅采样完整轨迹,能在更低的预估 token 成本下达到更高的成功率。
论文:academy.dair.ai/papers/mid-h…
来源:dair_ai · x.com