rohanpaul_ai· @rohanpaul_ai · X·· 2 天前AI 评分
Claude Opus 5 作为自动化 AI 研究员将 Qwen 模型 SWE-bench Verified 分数提升近三倍
Evolvent_AI 新发布的开源 RSIGym 让 AI Agent 在同一预算环境中重训模型并重写 harness,使 Claude Opus 5 作为自动化 AI 研究员把一个 Qwen 模型的 SWE-bench Verified 分数提升近三倍。
Claude Opus 5 在充当自动化 AI 研究员时,将某个 Qwen 模型的 SWE-bench Verified 得分提高了近两倍(接近三倍)。
@Evolvent_AI 最新发布的开源项目 RSIGym 使这一测量成为可能,它让 AI 智能体能够在同一个预算受限的环境中重新训练模型并重写其运行框架。
这表明,当训练、服务和测试都作为现成服务提供时,前沿 AI 智能体可以显著改进另一个 AI 模型。
智能体在仅 CPU 的容器中工作,通过调用远程服务来完成 LoRA 微调、模型服务、基准测试和沙箱操作,所有这些都计入每次运行的预算。
在主测试中,6 个前沿智能体从 Qwen3.5-35B-A3B-Base 和一个最小化运行框架起步,每个基准测试可使用 500 美元的服务额度。
如果你正在改进一个智能体,先阅读它的失败日志并修复运行框架:在 10 次小规模测试中,有 8 次更重的训练反而得分更低。
来源:rohanpaul_ai · x.com