RSIGym开源框架助Claude Opus 5大幅提升Qwen模型性能
先了解这件事
AI 综述
2026年10月8日,Rohan Paul 在 X 上表示,Evolvent_AI 新发布的开源框架 RSIGym,让 AI Agent 能在同一预算环境中重训模型并重写 harness。借助该框架,Claude Opus 5 作为自动化 AI 研究员,将一个 Qwen 模型的 SWE-bench Verified 分数提升近三倍。10月9日,DAIR.AI 的 Elvis Saravia 进一步介绍,RSIGym 为研究型智能体提供训练、推理、评测和沙箱即服务,使其把预算花在实验而非重建基础设施上;以 Opus 5 作为研究者,改进后的系统在 SWE-bench Verified 上从 17.67% 提升到 50.33%,并提到一种衡量 harness 与模型协同进化质量的方法。目前尚无第三方验证信息。
报道时间线
10月9日
- RSIGym 用系统工程提升自我改进智能体
RSIGym 为研究型智能体提供训练、推理、评测和沙箱即服务,使其把预算花在实验而非重建基础设施上;以 Opus 5 作为研究者,改进后的系统在 SWE-bench Verified 上从 17.67% 提升到 50.33%。推文还提到一种衡量 harness 与模型协同进化质量的方法,这正是全栈 AI 公司保持前沿的方式。
10月8日
- Claude Opus 5 作为自动化 AI 研究员将 Qwen 模型 SWE-bench Verified 分数提升近三倍
Evolvent_AI 新发布的开源 RSIGym 让 AI Agent 在同一预算环境中重训模型并重写 harness,使 Claude Opus 5 作为自动化 AI 研究员把一个 Qwen 模型的 SWE-bench Verified 分数提升近三倍。