adithya_s_k· @adithya_s_k · X·· 6 天前AI 评分
开源 multi-harness RL 训练方法:在 Claude Code 等 harness 内直接训练模型
作者发布 multi-harness RL 指南,提供一种开放方式,可在 Claude Code、Codex、OpenCode 等实际使用的 agent harness 内部用 RL 训练任意模型于任意任务集,无需改动 harness 或训练代码的任何一行。在四个 harness 上训练后,LFM2.5-2.6B 从 42% 提升到 54%,同时 tool calls 减少 31%。
1/ 很兴奋地发布《多框架强化学习终极指南》
同一个模型在每个智能体框架中的表现都不一样。因此我们构建了一种开放方式,可以在人们实际使用的框架(如 Claude Code、Codex 和 OpenCode)中,用强化学习训练任意模型完成任意任务集,无需改动一行框架代码或训练代码。
在四个框架上训练后,LFM2.5-2.6B 的表现从 42% 提升到 54%,同时工具调用次数减少了 31%。🧵
来源:adithya_s_k · x.com