跳到正文
原文
adithya_s_k· @adithya_s_k · X·· 6 天前AI 评分54

开源 multi-harness RL 训练方法:在 Claude Code 等 harness 内直接训练模型

AI 导读

作者发布 multi-harness RL 指南,提供一种开放方式,可在 Claude Code、Codex、OpenCode 等实际使用的 agent harness 内部用 RL 训练任意模型于任意任务集,无需改动 harness 或训练代码的任何一行。在四个 harness 上训练后,LFM2.5-2.6B 从 42% 提升到 54%,同时 tool calls 减少 31%。

正文 · AI 翻译

1/ 很兴奋地发布《多框架强化学习终极指南》

同一个模型在每个智能体框架中的表现都不一样。因此我们构建了一种开放方式,可以在人们实际使用的框架(如 Claude Code、Codex 和 OpenCode)中,用强化学习训练任意模型完成任意任务集,无需改动一行框架代码或训练代码。

在四个框架上训练后,LFM2.5-2.6B 的表现从 42% 提升到 54%,同时工具调用次数减少了 31%。🧵

来源:adithya_s_k · x.com