跳到正文
原文
rohanpaul_ai· @rohanpaul_ai · X·· 1 天前AI 评分61

MiMo-V2.6 论文发布:RL 训练循环中引入智能体自评与评分机制

AI 导读

MiMo-V2.6 论文发布,AI 在训练循环中自主构建任务、审核测试、评分答案并排查作弊,人类只设定预算和规则。

正文 · AI 翻译

小米 MiMo-V2.6 的论文已经发布。

在 MiMo-V2.6 中,AI 自主运行了大部分训练循环:智能体负责构建任务、审核测试、评分答案并寻找作弊行为。人类则设定预算和规则。

研究表明,通过同步扩大批量大小、任务与测试框架的多样性以及评分投入,智能体模型能够随着强化学习算力的增加持续提升。

为编码智能体扩展强化学习之所以困难,是因为通过/失败的测试无法区分干净的修复和取巧的修复。智能体还会学会钻环境的空子,例如直接下载已公布的修复补丁。

一个评分智能体会比较每组中通过测试的补丁,并将奖励导向更干净的方案。如果没有它,智能体就会倾向于更长的运行时间和吞掉异常之类的变通做法。

MiMo-V2.6-Pro 在 DeepSWE 上的得分在 260 万美元的强化学习投入中从 58.4 升至 72.6,且在训练停止时仍在上升。

– arxiv. org/abs/2610.11959

标题:《MiMo-V2.6:迈向自我改进的强化学习扩展》

来源:rohanpaul_ai · x.com