跳到正文
原文
omarsar0· @omarsar0 · X·· 23 小时前AI 评分57

Sakana AI 提出 MASS:用多智能体自监督扩展递归自我改进

AI 导读

作者推荐 Sakana AI 关于递归自我改进的论文,提出多智能体自监督方法 MASS。该方法让一个基础模型提出多智能体工作流、运行并打分,用进化搜索保留得分最高的工作流,再用自身轨迹微调模型,改进后的模型进入下一轮循环,从而不再依赖外部验证器。

正文 · AI 翻译

Sakana AI 推荐的一篇关于递归自我改进的论文。

他们提出了一种有趣的方法,通过多智能体自我监督来扩展递归自我改进。

在这类研究中,自我改进循环通常需要一个外部验证器,因此没有检查器的开放式任务就被排除在外。

MASS 去掉了这一要求。

一个基础模型提出多智能体工作流,运行并评分这些工作流,进化搜索保留得分最高的工作流。随后模型在自己的轨迹上进行微调,改进后的模型作为更优的优化器和评分器开启下一个循环。

在 Qwen3.6-27B 上进行两轮循环后,四个开放式基准上每个输出 token 的性能从 1.2 倍提升到 1.6 倍。

在多智能体轨迹上训练的学生模型,也胜过在多 1.4 倍 token 上训练的单智能体学生模型。

论文:arxiv.org/abs/2610.12176

论文讨论:academy.dair.ai/papers/recur…

来源:omarsar0 · x.com