跳到正文
原文
omarsar0· @omarsar0 · X·· 2 天前AI 评分61

Meta Superintelligence Labs 论文提出 agent plasticity 度量自我改进智能体

AI 导读

Meta Superintelligence Labs 发表关于自我改进智能体的论文,提出 agent plasticity 指标,即在模型权重冻结、每次运行从全新上下文开始的条件下,每投入 1 美元学习成本在保留任务上的增益。

正文 · AI 翻译

Meta 超级智能实验室(Meta Superintelligence Labs)关于自我改进智能体的论文,太炸了。

(建议收藏)

很难确切知道是什么驱动了自我改进,因为涉及的变量太多了(笔记、技能、运行之间的工具调用等等)。

Meta 的研究人员探索并讨论了一种衡量自我改进是否值得的方法。

他们称之为「智能体可塑性」(agent plasticity)。它指的是在模型权重冻结、每次运行都从全新上下文开始的条件下,每投入一美元学习成本在留出任务上获得的增益。

他们发现,表现最好的模型往往与学习效率最高的模型不是同一个。

在国际象棋、围棋和 Hex 中,Claude Fable 5 取得了最高的最终分数,而 GPT-5.6 Sol 每美元获得的增益最大。

在 NetHack 中,只有 Claude Opus 5.5 有显著提升,花费约 1,073 美元的学习成本,归一化分数提高了 66 分。

另一个有趣的发现是,学习慢的智能体往往会忽略自己已经写好的产物。学习快的智能体会复用这些产物,但当产物质量低时仍然会失败。

论文:arxiv.org/abs/2610.08902

论文讨论:academy.dair.ai/papers/agent…

来源:omarsar0 · x.com