跳到正文
原文
dair_ai· @dair_ai · X·· 15 小时前AI 评分56

Meta AI 论文提出 MIRA,用外层元推理器与执行器拆分改进研究智能体的下一步决策

AI 导读

Elvis Saravia 介绍 Meta AI 关于研究智能体如何决定下一步研究方向的论文 MIRA。该方法将智能体拆为外层元推理器与新执行器:外层读取持续研究记录并写下一份工作指令,执行器负责执行,决策只发生在工作指令边界,作者在这些点训练 critic 预测剩余收益,再训练单一 actor-critic(MIRA-AC)同时评估部分进展并选择下一步研究。

正文 · AI 翻译

Meta AI 出了一篇超赞的论文,讲的是决定下一步研究什么的研究智能体。

(收藏一下)

如果你运行长时程的研究智能体,选择下一项调查是很难学会的,因为在长轨迹中这类决策很稀少,而且它们的影响要过好几步才会显现。

MIRA 把智能体拆成了两部分。

一个外层的元推理器读取持续更新的研究记录,并为下一项调查写下工作指令。

一个全新的执行器负责执行每条工作指令。

决策只发生在工作指令的边界处,因此作者在这些点上训练一个评论家来预测剩余回报,然后训练一个单一的 actor-critic(MIRA-AC),既能评估部分进展,又能选择下一项调查。

即使不训练,这种拆分也能提升定理证明和开放式架构研究的效果。

在模型自身的代理信号上训练后,MIRA-AC 在全部四个自动研究环境中都提升了 gold 分数。

论文:arxiv.org/abs/2610.02525

与论文对话:academy.dair.ai/papers/learn…

来源:dair_ai · x.com