跳到正文
原文
omarsar0· @omarsar0 · X·· 2 天前AI 评分56

AutoCompact 训练智能体自主决定上下文压缩时机

AI 导读

DAIR.AI 介绍论文 AutoCompact,训练智能体自行决定何时压缩上下文、保留哪些工作状态以及如何恢复。

正文 · AI 翻译

先是 AutoHarness,然后是 AutoContext,现在是 AutoCompact。

我注意到一个日益增长的趋势:越来越多的工作在训练模型原生支持更多原本由 harness 承担的功能。

这项工作专门训练智能体自行决定何时进行压缩。

这让我想起 Meta 的那篇新论文,他们训练模型原生管理上下文。

但这种方法效果如何?

AutoCompact 训练智能体决定何时压缩、保留哪些工作状态以及如何恢复。

首先由一个评审器审查基础智能体的压缩决策,并在执行前替换掉有缺陷的决策。修正后的轨迹用于 SFT,随后通过以任务成功为奖励的 RL 同时训练编码和压缩能力。

在 SWE-bench Verified 上通过率提升了 9.2 个百分点,在 SWE-PolyBench Verified 上提升了 5.0 个百分点。

即使在 256K 窗口从未溢出的情况下,这一增益依然成立,这说明当上下文空间不是限制因素时,学习到的压缩同样有帮助。

这种方法在大规模场景下表现如何,以及在不同 harness 之间的鲁棒性如何,仍有待观察。

作者提到的一个有趣观点是,这种主动压缩是模型与 harness 协同设计的一种形式:harness 提供压缩机制,而模型学习何时调用它、保留什么以及之后如何继续。

更有趣的是,如何将 harness 中已有的基于规则的压缩技术与更多由模型调用的主动压缩结合起来。

论文:arxiv.org/abs/2610.02163

与论文对话:academy.dair.ai/papers/autoc…

来源:omarsar0 · x.com