跳到正文
原文
omarsar0· @omarsar0 · X·· 13 小时前AI 评分61

UT Austin 研究:LLM Agent 上下文压缩策略可能拖慢运行速度

AI 导读

DAIR.AI 转发 UT Austin 关于 LLM Agent 上下文压缩的研究,该研究在 SWE-bench Verified 和 Terminal-Bench 上跑了近 35,000 次 agent 运行,分别改变压缩方式、触发时机和删除比例三个决策。

正文 · AI 翻译

关于 LLM Agent 中上下文压缩的精彩综述。还有一个有趣且出乎意料的发现。如果你的压缩策略以削减 token 为目标,它可能会让 Agent 运行得更慢。UT Austin 关于编码 Agent 上下文压缩的出色研究。他们在 SWE-bench Verified 和 Terminal-Bench 上运行了近 35,000 次 Agent 运行,并分别改变了三个决策:上下文如何压缩、何时触发压缩,以及移除多少内容。在 Terminal-Bench 上使用 Qwen 时,只保留约三分之一 token 的策略可能比保留完整上下文慢 20% 到 80%。按步触发的策略每步削减的 token 最多,但需要多出 10% 到 27% 的模型调用。按阈值触发的策略削减 22% 到 55% 的 token,调用次数接近完整上下文。结果也因模型而异。对 Qwen 效果良好的策略会让 Devstral 降至 38.7% 并且变慢,所以在选择策略之前,要先测量每个模型的延迟和成本。论文:arxiv.org/abs/2609.32961论文讨论:academy.dair.ai/papers/beyon…

来源:omarsar0 · x.com