dair_ai· @dair_ai · X·· 3 天前AI 评分
NVIDIA 论文量化长程智能体在长上下文下的准确率衰减
DAIR.AI 介绍 NVIDIA 关于长程智能体的论文:模型即使接受 128K tokens 上下文,任务执行越久越容易出错。
NVIDIA 关于长时运行智能体的论文太炸了。
一个模型即使能接受 128K 令牌的上下文,在任务中处理得越久,犯的错反而越多。
如果你的智能体在处理长表格或账目时中途迷失了位置,这项工作量化了导致这一问题的原因。
实验设置:
Long-Transduction 要求模型在数千次输出中持续读取、更新并输出依赖状态的结果,并分别变化三个因素。
结果:
在七个开源权重模型上,当上下文从 4K 增长到 128K 时,准确率下降 62.8%;仅改变输入格式时下降 36.5%;当每步操作变得更难时下降 39.9%。
论文:academy.dair.ai/papers/stayi…
来源:dair_ai · x.com