跳到正文
原文
dair_ai· @dair_ai · X·· 3 天前AI 评分56

NVIDIA 论文量化长程智能体在长上下文下的准确率衰减

AI 导读

DAIR.AI 介绍 NVIDIA 关于长程智能体的论文:模型即使接受 128K tokens 上下文,任务执行越久越容易出错。

正文 · AI 翻译

NVIDIA 关于长时运行智能体的论文太炸了。

一个模型即使能接受 128K 令牌的上下文,在任务中处理得越久,犯的错反而越多。

如果你的智能体在处理长表格或账目时中途迷失了位置,这项工作量化了导致这一问题的原因。

实验设置:

Long-Transduction 要求模型在数千次输出中持续读取、更新并输出依赖状态的结果,并分别变化三个因素。

结果:

在七个开源权重模型上,当上下文从 4K 增长到 128K 时,准确率下降 62.8%;仅改变输入格式时下降 36.5%;当每步操作变得更难时下降 39.9%。

论文:academy.dair.ai/papers/stayi…

来源:dair_ai · x.com