NVIDIA论文:长任务模型准确率骤降
先了解这件事
AI 综述
2026年10月2日,X用户Rohan Paul发布消息称,NVIDIA一篇新论文测试了7个开源模型在加数字、排序列表等简单重复任务上的表现。结果显示,模型在长任务中准确率明显下降:128K token任务的平均准确率比4K token任务低62.8%;表现最好的模型在最长的任务中也只有17.1%全部答对。论文据此建议,对条目进行编号并分批处理,以缓解长任务中的准确率衰减。目前该事件仅有这一条报道,尚无后续进展或不同说法。
报道时间线
10月2日
- NVIDIA 论文:长任务中模型准确率下降,建议给条目编号并分批处理
NVIDIA 新论文测试 7 个开源模型在加数字、排序列表等简单重复任务上的表现,128K token 任务的平均准确率比 4K token 任务低 62.8%,最好的模型在最长的任务中也只有 17.1% 全部答对。