AI基准饱和争议:长任务能力测量失效
先了解这件事
AI 综述
2026年10月8日,Ethan Mollick在X上发文指出,少数尝试测量AI完成长期任务能力的基准——METR Long Tasks、GDPval——在今年初都已饱和,原因是AI开始能够高质量完成需要数天的工作,导致这些基准失去区分度。此前业界普遍关注AI在短时任务上的表现,而这一说法将讨论焦点转向了长周期、复杂任务的能力评估问题。目前该观点由Mollick单方面提出,尚无其他报道佐证或反驳,相关基准的具体饱和数据与时间线也未在报道中给出。
报道时间线
10月8日
- METR Long Tasks等基准今年初已饱和
少数尝试测量类似能力的基准(METR Long Tasks、GDPval)今年初都已饱和,因为 AI 开始能高质量完成数天的工作。