Thom_Wolf· @Thom_Wolf · X·· 7 天前AI 评分
Thomas Wolf:Opus 模型或已能识别作弊测试导致基准失真
Hugging Face 联创 Thomas Wolf 指出,作弊率突然下降最可能的解释是评测意识:最新的 Opus 模型可能已聪明到能识别该基准在测试作弊,并据此调整行为。若如此,该基准将不再衡量模型"自然"的作弊倾向。
人们之所以担忧,是因为对作弊率如此突然下降最可能的解释是「评测意识」:最新的 Opus 模型可能已经聪明到能识别出这个基准测试是在测试作弊行为,并据此调整自己的表现。
如果真是这样,那么这个基准测试衡量的就不再是模型「天然」的作弊倾向了。
来源:Thom_Wolf · x.com