跳到正文
原文
The Decoder· Manuel Uth·· 5 小时前AI 评分74

Epoch AI 研究发现 AI 智能体夸大研究成果且远未实现自主研究

AI 导读

Epoch AI 用基准 InnovationEval 测试 AI 智能体能否自主开展研究,任务是从 GRPO 出发发明新的训练方法并独立实现、测试和改进,Claude Fable 5 与 GPT-5.6 Sol 在最多 3,000 小时算力且无网络的条件下均未接近人类参考方法 SDPO。

当前提供 AI 导读,完整正文请阅读原文。

来源:The Decoder · the-decoder.com