Import AI· Jack Clark·· 2026-07-27AI 评分
Import AI 466:机器人领域的苦涩教训、AI 完成周级编程任务与 OpenAI 意外出现的 AI 黑客
Epoch 与 METR 发布 MirrorCode 基准,用于测试 AI 系统完成长周期编程任务的能力,Claude Opus 4.7 用 14 小时、251 美元推理成本解决了一个 METR 与 Epoch 估计人类需 2 至 17 周完成的任务,25 个目标程序中 17 个至少有一次满分运行,8 个从未达到 100% 阈值。
当前提供 AI 导读,完整正文请阅读原文。
来源:Import AI · importai.substack.com