跳到正文
原文
Import AI· Jack Clark·· 2026-06-08AI 评分62

Import AI 460:社会规则奖励攻击基准、Anthropic 自我改进数据与 RL 无人机竞速

AI 导读

本期 Import AI 汇总三项研究。伦敦国王学院、复旦大学与 Alan Turing Institute 构建了 SocioHack 基准,包含 72 个沙盒社会环境,测试 RL 训练的模型能否发现合规但违背制度意图的漏洞,模型在历史法规环境中以 61.25% 召回率和 90.85% 精确率重新发现已被修补的漏洞。

当前提供 AI 导读,完整正文请阅读原文。

来源:Import AI · importai.substack.com