AI 拒绝机制透明度与绕过风险引发关注
先了解这件事
AI 综述
2026年10月9日,MIT Technology Review 发文指出,AI 安全高度依赖模型的拒绝机制,但该机制存在过度依赖风险。文章称,拒绝机制在原理上并不透明:研究显示其在模型内部表现为高维多面锥状激活,具体决策过程难以完全理解;在实践中则屡被绕过,外部防护手段(如分类器)被形容为“奶酪般布满孔洞”,越狱攻击层出不穷——例如 Anthropic Fable 5 发布后三天内即被 Amazon 研究者破解部分黑客能力。文章还提出,拒绝机制可能被政府用作审查工具。
报道时间线
10月9日
- MIT Technology Review:AI 拒绝机制存在过度依赖风险
文章指出,AI 安全高度依赖模型的拒绝机制,但该机制在原理上并不透明、在实践中屡被绕过,且可能被政府用作审查工具。文中援引研究说明,拒绝行为在模型内部表现为高维多面锥状激活,其具体决策过程仍难以完全理解;分类器等外部防护手段被形容为奶酪般布满孔洞,越狱攻击层出不穷,如 Anthropic Fable 5 发布后三天内即被 Amazon 研究者破解部分黑客能力。