MIT Technology Review · AI· Arthur Holland Michel·· 10 小时前AI 评分
MIT Technology Review:AI 拒绝机制存在过度依赖风险
文章指出,AI 安全高度依赖模型的拒绝机制,但该机制在原理上并不透明、在实践中屡被绕过,且可能被政府用作审查工具。文中援引研究说明,拒绝行为在模型内部表现为高维多面锥状激活,其具体决策过程仍难以完全理解;分类器等外部防护手段被形容为奶酪般布满孔洞,越狱攻击层出不穷,如 Anthropic Fable 5 发布后三天内即被 Amazon 研究者破解部分黑客能力。
当前提供 AI 导读,完整正文请阅读原文。
来源:MIT Technology Review · AI · technologyreview.com