跳到正文
热点事件持续更新

AI 拒绝机制透明度与绕过风险引发关注

1 篇报道1 个报道来源7 小时前更新

先了解这件事

AI 综述

2026年10月9日,MIT Technology Review 发文指出,AI 安全高度依赖模型的拒绝机制,但该机制存在过度依赖风险。文章称,拒绝机制在原理上并不透明:研究显示其在模型内部表现为高维多面锥状激活,具体决策过程难以完全理解;在实践中则屡被绕过,外部防护手段(如分类器)被形容为“奶酪般布满孔洞”,越狱攻击层出不穷——例如 Anthropic Fable 5 发布后三天内即被 Amazon 研究者破解部分黑客能力。文章还提出,拒绝机制可能被政府用作审查工具。

AI 根据报道生成 · 6 小时前更新

报道时间线

沿着报道,了解事件的不同侧面。

10月9日
  1. MIT Technology Review · AI
    MIT Technology Review:AI 拒绝机制存在过度依赖风险

    文章指出,AI 安全高度依赖模型的拒绝机制,但该机制在原理上并不透明、在实践中屡被绕过,且可能被政府用作审查工具。文中援引研究说明,拒绝行为在模型内部表现为高维多面锥状激活,其具体决策过程仍难以完全理解;分类器等外部防护手段被形容为奶酪般布满孔洞,越狱攻击层出不穷,如 Anthropic Fable 5 发布后三天内即被 Amazon 研究者破解部分黑客能力。

本事件热度走势

当前热度 8·可比范围峰值 9(10月9日 19:00)·近 24 小时可比范围变化 –

02.557.51010月9日19:0010月9日21:0010月9日22:0010月10日00:00

趋势仅比较持续完整观测到的相同主体,范围可能小于当前热度统计。移动指针或点击图表查看每小时热度;键盘可用左右方向键切换。