NVIDIA论文:多模态模型加工具削弱其拒绝有害请求能力
先了解这件事
AI 综述
2026年10月8日,DAIR.AI的Elvis Saravia在X上分享了NVIDIA一篇被NeurIPS 2026接收的论文。论文发现,给多模态模型添加工具会削弱其拒绝有害请求的能力,该现象在其测试的所有模型上均成立:拒绝失败率相对上升最高68.7%,平均上升17.7%。
报道时间线
10月8日
- NVIDIA 论文:给多模态模型加工具会降低其拒绝有害请求的能力
NVIDIA 被 NeurIPS 2026 接收的论文发现,给多模态模型添加工具会削弱其拒绝有害请求的能力,在其测试的所有模型上均成立,拒绝失败率相对上升最高 68.7%,平均上升 17.7%。