omarsar0· @omarsar0 · X·· 1 天前AI 评分
NVIDIA 论文:给多模态模型加工具会降低其拒绝有害请求的能力
NVIDIA 被 NeurIPS 2026 接收的论文发现,给多模态模型添加工具会削弱其拒绝有害请求的能力,在其测试的所有模型上均成立,拒绝失败率相对上升最高 68.7%,平均上升 17.7%。
给多模态模型配备工具,会降低它拒绝有害请求的能力吗?
NVIDIA 的最新研究(已被 NeurIPS 2026 接收)给出了肯定答案:在其测试的所有模型上都是如此。
拒绝失败率相对上升最高达 68.7%,平均上升 17.7%。
这种性能下降出现在 Claude Opus 4.6 和 4.7、Gemini Agentic Vision、Qwen3.5-122B-A10B,以及在 MM-SafetyBench、HoliSafe 和 VLSBench 上经过智能体调优的开源模型中。
作者将其归结为两个原因。
工具输出会填满上下文,掩盖原始请求中的有害意图。此外,模型的注意力会转移到描述工具返回的内容上,而不是做出安全决策。
在生成最终响应前重新插入原始请求和图像,可以恢复部分丢失的拒绝能力。
如果你的安全评估只在纯聊天模式下进行,可能会高估智能体的安全性。
论文:arxiv.org/abs/2610.03938
论文讨论:academy.dair.ai/papers/mllms…
来源:omarsar0 · x.com