跳到正文
原文
omarsar0· @omarsar0 · X·· 1 天前AI 评分66

NVIDIA 论文:给多模态模型加工具会降低其拒绝有害请求的能力

AI 导读

NVIDIA 被 NeurIPS 2026 接收的论文发现,给多模态模型添加工具会削弱其拒绝有害请求的能力,在其测试的所有模型上均成立,拒绝失败率相对上升最高 68.7%,平均上升 17.7%。

正文 · AI 翻译

给多模态模型配备工具,会降低它拒绝有害请求的能力吗?

NVIDIA 的最新研究(已被 NeurIPS 2026 接收)给出了肯定答案:在其测试的所有模型上都是如此。

拒绝失败率相对上升最高达 68.7%,平均上升 17.7%。

这种性能下降出现在 Claude Opus 4.6 和 4.7、Gemini Agentic Vision、Qwen3.5-122B-A10B,以及在 MM-SafetyBench、HoliSafe 和 VLSBench 上经过智能体调优的开源模型中。

作者将其归结为两个原因。

工具输出会填满上下文,掩盖原始请求中的有害意图。此外,模型的注意力会转移到描述工具返回的内容上,而不是做出安全决策。

在生成最终响应前重新插入原始请求和图像,可以恢复部分丢失的拒绝能力。

如果你的安全评估只在纯聊天模式下进行,可能会高估智能体的安全性。

论文:arxiv.org/abs/2610.03938

论文讨论:academy.dair.ai/papers/mllms…

来源:omarsar0 · x.com