跳到正文
原文
arena· @arena · X·· 21 小时前AI 评分47

Arena 测评 AI 智能体虚假归因行为

AI 导读

Arena 测评发现 AI 智能体存在"虚假归因"问题,即把用户未说过的话或未做的决定错误归给用户。GPT-6 Luna 和 Astra 的误引率最低(15.6% 和 28.6%),但错误归因率高达 53.1% 和 48.2%;GPT-6 Sol 则以 23.5% 的比例最常篡改用户历史记录。

正文 · AI 翻译

我们还研究了「错误归因」(False Attribution),即智能体将某句话、某个请求、某种选择、某次批准或某项事实归于用户,但用户提供的证据与该归因相矛盾。

有趣的是,我们发现有些模型会错误引用用户的话(误述用户的要求),而另一些模型则会把别人的成果算到用户头上。

各模型的表现模式不尽相同:GPT-6 Luna 和 Astra 很少错误引用用户(分别为 15.6% 和 28.6%),却经常出现错误归因(分别为 53.1% 和 48.2%)。有趣的是,它们的同门模型 GPT-6 Sol 错误重构用户历史的比例最高(23.5%)。

来源:arena · x.com