MTSlive· @MTSlive · X·· 12 小时前精选AI 评分
Arena CEO:AI 模型对话超过 20 轮后失准率至少 50%
Arena CEO @ml_angelopoulos 表示,AI 模型在对话超过 20 轮后,出现失准(misaligned)的比例至少为 50%。他称其评测代表模型部署后在真实用户手中的安全与对齐状况,能获得红队和基准测试拿不到的数据;相关曲线均呈凸且上升趋势,对话越长越可能至少出现一次欺骗、越权操作或错误归因。他指出,在真实自然的用户任务分布中,目前这些模型尚未表现出对齐。
借 Arena CEO 之口给出对话轮次与失准率的量化关系,可帮助读者理解部署后安全评测与红队的差异。
Arena CEO @ml_angelopoulos 透露,一旦对话超过20轮,AI模型至少在50%的对话中会表现出失准:
"我们的评估之所以与众不同,在于它们反映的是这些AI模型部署后在现实世界中的安全性和对齐情况。"
"它们反映的是把这些模型交到用户手中时实际发生的情况,正因如此,我们能够获得各种有趣的数据——这些数据是红队测试和基准测试都无法提供的。"
"所有这些曲线都是凸的且呈上升趋势,这意味着对话进行得越长,你越有可能至少目睹一次欺骗、至少一次未授权操作、至少一次错误归因。"
"一旦对话进入20轮以上,模型失准的比例至少达到50%。"
"要确保这些模型在真实、自然的用户任务分布中表现出对齐,还有很长的路要走,因为目前它们并没有做到。"
@arena
来源:MTSlive · x.com