跳到正文
原文
rohanpaul_ai· @rohanpaul_ai · X·· 1 天前AI 评分66

OpenAI 将在欧盟为 ChatGPT 和 Codex 文本加入隐形水印 textGrain

AI 导读

OpenAI 将在欧盟为 ChatGPT 和 Codex 生成的文本加入隐形水印 textGrain,通过倾斜模型的词选择留下统计信号,肉眼不可见。

正文 · AI 翻译

OpenAI 将在欧盟对 ChatGPT 和 Codex 生成的文本进行隐形水印标记。

水印只会嵌入 ChatGPT 或 Codex 写出的文本中。因此,如果欧盟有人让 ChatGPT 写一段话并粘贴到个人博客上,这个隐藏信号会随这些文字一同传播,因为它存在于词语选择的模式中,而非任何特殊字符里。

如果此人大幅改写,信号会减弱甚至消失。任何由个人独立撰写的内容则完全不含水印。

未来几周内,所有套餐的合格用户都将获得水印功能,而全球的 API 客户今天即可为部分模型开启此功能。

公众无法使用 OpenAI 的工具来检查某段文本是否带有水印。

此次推出是为了回应欧盟《人工智能法案》第 50 条的要求,8 月 2 日之前已上市的生成式系统必须携带机器可读标记。

肉眼无法察觉,因为文本读起来与普通文本完全一样:没有标记,没有奇怪的字符,读者、编辑或老师都不会注意到。

唯一的检测方法是将文本输入 OpenAI 的检测器,而目前 OpenAI 仅向自己以及一小群逐一申请并获批的研究人员和专家机构开放该工具。

该方案名为 textGrain,它会微妙地影响模型的词语选择,从而留下一种读者不可见、但检测器可测量的统计信号。

在 1% 的误报率下,OpenAI 的测试显示,该检测器能识别约 80% 的 200 词心理学段落,以及约 95% 的 400 词段落。

数学答案的识别率明显较低,因为严谨的措辞留给可替换词语的空间更小,难以承载信号。

编辑也会削弱信号:在 400 词段落中替换 10% 的同义词,检测率从约 92% 降至 66%;替换 25% 则降至 17%。

阳性结果无法识别任何用户、提示词或所有者,而阴性结果也几乎不能说明什么,因为简短的、经过编辑的、翻译的或由竞争对手生成的文本都能逃避检测。

来源:rohanpaul_ai · x.com