OpenAI于10月5日(美国时间)发布了textGrain,这是一种在AI所写文本中悄悄留下标记的机制。在欧盟地区,ChatGPT和Codex所有套餐的输出将在未来数周内陆续应用该水印;而API用户在全球任何地方都可以自愿开启。其背景是欧盟《人工智能法》的透明度义务,肉眼看不见的水印究竟有多大用处,也是关注的焦点。

标记留在“选词方式”里,而不是字符里

textGrain并不是向文本中插入特殊字符或空格。模型在选择下一个词时,如果有多个同样自然的候选词,就会依据一把秘密密钥,把选择稍微往某个方向倾斜。单看每个词并无异样,但对一段有一定长度的文字做统计分析,这种倾斜就会显现出来。

它的优点是人眼无法分辨,复制粘贴也不易去除;代价是检测必须使用专用工具。

谁会在何时使用

适用范围因使用方式而异。

欧盟地区的ChatGPT和Codex用户,所有套餐将在未来数周内自动应用。这不是全球统一的默认设置,仅针对欧盟。

API客户自10月5日起可以选择开启。默认处于关闭状态,可以按项目或组织为单位启用。

检测工具并未公开。经批准的研究人员和专业机构可以逐案申请使用,申请通道也在10月5日开放。由于水印容易被人为破坏,检测手段被刻意限制在较小范围。

背景:欧盟《人工智能法》第50条

起因是欧盟《人工智能法》第50条。该条要求生成式AI提供者让输出内容能够以机器可读的方式被识别,这项透明度规则已于8月2日生效,面向所有为欧盟用户提供服务的企业。

据OpenAI介绍,欧盟关于透明度的实施守则并不要求对少于200个token的短输出和代码片段加水印。因此以代码为主的用途受影响较小,主要对象是文字内容的生成。

检测准确率在编辑面前很脆弱

按OpenAI公布的数字,在误报率控制为1%的条件下,200个token的文本约有80%可被检测出,400个token则约为95%。但这只是未经改动的理想条件下的数值。

一旦改动文本,准确率就会急剧下降。替换10%的词语,检测率从92%降到66%;替换25%,则降到17%。翻译和大幅修改同样会增加检测难度,过短的文本以及数学公式这类表达自由度低的内容也不擅长。在欧盟各语言中,西班牙语最高,为69%,罗马尼亚语最低,为42%。

这些数字来自OpenAI自身的评估,目前尚未出现第三方验证。

没有水印不代表是人写的

OpenAI也明确说明了局限:水印不能衡量人类参与了多少,不能确立归属或责任,不能识别用户,也不能保证内容准确。没有检测到水印,并不能证明文本出自人手。

因此,其他公司模型生成的文本,或经人大幅改写的AI草稿,往往不在检测范围内。在教育和出版领域,仅凭检测结果去判断某个人是有风险的。也有人担心,借助AI润色文章的非母语写作者可能被误判。

总结

textGrain是为应对欧盟《人工智能法》而出现的文本隐形水印。它将陆续应用于欧盟地区的ChatGPT和Codex,API用户自10月5日起可自愿使用。但它不耐改写,检测工具也只向少数对象开放,并不是识别AI文本的万能手段。目前更值得关注的是,作为合规第一步,它在实际中会如何推广。