OpenAI於10月5日(美國時間)發表textGrain,這是一種在AI所寫文字中悄悄留下標記的機制。在歐盟地區,ChatGPT與Codex所有方案的輸出將於未來數週內陸續套用;至於API使用者,全球各地都能自行選擇開啟。背景是歐盟《人工智慧法》的透明度義務,而肉眼看不見的浮水印究竟能發揮多少作用,也是焦點所在。
標記藏在「選字方式」,而非字元之中
textGrain並不是在文字中插入特殊字元或空白。模型挑選下一個字詞時,若有多個同樣自然的候選,便會依據一把秘密金鑰,讓選擇稍微朝某個方向偏移。單看每個字詞並無異狀,但對一段具一定長度的文字做統計分析,這種偏移就會浮現。
優點是人眼無法分辨,複製貼上也不容易消除;代價則是檢測必須使用專用工具。
誰會在何時使用
適用範圍依使用方式而不同。
歐盟地區的ChatGPT與Codex使用者,所有方案將於未來數週內自動套用。這並非全球統一的預設值,僅針對歐盟。
API客戶自10月5日起可選擇開啟。預設為關閉,可依專案或組織為單位啟用。
檢測工具並未公開。經核准的研究人員與專業機構可個案申請使用,申請管道也在10月5日開放。由於浮水印容易遭人為破壞,檢測手段被刻意限制在較小範圍。
背景:歐盟《人工智慧法》第50條
起因是歐盟《人工智慧法》第50條。該條要求生成式AI提供者讓輸出內容能以機器可讀的方式被辨識,這項透明度規則已於8月2日生效,適用於所有向歐盟使用者提供服務的業者。
依OpenAI的說明,歐盟關於透明度的實施守則並不要求對少於200個token的短輸出與程式碼片段加上浮水印。因此以程式碼為主的用途受影響較小,主要對象是文字內容的生成。
檢測準確率在編輯面前相當脆弱
依OpenAI公布的數字,在誤判率控制於1%的條件下,200個token的文字約有80%可被檢出,400個token則約為95%。但這只是未經修改的理想條件下的數值。
一旦修改文字,準確率便急遽下滑。替換10%的字詞,檢出率由92%降至66%;替換25%,則降至17%。翻譯與大幅修改同樣會提高檢測難度,過短的文字,以及數學算式這類表達自由度低的內容也不擅長。在歐盟各語言中,西班牙語最高,為69%,羅馬尼亞語最低,為42%。
這些數字來自OpenAI自身的評估,目前尚未出現第三方驗證。
沒有浮水印不代表是人寫的
OpenAI也明確說明了限制:浮水印無法衡量人類參與了多少,無法確立歸屬或責任,無法辨識使用者,也不能保證內容正確。沒有檢出浮水印,並不能證明文字出自人手。
因此,其他公司模型產生的文字,或經人大幅改寫的AI草稿,往往不在檢測範圍內。在教育與出版領域,僅憑檢測結果去評斷某個人是有風險的。也有人擔心,借助AI潤飾文章的非母語寫作者可能遭到誤判。
總結
textGrain是為因應歐盟《人工智慧法》而出現的文字隱形浮水印。它將陸續套用於歐盟地區的ChatGPT與Codex,API使用者自10月5日起可自願使用。但它不耐改寫,檢測工具也只開放給少數對象,並不是辨識AI文字的萬能手段。目前更值得關注的是,作為合規的第一步,它在實務上會如何推廣。
