7 月 31 日,OpenAI 開始在語音模型 GPT-Live 產生的所有音訊中嵌入 Google DeepMind 的數位浮水印技術 SynthID,ChatGPT Voice 與 OpenAI API 兩條路徑都在範圍內。同時,該公司開放了一組驗證 API,外部單位可以透過程式查詢某個音訊檔案是否帶有這道標記。這個時間點,正對上 8 月 2 日在歐盟生效的透明度義務。
聽不見的標記,加上從外部查證的管道
這次的變動可以拆成兩件事。其一,經由 ChatGPT Voice 與 API 輸出的 GPT-Live 音訊,都帶上了人耳無法分辨的浮水印。其二,這道浮水印在不在,現在可以用程式查詢。
OpenAI 在 5 月 19 日已經走過類似一步:透過 ChatGPT、Codex 與 API 產生的圖片,開始同時帶有 C2PA 簽章中繼資料與 SynthID 浮水印。不過當時公布的驗證方式是一個面向大眾的網頁,需要使用者上傳檔案再看結果。對個人有用,卻沒辦法接進別人的處理流程。
新的驗證 API 補的就是這一段。審閱投稿音訊的編輯台、大量篩檢上傳內容的平台、檢查對外錄音的企業法遵部門,都是設想中的使用情境。浮水印光是存在並不夠,要等到第三方能夠發問,它才真正成為一套機制。
標記刻在頻率圖上,而不是波形裡
圖片浮水印的做法,是在圖片產生之後對像素資料加入極其細微的擾動。音訊走不通這條路。SynthID 在語音上處理的是頻譜圖,也就是音訊訊號的頻率成分隨時間變化的那張圖。
流程大致分成三段:先把波形轉換成時間與頻率的表示,接著把浮水印圖樣寫進這張圖,最後再從修改過的頻譜圖重建波形。決定寫在哪裡的是心理聲學遮蔽原理,它利用人耳無法察覺緊鄰響亮聲音的微弱聲音這項特性。MP3 能在削去資料的同時維持聽感,靠的也是同一套模型,浮水印就藏在沒有人聽得見的位置。
這種擺法讓浮水印相當耐折騰。據稱它能撐過 MP3 壓縮、播放速度與音高的變動,甚至是把音訊用喇叭播出來再用麥克風錄一次這樣的來回。而附在檔案上的中繼資料,通常在第一步就已經不見了。
歐盟的標示義務 8 月 2 日開始生效
時間點並非巧合。歐盟人工智慧法第 50 條的透明度義務,自 8 月 2 日起在 27 個會員國適用。該條款要求提供者對生成式 AI 產出的音訊、圖片、影片與文字,以機器可讀的形式加以標示,使其能夠被辨識為人工產生。
違規的罰鍰上限為 1,500 萬歐元(約 27 億日圓)或全球年營業額的 3%,取較高者。不過對於 8 月 2 日之前已投放市場的系統,這項標示義務有寬限期,延到 12 月 2 日。
※1 歐元 = 182 日圓(截至 2026 年 8 月 1 日)
條文要求在技術可行的範圍內,採用有效、可互通、穩健且可靠的方案。中繼資料容易被剝除,浮水印單獨使用又承載不了足夠的資訊。OpenAI 把 C2PA 與 SynthID 疊在一起用,背後正是單一層次難以達標的判斷。
涵蓋範圍止於 GPT-Live 音訊
浮水印只加在 GPT-Live 的輸出上。GPT-Live 於 7 月 8 日發表,採用可以邊聽邊說的全雙工架構,取代先前的進階語音模式,成為 ChatGPT Voice 的預設。OpenAI 表示,每週使用 ChatGPT 語音與聽寫功能的人數超過 1.5 億。產品分兩個層級:給付費方案的 GPT-Live-1,以及給免費使用者的 GPT-Live-1 mini。
反過來說,不是 GPT-Live 產出的音訊,裡面什麼都沒有。其他廠商語音合成的輸出,或用開源模型做出的聲音複製,丟給驗證 API 都會回傳沒有訊號。而沒有訊號並不能證明這段音訊出自真人。這組 API 只回答一個問題,也就是有沒有找到 OpenAI 來源的浮水印,它不是通用的合成語音偵測器。使用的一方需要把這條界線記清楚。
浮水印本身的強度也有爭論。有研究者報告能以相當高的比例去除 SynthID 訊號,Google 對這些數字提出異議。即便如此,削弱訊號與徹底抹除並不相同,雙層設計的用意也在於:對 SynthID 的攻擊就算奏效,C2PA 中繼資料仍可能完好,反之亦然。
目前到位的,是可以發問的那套管線。平台會不會真的把它接進內容流程,是另一個決定,主導權在平台那一側。
總結
7 月 31 日,OpenAI 為經由 ChatGPT Voice 與 API 產生的 GPT-Live 音訊加上 SynthID 浮水印,並公開了用於查詢的驗證 API。浮水印透過心理聲學遮蔽嵌入頻譜圖,能夠承受 MP3 壓縮與重新錄製。背後是 8 月 2 日生效的歐盟人工智慧法第 50 條,違規罰鍰上限為 1,500 萬歐元(約 27 億日圓)或全球營業額的 3%。但可偵測的範圍僅限於 OpenAI 來源的音訊,沒有訊號並不構成真實性的證明。
