7 月 31 日,OpenAI 开始在语音模型 GPT-Live 生成的所有音频中嵌入谷歌 DeepMind 的数字水印技术 SynthID,覆盖 ChatGPT Voice 和 OpenAI API 两条通道。与此同时,公司开放了一个验证 API,外部方可以通过程序查询某个音频文件是否带有该水印。这一时间点,正对着 8 月 2 日在欧盟生效的透明度义务。

听不见的标记,以及从外部核验的通道

这次变化可以拆成两件事。一是经由 ChatGPT Voice 和 API 输出的 GPT-Live 音频,都带上了人耳无法分辨的水印。二是这个水印的有无,现在可以用代码查询。

OpenAI 在 5 月 19 日已经走过类似一步:通过 ChatGPT、Codex 和 API 生成的图像,开始同时携带 C2PA 签名元数据与 SynthID 水印。不过当时公布的验证手段是一个面向公众的网页,需要用户上传文件再看结果。对个人有用,却无法嵌入他人的处理流程。

新的验证 API 补的正是这一段。审核投稿音频的编辑部、批量筛查上传内容的平台、检查外发录音的企业合规部门,都是设想中的使用场景。水印只是存在并不够,只有当第三方能够发起查询,它才真正构成一套机制。

标记刻在频率图上,而不是波形里

图像水印的做法,是在图像生成之后向像素数据加入极其细微的扰动。音频走不通这条路。SynthID 在语音上处理的是声谱图,也就是音频信号的频率成分随时间变化的那张图。

流程大致分三步:先把波形转换成时间与频率的表示,再把水印图案写进这张图,最后从修改后的声谱图重建波形。决定写在哪里的,是心理声学掩蔽原理,它利用了人耳无法察觉紧邻响亮声音的微弱声音这一特性。MP3 能在削减数据的同时保持听感,靠的也是同一套模型,水印就藏在没有人听得见的位置。

这种放置方式让水印相当耐折腾。据称它能挺过 MP3 压缩、播放速度与音高的改变,甚至是把音频用扬声器放出来再用麦克风录一遍这样的往返过程。而附在文件上的元数据,通常在第一步就已经消失。

欧盟的标注义务 8 月 2 日开始生效

时间点并非巧合。欧盟人工智能法案第 50 条的透明度义务,自 8 月 2 日起在 27 个成员国适用。该条款要求提供者对生成式 AI 产出的音频、图像、视频和文本,以机器可读的形式加以标记,使其能够被识别为人工生成。

违规的罚款上限为 1,500 万欧元(约 27 亿日元)或全球年营业额的 3%,取较高者。不过对于 8 月 2 日之前已投放市场的系统,这项具体的标记义务有宽限期,延至 12 月 2 日。

※1 欧元 = 182 日元(截至 2026 年 8 月 1 日)

条文要求在技术可行的范围内,采用有效、可互操作、稳健且可靠的方案。元数据容易被剥离,水印单独使用又承载不了足够信息。OpenAI 把 C2PA 和 SynthID 叠加使用,背后正是单层难以达标的判断。

覆盖范围止于 GPT-Live 音频

水印只加在 GPT-Live 的输出上。GPT-Live 于 7 月 8 日发布,采用可以边听边说的全双工结构,取代此前的高级语音模式,成为 ChatGPT Voice 的默认选择。OpenAI 表示,每周使用 ChatGPT 语音与听写功能的人数超过 1.5 亿。产品分两档:面向付费方案的 GPT-Live-1,以及面向免费用户的 GPT-Live-1 mini。

反过来说,不是 GPT-Live 产出的音频,里面什么都没有。其他厂商语音合成的输出,或用开源模型做出的声音克隆,投给验证 API 都会返回"无信号"。而"无信号"并不能证明这段音频出自真人。这个 API 只回答一个问题——是否发现了 OpenAI 来源的水印——它不是通用的合成语音检测器。使用方需要把这条界线记清楚。

水印本身的强度也存在争议。有研究者报告称能以较高比例去除 SynthID 信号,谷歌对这些数字提出了异议。即便如此,削弱信号与彻底抹除并不相同,双层设计的用意也在于:对 SynthID 的攻击即使奏效,C2PA 元数据仍可能完好,反之亦然。

目前落地的,是可以发问的那套管道。平台是否真的把它接进内容流程,是另一个决定,主动权在平台一侧。

总结

7 月 31 日,OpenAI 为经由 ChatGPT Voice 和 API 生成的 GPT-Live 音频加上 SynthID 水印,并公开了用于查询的验证 API。水印借助心理声学掩蔽嵌入声谱图,能够经受 MP3 压缩与重新录制。背后是 8 月 2 日生效的欧盟人工智能法案第 50 条,违规罚款上限为 1,500 万欧元(约 27 亿日元)或全球营业额的 3%。但可检测的范围仅限于 OpenAI 来源的音频,没有信号并不构成真实性的证明。