OpenAIが7月31日、音声モデル「GPT-Live」の出力する音声すべてに、Google DeepMindの電子透かし技術「SynthID」を埋め込む運用を開始しました。ChatGPT VoiceとOpenAI APIの両方が対象です。あわせて、音声ファイルに透かしが入っているかどうかを外部から機械的に問い合わせられる検証APIも公開されました。EUで8月2日から始まる表示義務を意識した動きでもあります。
聞こえない印を入れ、外から確かめられるようにした
今回の変更は2つに整理できます。1つは、ChatGPT VoiceおよびAPI経由でGPT-Liveが生成した音声に、人間の耳では判別できない透かしが入るようになったこと。もう1つは、その透かしの有無をプログラムから照会できるようになったことです。
OpenAIは5月19日にも、ChatGPTやCodex、APIで生成した画像へC2PAの署名付きメタデータとSynthIDの透かしを付ける取り組みを発表しています。ただし当時公開された検証手段は、利用者がファイルをアップロードして結果を見る一般向けのページでした。人が1件ずつ確かめる仕組みなので、他社の処理の流れに組み込むことはできません。
今回の検証APIは、そこを埋めるものです。投稿された音声を確認する編集部、アップロードを機械的にふるいにかける投稿プラットフォーム、外部に出す録音を点検する企業のコンプライアンス部門といった使い方が想定されます。透かしは入っているだけでは意味が薄く、第三者が照会できて初めて仕組みとして働く、というのが今回の肝です。
波形ではなく周波数の絵に印を刻む
画像の透かしは、生成後の画素データにごくわずかな揺らぎを加えることで成立します。音声はそのやり方が通用しません。SynthIDが音声で使うのはスペクトログラム、つまり音の周波数成分が時間とともにどう変化するかを表した図の側です。
手順はおおむね3段階です。まず音の波形を時間と周波数の表現に変換し、次にその上へ透かしのパターンを書き込み、最後に修正後のスペクトログラムから波形を組み直します。書き込む場所を決めるのが心理音響マスキングという考え方で、人間の耳は大きな音の近くにある小さな音を知覚できないという性質を利用します。MP3が音質をあまり落とさずにデータを削れるのと同じ原理で、聞こえない領域に信号を隠すわけです。
この置き方のおかげで、透かしはかなり手荒な扱いに耐えます。MP3への圧縮、再生速度やピッチの変更、さらにはスピーカーから流した音をマイクで録り直すという経路を通っても、信号は残るとされています。ファイルに付いたメタデータであれば、こうした変換の1回目で消えてしまうところです。
EUの表示義務が8月2日に効き始める
タイミングは偶然ではありません。EUのAI法(AI Act)第50条が定める透明性の義務は、8月2日から27の加盟国で適用されます。生成AIが作った音声・画像・映像・テキストについて、機械が読み取れる形で「人工的に生成された」と分かるようにすることを提供者に求める条項です。
違反した場合の制裁金は、最大で1,500万ユーロ(約27億円)か、全世界の年間売上高の3パーセントのいずれか高い方とされています。ただし8月2日より前から市場に出ていたシステムについては、この表示義務の適用が12月2日まで猶予されます。
※1ユーロ=182円換算(2026年8月1日時点)
条文は、技術的に可能な範囲で、効果的・相互運用可能・堅牢かつ信頼できる手段を用いるよう求めています。メタデータだけでは剥がれやすく、透かしだけでは情報量が足りません。OpenAIがC2PAとSynthIDを重ねて使っているのは、この2層構えでないと条文の要求を満たしにくいという判断があるからでしょう。
対象はGPT-Liveの音声、その外側には届かない
透かしが入るのはGPT-Liveの出力です。GPT-Liveは7月8日に公開された音声モデルで、聞きながら同時に話せる全二重の構造を持ち、これまでの高度な音声モードに代わってChatGPT Voiceの標準になりました。OpenAIによれば、ChatGPTの音声入力や音声認識を使う人は週に1億5,000万人を超えます。有料プラン向けのGPT-Live-1と、無料プラン向けのGPT-Live-1 miniの2種類が用意されています。
裏を返せば、GPT-Live以外から出てきた音声には何も入っていません。他社の音声合成サービスの出力も、オープンソースのモデルで作った声のクローンも、検証APIに投げれば「信号なし」と返ってきます。そしてこの「信号なし」は、その音声が本物の人間の声である証明にはなりません。判定できるのは「OpenAI由来の透かしが見つかったかどうか」だけで、合成音声かどうかを一般的に見分ける機能ではないという点は、使う側が押さえておく必要があります。
透かし自体の強度にも議論があります。研究者からは、SynthIDの信号を高い割合で除去できたとする報告が出ており、Googleはその数値に異議を唱えています。もっとも、部分的に信号が弱められても完全に消えるわけではなく、SynthIDが壊れてもC2PAのメタデータが残る、あるいはその逆というのが2層構えの狙いでもあります。
現時点で分かるのは、照会するための仕組みが用意されたところまでです。実際に投稿の流れへ組み込むかどうかは、プラットフォーム側の判断に委ねられています。
まとめ
OpenAIは7月31日、ChatGPT VoiceとAPIで生成されるGPT-Liveの音声にSynthIDの透かしを適用し、その有無を照会できる検証APIを公開しました。透かしはスペクトログラム上に心理音響マスキングを使って埋め込まれ、MP3圧縮や録り直しにも耐えます。背景には8月2日に適用が始まるEU AI法第50条の表示義務があり、違反時の制裁金は最大1,500万ユーロ(約27億円)または全世界売上高の3パーセントです。ただし検出できるのはOpenAI由来の音声に限られ、信号がないことは本物の証明にはなりません。
