Google DeepMindは9月30日(米国時間)、AIが設計したタンパク質に目に見えない署名を埋め込む技術「SynthID Bio」を発表しました。研究成果は科学誌Natureに掲載され、コードや実験データ、モデルの重みも研究コミュニティ向けに公開されています。画像や文章で使われてきた透かしの考え方を、生物学的な設計にまで広げた試みです。
アミノ酸配列と立体構造の両方に署名を入れる
SynthID Bioは、AI生成の生物学的配列や構造に、検出しやすく、なおかつ機能を保てる透かしを入れる手法群です。対象は大きく2つあります。
1つ目はタンパク質のアミノ酸配列です。ProteinMPNNをベースにした配列設計モデルがアミノ酸を選ぶ際、その確率分布にわずかな偏りを与え、統計的に検出できるパターンを残します。検出時は、配列の統計的な偏りを示す「g値」を計算します。透かしのない配列では平均が約0.5に収まり、透かしのある配列では0.5を大きく上回る仕組みです。
2つ目は立体構造です。AlphaFold 3の拡散モジュールを微調整し、予測される原子座標そのものに署名を埋め込みます。予測精度を保ったまま、ほぼ完璧に検出できるとされています。DeepMindによれば、この署名は合成後の実物のタンパク質に対しても確認できます。
結合性能は透かしなしと同等
効果の検証には、3種類の標的に対するタンパク質バインダー(標的に結合するよう設計したタンパク質)が使われました。VEGF-A、新型コロナウイルスのスパイクタンパク質の受容体結合ドメイン、PD-L1の3つです。透かしを入れた設計は、ヒット率、結合親和性、天然配列に近い多様性のいずれも、透かしなしの設計と同等でした。バクテリオファージを改変した初期の試験でも、機能は維持されたと報じられています。
バイオセキュリティの隙間を埋める狙い
背景にあるのは、AIによるタンパク質設計が広がるなかでの安全管理です。DNA合成の事業者は、注文された配列をスクリーニングしています。透かしがあれば、信頼できるモデルが出力した配列なのか、出自の分からない配列なのかを見分けやすくなります。DeepMindは、この透かしが合成のスクリーニングを補強する材料になると位置づけています。
課題はまだ多い
一方で、現時点では概念実証の段階です。DeepMindは、意図的な改ざんへの耐性を「これから解決すべき課題」としています。報道では、次のような制約も指摘されています。
- 短いタンパク質は、署名を安定して読み取るだけのアミノ酸数が足りない場合がある
- わずかな配列の違いで機能が変わる酵素のような複雑なタンパク質では、効果が不確かである
- 業界で互換性のある検証の仕組みと、共通の基準が広く採用される必要がある
こうした点から、DeepMindは来歴を示すメタデータや中央のリポジトリと組み合わせる運用を提案しています。
公開されたリソース
GitHubのリポジトリでは、主要なソフトウェアがApache License 2.0で公開されています。ProteinMPNNのモデルパラメータにはMITライセンス、データファイルにはCC BY 4.0が適用されています。配列のアルファベットはアミノ酸21種類にマスクトークンを加えたもので、既定のn-gram長は4、コンテキストの履歴サイズは1,024です。研究者が自分のモデルで試せる形になっています。
まとめ
SynthID Bioは、AI生成コンテンツに透かしを入れるという発想を、タンパク質設計という生命科学の領域へ持ち込んだ技術です。設計の性能を落とさずに署名を残せることが示された点は大きな前進といえます。ただし改ざん耐性や短い配列への対応など、実用化までの課題は残っています。公開された成果を研究者がどう検証していくかが、今後の焦点になりそうです。
参考
[1] https://deepmind.google/blog/introducing-synthid-bio/
[2] https://github.com/google-deepmind/synthidbio
