Google DeepMind 於 9 月 30 日(美國時間)發表 SynthID Bio,這項技術能在 AI 設計的蛋白質中嵌入肉眼無法察覺的簽章。相關成果已刊登於《自然》(Nature)期刊,程式碼、體外實驗資料與模型權重也已向研究社群公開。它將過去用於影像與文字的浮水印概念,延伸到了生物設計領域。
在胺基酸序列與三維結構中都寫入簽章
SynthID Bio 是一組方法,用來在 AI 生成的生物序列與結構中加入容易偵測、同時能保留功能的浮水印。主要針對兩類對象。
第一類是胺基酸序列。以 ProteinMPNN 為基礎的序列設計模型在挑選胺基酸時,會對機率分布施加輕微偏置,留下可透過統計偵測的模式。偵測時會計算反映統計偏差的「g 值」:沒有浮水印的序列平均約為 0.5,帶有浮水印的序列則明顯高於 0.5。
第二類是三維結構。DeepMind 對 AlphaFold 3 的擴散模組進行微調,將簽章直接嵌入預測出的原子座標中。預測精度得以維持,浮水印偵測接近完美。依 DeepMind 的說明,合成後的實體蛋白質同樣可以驗證這個簽章。
結合表現與未加浮水印的設計相當
驗證使用了針對 3 個標靶設計的蛋白質結合劑(被設計來與標靶結合的蛋白質):VEGF-A、新冠病毒棘蛋白的受體結合域,以及 PD-L1。帶有浮水印的設計在命中率、結合親和力與接近天然序列的多樣性上,皆與未加浮水印的設計相當。據報導,在改造噬菌體的初期試驗中,功能同樣得以維持。
目標是補上生物安全的缺口
其背景是 AI 蛋白質設計日益普及後的安全管理問題。DNA 合成業者會對客戶訂購的序列進行篩檢。有了浮水印,就更容易分辨一條序列是來自可信任的模型,還是來源不明。DeepMind 將這項浮水印定位為強化合成篩檢的一種手段。
仍有不少課題
目前仍處於概念驗證階段。DeepMind 將抵禦蓄意竄改稱為「尚待解決的課題」。報導還指出了其他限制。
- 較短的蛋白質可能沒有足夠的胺基酸數量來穩定讀取簽章
- 對於酵素這類序列稍有改變功能就會不同的複雜蛋白質,效果尚不確定
- 需要業界廣泛採用相容的驗證機制與共通標準
因此,DeepMind 建議將浮水印與來源中繼資料或中央儲存庫搭配使用。
已公開的資源
在 GitHub 儲存庫中,主要軟體以 Apache License 2.0 發布,ProteinMPNN 的模型參數採用 MIT 授權,資料檔案則採用 CC BY 4.0。字母表由 21 種胺基酸加上一個遮罩標記組成,預設 n-gram 長度為 4,預設上下文歷史大小為 1,024。研究人員可以在自己的模型上嘗試。
總結
SynthID Bio 把為 AI 生成內容加浮水印的概念帶進了生命科學中的蛋白質設計領域。證明能在不降低設計表現的前提下留下簽章,是值得關注的進展。不過,抗竄改能力與對短序列的支援等問題,仍是邁向實用化的障礙。研究人員將如何驗證已公開的成果,會是接下來的觀察重點。
參考資料
[1] https://deepmind.google/blog/introducing-synthid-bio/
[2] https://github.com/google-deepmind/synthidbio
