Google DeepMind 于 9 月 30 日(美国时间)发布了 SynthID Bio,这项技术可以在 AI 设计的蛋白质中嵌入肉眼不可见的签名。相关成果已发表在《自然》(Nature)杂志上,代码、体外实验数据和模型权重也已向研究界公开。它把此前用于图像和文本的水印思路,延伸到了生物设计领域。
在氨基酸序列和三维结构中都写入签名
SynthID Bio 是一组方法,用于在 AI 生成的生物序列和结构中加入易于检测、同时保持功能的水印。主要针对两类对象。
第一类是氨基酸序列。基于 ProteinMPNN 的序列设计模型在选择氨基酸时,会对概率分布施加轻微偏置,留下可通过统计检测的模式。检测时通过计算反映统计偏差的“g 值”来判断:没有水印的序列平均约为 0.5,带水印的序列则明显高于 0.5。
第二类是三维结构。DeepMind 对 AlphaFold 3 的扩散模块进行了微调,将签名直接嵌入预测得到的原子坐标中。预测精度得以保持,水印检测接近完美。据 DeepMind 介绍,合成之后的实体蛋白质同样可以验证这一签名。
结合性能与未加水印的设计相当
验证使用了针对 3 个靶点设计的蛋白质结合剂(被设计用来与靶标结合的蛋白质):VEGF-A、新冠病毒刺突蛋白的受体结合域,以及 PD-L1。带水印的设计在命中率、结合亲和力和接近天然序列的多样性方面,均与未加水印的设计相当。据报道,在改造噬菌体的早期试验中,功能同样得到保持。
旨在弥补生物安全的缺口
其背景是 AI 蛋白质设计日益普及后的安全管理问题。DNA 合成服务商会对客户订购的序列进行筛查。有了水印,就更容易分辨一条序列来自可信模型,还是来源不明。DeepMind 将这项水印定位为强化合成筛查的一种手段。
仍有不少课题
目前仍处于概念验证阶段。DeepMind 把抵御蓄意篡改称为“尚待解决的课题”。报道还指出了其他限制。
- 较短的蛋白质可能没有足够的氨基酸数量来稳定读取签名
- 对于酶这类序列稍有变化功能就会改变的复杂蛋白质,效果尚不确定
- 需要行业内广泛采用兼容的验证机制和统一标准
因此,DeepMind 建议将水印与来源元数据或中央存储库结合使用。
已公开的资源
在 GitHub 仓库中,主要软件以 Apache License 2.0 发布,ProteinMPNN 的模型参数采用 MIT 许可,数据文件采用 CC BY 4.0。字母表由 21 种氨基酸加上一个掩码标记组成,默认 n-gram 长度为 4,默认上下文历史大小为 1,024。研究人员可以在自己的模型上进行尝试。
总结
SynthID Bio 把为 AI 生成内容加水印的思路带入了生命科学中的蛋白质设计领域。证明可以在不降低设计性能的前提下留下签名,是一项值得关注的进展。不过,抗篡改能力和对短序列的支持等问题,仍是走向实用化的障碍。研究人员将如何验证已公开的成果,会是接下来的看点。
参考资料
[1] https://deepmind.google/blog/introducing-synthid-bio/
[2] https://github.com/google-deepmind/synthidbio
