发生了什么
谷歌 DeepMind 于 9 月 30 日在官方博客与《自然》论文中同时公布 SynthID Bio,把此前用于图片与音视频的 SynthID 水印技术带入合成生物学。核心主张是:水印不是写在文件元数据里,而是嵌进生物序列本身,因此不仅在数字模型上可验证,在合成出来的实物蛋白上同样可验证。
它要解决的问题很具体。AI 已经能设计出与已知病原体毫无相似度的全新序列,这让 DNA 合成企业的常规筛查失去一个长期依赖的假设——「陌生序列大概率是尚未被发现的天然生物」。要证明一个陌生订单不是被改造出的威胁,过去只能靠人工逐条复核,往往拖慢正常科研。SynthID Bio 想做的是提供一条自动化验证信号:该订单来自带内置防护的可信模型。
两种水印怎么做
- 序列水印:与蛋白序列生成工具 ProteinMPNN 集成,用密钥在前四个残基的基础上影响下一个氨基酸的选择,不改变蛋白的预期功能;检测方用同一密钥重算得分,统计信号出现频率。
- 结构水印:微调 AlphaFold 3 扩散网络的一小部分,把水印写进模型权重,使预测出的原子坐标天生带可检出模式,无论谁来运行该模型都成立。
- 蛋白设计流程:以 AlphaProteo 搭配启用 SynthID Bio 的 ProteinMPNN 设计结合体(binder),即能特异性结合目标蛋白的分子。
- 序列水印因设计采样温度低、可操作空间小,论文采取提高温度或使用带重复密钥的「有损」变体,并按校准阈值筛选设计。
验证结果与保留意见
湿实验覆盖三个靶点:VEGF-A、新冠病毒刺突蛋白受体结合域与 PD-L1。设计使用过往 AlphaProteo 项目留下的 15 个骨架,分别重新设计为带与不带水印的序列,用表面等离子体共振测量结合强度。官方称带水印设计在命中率、结合亲和力与序列多样性上与未加水印版本相当,并称这是首批「带水印且具备生物功能」的蛋白结合体。
- 结构检测在 0.1% 假阳性率下真阳性超过 99.8%;推荐模型在 0.01% 假阳性率下为 98.99%,其 LDDT 与 TM-score 不低于 AlphaFold 3。
- 水印能抵抗刚性变换,也能在 0.01 埃量级的坐标噪声下大致保留;但力场松弛会将其抹去,论文自承抗松弛能力不足。
- 检测本质上是统计判断,阈值直接决定假阳性与假阴性比例;水印的密钥分发与保管流程同样决定其实际强度。
- 过短的蛋白可能带不上足够多的标记氨基酸,把带水印与不带水印的蛋白融合也可能稀释信号。
- 绝大多数 AI 蛋白设计工具并不使用 ProteinMPNN,覆盖面仍有限。
为什么重要
生物安全依赖多层防护,任何单层都有缝隙。模型侧缓解与客户尽调各是一层,SynthID Bio 试图补上「设计自身可溯源」这一层,把验证点前移到 DNA 合成环节。它对公共数据库的意义同样明确:Protein Data Bank、UniProt 与 GenBank 接受外部提交,被误标或伪造的 AI 生成结构会污染后续研究,水印可作为一种标注手段——但官方也说明这只是设想,尚未落地。
需要区分的边界是:水印只能证明「输出来自选择启用它的开发者」。如果对手使用不带水印的模型,这条信号就无从产生。因此它的现实定位更接近为可信订单开快车道,而不是拦截恶意行为的网。DeepMind 已把该技术接入基因组模型 Evo 2,与斯坦福 Hie 实验室及 Arc Institute 合作,为 Evo 2 设计的一种噬菌体基因组加了水印,早期细菌培养实验显示噬菌体仍有功能,详细手稿尚未发布。

