药企联合释放"秘密武器":2万+私有蛋白结构让 AI 折叠模型准确率飙升 46%
🧬 药企联合释放"秘密武器":2万+私有蛋白结构让 AI 折叠模型准确率飙升 46%
AISB Network 用开放代码 + 保密数据的新范式,让 OpenFold3 在药物-蛋白复合物预测上从 35.6% 跃升至 52.1%
AlphaFold 的公开数据库正在趋近饱和——能提取的公共蛋白结构几乎已被挖掘殆尽。但与此同时,全球各大制药公司的研究档案室里,却躺着数万条从未公开的蛋白-配体复合物结构数据。这些数据与药物开发管线紧密相关,被视为商业机密。
现在,一个由 AbbVie、Astex 等药企组成的联盟——AI Structural Biology (AISB) Network——做了一个大胆的实验:他们把这些"秘密数据"投入开源模型 OpenFold3 的微调中,结果惊人。
一、一场"既保密又共享"的数据实验
AISB Network 成立于去年,由多家制药公司组成。他们的目标很明确:在不泄露原始数据的前提下,利用各自的私有蛋白结构数据提升开源折叠模型的性能。
团队选择了 OpenFold3——AlphaFold 3 的开源复刻版——作为基础模型。为什么是它?因为开源模型允许外部微调,且已有成熟的社区支持。更重要的是,开源协议为"联合训练"提供了法律和技术框架。
具体的做法是:各家药企贡献自己的蛋白-配体复合物结构数据(共计 20,167 条),通过联邦学习或差分隐私等机制,在不传递原始数据的前提下更新模型权重。最终得到的 AISB 微调模型,既吸收了私有数据的价值,又没有泄露任何一家公司的核心资产。
📊 性能对比:AISB 微调模型 vs 基线模型
| 模型 | 训练数据 | held-out 准确率 |
|---|---|---|
| OpenFold3(公开版) | 仅公共数据库 | 35.6% |
| AISB 微调模型 | 公共 + 20,167 私有结构 | 52.1% |
| Boltz-2(竞品) | 公开数据 | 低于 35.6% |
测试集:1,056 个 held-out 蛋白-配体复合物结构,评估高质量预测比例
"你加入所有这些数据,性能会大幅提升。"哥伦比亚大学生物计算学家 Mohammed AlQuraishi 评价道,"AlphaFold 正在用尽公共数据,药企正在构建自己的版本。"
二、为什么这不只是数字游戏
52.1% vs 35.6%,看起来只是一个百分比的提升。但在药物发现领域,这个差距意味着什么?
🎯 更准确的结合口袋预测
蛋白-配体复合物的精确结构,是理性药物设计的核心。更高的预测准确率意味着更可靠的虚拟筛选和先导化合物优化。
🔒 数据隐私的新范式
AISB 证明了"隐私保护共享"的可行性:药企可以在不泄露商业机密的前提下,贡献数据价值给整个社区。
💡 从"自建"到"微调"
过去,每家药企都倾向于自建私有模型(封闭、重复建设)。现在,微调开源模型成为更高效的选择。
🌍 推动公共数据倡议
研究团队同时提出了 OpenBind 等公开数据集倡议,呼吁更多"类私有"数据(如代谢组学、单细胞数据)也采用类似共享模式。
这项研究的深层意义在于:它重新定义了药企数据资产的价值实现方式。过去,这些数据要么锁在档案室里,要么用于申请专利;现在,它们可以通过微调开源模型,提升整个行业的 AI 能力,同时保持商业机密的安全。
三、局限与挑战:距离普及还有多远?
当然,这项研究并非完美。以下几点值得保持清醒:
- 论文尚未 peer-reviewed:目前以 blog post 形式发布在 Nature News,未经同行评议
- 模型未公开发布:AISB 微调模型仅供联盟内部使用,外界无法复现或验证
- 隐私机制细节未披露:联邦学习/差分隐私的具体实现方案仍属商业机密
- 泛化能力待验证:当前测试集中在蛋白-配体复合物,对其他类型(膜蛋白、大复合物等)的表现未知
此外,药企参与此类合作的意愿也参差不齐。并非所有公司都愿意将数据交给"竞争对手"的微调流程——即使技术上无法反推原始数据。法律合规、数据主权、商业竞争等因素,都会影响 AISB 模式的推广速度。
四、展望:制药 AI 的"开源联邦学习"时代?
AISB Network 的实验,可能预示着制药行业 AI 研发的一个新趋势:开源模型 + 私有数据微调。
过去十年,AI for Science 的发展主要依赖公共数据集(PDB、UniProt 等)。但随着公共数据趋近饱和,行业开始意识到:真正的价值藏匿在私有数据中。然而,完全封闭的数据孤岛又会导致重复建设和资源浪费。
AISB 提供的解决方案是:数据不动,模型动。通过隐私保护计算技术,多家机构的私有数据可以"无形"地参与模型训练,最终得到一个比任何单一机构都能独立训练出的更强大的模型。
这种模式不仅在蛋白质结构预测中有潜力,还可能扩展到:
- 酶设计与催化机理预测
- 抗体-抗原相互作用建模
- 药物代谢与毒性预测
- 生物标志物发现与验证
正如 AlQuraishi 所言:"这强化了为蛋白质折叠 AI 生成类似公开数据集的必要性。"
AISB Network 的第一步已经迈出。下一步,是让更多药企加入,让开源社区参与,让这个"既保密又共享"的范式真正落地。
- Nature News: "Drug firms' secret data supercharge AI protein models" (d41586-026-02882-x, 2026-09-14)
- Positron Today 转述 (2026-09-14)
- Memesita 转述 (2026-09-14)
- EuropeSays 转述 (2026-09-14)
- NewsBeep 转述 (2026-09-14)
- OERLive 月报提及 (2026-09-16)
基于多家媒体转述整理,原文未 peer-reviewed
📌 栏目:生物模型动态 | 关注 AI 在生命科学领域的最新进展