← 文章 / AI技术
NVIDIA 博客 6小时前 · 2026-09-27 08:28:41 · 3 阅读

开放科学如何助力研究者为下一场大流行做准备

COVID-19 出现时,科学家们手握一项关键优势:几十年的冠状病毒研究积累,让他们对病毒的关键蛋白了如指掌,从而以创纪录的速度设计出疫苗。而下一场大流行未必会给我们同样的先机。

为了提高胜算,NVIDIA 加入了由 Google DeepMind 和欧洲分子生物学实验室欧洲生物信息学研究所(EMBL-EBI)等全球研究机构组成的联盟,公开发布了 2,800 多种病毒蛋白复合物的预测三维结构——任何科学家都可以通过 AlphaFold Database 免费获取。

这批新数据集中的结构是用 AlphaFold2(Google DeepMind 用于预测蛋白质折叠成三维构象的 AI 模型)推断得出的,并借助 NVIDIA BioNeMo Inference Runtime 进行了优化。这让团队能够将推理扩展到数千个病毒蛋白质组,预测每种病毒中编码的复合物,即相互作用的蛋白质组合。

“我们对 AlphaFold Database 的一贯目标,就是让基础生物学资源大规模普及,”Google DeepMind 生命科学合作经理 Risha Patel 表示,“这次合作将数千个病毒复合物纳入数据库,能让全球科学家获得洞察,为应对未来疫情做好准备。”

NVIDIA 还同时开源了生成这批数据所用的 GPU 加速工作流 BioNeMo Structure Prediction Pipeline,研究人员可以用它对自己的目标蛋白实现从序列到预测三维结构的全流程。

为下一场大流行做的准备必须从现在开始。全球发展中心(Center for Global Development)的一项分析估计,到 2050 年,世界再次遭遇一场严重程度堪比 COVID-19 的疫情的可能性约为 50%。

“当下一场大流行来临时,可能会突然冒出完全未知的病原体,届时我们将没有当年对付 COVID 的那些知识储备,”医学研究理事会-格拉斯哥大学病毒研究中心分子病毒学教授、本项目合作者 Joe Grove 说,“我们想做的,就是提前囤积一部分这样的知识。”

该数据库中新添加的蛋白质相互作用中,约有 30% 对科学界而言是完全陌生的。这些相互作用展现了蛋白质数据库(PDB,实验确定的蛋白质结构主要存储库)中从未被记录过的构象。这为生物学界带来了新的洞察,使他们得以探索并利用这些发现来生成新知识。

“这个数据库是假设生成的引擎,”NVIDIA 数字生物学应用研究科学团队负责人 Chris Dallago 表示,“我们使生物学家和人工智能界能够研究蛋白质相互作用——不仅仅是单个分子,而是复合物——从而推动整个领域向前发展。”

预测复杂蛋白质结构

大多数蛋白质并非独自工作,它们会形成由多个分子组成的复合物,以执行复杂功能。这些结构往往是疫苗或药物必须针对的目标,以破坏病毒功能。

以新冠病毒的刺突蛋白为例,理解其 3D 结构被证明是疫苗设计的基础。然而,对于成千上万的其他病毒,目前尚缺乏此类结构知识。这一数据集开始填补这一空白。

传统确定蛋白质结构的方法——将蛋白质结晶并用 X 射线照射——可能需要数年,且每个结构的成本高达数千美元。经 NVIDIA BioNeMo 优化的 AlphaFold2 可在 NVIDIA GPU 上高效运行,几分钟内即可预测结构,并支持批量运行。科学家随后可通过实验方法验证高置信度预测。

在该项目中,团队系统梳理了已知感染人类的病毒家族的蛋白质结构,从普通感冒病毒到猴痘(Mpox)等新兴威胁,无所遗漏。

全球协作,开放共享

此次合作横跨流行病准备与创新联盟(CEPI)、欧洲分子生物学实验室欧洲生物信息学研究所(EMBL-EBI)、Google DeepMind、NVIDIA、首尔国立大学、成均馆大学、瑞士生物信息学研究所和格拉斯哥大学。

这次数据集发布恰逢世界经合论坛在纽约市召集的联合国大会,主题为流行病预防、备灾与应对。该数据补充了 AlphaFold 数据库,后者目前收录了超过2.6亿个蛋白质及蛋白质复合体预测,涵盖了几乎所有已编目进入科学视野的蛋白质。

EMBL-EBI 临时主任 Jo McEntyre 表示:“开放这些数据对于理解病毒诊断以及开发疗法和疫苗至关重要。该数据集还涵盖了一些研究较少的病毒,降低了资源匮乏地区科学家在亲历疫情时进行研究的门槛。”

开放数据集中的预测结果附带置信度标签。结构展示了病毒复合物可能的形态,以及单个蛋白质在病毒蛋白质组中可能如何相互作用。

总体而言,这项新数据对于数字生物学和疾病研究领域的科学家可用的信息而言,是一次重大贡献。

Grove 说:“读博期间,我们要研究的任何蛋白质都没有可用的结构数据。那就像在黑暗中摸索,我们只能猜测发生了什么。现在这个数据集是当下所有博士研究生的强大工具,为他们提供高质量的结构性数据,加速基础科学研究。”

在AlphaFold 数据库的流行病备灾门户上浏览病毒蛋白质复合物数据集,使用BioNeMo 结构预测流水线预测蛋白质靶点的结构,并进一步了解NVIDIA BioNeMo。

原始来源: NVIDIA 博客

评论 (0)