内容提要
英伟达联合谷歌DeepMind、欧洲生物信息研究所等机构,通过AlphaFold数据库开放发布2800多种病毒的蛋白质复合物三维结构预测,其中约30%为科学界全新发现。团队利用AlphaFold2和英伟达BioNeMo加速推理,将传统需数年的结构解析缩短至数分钟,旨在为下一次大流行储备知识,并开源预测流程以降低全球科研门槛。
延伸解读
开放数据如何降低全球科研门槛
该数据集通过AlphaFold数据库向所有科学家开放,并特别关注研究较少的病毒。EMBL-EBI临时主任指出,这有助于低资源地区的科学家应对疫情。开放预测流程和结构数据,使得原本依赖昂贵实验的结构解析变得可及,从而缩小了不同地区间的科研资源差距。
从数年到数分钟:AI预测的效率跃升
传统方法如X射线晶体学解析一个蛋白质结构可能耗时数年、花费数千美元。而AlphaFold2结合英伟达BioNeMo优化后,能在几分钟内预测结构并批量运行。这种效率提升使得系统性地预测数千种病毒蛋白质复合物成为可能,为后续实验验证提供了高效起点。
30%全新发现:未知病毒蛋白互作的结构蓝图
约30%的蛋白质相互作用是科学界全新发现,从未在蛋白质数据库(PDB)中记录。这些新结构揭示了此前未知的病毒蛋白互作模式,为理解病毒功能、开发疫苗和药物提供了新靶点。正如研究人员所说,该数据库是假设生成的引擎,推动生物学和AI领域共同探索。
为下一次大流行提前储备知识
全球发展中心分析估计,到2050年世界面临与COVID-19相当的大流行概率约为50%。与COVID-19时已有数十年冠状病毒研究不同,下一次大流行可能来自未知病原体。该项目旨在提前储备病毒蛋白结构知识,避免疫情暴发时从零开始,从而加速诊断、治疗和疫苗研发。
Q&A
英伟达联合哪些机构发布了病毒蛋白质结构数据集?
英伟达与谷歌DeepMind、欧洲分子生物学实验室的欧洲生物信息研究所(EMBL-EBI)等全球研究组织合作,发布了病毒蛋白质结构数据集。
这个开放数据集包含了多少种病毒?其中有多少是全新发现?
数据集包含超过2800种病毒的蛋白质复合物三维结构预测,其中约30%的蛋白质相互作用是科学界全新的发现,从未在蛋白质数据库(PDB)中记录过。
AlphaFold2和英伟达BioNeMo如何加速蛋白质结构预测?
AlphaFold2是谷歌DeepMind的AI模型,能预测蛋白质折叠成三维形状;英伟达BioNeMo推理运行时对其优化,使其能在GPU上高效运行,将传统需数年的结构解析缩短至数分钟,并可批量处理数千种病毒蛋白质组。
为什么开放这些病毒蛋白质结构数据对下一次大流行防范很重要?
因为下一次大流行可能带来未知病毒,而科学家可能缺乏像COVID-19那样数十年研究积累的知识。开放数据可以提前储备知识,帮助全球研究人员快速理解病毒关键蛋白,从而加速疫苗和药物设计。
这个项目对资源有限地区的科学家有什么帮助?
开放数据集降低了科研门槛,使资源有限地区的科学家也能免费获取高质量的病毒蛋白质结构预测,帮助他们应对当地爆发的疫情,并开展诊断、治疗和疫苗研究。
英伟达还开源了什么工具来帮助研究人员预测蛋白质结构?
英伟达开源了BioNeMo结构预测流程(BioNeMo Structure Prediction Pipeline),这是一个GPU加速的工作流,研究人员可以用它从蛋白质序列生成自己目标蛋白的预测三维结构。