百度蛋白配体全原子扩散模型效果直逼AlphaFold3,代码数据全面开源

💡 原文中文,约2200字,阅读约需6分钟。
📝

内容提要

百度飞桨螺旋桨PaddleHelix团队开源了基于大规模预训练方法的HelixDock全原子扩散模型,能够准确预测蛋白质和小分子的结合构象。该模型具有高精度、泛化能力和鲁棒性,通过大规模数据验证了AI在科学领域的Scaling Laws。HelixDock代码和训练数据已全面开源,PaddleHelix计算平台提供免费在线服务。

🔎

延伸解读

HelixDock的泛化能力验证

文章通过低相似度靶点和cross-docking实验验证了HelixDock的泛化能力。在PoseBusters上,模型对与训练集相似度低的靶点仍保持良好成功率;在PDBbind-CrossDocked-Core和APObind-Core数据集上,预测成功率分别达80.7%和68.1%。这表明模型不依赖训练集相似性,能适应新靶点,对实际药物发现中多样化的靶点具有重要价值。

虚拟筛选中的实际优势

在包含102个药物靶点的DUD-E虚拟筛选基准上,HelixDock预测的构象在富集指数(EF1%,EF5%)上明显优于其他方法。富集指数衡量早期发现活性分子的能力,其优势意味着HelixDock能更高效地从大量化合物中筛选出潜在活性分子,从而加速先导化合物发现,降低实验成本。

Scaling Laws在AI for Science的验证

HelixDock利用国家超算生成的亿级仿真对接数据(涵盖近20万靶点、2000多个蛋白质家族)进行预训练。实验显示,预训练下模型精度随参数量和数据量增加持续提升,而无预训练时精度并未随参数量提升。这验证了Scaling Laws在AI for Science领域的适用性,表明大数据与大模型对提升药物发现AI效果至关重要。

开源与商业化路径

HelixDock的代码和亿级训练数据面向学术领域全面开源,商业客户需通过官网咨询商用规则。同时,PaddleHelix计算平台提供免费在线服务,方便从业人员实时体验。这种开源策略有助于推动学术研究,而商业化路径则为产业应用提供支持,平衡了开放与商业利益。

❓

Q&A

HelixDock模型的主要功能是什么?

HelixDock模型能够准确预测蛋白质和小分子的结合构象。

HelixDock与传统物理对接工具相比有什么优势?

HelixDock在构象预测准确度上显著高于传统物理对接工具,且在PoseBusters上的成功率达85.6%。

HelixDock是如何解决训练数据匮乏的问题的?

HelixDock通过生成亿级的仿真数据构建了蛋白质-小分子对接构象数据集,用于模型的预训练。

HelixDock的开源情况如何?

HelixDock的代码和训练数据已全面开源,支持学术研究和药物发现。

HelixDock在虚拟筛选任务中的表现如何?

HelixDock在虚拟筛选任务中表现优异,富集指数明显优于其他方法。

HelixDock的泛化能力如何?

HelixDock在低相似度靶点上保持良好成功率,展现出良好的泛化能力和鲁棒性。

🏷️

标签

➡️

继续阅读