PharmacoMatch:通过神经子图匹配实现高效的3D药效基筛选
内容提要
该论文介绍了多种基于人工智能的药物发现方法,包括DrugOOD数据集、RaSECo跨视图协同对比学习和GraphCL-DTA靶标结合亲和力预测。这些方法在药物相互作用预测和虚拟筛选中表现出色,提高了药物研发的效率和准确性。此外,提出的Syngand和Imagand模型解决了数据稀疏问题,生成合成药物动力学数据,推动了药物再利用研究。
延伸解读
从数据稀疏到合成数据:Syngand与Imagand的应对策略
文章指出,药物发现中数据集常独立收集、缺乏重叠,导致数据稀疏。Syngand作为扩散图神经网络,能生成配体和药物动力学数据,并在AqSolDB、LD50和hERG central等回归任务上初步验证有效。Imagand则是一种SMILES到药物动力学扩散模型,生成与SMILES条件关联的目标属性,合成数据分布与真实数据高度相似,提升了后续任务表现。两者为跨数据集研究提供了数据生成方案。
虚拟筛选的效率革新:DrugCLIP与PharmacoNet的对比
DrugCLIP将虚拟筛选重构为密集检索任务,利用对比学习对齐蛋白口袋与分子表示,无需准确结合亲和力标签,在零样本设置中显著减少计算时间。PharmacoNet则通过粗粒化图形匹配,避免昂贵的配体姿态采样和评分,在保持合理准确性的同时提升速度,并能在严格预筛选阈值下保留命中候选物。两者分别从检索和匹配角度提升了筛选效率。
图对比学习在药物发现中的角色:GraphCL-DTA与RaSECo
GraphCL-DTA基于分子语义的图对比学习,优化药物和靶标表征质量,在KIBA和Davis数据集上优于其他最新模型。RaSECo则通过关系感知子图嵌入的跨视图协同对比学习,构建多属性药物相似性图,在药物相互作用预测中表现优越。这些方法展示了图对比学习在提升药物表示和预测性能方面的潜力。
主动学习与预训练模型:提升虚拟筛选的样本效率
文章提到,预训练的基于转换器的语言模型和图神经网络在贝叶斯优化主动学习框架中表现良好,仅筛选超大型库的0.6%即可识别排名前50000位化合物的58.97%,较先前最先进基准提高8%。这表明主动学习能显著提高基于分子虚拟筛选的准确性和样本效率,在结构基础和配体基础药物发现中均有卓越性能。
Q&A
DrugOOD数据集的主要用途是什么?
DrugOOD数据集用于药物靶向结合亲和力预测的模型性能测试。
RaSECo方法在药物研究中有什么优势?
RaSECo方法通过关系感知子图嵌入实现药物的有效嵌入,在药物相互作用预测中表现优越。
GraphCL-DTA方法如何优化药物和靶标的表征质量?
GraphCL-DTA通过基于分子语义的图对比学习方法,学习到更准确和有效的药物表示。
Syngand模型解决了什么问题?
Syngand模型解决了数据稀疏问题,能够生成配体和药物动力学数据。
Imagand模型的主要贡献是什么?
Imagand模型有效生成与SMILES输入条件相关联的药物动力学目标属性,提升了后续任务的表现。
DrugCLIP如何提高虚拟筛选的效率?
DrugCLIP将虚拟筛选重构为密集检索任务,利用对比学习显著提高了虚拟筛选的效率,尤其在零样本设置中表现突出。