无实验数据指导蛋白质定向进化,上海交大洪亮课题组发表微环境感知图神经网络 ProtLGN

💡 原文中文,约5100字,阅读约需13分钟。
📝

内容提要

上海交通大学洪亮课题组研发了一种名为PROTLGN的微环境感知图神经网络,能够从蛋白质三维结构中学习并预测有益的氨基酸突变位点,指导蛋白质设计。PROTLGN具有更高的效率和准确性,可用于突变预测、荧光蛋白优化、VHH抗体设计和Ago蛋白突变等方面。此外,PROTLGN还能预测蛋白质的亚细胞定位。

🔎

延伸解读

从序列到结构:PROTLGN 的差异化思路

现有深度学习蛋白质设计方法多依赖多序列比对或蛋白质语言模型,前者受同源信息质量限制,后者训练成本高且泛化困难。PROTLGN 转而从蛋白质三维结构出发,利用 kNN 图构建残基拓扑关系,并通过等变图神经网络保持旋转平移不变性。这一路线不依赖多序列比对,为同源信息稀缺的蛋白质提供了新的建模范式,也解释了其在跨家族迁移任务中表现突出的原因。

零样本与少样本场景下的实际表现

文章显示,PROTLGN 在缺乏实验数据时仍能达到约 40% 的单点突变成功预测率。在 VHH 抗体设计中,仅用约 30,000 个未标记结构预训练,前 10 个突变体中就有 3 个同时提升结合亲和力与热稳定性。在 GFP 微调后,10 个突变体中 5 个荧光强于野生型,最佳达 2 倍。这些数据说明其价值主要体现在实验数据稀缺的早期筛选阶段。

高阶突变组合与上位效应的识别能力

蛋白质工程中多个有益突变组合常因负上位效应导致功能下降。PROTLGN 在 KmAgo 实验中组合 12 个已知单点突变,筛选 2 至 7 位点的高阶候选体,结果显示 90% 的突变体 DNA 切割活性增强,最佳 7 位点突变体活性达野生型 8 倍,且高阶突变体整体优于低阶。这表明模型不仅能识别单点增益,还能捕捉正向上位效应,对多位点协同改造具有参考意义。

轻量参数与亚细胞定位预测的延伸价值

在与其他自监督模型的对比中,PROTLGN 在蛋白质适应度预测上表现最佳,同时可训练参数最少,意味着训练与微调成本更低,也更适合在少量标记数据上学习。此外,模型还被用于预测蛋白质亚细胞定位,在 9,366 个标记蛋白上训练、2,738 个测试蛋白上评估,准确性显著超越基于序列或同源信息的基线方法,显示其架构具备向更广泛结构生物学任务迁移的潜力。

❓

Q&A

PROTLGN模型的主要功能是什么?

PROTLGN模型能够从蛋白质三维结构中学习并预测有益的氨基酸突变位点,指导蛋白质设计。

PROTLGN在蛋白质设计中有哪些应用?

PROTLGN可用于突变预测、荧光蛋白优化、VHH抗体设计和Ago蛋白突变等方面。

PROTLGN的训练过程是怎样的?

PROTLGN的训练过程包括自监督预训练、等变图卷积层、噪声注入和微调。

PROTLGN的预测准确性如何?

PROTLGN在多种蛋白质的不同生物学功能上进行了广泛验证,显示出40%的单点突变成功预测率。

PROTLGN如何处理蛋白质的空间结构变化?

PROTLGN使用等变GNN作为核心网络层,能够识别并保持蛋白质结构的旋转不变性。

PROTLGN在荧光蛋白设计中的表现如何?

PROTLGN在荧光蛋白设计中表现出良好的迁移能力和预测准确性,能够优化荧光强度。

🏷️

标签

➡️

继续阅读