无实验数据指导蛋白质定向进化,上海交大洪亮课题组发表微环境感知图神经网络 ProtLGN
内容提要
上海交通大学洪亮课题组研发了一种名为PROTLGN的微环境感知图神经网络,能够从蛋白质三维结构中学习并预测有益的氨基酸突变位点,指导蛋白质设计。PROTLGN具有更高的效率和准确性,可用于突变预测、荧光蛋白优化、VHH抗体设计和Ago蛋白突变等方面。此外,PROTLGN还能预测蛋白质的亚细胞定位。
延伸解读
从序列到结构:PROTLGN 的差异化思路
现有深度学习蛋白质设计方法多依赖多序列比对或蛋白质语言模型,前者受同源信息质量限制,后者训练成本高且泛化困难。PROTLGN 转而从蛋白质三维结构出发,利用 kNN 图构建残基拓扑关系,并通过等变图神经网络保持旋转平移不变性。这一路线不依赖多序列比对,为同源信息稀缺的蛋白质提供了新的建模范式,也解释了其在跨家族迁移任务中表现突出的原因。
零样本与少样本场景下的实际表现
文章显示,PROTLGN 在缺乏实验数据时仍能达到约 40% 的单点突变成功预测率。在 VHH 抗体设计中,仅用约 30,000 个未标记结构预训练,前 10 个突变体中就有 3 个同时提升结合亲和力与热稳定性。在 GFP 微调后,10 个突变体中 5 个荧光强于野生型,最佳达 2 倍。这些数据说明其价值主要体现在实验数据稀缺的早期筛选阶段。
高阶突变组合与上位效应的识别能力
蛋白质工程中多个有益突变组合常因负上位效应导致功能下降。PROTLGN 在 KmAgo 实验中组合 12 个已知单点突变,筛选 2 至 7 位点的高阶候选体,结果显示 90% 的突变体 DNA 切割活性增强,最佳 7 位点突变体活性达野生型 8 倍,且高阶突变体整体优于低阶。这表明模型不仅能识别单点增益,还能捕捉正向上位效应,对多位点协同改造具有参考意义。
轻量参数与亚细胞定位预测的延伸价值
在与其他自监督模型的对比中,PROTLGN 在蛋白质适应度预测上表现最佳,同时可训练参数最少,意味着训练与微调成本更低,也更适合在少量标记数据上学习。此外,模型还被用于预测蛋白质亚细胞定位,在 9,366 个标记蛋白上训练、2,738 个测试蛋白上评估,准确性显著超越基于序列或同源信息的基线方法,显示其架构具备向更广泛结构生物学任务迁移的潜力。
Q&A
PROTLGN模型的主要功能是什么?
PROTLGN模型能够从蛋白质三维结构中学习并预测有益的氨基酸突变位点,指导蛋白质设计。
PROTLGN在蛋白质设计中有哪些应用?
PROTLGN可用于突变预测、荧光蛋白优化、VHH抗体设计和Ago蛋白突变等方面。
PROTLGN的训练过程是怎样的?
PROTLGN的训练过程包括自监督预训练、等变图卷积层、噪声注入和微调。
PROTLGN的预测准确性如何?
PROTLGN在多种蛋白质的不同生物学功能上进行了广泛验证,显示出40%的单点突变成功预测率。
PROTLGN如何处理蛋白质的空间结构变化?
PROTLGN使用等变GNN作为核心网络层,能够识别并保持蛋白质结构的旋转不变性。
PROTLGN在荧光蛋白设计中的表现如何?
PROTLGN在荧光蛋白设计中表现出良好的迁移能力和预测准确性,能够优化荧光强度。