学术分享|无惧数据匮乏!上海交大博士后周子宜详解蛋白质语言模型的小样本学习方法 FSFP...

💡 原文中文,约2800字,阅读约需7分钟。
📝

内容提要

上海交通大学研究团队开发了一种小样本学习方法,能够提升蛋白质突变效果预测性能。该方法通过元学习构建辅助任务并训练蛋白质语言模型,成功将其转移到目标任务上。研究成果将在线上直播中分享。

🔎

延伸解读

小样本学习如何降低蛋白质工程的数据门槛

传统蛋白质语言模型微调通常依赖大量湿实验数据,而FSFP方法仅需数十个训练样本即可显著提升突变效果预测性能。这意味着实验室在数据有限的情况下,也能借助预训练模型开展定向进化,减少对高通量筛选的依赖,从而降低时间和成本。

FSFP的三阶段设计:从元学习到迁移

FSFP包含构建辅助任务、在辅助任务上元训练PLMs、以及通过LTR将模型迁移到目标任务三个阶段。其中ListMLE损失用于学习突变适应度的排序,在元训练和迁移阶段均被采用。这种设计使模型能利用辅助任务中的通用排序知识,再适配到具体目标蛋白。

评估表现与实际应用验证

在ProteinGym基准的评估中,FSFP训练后的PLMs在平均性能和外推性能上均优于其他基线,Spearman相关性更优。该方法还成功应用于Phi29 DNA聚合酶的工程改造,显著提升了阳性率,表明其不仅停留在基准测试,也具备实际蛋白质工程的应用潜力。

直播分享与AI辅助定向进化的讨论

本次「Meet AI4S」直播将围绕PLM基本原理及其在蛋白质工程中的应用展开,并探讨AI辅助下定向进化的新思路。对于关注AI for Science的研究者,可借此了解小样本学习如何与蛋白质语言模型结合,以及该方法在真实实验场景中的落地考量。

Q&A

什么是蛋白质语言模型的小样本学习方法?

蛋白质语言模型的小样本学习方法是一种通过元学习构建辅助任务,训练蛋白质语言模型,从而在使用极少数实验数据的情况下提升蛋白质突变效果预测性能的方法。

FSFP方法的三个阶段是什么?

FSFP方法包含三个阶段:构建辅助任务、在辅助任务上训练PLMs、将PLMs转移到目标任务。

FSFP方法在性能评估中表现如何?

FSFP方法在平均性能和外推性能评估中均优于其他基线,成功应用于Phi29 DNA聚合酶的工程改造,显著提升了阳性率。

预训练蛋白质语言模型的优势是什么?

预训练蛋白质语言模型能够无监督学习氨基酸序列的分布特征,揭示蛋白质序列与功能之间的隐含关系,显示出巨大的潜力。

周子宜博士将在直播中分享什么内容?

周子宜博士将在直播中分享蛋白质语言模型的小样本学习方法,探讨AI辅助下的定向进化新思路。

上海交通大学洪亮课题组的研究方向是什么?

上海交通大学洪亮课题组的研究方向主要为AI蛋白和药物设计、分子生物物理,包括蛋白质定向改造和酶工程定向进化等。

🏷️

标签

➡️

继续阅读