入选ACL2024主会 | InstructProtein:利用知识指令对齐蛋白质语言与人类语言

💡 原文中文,约5400字,阅读约需13分钟。
📝

内容提要

浙江大学的研究团队提出了一种名为InstructProtein的模型,通过知识指令对齐蛋白质语言和人类语言,实现了双向生成能力。该模型在蛋白质序列理解和设计方面优于现有的大语言模型。研究人员使用UniProtKB构建了蛋白质知识图谱,并通过指令数据集进行模型微调。InstructProtein能够准确预测蛋白质的功能和位置,对蛋白质工程和药物发现具有重要意义。该研究为蛋白质大模型的发展提供了新的思路和方法。

🔎

延伸解读

知识指令与知识因果建模:InstructProtein 的方法核心

InstructProtein 的核心创新在于利用知识图谱构建指令数据集,并通过知识因果建模(KCM)表示蛋白质知识的因果链。KCM 将多个三元组组织在有向无环图中,边表示因果关系,从微观序列特征延伸到宏观生物功能。这种方法不依赖大语言模型对蛋白质语言的理解,避免了模型偏误或幻觉引入虚假信息,从而生成平衡且多样化的指令数据,为模型微调提供高质量数据支持。

性能优势与关键发现:为何优于现有模型

在蛋白质序列理解任务中,InstructProtein 在 zero-shot 设置下超越了所有基线模型,包括 OPT、LLaMA、Alpaca 等通用 LLM 以及 Galactica、BioMedGPT 等生物领域模型。关键发现是:使用蛋白质和自然语言共存的语料库进行训练能提升 LLM 对蛋白质语言的理解;高质量指令数据能显著提升 zero-shot 性能。此外,通用 LLM 在亚细胞定位任务中存在严重偏差,而 InstructProtein 避免了这一问题。

蛋白质设计能力:从指令到功能蛋白

InstructProtein 展示了双向生成能力,不仅能理解蛋白质序列,还能根据功能指令设计蛋白质。在指令-蛋白质配对任务中,它显著超越所有基线模型。研究人员进一步使用 InstructProtein 设计 heme 结合蛋白,生成的蛋白质展示了显著的结合亲和力,验证了其在实际蛋白质设计中的有效性。这为蛋白质工程和药物发现提供了新工具,表明模型能够跟随功能相关指令进行从头设计。

局限与未来方向:定量任务与更广指令

尽管 InstructProtein 在蛋白质序列理解和设计上表现优异,但当前模型仍存在处理数值任务的挑战,这在需要定量分析的蛋白质建模领域尤为重要,包括 3D 结构确立、稳定性评估和功能评价。未来研究将拓展至包括定量描述在内的更广泛指令范围,增强模型提供定量输出的能力,从而推进蛋白质语言和人类语言的整合,并拓展其在不同应用场景下的实用性。

❓

Q&A

InstructProtein模型的主要功能是什么?

InstructProtein模型通过知识指令对齐蛋白质语言与人类语言,能够准确预测蛋白质的功能和位置。

InstructProtein是如何构建的?

InstructProtein通过预训练和微调两步训练方法,利用来自UniRef100的蛋白质序列和PubMed摘要的句子构建指令数据集。

InstructProtein在蛋白质序列理解方面的表现如何?

InstructProtein在蛋白质序列理解任务中表现优异,超越了所有基线模型,尤其在功能预测和位置预测上。

该研究对蛋白质工程和药物发现有什么意义?

InstructProtein的准确预测能力对蛋白质工程和药物发现具有重要意义,能够推动相关研究的进展。

InstructProtein如何解决现有模型的不足?

InstructProtein通过知识指令填补了人类语言与蛋白质语言之间的空白,提升了模型在蛋白质语言理解方面的能力。

未来对InstructProtein的研究方向是什么?

未来研究将拓展至包括定量描述在内的更广泛指令范围,增强模型的实用性。

🏷️

标签

➡️

继续阅读