入选ACL2024主会 | InstructProtein:利用知识指令对齐蛋白质语言与人类语言
内容提要
浙江大学的研究团队提出了一种名为InstructProtein的模型,通过知识指令对齐蛋白质语言和人类语言,实现了双向生成能力。该模型在蛋白质序列理解和设计方面优于现有的大语言模型。研究人员使用UniProtKB构建了蛋白质知识图谱,并通过指令数据集进行模型微调。InstructProtein能够准确预测蛋白质的功能和位置,对蛋白质工程和药物发现具有重要意义。该研究为蛋白质大模型的发展提供了新的思路和方法。
延伸解读
知识指令与知识因果建模:InstructProtein 的方法核心
InstructProtein 的核心创新在于利用知识图谱构建指令数据集,并通过知识因果建模(KCM)表示蛋白质知识的因果链。KCM 将多个三元组组织在有向无环图中,边表示因果关系,从微观序列特征延伸到宏观生物功能。这种方法不依赖大语言模型对蛋白质语言的理解,避免了模型偏误或幻觉引入虚假信息,从而生成平衡且多样化的指令数据,为模型微调提供高质量数据支持。
性能优势与关键发现:为何优于现有模型
在蛋白质序列理解任务中,InstructProtein 在 zero-shot 设置下超越了所有基线模型,包括 OPT、LLaMA、Alpaca 等通用 LLM 以及 Galactica、BioMedGPT 等生物领域模型。关键发现是:使用蛋白质和自然语言共存的语料库进行训练能提升 LLM 对蛋白质语言的理解;高质量指令数据能显著提升 zero-shot 性能。此外,通用 LLM 在亚细胞定位任务中存在严重偏差,而 InstructProtein 避免了这一问题。
蛋白质设计能力:从指令到功能蛋白
InstructProtein 展示了双向生成能力,不仅能理解蛋白质序列,还能根据功能指令设计蛋白质。在指令-蛋白质配对任务中,它显著超越所有基线模型。研究人员进一步使用 InstructProtein 设计 heme 结合蛋白,生成的蛋白质展示了显著的结合亲和力,验证了其在实际蛋白质设计中的有效性。这为蛋白质工程和药物发现提供了新工具,表明模型能够跟随功能相关指令进行从头设计。
局限与未来方向:定量任务与更广指令
尽管 InstructProtein 在蛋白质序列理解和设计上表现优异,但当前模型仍存在处理数值任务的挑战,这在需要定量分析的蛋白质建模领域尤为重要,包括 3D 结构确立、稳定性评估和功能评价。未来研究将拓展至包括定量描述在内的更广泛指令范围,增强模型提供定量输出的能力,从而推进蛋白质语言和人类语言的整合,并拓展其在不同应用场景下的实用性。
Q&A
InstructProtein模型的主要功能是什么?
InstructProtein模型通过知识指令对齐蛋白质语言与人类语言,能够准确预测蛋白质的功能和位置。
InstructProtein是如何构建的?
InstructProtein通过预训练和微调两步训练方法,利用来自UniRef100的蛋白质序列和PubMed摘要的句子构建指令数据集。
InstructProtein在蛋白质序列理解方面的表现如何?
InstructProtein在蛋白质序列理解任务中表现优异,超越了所有基线模型,尤其在功能预测和位置预测上。
该研究对蛋白质工程和药物发现有什么意义?
InstructProtein的准确预测能力对蛋白质工程和药物发现具有重要意义,能够推动相关研究的进展。
InstructProtein如何解决现有模型的不足?
InstructProtein通过知识指令填补了人类语言与蛋白质语言之间的空白,提升了模型在蛋白质语言理解方面的能力。
未来对InstructProtein的研究方向是什么?
未来研究将拓展至包括定量描述在内的更广泛指令范围,增强模型的实用性。