首个面向LLM的蛋白突变排序标准化评测基准!哈佛大学团队提出PG-LLM,一次性测评13款主流模型+95种专业模型

首个面向LLM的蛋白突变排序标准化评测基准!哈佛大学团队提出PG-LLM,一次性测评13款主流模型+95种专业模型

💡 原文中文,约5100字,阅读约需13分钟。
📝

内容提要

哈佛大学等团队提出PG-LLM基准测试,首次统一评估13款通用语言模型与95种专业蛋白质预测工具。结果显示,Claude Opus 5等通用模型在蛋白突变排序上超越半数专业工具,但落后于顶尖模型VenusREM。研究揭示通用模型随推理资源增加性能提升有限,且对候选集规模敏感,为蛋白质工程工具选择与融合提供新思路。

🔎

延伸解读

评测设计的关键细节

PG-LLM基准测试在候选集构建上采用分层抽样,确保低、中、高功能突变均衡覆盖,并设置三套独立子集取平均,以减少随机误差。候选集规模设为10、50、100,主要结论基于50。评测时通用模型仅输入序列和实验描述,而专业模型可使用MSA或结构信息,这种不对等条件凸显了通用模型的挑战性。

通用模型的性能边界

Claude Opus 5在通用模型中排名第一,但斯皮尔曼相关系数仅0.406,超过半数专业工具,却远低于VenusREM的0.523。增加推理计算资源虽能小幅提升性能,但增益有限;扩大候选集规模反而导致性能下降,而专业模型几乎不受影响。这表明通用模型在蛋白突变排序上存在明显天花板。

融合使用的潜在方向

研究指出通用模型与专业模型各有优劣,通用模型擅长理解复杂实验要求,专业模型擅长利用进化信息精准打分。作者建议采用人机回环方式,让通用模型负责解读任务,专业模型负责具体预测,可能实现更优效果。这为蛋白质工程工具选择提供了新思路。

Q&A

PG-LLM基准测试是什么?它有什么意义?

PG-LLM是哈佛大学等团队提出的首个面向通用语言模型的蛋白突变排序标准化评测基准,基于ProteinGym数据集构建,首次统一评估了13款通用语言模型和95种专业蛋白质预测工具。它明确了通用语言模型在蛋白突变筛选中的实用价值,并划清了其与专业模型的性能边界,为蛋白质工程工具选择和融合提供了新思路。

PG-LLM基准测试是如何设计的?

PG-LLM基于ProteinGym v1.3数据集,覆盖186种蛋白质、217组实验数据。采用分层抽样构建候选突变集,每组实验构建三套独立候选子集,设置10、50、100三种规模,主要基于50规模得出结论。评估时,通用语言模型仅输入蛋白序列和实验描述,不提供MSA或结构信息;专业模型可使用原生输入。得分采用斯皮尔曼等级相关系数。

在PG-LLM基准测试中,通用语言模型和专业模型的表现如何?

Claude Opus 5在通用语言模型中排名第一(ρ=0.406),GPT-5.6 Sol紧随其后(ρ=0.402)。Claude Opus 5超过了95种专业方法中的49种,但大幅落后于顶尖专业模型VenusREM(ρ=0.523)。

增加推理计算资源对通用语言模型的性能有何影响?

增加推理计算资源(如更长的思考时间)可以提升GPT、Claude和Gemini等模型的排名准确率,但性能增益会逐渐收束,始终无法追上专用蛋白预测模型。

候选集规模对通用语言模型和专业模型有何不同影响?

增加候选集规模(从10到100)会导致通用语言模型性能下降,如GPT-5.6 Sol得分从0.423降至0.375;而专业模型如ESM2和VenusREM几乎不受影响。

通用语言模型和专业模型在进化对比信息(MSA深度)上的表现有何差异?

纯序列专业工具在进化对比信息充足的蛋白上表现更好,性能随MSA深度增加而提升(从低深度0.309到高深度0.411);而通用语言模型的准确率几乎不受对比深度影响(低、中、高深度性能分别为0.313、0.301、0.311)。

训练数据污染是否影响通用语言模型的预测准确率?

研究显示,能认出原始文献的推理过程与没认出的相比,排名准确度并无稳定提升,甚至部分模型认出后的分数更低,表明训练数据污染对预测准确率没有明显影响。

VenusREM模型是什么?它有什么特点?

VenusREM是天鹜科技AI Lab技术科学家谭扬牵头研发的检索增强型开源蛋白语言模型,专门用于零样本单位点突变效应预测。它联合利用氨基酸序列、三维结构和同源进化信息,通过解耦多头交叉注意力建模序列上下文、局部结构特征和残基间相对位置关系,并引入检索增强模块提取进化保守性。在PG-LLM基准测试中表现最佳(ρ=0.523)。

通用语言模型和专业模型如何融合使用?

研究提出潜在融合方案:用通用语言模型负责理解复杂的实验要求,实现人机回环,结合垂类模型利用进化信息或结构信息进行精准打分,可能实现更优效果。

🏷️

标签

➡️

继续阅读