内容提要
康奈尔大学团队开发了多智能体神经符号框架AIMe,结合化学规则与神经网络模拟分子碎裂,为PubChem中超过1亿个小分子生成了8亿多张预测质谱,构建了MS²KOSMOS,使可搜索质谱空间扩大约3个数量级。该模型在CASMI等测试中表现领先,并应用于小鼠代谢物及GNPS数据库注释,但结果仍属Level 3注释,需实验验证。
延伸解读
从“匹配”到“推理”:解析逻辑的转变
传统未知物解析依赖实验谱库直接匹配,但谱库覆盖不足1%,导致超过80%的代谢物无法鉴定。AIMe将已知小分子空间转化为可搜索的预测质谱空间,并借助碎裂路径推理缩小候选范围。这使未知质谱不再只有“匹配上”或“匹配不上”两种结果,而能成为提出结构假设的起点,为后续实验验证提供方向。
神经符号框架的协同机制
AIMe的核心DeepMS²Reasoner并非直接学习“分子对应哪些峰”,而是模拟碎裂过程动态构建有向无环图。神经网络ALEA判断碎裂路径概率,化学规则则约束哪些路径可行,并合并相同碎片、剪枝低概率分支。这种神经符号结合既保留了化学合理性,又避免穷举全部路径,使模型能处理多步断键、开环和重排等复杂碎裂。
性能提升与检索规模
在NIST 2020测试集上,DeepMS²Reasoner预测谱与实验谱的平均余弦相似度达0.83,高于对比模型的0.61—0.75。在CASMI全异构体测试中,Top-1准确率为35.6%,比第二名FraGNNet高出10个百分点以上。MS²KOSMOS为超过1亿种小分子生成8亿多张预测谱,使可搜索质谱空间扩大约3个数量级,支持亿级分子中的快速检索。
应用边界与验证要求
AIMe已用于小鼠代谢组111个未鉴定信号和GNPS数据库714万余张共识谱的注释,约三分之一获得候选。但结果仍属Level 3注释,MS²本身通常不足以完成最终结构确认。随着分子量增加,碎裂路径增多而训练数据覆盖不足,预测性能会下降。因此,AIMe的作用是缩小候选范围、提出假设并解释碎裂依据,最终确认仍需保留时间、NMR或标准品等实验验证。
Q&A
AIMe是什么?它主要解决代谢组学中的什么问题?
AIMe(AI Molecule Explorer)是康奈尔大学开发的多智能体神经符号AI框架,用于小分子质谱解析。它主要解决传统实验参考谱库覆盖不足(已知化合物不足1%)、超过80%代谢物无法鉴定的问题,通过预测质谱空间来扩大可搜索范围。
AIMe的核心模型DeepMS²Reasoner是如何预测质谱的?
DeepMS²Reasoner将化学规则、碎裂路径推理与神经网络结合。它从前体分子开始模拟碎裂过程,动态构建有向无环图(DAG),节点代表碎片,边代表碎裂动作。神经网络组件ALEA(基于Graphormer)判断碎裂路径概率,化学规则限制可行路径,最终由碎片累积停止概率得到质谱峰强度。
MS²KOSMOS是什么?它包含多少数据?
MS²KOSMOS是AIMe构建的可搜索预测质谱库,为PubChem中超过1亿种小分子(m/z<1000的有机化合物)在正负离子模式和4种碰撞能量下生成超过8亿张预测MS²谱,使可搜索质谱空间较现有实验谱库扩大约3个数量级。
AIMe在质谱预测和结构检索任务上的性能如何?
在NIST 2020测试集上,预测谱与实验谱平均余弦相似度0.83,中位数0.89;在CASMI 2022和MassSpecGym上平均余弦相似度分别为0.67和0.59,均为参评模型最高。在CASMI全异构体检索中,Top-1、Top-10、Top-50准确率分别为35.6%、64.4%、79.8%,Top-1和Top-10比第二名FraGNNet高出10个百分点以上。
AIMe在真实样本和数据库注释中有哪些应用案例?
AIMe用于小鼠肠道微生物相关代谢物解析:111个未鉴定信号中约三分之一找到高度相似匹配,并成功解析出罕见大环精胺衍生物,经化学合成验证。在GNPS数据库714万余张共识质谱中,以余弦相似度0.7为阈值,约269万张获得候选注释,阈值0.8时仍新增约127万高相似度注释。
AIMe的注释结果属于什么级别?有哪些局限性?
AIMe的结果主要属于Level 3注释,因为MS²本身通常不足以完成最终结构确认,缺少保留时间、NMR或标准品等独立证据。局限性包括:随着分子量增加,碎裂路径增多且训练数据中大分子覆盖不足,预测性能下降;最终确认仍需实验验证。