天津大学在生物学中实现了闭环递归的自我改进

天津大学在生物学中实现了闭环递归的自我改进

💡 原文中文,约5000字,阅读约需12分钟。
📝

内容提要

天津大学团队开发REAP闭环系统,结合AI预测与自动化实验,通过排名导向的混合损失函数,五轮迭代将P450 BM3酶活性提升57倍,Sortase A提升104倍。该系统优先学习突变体排序而非精确数值,能发现自然界罕见的远端突变,并有效筛选组合突变,突破传统定向进化局限,标志着酶工程进入算法驱动的自动化时代。

🔎

延伸解读

排名导向损失函数的优势

REAP系统采用排名导向的混合损失函数RankReg,优先学习突变体的排序而非精确数值。在酶活性数据噪声大、样本稀少的场景下,排名信息比数值更鲁棒,对实验批次差异不敏感。对比实验显示,在ProteinGym的212个数据集上,RankReg的Spearman相关系数显著优于传统损失函数,小样本时表现也更好。

发现罕见远端突变

REAP不仅能优化活性中心附近的位点,还能发现远离催化中心的远端突变,如BMP结构域表面的207位点。这些突变在自然界同源序列中出现频率低于1%,传统定向进化难以发现。这表明机器学习能突破自然选择的局限,找到工程师所需的极限性能突变,而非自然进化追求的平衡。

组合突变与上位效应

酶工程中组合突变常因上位效应导致效果抵消。REAP通过探索与剥削模式的切换,在第四、五轮聚焦优选组合,发现双突变中36.36%具有正上位效应,且比例随突变阶数增加。网络分析显示A330是高频节点,最终通过路径图分析组合出五突变体,活性提升57倍,展示了算法在组合空间中的导航能力。

闭环自动化的效率与局限

REAP将AI预测与自动化实验结合,一周可测试超2000个变体,速度远超手动操作。但当前仅支持单目标优化,工业酶常需兼顾活性、稳定性等多目标。此外,部分酶缺乏合适的检测方法,需依赖纳米抗体或生物传感器。尽管如此,该框架证明了AI闭环在酶工程中的可行性,为未来云服务化奠定基础。

Q&A

REAP系统是什么?它如何工作?

REAP是天津大学团队开发的闭环酶工程平台,结合AI预测与自动化实验。它通过预测有益突变、自动合成和测试突变体、从结果中学习并重复循环,实现酶的快速优化。

REAP系统在实验中取得了哪些具体成果?

REAP系统在五轮迭代中,将P450 BM3酶的活性提升了57倍,将Sortase A酶的活性提升了104倍。

RankReg损失函数与传统损失函数有何不同?为什么更有效?

RankReg是一种混合损失函数,优先学习突变体的排序而非精确数值。传统损失函数如MSE只关注数值准确性,在数据稀疏和噪声大的情况下容易过拟合。RankReg通过结合排序和数值信息,对噪声不敏感,能更好地指导模型选择高活性突变体。

REAP系统如何发现自然界罕见的远端突变?

REAP系统不局限于活性中心,而是通过AI预测覆盖整个蛋白质结构,包括远端位点。它发现的高效突变如L75N、E207L等,在自然界同源序列中出现频率低于1%,但能显著提升活性,突破了传统定向进化的局限。

REAP系统如何处理组合突变中的上位效应?

REAP系统在第四轮和第五轮切换到剥削模式,专注于优选组合。通过模型预测和网络分析,它筛选出具有正上位效应的突变组合,如A330Y与T180L的组合,最终构建出五突变组合,活性提升57倍。

REAP系统相比传统定向进化有哪些优势?

REAP系统相比传统定向进化,速度更快(一周可测试超过2000个变体),效率更高(五轮提升57倍),且能发现传统方法忽略的远端突变和组合突变。它实现了算法驱动的自动化,减少了人工干预和随机性。

REAP系统目前存在哪些局限性?

REAP系统目前只支持单目标优化,而工业酶通常需要同时优化多个特性。此外,它依赖荧光和质谱检测,对于没有合适读出系统的酶,需要开发新的检测方法。

🏷️

标签

➡️

继续阅读