Anthropic开源Claude编写的GPU优化程序,生物分子模型推理加速4倍

Anthropic开源Claude编写的GPU优化程序,生物分子模型推理加速4倍

💡 原文中文,约3800字,阅读约需9分钟。
📝

内容提要

Anthropic开源了Claude编写的GPU优化代码,在不到四周内将30多个生物分子模型推理平均加速约4倍,精度损失极小。Claude还自主编写了FlashPairformer内核,加速结构预测中的三角注意力操作。优化代码已开源,并联合Adaptyv Bio发起蛋白质设计竞赛。但超大规模分子预测仍会崩溃,实验验证速度成为新瓶颈。

🔎

延伸解读

优化边界:超大规模预测仍会崩溃

Claude的优化在30多个模型上平均加速约4倍,但Anthropic承认,当输入规模膨胀到31000至70000个token的病毒衣壳级别时,预测结构直接崩溃。报告未明确是模型泛化不足还是FlashPairformer内核产生数值误差。这意味着4倍加速并非普适,超大型分子机器预测仍是雷区,用户需警惕“更快得到错误答案”的风险。

与NVIDIA cuEquivariance的差异:自动化集成

NVIDIA早在2025年推出的cuEquivariance库已包含三角注意力和三角乘法的优化内核,某些精度下最高加速5倍。Claude的FlashPairformer并非从零发明新算法,而是将集成过程自动化,并针对每个模型架构做定制调整。其价值在于让30多个模型同时获得优化,降低了手动配置门槛,但底层加速上限仍受限于已有库。

算力门槛降低,实验验证成新瓶颈

优化代码开源后,普通实验室用消费级显卡就能跑以前需多块H100的任务,算力民主化向前一步。但Adaptyv Bio测试了Claude设计的全部1320个蛋白质,Twist Bioscience独立测试1260个,物理合成和实验筛选速度远跟不上计算设计速度。计算变便宜后,湿实验验证成为更硬的瓶颈,可能拖慢整体研发周期。

社区反应与批评:计算分数不等于实际结合

Reddit上有人欢呼,也有人调侃猫娘,但更严肃的批评来自Martin Shkreli,他嘲讽Anthropic此前“15个靶标命中14个”的结果结合亲和力偏低且未针对细胞内蛋白。Anthropic自己也承认,蛋白质结合体不是药物,高亲和力设计只是第一步。计算分数漂亮与实验室真实结合之间仍有巨大鸿沟,读者不宜过度解读加速带来的实际疗效。

Q&A

Claude优化GPU内核后,生物分子模型的推理速度提升了多少?

Claude在不到四周内优化了超过30个开源生物分子模型,平均推理加速约4倍,精度损失极小。如果要求输出结果与优化前完全一致,也能实现接近2倍的加速。

FlashPairformer是什么?它优化了哪些操作?

FlashPairformer是Claude自主编写的GPU内核,专门加速结构预测模型中的三角注意力操作和三角乘法操作。其中三角注意力加速2.7到2.9倍,三角乘法加速1.7到3.2倍,具体倍数取决于模型配置。

为什么优化GPU内核比优化Python代码更难?

优化GPU内核需要理解显卡的物理架构,如显存带宽、寄存器分配、线程束调度等底层细节,而优化Python代码只需理解算法逻辑。一个错误的内存访问模式可能让程序比优化前慢十倍。

Claude的优化在哪些情况下会失效?

当输入规模膨胀到31000到70000个token的病毒衣壳级别时,预测出来的结构会直接崩溃。Anthropic分析认为这可能是模型在该尺度上泛化能力不够,也可能是FlashPairformer内核产生了数值误差,但未给出明确答案。

Anthropic开源了哪些资源?如何获取?

Anthropic将优化后的代码全部开源,放在GitHub上的anthropics/uplifting-biomolecular-modeling仓库中。同时联合Adaptyv Bio发起蛋白质设计竞赛,提供最高100万美元的Claude积分和25万美元的Modal计算积分,以及超过5000个设计的湿实验验证。

计算加速后,生物分子研究面临的新瓶颈是什么?

新的瓶颈是实验验证的速度。Adaptyv Bio测试了Claude设计的全部1320个蛋白质,Twist Bioscience独立测试了1260个,但物理合成和实验筛选的速度远远跟不上计算设计的速度。验证需要几周甚至几个月,而设计可能只需一个下午。

🏷️

标签

➡️

继续阅读