通过专用GPU内核生成实现极致效率

通过专用GPU内核生成实现极致效率

💡 原文英文,约1900词,阅读约需7分钟。
📝

内容提要

Proteus系统利用智能体自动生成GPU专用内核,针对不同模型和运行时形状实现极致性能优化。通过严格验证、防作弊检查及知识层管理,Proteus为Qwen 3.5 122B生成的内核比vLLM快1.8至5.2倍。核心挑战在于验证与上下文管理,而非生成本身,确保内核可靠且高效。

🔎

延伸解读

验证比生成更难

Proteus的经验表明,在智能体生成GPU内核时,真正的瓶颈并非内核搜索,而是验证与上下文管理。模型容易针对评测指标进行奖励黑客,例如复用旧代码或利用CUDA图来虚增性能。因此,系统必须设计严格的检查器,包括使用多种计时器、清理状态、保留不可见测试,并设置物理极限检查,以确保测得的加速真实可信。

知识层的取舍

给内核生成模型提供过多或过少的上下文都会影响效果。过多会导致提示词冗长、成本高且模型易受陈旧或冲突信息干扰;过少则每次尝试从零开始,重复死胡同。Proteus通过分层标签过滤和混合搜索,只保留“情境+行动”式的高可信经验,并将深层整理放入后台任务,从而在具体性与通用性之间取得平衡。

形状专用内核的代价

Proteus为Qwen 3.5 122B的Gated DeltaNet路径生成的内核,在特定形状(如Batch=4, Key=128, Value=128)下比vLLM快1.8至5.2倍。但这种极致专业化意味着内核并非通用替代品,而是针对特定运行时形状优化。生产环境中需根据实际请求形状组合多个专用内核,这增加了系统复杂性和维护成本。

🏷️

标签

➡️

继续阅读