智源研究院提出 Triton-TLE 分层语言扩展,并通过 FlagTree 编译优化实现百倍级自动调优加速

智源研究院提出 Triton-TLE 分层语言扩展,并通过 FlagTree 编译优化实现百倍级自动调优加速

💡 原文中文,约5500字,阅读约需14分钟。
📝

内容提要

从 TLE-Lite 的轻量语义提示,到 TLE-Struct 的架构感知控制,再到 TLE-Raw 的原生能力透传,结合各种编译优化技术,FlagTree 正尝试在 Triton 易用性、跨平台迁移和极致性能之间建立一套更具弹性的分层体系,并让新硬件能力更快转化为模型和算子的实际性能。实际模型推理中,同一种算子可能对应大量不同...

🏷️

标签

➡️

继续阅读