内容提要
8月1日北京将举办AI编译器技术分享会,智源、TileRT、腾讯、华为昇腾、智元创新等专家出席。议题涵盖Triton语言扩展、TileRT低延迟推理、FalconGEMM低复杂度矩阵乘法、AscendNPU IR开源及具身智能编译器,探讨多层级协同优化。活动限150人,需报名。
延伸解读
多层级协同优化成为AI编译新趋势
本次分享会聚焦AI编译的多层级协同优化,议题覆盖从语言扩展(Triton-TLE)、编译后端(Tile IR)、算子优化(FalconGEMM)到硬件接入(AscendNPU IR)和场景应用(具身智能)。这反映出AI编译器正从单一环节优化转向全栈协同设计,以应对大模型带来的性能挑战。
低复杂度矩阵乘法:突破硬件性能天花板
FalconGEMM项目探索低复杂度矩阵乘法(如Strassen、AlphaTensor),通过减少乘法次数来突破传统O(N³)算法的性能极限。尽管面临访存膨胀、算法选择和跨平台移植等工程难题,但该项目通过编译器自动代码生成和性能模型决策,已在多种平台上超越官方库,为算子优化提供了新思路。
具身智能编译器:应对多模型多框架部署挑战
面向具身智能的通用AI编译器需处理多模型、多框架、多阶段pipeline带来的工程复杂度。通过动态trace捕获完整算法流程,并组织为可编译的DAG模板,配合分组编译和统一runtime,可支持不同后端,在保持统一交付的同时发挥各芯片优势,解决端侧部署和跨框架适配问题。
Q&A
Meet AI Compiler 第9期活动的时间和地点是什么?
活动于8月1日(周六)13:30-18:10在北京市海淀区中关村创业大街12号楼五层多功能厅举行。
如何报名参加这次AI编译器技术分享会?
需要通过活动行平台预约报名,活动仅开放150个到场名额,建议尽早报名。
本次AI编译器技术分享会邀请了哪些机构或团队?
邀请了智源研究院、TileRT团队、腾讯、华为昇腾、智元创新等机构的专家。
FlagTree分享的主要内容是什么?
FlagTree分享分为三部分:Triton-TLE语言扩展、Tile IR后端集成、以及layout优化和指令重排等编译优化技术,旨在提升Triton算子的性能。
TileRT如何实现超低延迟的大模型推理?
TileRT通过AI编译器、Runtime架构演进和模型-系统协同设计,重构底层计算调度,以GLM-5为例,使万亿参数模型在单batch推理突破1000 TPS。
FalconGEMM项目解决了什么问题?
FalconGEMM解决了低复杂度矩阵乘法(LCMA)在实际应用中的三大工程难题:访存膨胀、算法选择和跨平台移植,通过编译器自动代码生成、Group并行融合和基于性能模型的算法决策,将LCMA从理论带入生产,并在多种平台上超越官方库。
AscendNPU IR开源的意义是什么?
AscendNPU IR作为昇腾面向三方编程框架的MLIR接入层,全面开源后支持多语言接入昇腾,提供灵活对接、完备表达和昇腾亲和编译优化能力,帮助多个前端DSL提升昇腾算子性能。
面向具身智能的通用AI编译器解决了哪些部署挑战?
该编译器解决了具身智能模型部署中的多模型、多框架、多阶段pipeline带来的工程复杂度与维护成本问题,通过动态trace捕获完整算法流程,并组织为可编译的DAG模板,支持分组编译和统一runtime架构,适配不同后端。