腾讯在AI编译器技术沙龙上介绍了FalconGEMM,一种基于低复杂度矩阵乘法的优化方案。它利用Strassen和AlphaTensor算法,通过LCMA框架统一描述,结合QDSL、算子融合和调度优化,在NVIDIA H20上超越cuBLAS,峰值性能提升10%-16%,并保持数值精度。该工作展示了从算法复杂度入手突破硬件性能瓶颈的新思路。
完成下面两步后,将自动完成登录并继续当前操作。