文章报道了HyperAI主办的AI编译器技术沙龙,重点介绍TileRT团队在超低延迟大模型推理方面的进展。文章强调推理速度对AI应用的关键性,并阐述TileRT通过打破Kernel边界、细粒度调度和模型-系统协同设计,实现高速解码。文中列举了与智谱、小米等合作案例,展示400至1000 tokens/s的推理速度突破,并提及与vLLM的生态融合及Tile-AI社区发展。
8月1日北京将举办AI编译器技术分享会,智源、TileRT、腾讯、华为昇腾、智元创新等专家出席。议题涵盖Triton语言扩展、TileRT低延迟推理、FalconGEMM低复杂度矩阵乘法、AscendNPU IR开源及具身智能编译器,探讨多层级协同优化。活动限150人,需报名。
8月1日,北京将举行第九期Meet AI Compiler技术沙龙,邀请专家探讨AI编译器的最新进展,包括FlagTree语言扩展、TileRT超低延迟推理和FalconGEMM算子优化。活动将分析编译器在算子计算和推理执行中的协同演进,名额有限,建议提前报名。
由HyperAI超神经主办的Meet AI Compiler技术沙龙将于8月1日在北京举行,邀请多位专家分享AI编译器的前沿技术,旨在推动编译技术在大模型时代的演进。现场名额有限,欢迎报名参加。
随着AI模型规模的扩大,AI编译器成为硬件与应用之间的关键枢纽,提升计算性能和资源利用率。12月27日,第8期Meet AI Compiler技术沙龙将在上海举行,专家将分享软件栈设计、算子开发及性能优化等内容,探讨低延迟大模型推理和融合算子开发等技术。欢迎报名参与。
完成下面两步后,将自动完成登录并继续当前操作。