速度即智能!TileRT 团队马凌霄详解:超低延迟大模型推理的计算探索与协同设计

速度即智能!TileRT 团队马凌霄详解:超低延迟大模型推理的计算探索与协同设计

💡 原文中文,约6300字,阅读约需15分钟。
📝

内容提要

文章报道了HyperAI主办的AI编译器技术沙龙,重点介绍TileRT团队在超低延迟大模型推理方面的进展。文章强调推理速度对AI应用的关键性,并阐述TileRT通过打破Kernel边界、细粒度调度和模型-系统协同设计,实现高速解码。文中列举了与智谱、小米等合作案例,展示400至1000 tokens/s的推理速度突破,并提及与vLLM的生态融合及Tile-AI社区发展。

🔎

延伸解读

速度为何成为智能的关键

文章指出,随着模型能力增强,模型将更多参与自动化工作,如AI工厂、量化决策等,此时输出对象是模型本身,速度直接决定生产效率。Test-Time Scaling(TTS)是增强模型效能的主要途径,在相同时间窗口内,更高推理速度能产生更多思考token,实现更好智能。例如,50 token/s下10秒仅产生500 token思考,而1000 token/s可产生10000 token。此外,长链思维或agent执行是串行的,无法通过batch并行加速,只能依赖极致推理速度。

打破Kernel边界:TileRT的优化思路

传统框架按Kernel-by-Kernel方式执行,Kernel边界限制了计算、访存和通信的overlap。TileRT将执行拆解到更细粒度的Tile级任务,跨越Kernel边界重新编排,使后续依赖的计算更早开始,形成更紧密的流水。这并非简单融合Kernel,而是打破调度空间限制,获得更多overlap。例如,与智谱合作时,将Sparse Attention拆分为异构Worker,由一张GPU负责索引和路由,其余七张负责计算,减少重复计算和同步等待,实现400 tokens/s生产级速度。

模型与系统协同设计的实践案例

文章展示了与小米MiMo团队的协同设计:对MoE Expert进行FP4 QAT量化,降低访存压力,同时采用DFlash投机解码,一次前向生成多个候选token,减少串行开销。最终在通用8-GPU节点上实现1T模型超1000 tokens/s,打破全球记录,且未依赖专用芯片。这表明当系统性能逼近硬件上限时,需模型结构、编译系统与硬件执行方式共同演进。此外,与vLLM的共存式架构通过PD分离和公开Connector接口,复用vLLM生态,延迟敏感请求路由到TileRT,常规请求由vLLM处理,降低工程成本。

Q&A

为什么说推理速度是AI应用的核心竞争力?

随着模型能力增强,模型将参与更多自动化工作,如AI工厂、量化决策、实时风控等,此时模型的输出对象是模型本身,形成自动化工作流。模型运行越快,工作效率越高,极致速度成为决定生产效率和体验的核心因素。

Test-Time Scaling(TTS)如何依赖推理速度?

TTS是增强模型效能的主要途径,在相同时间窗口内,更高的推理速度能产生更多思考token,实现更好的模型智能。例如,10秒内50 token/s只能产生500 token思考,而1000 token/s可产生10000 token思考。

提升解码速度需要从哪些方面协同优化?

提升解码速度需协同算法、系统和硬件三方面:硬件决定上限,软件系统效率发挥硬件性能,算法如量化和投机解码减少计算和访存。

TileRT的核心思路是什么?

TileRT的核心思路是打破Kernel边界,将执行拆解到更细粒度的Tile级任务,从全局视角重新编排计算、访存和通信,实现更充分的overlap,从而降低固定开销,提升解码速度。

TileRT与智谱合作推出的GLM-5.1-HighSpeed推理速度是多少?

TileRT与智谱合作推出GLM-5.1-HighSpeed高速推理服务,实现400 tokens/s的生产级输出速度,启用MTP后短序列可超600 tokens/s。

TileRT与小米MiMo团队如何实现1T模型超1000 tokens/s的生成速度?

通过FP4 QAT量化和DFlash投机解码,在通用8-GPU节点上实现1T模型超1000 tokens/s的生成速度,打破全球推理速度记录。

TileRT如何与vLLM生态融合?

TileRT与vLLM社区合作,通过PD分离和公开Connector接口实现共存式异构推理服务架构,复用vLLM生态,延迟敏感请求路由到TileRT,常规请求由vLLM处理。

Tile-AI社区包含哪些组件?

Tile-AI社区包括TileLang、TileScale、TileRT、TileFoundry、TileOPs和TileSight等组件,分别用于编程、分布式编译、推理引擎、算子自动生成、算子库和性能分析。

🏷️

标签

➡️

继续阅读