让Token生产更高效:异构混推的关键技术演进与创新实践

让Token生产更高效:异构混推的关键技术演进与创新实践

💡 原文中文,约2000字,阅读约需5分钟。
📝

内容提要

商汤大装置针对Token需求爆发,以“Token、状态与时延预算”为核心设计推理系统,日均Token服务量从2月的0.46万亿增长至8月的4.5万亿。通过横向编排统一异构算力、纵向优化模型引擎与芯片,并推进动态资源池和模块级资源池演进,提升吞吐并降低成本。

🔎

延伸解读

从训练到推理:算力需求的结构性反转

文章指出,推理需求已取代训练成为算力增长主引擎,Token调用量迈向千倍级增长。商汤大装置日均Token服务量从2月的0.46万亿增至8月的4.5万亿,印证了这一趋势。这意味着AI基础设施的设计重心正从训练集群转向推理系统,如何高效、稳定地生产Token成为核心命题。

横向编排:异构算力的统一调度与动态分工

面对不同品牌、规格的算力,商汤大装置构建统一资源画像,覆盖计算吞吐、KV Cache容量、有效带宽等,让异构芯片进入同一编排视角。平台对请求进行全生命周期管控,并动态调整芯片角色,不将某类芯片永久固定为P或D节点,从而提升可用性与资源组合灵活性。

纵向优化:模型、引擎、芯片三层协同

商汤大装置在模型层进行权重量化与显存预算调优,在引擎层优化Attention、GEMM等核心算子,在芯片层适配编译、访存调度与内存管理。所有优化结果均在真实负载中验证,避免单点效率瓶颈,最终指向模型质量达标、SLO达标、有效吞吐提升与单位成本下降。

资源池化演进:从固定P/D到模块级弹性

静态P/D配比易导致局部排队和资源错配。商汤大装置正构建Prefill Pool和Decode Pool,根据实时负载动态路由请求并调整P/D资源。面向多模态、MoE模型,未来将进一步拆分为Encoder、Attention、FFN等模块级资源池,各自弹性扩缩容,实现更精准的资源匹配与更高利用率。

Q&A

商汤大装置的日均Token服务量增长情况如何?

商汤大装置的日均Token服务量从2025年2月的0.46万亿增长至8月的4.5万亿。

商汤大装置推理系统的核心设计理念是什么?

商汤大装置的推理系统以“Token、状态与时延预算”为中心进行设计,所有设计都围绕Token的生产效率、交付质量与单位成本来组织和利用资源。

商汤大装置如何通过横向编排实现异构算力协同?

商汤大装置构建统一的资源画像,覆盖计算吞吐、KV Cache容量、有效带宽、模型兼容性等,让不同算力进入同一编排视角;对推理请求进行全生命周期管控,从准入配对、Prefill执行、KV Cache状态交接,到Decode接管,都有标准化协同机制;并根据模型、批量、上下文长度的瓶颈变化,动态调整不同芯片的角色分工。

商汤大装置在纵向优化方面做了哪些工作?

商汤大装置深化“模型×引擎×芯片”三层纵向优化:模型层针对权重量化、显存预算进行精细化调优;引擎层针对Attention、GEMM等核心算子进行并行优化;芯片层深度适配编译、访存调度与内存管理。所有优化结果都会在真实负载中进行系统验证。

商汤大装置从固定P/D向动态资源池演进的原因和做法是什么?

原因是不同业务、不同时间段的输入输出长度和流量热点不断变化,静态P/D组合容易造成局部排队和资源错配。做法是分别构建Prefill Pool和Decode Pool,根据实时负载、KV Cache状态及节点健康度,动态完成请求路由和P/D资源匹配;当长输入导致Prefill压力升高时动态增加P节点,当长输出推高Decode负载时增加D节点,甚至通过角色切换实现P/D节点灵活转换。

商汤大装置未来向模块级资源池演进的方向是什么?

面向未来多模态、MoE模型的发展,商汤大装置的架构演进方向是进一步走向模块级资源池化:将Encoder、Attention、FFN、视觉编码等不同模块拆分为独立资源池,各自按负载特点弹性扩缩容,让资源匹配更精准、利用率更高。

🏷️

标签

➡️

继续阅读