内容提要
无问芯穹在WAIC发布跨集群异构推理架构PDD,通过“P-RLD-MD”三级分离设计,利用本地中继掩盖以太网KV Cache传输延迟。实测首Token延迟降低51.5%,单Token成本降37.5%,有效提升异构算力调度效率,释放存量集群价值。
延伸解读
跨集群PD分离的工程挑战与PDD的破局思路
传统PD分离受限于同集群异构硬件的高成本与固定配比,而跨集群方案又面临KV Cache传输的带宽和延迟瓶颈。PDD通过引入本地中继(RLD)掩盖以太网延迟,并利用DRC缓存和命中率偏斜规律,将传输压力降至最低。这一设计为低成本利用存量集群提供了可行路径,但需注意其依赖高缓存命中率,若业务场景命中率低,效果可能受限。
“只传Token,本地重算”的交接机制为何有效
PDD的Extend-Decode Handoff机制反直觉地放弃传输KV Cache,改为仅传Token ID,利用Decode阶段计算轻量的特性,在MD端重算KV Cache。实测重算耗时稳定(平均305.2ms,标准差仅4.8ms),远优于以太网传输的波动性(峰值512.6ms)。这一机制将不可控的网络延迟转化为确定性本地计算,但依赖MD端具备足够的计算冗余,且需与MTP等优化配合才能发挥最大效用。
PDD的实测收益与适用边界
在DeepSeek-V4-pro和真实Agentic负载下,PDD将P90 TTFT从18.3秒降至9.8秒,性价比提升37.5%,且RLD仅承担6.2%的Token生成任务,证明其负载可控。但需注意,实验未开启MTP等优化,且RLD使用最小规模部署,实际收益可能更高。该架构尤其适合前缀缓存命中率高、输出短的Agent场景,对于低命中率或长输出任务,其优势可能减弱。
Q&A
无问芯穹提出的PDD架构是什么?
PDD(Prefill-RelayDecode-MainDecode)是一种跨集群异构推理架构,它将传统的PD分离链路(P-D)解构为P-RLD-MD三级分离式设计,通过在中间插入RelayDecode(RLD)实例来掩盖以太网环境下KV Cache的传输延迟,从而提升推理效率和降低成本。
PDD架构如何解决KV Cache传输延迟问题?
PDD架构在Prefill和MainDecode之间插入一个本地的RelayDecode(RLD)实例。当P实例算完Prefill后,通过高速RDMA将KV Cache传给同机房的RLD,RLD立即开始解码输出,从而掩盖了通过以太网传输到远端MD的延迟。同时,利用Extend-Decode Handoff机制,RLD只传输Token ID给MD,MD本地重算KV Cache,避免了传输庞大的KV Cache。
PDD架构在实测中取得了哪些性能提升?
实测数据显示,PDD架构使首Token延迟(TTFT)降低51.5%,单Token成本降低37.5%。在跨集群场景下,P90 TTFT从18.3秒降至9.8秒(降低约46%),P99从29.7秒降至14.4秒。同时,在总成本下降3.5%~7.1%的情况下,有效吞吐量提升27.8%,性价比(BCR)提升37.5%。
为什么PDD架构能降低推理成本?
PDD架构通过跨集群使用低成本的广域网以太网连接各地已建成的同构集群,避免了在同一集群内构建大规模异构算力的高昂采购成本。同时,它让硬件各司其职,利用偏科芯片的长板,并通过RLD只承担少量任务(6.2%的Token生成),MD承担大部分重活,从而提高了资源利用率,降低了单Token成本。
PDD架构中的RLD实例承担什么角色?
RLD(RelayDecode)实例是PDD架构中的中继站,它通过高速RDMA从P实例接收KV Cache,立即开始解码输出,以掩盖跨集群以太网传输的延迟。RLD只负责掩藏延迟,承担极少数的计算任务(实测仅6.2%的Token生成),避免成为系统瓶颈。
PDD架构中的Extend-Decode Handoff机制是如何工作的?
Extend-Decode Handoff机制是PDD架构中RLD与MD交接解码任务的方法。RLD不传输庞大的KV Cache,而是只将生成的Token ID传给MD(仅几KB数据),MD收到后利用Extend-Decode技术(常见于MTP和投机解码)在本地重新计算这些Token对应的KV Cache,同时生成下一个新Token。这种方式将受网络波动影响的操作变为确定性的本地计算,平均重算100个Token的KV Cache仅需305.2ms。
PDD架构基于哪些关键洞察设计?
PDD架构基于三个核心洞察:1)硬件性能极度偏科,例如某芯片在Prefill阶段只有基线81%性能,但在Decode阶段可达210%;2)DRC技术利用高缓存命中率可将跨集群带宽需求降低10倍;3)智能体工作负载下KV Cache传输延迟是主要瓶颈,且延迟分布极度偏斜,只有少数低命中率请求造成长尾延迟。
PDD架构对未来算力调度有什么意义?
PDD架构实现了全域异构算力的最大化调度,让分散各处的存量集群资源能够充分释放产业价值。它支持极简局部异构+灵活远端分离的MaaS基础设施,未来可以在主算力中心保留极小比例的接力手,将解码任务分发到全国乃至全球的低成本算力节点,大幅盘活存量算力,压低资源空置比例。