内容提要
趋境科技与摩尔线程达成战略合作,基于国产PD异构技术与MTT S5000智算卡,共建高品质AI Token工厂。方案已投产,性价比超越国际算力,实现超50 TPS生成速度、99.9%稳定性。双方将推广Token Pod方案,推动国产算力规模化落地。
延伸解读
性价比优势的关键:PD异构分工
方案宣称性价比超越国际算力,并非仅靠硬件低价,而是通过PD异构将Prefill与Decode分离:MTT S5000负责Prefill和KV Cache生成,高带宽GPU专注Decode。这种分工减少了对高成本资源的占用,避免按单一峰值配置整套基础设施,从而在同等服务标准下降低单位Token成本。
生产级数据验证国产算力可行性
文章给出具体生产数据:平均超50 TPS生成速度、超90% KV Cache命中率、99.9%稳定性,并已承接头部模型厂商真实流量。这些指标表明国产算力已从实验走向规模化生产,但需注意数据由合作方提供,且未与国际方案直接对比,读者应关注独立第三方验证。
“少模型、深优化”路线的现实意义
趋境科技强调“少模型、深优化”,即聚焦重点模型深度优化,而非广泛适配。这有助于在国产GPU生态尚不完善时快速实现生产级性能,但也意味着方案可能缺乏通用性,迁移到其他模型需重新优化。读者应评估自身模型是否在重点支持范围内。
Q&A
趋境科技与摩尔线程的战略合作具体内容是什么?
双方签署战略合作协议,基于趋境科技自研的国产PD异构技术与摩尔线程MTT S5000智算卡及MUSA软件平台深度融合,共同建设国产化高品质AI Token工厂,并研发推广Token Pod(Token超节点)联合解决方案。
为什么说该方案的性价比超越国际先进算力?
性价比优势源于对Prefill和Decode阶段的资源优化:MTT S5000负责Prefill阶段,高带宽GPU负责Decode,减少了对高成本资源的占用,避免了按单一阶段峰值配置整套基础设施,从而在同等生产服务标准下,输入Token处理性价比超过国际先进算力方案。
该方案在生产环境中的实际性能表现如何?
生产运行数据显示,在国产头部大模型复杂业务场景下,平均生成速度超过50 TPS,KV Cache命中率超90%,稳定性达99.9%,并保障生产级低首Token时延(TTFT)。
什么是PD异构技术?在该方案中如何应用?
PD异构技术是将Prefill和Decode两个阶段分离,由不同硬件分别处理。该方案中,摩尔线程MTT S5000负责Prefill阶段的输入计算与KV Cache生成,高带宽GPU负责Decode阶段的Token生成,通过趋境科技的跨设备协同优化,整合为统一的端到端推理服务。
趋境科技的“少模型、深优化”理念是什么?
该理念指将核心工程聚焦于具有明确规模化需求的重点模型,围绕模型、芯片、推理系统和真实业务负载进行持续优化,最终衡量标准是能否在实际运行中兼顾时延、吞吐、稳定性、精度、长上下文处理与成本,持续产出高品质AI Token。
Token Pod解决方案有哪些特点?
Token Pod是软硬一体化的Token生产解决方案,具备共享KV Cache、流量感知配置、弹性扩展和故障隔离等能力,可适配国产与国际主流硬件组合,形成可根据业务需求配置和扩展的Token生产单元。
双方未来计划在哪些行业推广该方案?
未来将拓展在互联网企业、前沿基础模型公司、运营商等国家关键基础行业的合作,推动国产PD异构推理进入更广泛的生产应用场景。