趋境科技与摩尔线程达成战略合作,高品质 AI Token 国产异构方案性价比超越国际先进算力

趋境科技与摩尔线程达成战略合作,高品质 AI Token 国产异构方案性价比超越国际先进算力

💡 原文中文,约3000字,阅读约需8分钟。
📝

内容提要

趋境科技与摩尔线程达成战略合作,基于国产PD异构技术与MTT S5000智算卡,共建高品质AI Token工厂。方案已投产,性价比超越国际算力,实现超50 TPS生成速度、99.9%稳定性。双方将推广Token Pod方案,推动国产算力规模化落地。

🔎

延伸解读

性价比优势的关键:PD异构分工

方案宣称性价比超越国际算力,并非仅靠硬件低价,而是通过PD异构将Prefill与Decode分离:MTT S5000负责Prefill和KV Cache生成,高带宽GPU专注Decode。这种分工减少了对高成本资源的占用,避免按单一峰值配置整套基础设施,从而在同等服务标准下降低单位Token成本。

生产级数据验证国产算力可行性

文章给出具体生产数据:平均超50 TPS生成速度、超90% KV Cache命中率、99.9%稳定性,并已承接头部模型厂商真实流量。这些指标表明国产算力已从实验走向规模化生产,但需注意数据由合作方提供,且未与国际方案直接对比,读者应关注独立第三方验证。

“少模型、深优化”路线的现实意义

趋境科技强调“少模型、深优化”,即聚焦重点模型深度优化,而非广泛适配。这有助于在国产GPU生态尚不完善时快速实现生产级性能,但也意味着方案可能缺乏通用性,迁移到其他模型需重新优化。读者应评估自身模型是否在重点支持范围内。

Q&A

趋境科技与摩尔线程的战略合作具体内容是什么?

双方签署战略合作协议,基于趋境科技自研的国产PD异构技术与摩尔线程MTT S5000智算卡及MUSA软件平台深度融合,共同建设国产化高品质AI Token工厂,并研发推广Token Pod(Token超节点)联合解决方案。

为什么说该方案的性价比超越国际先进算力?

性价比优势源于对Prefill和Decode阶段的资源优化:MTT S5000负责Prefill阶段,高带宽GPU负责Decode,减少了对高成本资源的占用,避免了按单一阶段峰值配置整套基础设施,从而在同等生产服务标准下,输入Token处理性价比超过国际先进算力方案。

该方案在生产环境中的实际性能表现如何?

生产运行数据显示,在国产头部大模型复杂业务场景下,平均生成速度超过50 TPS,KV Cache命中率超90%,稳定性达99.9%,并保障生产级低首Token时延(TTFT)。

什么是PD异构技术?在该方案中如何应用?

PD异构技术是将Prefill和Decode两个阶段分离,由不同硬件分别处理。该方案中,摩尔线程MTT S5000负责Prefill阶段的输入计算与KV Cache生成,高带宽GPU负责Decode阶段的Token生成,通过趋境科技的跨设备协同优化,整合为统一的端到端推理服务。

趋境科技的“少模型、深优化”理念是什么?

该理念指将核心工程聚焦于具有明确规模化需求的重点模型,围绕模型、芯片、推理系统和真实业务负载进行持续优化,最终衡量标准是能否在实际运行中兼顾时延、吞吐、稳定性、精度、长上下文处理与成本,持续产出高品质AI Token。

Token Pod解决方案有哪些特点?

Token Pod是软硬一体化的Token生产解决方案,具备共享KV Cache、流量感知配置、弹性扩展和故障隔离等能力,可适配国产与国际主流硬件组合,形成可根据业务需求配置和扩展的Token生产单元。

双方未来计划在哪些行业推广该方案?

未来将拓展在互联网企业、前沿基础模型公司、运营商等国家关键基础行业的合作,推动国产PD异构推理进入更广泛的生产应用场景。

🏷️

标签

➡️

继续阅读