内容提要
无问芯穹作为AI Infra公司,与Kimi、智谱、MiniMax、阶跃星辰等头部模型厂商合作。通过准入测试保障模型精度,采用跨集群异构PD分离技术降低成本37.5%,智能体系统提升运维效率,并构建“前店后厂一中心”战略,覆盖算力调度、Token工厂及行业应用,旨在成为大模型时代的基础设施共同选择。
延伸解读
模型精度为何是隐形成本
文章指出,第三方供应商部署模型时,精度可能比原厂下降30%,而常规监控难以察觉,直到业务指标下滑才被发现。这提醒读者,在选购MaaS服务时,不能只看价格和响应速度,模型输出的质量一致性是容易被忽视的关键指标。无问芯穹通过准入测试标准来保障精度,但这也意味着,模型厂商与基础设施提供商的深度绑定,可能是确保服务质量的重要方式。
跨集群PD分离的成本账
无问芯穹的跨集群异构PD分离技术,通过将Prefill和Decode拆分到不同硬件,并首创PDD架构解决传输延迟,实现了首Token延迟降低51.5%、单Token成本降低37.5%。这展示了在算力紧缺背景下,通过架构创新优化成本的可能性。对于企业而言,这意味着在算力成本高企时,技术优化带来的成本下降空间可能比单纯采购更多硬件更有效。
运维智能体:从人找问题到问题找人
文章提到,无问芯穹发布的智算集群运维智能体系统,实现了7×24小时值守,将运维人效提升5倍以上,关键故障处理效率提升6倍。这反映了AI Infra领域的一个趋势:用智能体自动化运维,减少人工干预。对于依赖大规模算力的企业,运维效率直接关系到业务稳定性,智能体系统可能成为未来基础设施标配。
国产芯片生态的差异化挑战
无问芯穹对标海外Baseten、Together AI等公司,但后者基于英伟达单一生态,而无问芯穹面对的是碎片化的国产芯片生态。这既是挑战也是护城河:需要适配多种芯片,但一旦形成能力,就难以被替代。对于国内AI企业,选择基础设施时需考虑其对国产芯片的适配能力,这关系到长期供应的稳定性和自主可控。
Q&A
无问芯穹与哪些头部模型厂商有合作?
无问芯穹与Kimi、智谱、MiniMax、阶跃星辰等头部模型厂商有深度合作。
无问芯穹如何保证模型部署后的精度不下降?
无问芯穹制定了一套准入测试标准,从工具调用一致性到推理模式精度对齐逐项核验,确保每个新模型上架前都经过严格测试,从而保证客户体验与原厂API几乎无差别。
跨集群异构PD分离技术是什么?它带来了哪些收益?
跨集群异构PD分离技术将大模型推理中的Prefill和Decode阶段拆分到不同集群,利用异构芯片各自优势,并通过Radix Cache和PDD架构解决跨集群传输延迟问题。实测该技术使首Token延迟降低51.5%,单Token成本降低37.5%。
无问芯穹的智算集群运维智能体系统有什么作用?
该系统实现7×24小时全天候值守,将运维从“人找问题”转变为“问题找人”和“问题自己解决”,运维人效提升5倍以上,关键故障处理效率提升6倍。
无问芯穹的“前店后厂一中心”战略具体指什么?
“前店”指AI生产力商店,提供行业解决方案;“后厂”指Token工厂,即Agentic MaaS平台;“一中心”指算力集散中心,即Agentic Infra平台。三者相互反哺,构成完整战略。
无问芯穹在跨集群强化学习方面取得了什么成果?
无问芯穹实现了跨域强化学习训练连续一周0中断稳定运行,并计划将跨域计算资源支撑规模拓展至十万卡级以上。
无问芯穹的Agentic MaaS平台日均Token调用量增长情况如何?
截至7月,无问芯穹Agentic MaaS平台的日均Token调用量较去年12月增长了40倍。
无问芯穹在行业应用方面有哪些具体案例?
无问芯穹与VAST合作3D游戏解决方案,帮助上海瑞金医院探索医疗大模型落地,为律所提供AI合伙人产品,并与南方电网合作智算中心能耗预测。