AI算力之争不靠堆卡!浪潮信息捅破智算「能力天花板」,还瓦解了「产能焦虑」

AI算力之争不靠堆卡!浪潮信息捅破智算「能力天花板」,还瓦解了「产能焦虑」

💡 原文中文,约4800字,阅读约需12分钟。
📝

内容提要

AI算力竞争已从堆卡转向能力与产能双重挑战。Agent时代推理负载多元,Token需求激增,算力缺口扩大。浪潮信息发布元脑SD200 Ultra和HC2000,分别应对前沿模型运行与低成本Token生产,推动算力产业从提供算力转向生产智能。

🔎

延伸解读

算力竞争转向能力与产能双轨

文章指出,AI算力竞争已从单纯堆卡转向两个独立又关联的维度:能力上限(Capability)和产能规模(Capacity)。能力上限关乎前沿模型能否装下、跑快、跑稳;产能规模则关乎以多低成本生产多少Token。IDC报告显示,全球AI算力需求满足率将从2024年的79%降至2027年的71%,到2030年算力缺口绝对值达3809亿美元。这意味着只解决其中一个维度无法突破整体瓶颈。

Agent时代推理负载多元化挑战

Agent任务使算力调用从脉冲式变为持续长流,一个人类意图可能触发几十到几百次连续推理,系统连续运转数小时甚至数天。推理负载中,Prefill高并行、Decode吃内存带宽、Attention频繁访问KV Cache、MoE含稀疏计算,各阶段计算特征不同且动态变化。单纯堆同一种算力会导致资源配比失衡,部分闲置、部分过载,无法线性提升容量。

两款新品分别应对能力与产能

浪潮信息发布元脑SD200 Ultra和HC2000。SD200 Ultra通过3D Hyper Mesh架构将128颗芯片紧致扩展,显存8TB、存储64TB,可单机运行2.8万亿参数的Kimi K3,并支持10万亿参数模型;其统一寻址和对称直连使All to All通信时延降至0.69微秒,超级算子技术将算子数量降至十分之一,推理性能提升3倍以上。HC2000则采用全液冷整机柜,单柜供电超300千瓦,支持256张AI加速卡,通过MCIS软件栈实现多元算力协同,同等投资下Token产能提升10倍。

能力与产能形成螺旋上升

文章强调,Capability和Capacity并非分道扬镳,而是互为因果:能力突破经算法优化和工程迭代后成本下降,渗透为产能需要规模化供给的东西;产能普及后产生新应用和新需求,又推动下一轮能力突破。这一螺旋正在加速,例如全球最大开源模型参数量从DeepSeek-R1的6710亿增至Kimi K3的2.8万亿。企业端已出现同一业务中前沿模型负责思考规划、轻量模型负责执行重复的并行模式。

Q&A

AI算力竞争为什么不能只靠堆卡?

因为Agent时代推理负载多元,Prefill和Decode等计算特征不同,堆同一种算力无法覆盖差异,反而导致资源配比失衡,部分算力闲置,部分过载。

浪潮信息发布的元脑SD200 Ultra主要解决什么问题?

SD200 Ultra解决前沿模型装不下、跑不快、跑不稳的问题,通过紧致扩展、统一寻址、对称直连和超级算子等技术,提升模型运行能力和推理性能。

元脑HC2000如何提升Token产能?

HC2000通过高密液冷整机柜、多元算力承载和MCIS协同推理软件栈,让不同芯片按推理阶段分工,在典型Agent任务中实现同等投资下10倍的Token产能提升。

Agent时代算力需求增长有哪些具体数据?

IDC数据显示,从今年到2030年全球Token消耗量复合增长率达4822.6%;全球AI算力需求满足率从2024年79%下滑至2027年预计71%,2030年算力缺口绝对值达3809亿美元。

Capability和Capacity两种智算有什么区别和联系?

Capability是能力型智算,支撑前沿模型突破智能上限;Capacity是容量型智算,让智能供给更充足便宜。两者互为因果,Capability突破的新能力会向下渗透变成Capacity,Capacity普及后产生新需求又推动Capability,形成加速螺旋。

浪潮信息如何重新定义算力产业的价值尺度?

从“提供算力”转向“生产智能”,让用户买算力设施像买电冰箱一样,插上电就能产Token,使智能像计算和电力一样成为可大规模生产和供给的资源。

🏷️

标签

➡️

继续阅读