AI算力开始听电网指挥:比换GPU更现实的增产方法

AI算力开始听电网指挥:比换GPU更现实的增产方法

💡 原文中文,约1900字,阅读约需5分钟。
📝

内容提要

NVIDIA与Emerald AI、Lambda的测试表明,统一调度任务优先级、机架功率与电网信号,可在用电紧张时降载,并在不扩容电力的情况下提升Token吞吐。Lambda五机架测试中,吞吐提升24%,每瓦性能提升23%。AI竞争正从购买GPU转向在电力约束下交付可用任务,调度软件与业务分级愈发重要。

🔎

延伸解读

从买卡到调度:产能逻辑的转变

文章指出,AI基础设施的瓶颈正从GPU转向园区可获得的稳定电力。NVIDIA与Emerald AI、Lambda的测试显示,将任务优先级、机架功率与电网信号纳入统一调度,可在不扩容电力的情况下提升Token吞吐。这意味着竞争焦点从“买到多少GPU”转向“在电力、网络和延迟约束下交付多少可用任务”,调度软件与业务分级的重要性随之上升。

动态功率分配如何释放搁浅容量

传统机房按单机最坏功耗预留电力,导致许多节点不会同时达到峰值,形成“有GPU但不敢一起开”的搁浅容量。动态功率分配持续观察节点负载,把未用满的功率余量转给需要的节点。文章强调,调度对象不仅是硬件,还包括服务等级目标,因为训练、推理和批处理的功率曲线与可延迟性各不相同。

三层控制与反作用风险

文章将控制分为三层:GPU和机架层负责功率封顶,集群层决定资源份额,设施层响应电网、制冷和价格事件。只优化其中一层会遇到反作用:降低GPU功率可能拉长任务时间,暂停训练可能造成检查点开销,在线推理若缺少容量保护则会抬高尾延迟。因此“每兆瓦Token”只是产出指标,任务完成率和用户等待时间仍需单独核算。

落地前需核实的四个边界

文章提醒官方数字有四个边界:24%来自19节点对16节点的特定比较,不是单节点提速;功率下降不等于总能耗同比例下降;Token吞吐没有衡量答案质量与业务成功率;下一代适合环境可容纳更多GPU或获得更高吞吐的说法包含预测,需等待独立部署验证。团队应把厂商结果视为假设,在自己的模型、批量与网络拓扑上复现。

Q&A

NVIDIA和Emerald AI在加州圣克拉拉的测试中,系统是如何响应电网信号的?

NVIDIA的Eos AI工厂接收Silicon Valley Power的需求响应信号,Emerald AI的Conductor平台按预设工作负载等级,让可等待任务降速或改期,同时维持高优先级推理。系统已响应超过200次信号,一次展示中功率在一分钟内从4兆瓦降到3兆瓦。

Lambda的五机架测试中,DSX MaxLPS带来了哪些具体提升?

在五个机架、19个节点上,19个节点以约85%的功率策略运行,与16个满功率节点保持相同设施预算。集群吞吐从约每秒400万Token升至500万,增加24%,每瓦性能提升23%。

为什么说AI基础设施的新瓶颈不只是GPU?

因为园区能拿到多少稳定电力成为关键限制。传统机房按单机最坏功耗预留电力,导致许多节点不会同时达到峰值,形成“有GPU但不敢一起开”的搁浅容量。通过动态功率分配和调度,可以在不扩容电力的前提下提高Token吞吐。

动态功率分配系统涉及哪三层控制?只优化一层会有什么问题?

三层控制是:GPU和机架层负责功率封顶;集群层决定节点与作业的资源份额;设施层响应电网、制冷和价格事件。只优化其中一层会遇到反作用:降低GPU功率可能拉长任务时间,暂停训练可能造成检查点开销,在线推理若缺少容量保护则会抬高尾延迟。

开发团队未来提交作业时可能需要提供哪些新参数?

过去提交作业只写GPU数量和显存,今后还可能写功率弹性、最晚完成时间、可否抢占和恢复成本。例如,一次离线微调可以在电价高时暂停,但面向客户的实时Agent若被同样处理,就会直接违约。

官方公布的24%吞吐提升有哪些边界需要注意?

边界包括:第一,24%来自19节点对16节点的特定比较,不是单节点提速。第二,功率下降不等于总能耗同比例下降,任务延长会改变累计电量。第三,Token吞吐没有衡量答案质量与业务成功率。第四,NVIDIA称下一代适合环境可容纳更多GPU或获得更高吞吐,其中包含预测,需等待独立部署验证。

企业若想实施自动电网响应,需要先具备哪些条件?

需要有机架级遥测、任务优先级和可恢复检查点。若团队没有这些,不适合直接做自动电网响应,先完善可观测性更重要。若负载主要是毫秒级交易或医疗实时服务,也不应为追求电价收益频繁抢占。

🏷️

标签

➡️

继续阅读