内容提要
AI发展给数据中心存储架构带来挑战,传统数据湖难以支撑推理负载的持续并行访问。QLC NAND闪存凭借更高密度与能效,可支持256TB级SSD,降低占地与功耗。未来需采用分层存储,高性能层靠近计算,高容量QLC支撑数据湖,实现算力、内存与存储的均衡扩展。
延伸解读
AI推理如何改变存储访问模式
文章指出,AI推理工作负载的数据访问模式与传统批处理分析截然不同。一次看似简单的请求可能触发数十个底层操作,每个操作都需要访问存储数据、中间结果或上下文信息。这意味着数据湖需要支持持续、并行的访问,而非间歇性读取。传统数据湖假设只有少量数据被频繁访问,因此容忍延迟并优化每TB成本,但面对AI推理的持续并行访问,这种架构已难以支撑。
QLC NAND为何成为AI数据湖的候选方案
QLC NAND闪存每个单元存储4比特,显著提升存储密度,使企业级SSD容量达到256TB级别。文章强调,这种高容量SSD不仅减少物理占地,还通过每瓦TB数衡量能效,对功耗受限的超大规模数据中心尤为重要。此外,NAND闪存的设计正从通用存储转向针对AI的特定需求,如持续访问模式和大数据集,这使其更适合作为AI数据湖的底层存储介质。
高容量SSD带来的工程挑战与应对
随着单盘容量达到数百TB,传统SSD依靠后台进程回收和重组数据的方式可能变得低效。频繁重写大量数据既不实际也不节能,还可能缩短驱动器寿命。文章提到,新架构正致力于减少不必要的数据移动,通过重新思考I/O操作处理和优化数据放置来最小化写放大,从而提升系统效率。这些改进在超大规模环境下能转化为显著的成本节约和更快的价值实现。
分层存储:平衡算力、内存与存储的扩展
文章建议采用更细分层的存储方法:高性能层靠近计算层,满足低延迟需求;高容量QLC系统则作为数据湖的基石,支撑大规模数据存储。这种架构旨在平衡容量、性能和效率,避免单纯增加计算或DRAM高带宽内存带来的功耗、空间和成本限制。对于数据中心管理者,这意味着可以在不按比例增加成本、功耗或物理占地的情况下,扩展存储以支持持续的AI工作负载。
Q&A
AI数据湖为什么对传统存储架构提出了新挑战?
AI工作负载改变了数据的角色,数据不再间歇或批量访问,而是持续被消费、召回和重组。AI推理会生成超出单次查询的数据访问事件,触发数十个底层操作,需要并发访问存储数据、中间结果或上下文信息。传统数据湖假设只有一小部分数据会被访问,容忍延迟,优化的是每TB成本而非每工作负载吞吐量,难以应对持续并行的访问模式。
QLC NAND闪存如何帮助解决AI数据湖的存储需求?
QLC NAND闪存每个单元存储4比特,提高存储密度,支持高达256TB的NVMe SSD。这些超高容量SSD支持AI数据湖等数据密集型应用,允许数据中心在更少的驱动器上存储更多数据,减少物理占地。同时,更高密度带来能效提升(以每瓦TB衡量),这对能耗为主要约束的超大规模环境至关重要。
AI推理工作负载如何改变数据访问模式?
AI推理工作负载生成的数据访问事件超出单次查询,一个简单请求可能触发数十个底层操作,每个操作都需要访问存储数据、中间结果或上下文信息。因此,AI数据湖需要持续高速地交付输出,支持多个管道的并发访问,并在持续负载下快速摄取新数据。数据湖不再是被动存储库,而是主动、持久且日益成为整体系统性能的核心。
超大规模数据中心在存储AI工作负载时面临哪些经济和技术限制?
GPU集群构建和运营成本高昂,消耗大量电力,需要先进冷却方案。简单增加计算或基于DRAM的高带宽内存并不总是可行,因为电力预算、空间和更换周期带来物理和经济限制。传统数据湖针对每TB成本优化,而非每工作负载吞吐量,在持续并行访问下表现不佳。这些压力也促使云提供商重新调整存储服务层级和SLA。
为什么AI数据湖需要分层存储架构?
AI数据湖需要平衡容量、性能和效率。分层存储方法中,高性能层靠近计算层,满足低延迟和高吞吐需求;高容量QLC系统支撑数据湖,提供大规模存储。这种架构能更均衡地整合计算、内存和存储,支持当前和未来工作负载,同时避免按比例增加成本、功耗或物理占地。
高容量SSD在数据管理上面临哪些工程挑战?
随着单盘容量达到数百TB,管理数据随时间变得高效成为重大挑战。传统SSD设计依赖后台进程回收和重组数据以维持性能和耐久性,但在极高容量下,这些进程可能效率低下。频繁重写大量数据既不实际也不节能,还可能缩短驱动器寿命。新架构专注于减少不必要的数据移动,通过重新思考I/O操作处理和优化数据放置,最小化写放大并提高整体系统效率。