AI SSD:大模型推理的存储范式转移

AI SSD:大模型推理的存储范式转移

💡 原文中文,约7100字,阅读约需17分钟。
📝

内容提要

AI基础设施正从堆叠GPU转向协同算力、网络、内存与存储。月之暗面Mooncake和NVIDIA CMX将KV Cache作为一级资源,推动SSD进入推理主链路。群联、江波龙、寅谱-联芸等厂商探索AI SSD,优化数据调度与预取,以提升Token产出效率,降低计算成本。

🔎

延伸解读

AI SSD的两种路线:强化型与参与型

文章将AI SSD分为两类:一是AI负载强化型企业级SSD,如英韧科技洞庭-N3X和华为OceanDisk LC 560,它们保持标准块存储形态,但针对AI集群的高频缓存、模型加载等调整性能指标;二是推理参与型AI SSD,如群联、江波龙、寅谱-联芸的方案,它们试图让SSD参与模型权重、KV Cache和MoE专家的运行时管理。这种分类有助于理解不同厂商的定位和产品差异。

KV Cache成为一级资源,存储进入推理主链路

月之暗面的Mooncake和NVIDIA的CMX都将KV Cache视为一级资源,推动存储进入推理实时主链路。Mooncake采用以KV Cache为中心的分离式架构,将CPU、DRAM、SSD等组织为分布式缓存池;NVIDIA的CMX则通过Flash提供Pod级上下文内存。这表明推理状态的管理成为AI基础设施的关键,存储不再只是模型启动前的文件来源,而是影响TTFT和吞吐的推理数据层。

AI SSD面临的挑战:尾延迟与写放大

文章指出,传统SSD设计围绕顺序带宽和随机IOPS,但LLM推理需要严格时序的数据供应。NAND Flash的页读取、块擦除特性,以及FTL的垃圾回收和磨损均衡,可能导致写放大和难以预测的尾延迟。此外,传统LBA排布不了解模型层、KV块和MoE专家的执行次序,逻辑上相关的数据在物理上未必适合并行读取。因此,AI SSD需要解决数据布局和调度问题,而不仅仅是提高峰值带宽。

Q&A

AI SSD是什么?它在大模型推理中扮演什么角色?

AI SSD是面向AI推理优化的固态硬盘,它不再只是存储设备,而是作为推理数据路径中的可调度层级,参与KV Cache、模型权重和MoE专家的运行时管理,以提升Token产出效率并降低计算成本。

Mooncake架构如何通过KV Cache优化大模型推理?

Mooncake采用以KV Cache为中心的分离式架构,将Prefill和Decode部署在不同资源池,利用集群中未充分利用的CPU、DRAM、SSD和NIC组成分布式KV Cache池,通过全局调度器(Conductor)结合缓存分布和负载,实现缓存复用和高效调度,从而提升有效请求承载能力。

NVIDIA CMX是什么?它如何提升推理性能?

NVIDIA CMX是Pod级上下文存储平台,通过以太网连接、以Flash为介质,为KV Cache优化提供PB级共享上下文容量。它通过Dynamo、NIXL和DOCA Memos等组件实现KV块的跨层编排和预取,减少GPU等待,据称在长上下文和智能体负载下,持续Token吞吐与功耗效率可达传统存储方案的5倍。

传统SSD为什么不适合直接用于大模型推理?

传统SSD主要围绕顺序带宽、随机IOPS和单位容量成本设计,而LLM推理需要严格时序约束的数据供应。KV Cache和MoE专家权重的读取必须赶上模型计算窗口,否则GPU会等待。此外,NAND Flash的读写特性(页读块擦)和FTL的垃圾回收会导致写放大和尾延迟,且传统LBA排布不感知模型层和KV块的关系,无法优化并行读取。

群联aiDAPTIV方案是如何工作的?

群联aiDAPTIV由专用缓存SSD、内存管理中间件和工具链组成,将SSD作为GPU显存之外的高容量缓存层。当模型权重超过VRAM时,系统将权重切块,根据执行进度在SSD和VRAM间流式搬运,并保存被驱逐的KV Cache以便复用,从而减少重新计算。其专用缓存SSD耐久性最高达100 DWPD。

江波龙的SPU和iSA在AI SSD中分别起什么作用?

江波龙的方案中,SPU是硬件执行层,负责存储控制、硬件压缩、高速缓存和数据搬运;iSA是软件决策层,感知推理负载并制定数据分层与预取策略。两者协同实现存储侧智能化,使SSD能主动承担压缩、冷热识别和调度执行,适用于AI PC、工作站和端侧设备。

寅谱-联芸的AI SSD方案有何独特之处?

寅谱-联芸方案以AI Native身份进入AI SSD领域,从模型执行、数据流和调度出发,贯通计算侧缓存体系、middleware、firmware、controller和NAND介质管理。它围绕MoE专家、KV Cache和数值精度进行数据切分、冷热分层和预测式预取,旨在减少对模型文件和推理框架的侵入,适配多种计算平台。

AI SSD的发展趋势是什么?它是否会取代HBM或DRAM?

AI SSD不会取代HBM、VRAM或DRAM,而是推动更细致的存储层级形成:热数据留在计算芯片附近,温数据进入DRAM或高性能Flash,冷数据下沉至大容量低成本层级。AI SSD将作为推理数据路径中的可调度层级,与算力、网络和内存协同,提升每瓦Token产出和GPU利用率。

🏷️

标签

➡️

继续阅读