降低大模型推理87%时延!华为云论文入选顶会USENIX ATC‘24

💡 原文中文,约2000字,阅读约需5分钟。
📝

内容提要

华为云EMS团队的论文《Cost-Efficient Large Language Model Serving for Multi-turn Conversations with CachedAttention》被USENIX ATC 2024收录。该论文提出了全球首个面向大模型推理的多级KV Cache缓存系统,通过CachedAttention降低了大模型推理的87%时延。华为云发布了EMS弹性内存存储服务,实现了“显存扩展”、“算力卸载”、“以存代算”等功能,构建AI Native的基础设施。

🔎

延伸解读

多轮对话推理的重复计算瓶颈

文章指出,现有LLM服务引擎在多轮对话中需要反复计算历史Token的KV Cache,导致效率低下和推理成本高昂。CachedAttention通过重用KV Cache来减少重复计算,这揭示了多轮对话场景下优化推理性能的关键在于避免对历史上下文的冗余计算。

分层KV Cache存储的设计权衡

CachedAttention采用DRAM和SSD构建分层KV Cache存储系统AttentionStore,并利用分层预加载、异步保存、调度感知的Fetch/Evict以及解耦位置编码等技术,在存储成本与访问速度之间取得平衡。这种设计表明,大模型推理优化不仅依赖算力,存储层次的管理同样重要。

实验指标的实际意义

实验结果显示,CachedAttention降低高达87%的首Token时延,提升Prefill阶段7.8倍吞吐量,从而大幅降低端到端推理成本。这些指标说明,KV Cache复用主要优化了推理的预填充阶段,对于需要快速响应的多轮对话应用具有直接价值。

从论文到云服务的落地路径

华为云基于该论文发布了EMS弹性内存存储服务,具备显存扩展、算力卸载、以存代算功能,并形成AI-Native智算存储解决方案。这体现了学术研究向云服务产品的转化,旨在帮助客户构建AI Native基础设施,应对万亿模型存储与训练任务恢复等挑战。

❓

Q&A

华为云的论文在USENIX ATC 2024上有什么重要贡献?

华为云的论文提出了全球首个面向大模型推理的多级KV Cache缓存系统,称作AttentionStore,降低了87%的首Token时延。

CachedAttention是如何提高多轮对话的推理性能的?

CachedAttention通过重用KV Cache来减少重复计算开销,从而显著提升推理性能。

USENIX ATC会议的录用率是多少?

2024年USENIX ATC会议的录用率为15.8%。

华为云的EMS弹性内存存储服务有哪些功能?

EMS弹性内存存储服务具备显存扩展、算力卸载和以存代算等功能。

CachedAttention的实验结果如何?

实验结果表明,CachedAttention降低了87%的首Token时延,提升了7.8倍的吞吐量。

华为云的AI-Native智算存储解决方案包含哪些组件?

该解决方案包含EMS弹性内存存储、SFS Turbo弹性文件存储和OBS对象存储。

🏷️

标签

➡️

继续阅读