LServe: Efficient Long-Sequence LLM Service with Unified Sparse Attention

💡 原文英文,约100词,阅读约需1分钟。
📝

内容提要

本研究提出LServe系统,旨在解决长序列大型语言模型在预填充和解码阶段的计算复杂度和内存占用问题。通过混合稀疏注意力,该系统使预填充速度提升近2.9倍,解码速度提升1.3-2.1倍,同时保持长序列的精度。

🏷️

标签

➡️

继续阅读