Can Large Language Models Maintain Fundamental Capabilities Under KV Cache Compression?

💡 原文英文,约100词,阅读约需1分钟。
📝

内容提要

本研究探讨KV缓存压缩对大语言模型的影响,发现不同压缩方法在特定任务上表现差异,尤其在算术推理任务中影响显著。提出的新方法ShotKV在激进压缩下,提升了长上下文生成任务的性能9%-18%。

🏷️

标签

➡️

继续阅读