TokenSelect: Efficient Long-Context Inference and Length Extrapolation via Dynamic Token-Level KV Cache Selection

💡 原文英文,约100词,阅读约需1分钟。
📝

内容提要

本研究提出了一种名为TokenSelect的方法,旨在解决大语言模型在长上下文推理中的性能下降和计算复杂度问题。该方法通过动态令牌级KV缓存选择,在保持准确性的同时显著提高推理速度,评估结果显示注意力计算加速最高可达23.84倍。

🏷️

标签

➡️

继续阅读