本研究提出了一种名为TokenSelect的方法,旨在解决大语言模型在长上下文推理中的性能下降和计算复杂度问题。该方法通过动态令牌级KV缓存选择,在保持准确性的同时显著提高推理速度,评估结果显示注意力计算加速最高可达23.84倍。
完成下面两步后,将自动完成登录并继续当前操作。