本研究提出了一种“压缩注意力”机制,以应对长输入提示对大语言模型推理效率的挑战。通过优化固定上下文,显著提高了推理速度,实验结果显示速度提升超过4倍,同时保持了较低的准确性损失。
完成下面两步后,将自动完成登录并继续当前操作。