小红花·文摘

本研究提出了基于锚点的LLM (AnLLM) 模型，利用基于锚点的自注意力网络 (AnSAN) 和推理策略，将序列信息压缩到锚点令牌中，减少键/值缓存并提高推理效率。实验证明，AnLLM 在保持可比精度的同时缩减了99%的键/值缓存，并实现了3.5倍的更快推理速度。AnLLM 在计算效率和资源利用方面具有显著改善，展示了锚点式注意力方法在实时推理的潜力。