【Transformer 与注意力机制】49|KV Cache:推理为什么是 O(n) 不是 O(n²)
原文中文,约7500字,阅读约需18分钟。
📝
内容提要
自回归推理里,历史 token 的 K/V 因果掩码下不变、可以缓存,Q 不行——本文给出可自证的归纳证明,推导显存公式与长上下文并发上限,拆解 MQA/GQA/MLA、PagedAttention、cache 量化三条正交压缩路线各解决哪一项,并给出结构性压缩路线上一处工业选择分歧与两个开放问题。
🏷️