本文介绍大模型缓存技术,涵盖KV Cache、PagedAttention、Prefix/Prompt/Context Cache及Semantic/Response Cache等层级。文章解释各缓存机制、作用阶段、显存估算及工程观测指标,并对比厂商缓存产品形态,强调缓存主要降低重复输入成本,而非输出成本,需结合场景选择策略。
Prefix Cache 是一种通过检测请求公共前缀来复用计算结果的缓存机制,旨在提升推理性能。使用 Radix Tree 构建缓存时,建议将不变部分放在前面。测试结果显示启用缓存后性能有所提升,但缓存命中率仍需进一步优化。
完成下面两步后,将自动完成登录并继续当前操作。