动态 KV Cache 技术分享

💡 原文中文,约400字,阅读约需1分钟。
📝

内容提要

提出KV Cache动态调节技术:部署时根据用户输入上下文动态调整显存占用,不再用--gpu-memory-utilization固定分配。按公式2GiB+tokens×87KiB计算,再按256MiB对齐。改动后Qwen 3.8 27B在512K与900K上下文下显存差距约30GB,可省出显存并行跑其他模型。

🏷️

标签

➡️

继续阅读