Agent时代长上下文推理导致KV Cache急剧膨胀,显存不足会清空缓存并触发重复Prefill,推高首Token延迟。英特尔提出以CPU管理分层存储与硬件压缩为核心的优化方案,包括KV Shrink、KV Fuse、KV Cascade和KV Infinity,并借助QAT加速压缩。测试表明该方案可显著降低TTFT、节省缓存空间,使GPU专注生成新Token。
完成下面两步后,将自动完成登录并继续当前操作。