华为开源的KVarN是一种KV Cache量化技术,通过Hadamard旋转和双轴方差归一化,有效解决大模型推理中的显存瓶颈。该技术在2-bit量化下保持接近FP16的精度,显存占用降低至原来的三分之一到五分之一,吞吐量超越FP16,且无需校准,已集成至vLLM框架。
完成下面两步后,将自动完成登录并继续当前操作。