vLLM 推出硬件无关模型层,采用双轨架构:热门模型走硬件专用路径以提升性能,长尾模型和非主流加速器保留通用可编译路径。官方称在 H100 上三种模型吞吐差距不超过 3.4%。建议建立模型—硬件兼容矩阵,用真实流量验收正确性、吞吐、P99 和显存,并锁定提交版本。
完成下面两步后,将自动完成登录并继续当前操作。