NVIDIA 发布开源 AI 推理压测工具 AIPerf,用于测量 P99 尾延迟。文章指出平均值会掩盖慢请求,应关注 TTFT、ITL 和分位数。通过 Python 示例展示 P99 能暴露 4.2 秒的延迟尾巴,并介绍 AIPerf 的安装与压测命令,提醒避免只测并发 1、只看平均值等误区,强调优化 P99 才能决定用户体验。
完成下面两步后,将自动完成登录并继续当前操作。