本文通过vLLM在单GPU上的基准测试,对比了吞吐量与“有效吞吐量”(goodput,即满足延迟目标的请求数)。结果显示,仅优化吞吐量会牺牲TPOT延迟,导致服务体验变差。作者强调,应设定TTFT和TPOT目标,通过自动化搜索寻找最佳配置,而非盲目追求高吞吐量,并指出配置需随流量和模型变化持续调整。
完成下面两步后,将自动完成登录并继续当前操作。