分享 DeepSeek V4 Flash TP2 模型的并发调优经验:多并发时第二个 Prefill 等待过久,原因是 vLLM 的 --long-prefill-token-threshold 参数默认值 2048 过大,导致首个 Prefill 独占调度。调小该值可增加多 Prefill 调度机会。实测 1024 最佳,8 并发下后续 Prefill 等待从 90 秒降至约 7 秒,总吞吐仅降 2.5%;降至 512 则吞吐损失超 15%。
完成下面两步后,将自动完成登录并继续当前操作。