原文中文,约500字,阅读约需2分钟。
📝
内容提要
用户测试了专为Qwen优化的推理框架Ninfer,并与优化后的vLLM对比。在Qwen 3.8 27B、开启CUDA Graph下,vLLM的Decode和Prefill性能全面超越Ninfer,解码最高63.34 TPS,Prefill最高3230 TPS,TTFT低至0.15秒。多数场景vLLM更快,250K Prefill和TTFT领先达54.5%。优化后单流解码提升8.6%~14.5%,并发吞吐提升约15.6%。
🏷️