Kubernetes 集群看似健康,但 LLM 应用在高峰时仍严重延迟。瓶颈不在模型,而在路由、排队、预填充和解码四个阶段:负载均衡按连接分配、自动扩缩容因冷启动滞后、GPU 碎片化、入口超时与缓冲破坏流式输出。建议按 token 吞吐规划容量,用队列深度扩缩容,监控首 token 延迟,并明确平台与应用团队的责任归属。
完成下面两步后,将自动完成登录并继续当前操作。