KServe 入门:部署第一个 vLLM 推理服务

KServe 入门:部署第一个 vLLM 推理服务

💡 原文中文,约10500字,阅读约需25分钟。
📝

内容提要

在 Kubernetes 上启动一个推理服务并不难,vLLM + Deployment 就能跑起来。但是服务多起来以后,模型从哪里加载、使用哪个 Runtime、GPU 怎么分配、服务怎么暴露,这些配置很快就会散落在一堆 YAML 里。KServe 就是用来解决模型服务管理问题的。 本文从零安装 KServe Standard 模式和 Envoy Gateway,通过本地 PVC 部署...

🏷️

标签

➡️

继续阅读