KServe是基于Kubernetes的AI推理平台,分为控制面和数据面。用户提交InferenceService后,Webhook校验配置,Controller根据modelFormat匹配ServingRuntime,合并配置创建Deployment、Service和HTTPRoute。Pod启动时注入PVC存储,HuggingFaceServer自动选择vLLM作为推理后端,加载模型并执行推理。请求经Envoy Proxy转发至Predictor Pod,由vLLM在GPU上完成推理。
完成下面两步后,将自动完成登录并继续当前操作。