小红花·文摘
  • 首页
  • AI Tokens🪙
  • 排行榜🏆
  • 直播
  • FAQ
【vLLM 学习】Eagle

vLLM 是加速大语言模型推理的框架,实现KV缓存零浪费。文章提供Helm图表部署配置及EAGLE投机解码示例,通过离线推理脚本展示如何用vLLM加载模型、设置采样参数并计算平均接受token长度,以优化推理性能。

【vLLM 学习】Eagle

HyperAI超神经 HyperAI超神经 · 2026-08-31T11:09:52Z
3 张卡到底能不能跑大模型推理?从 vLLM、llama.cpp 到 TensorSharp 的多卡真相 - 张善友

vLLM的并行限制源于注意力头数需被TP大小整除,而非固定1/2/4/8卡;llama.cpp采用层切分,通信量小,卡数影响不大,关键在互联类型。TensorSharp引擎同时支持层切分和张量并行,3卡跑744B模型性能超llama.cpp,但TP对互联敏感,2卡仅提升1.4倍。核心结论:层切分对卡数免疫,TP对互联敏感。

3 张卡到底能不能跑大模型推理?从 vLLM、llama.cpp 到 TensorSharp 的多卡真相 - 张善友

张善友 张善友 · 2026-08-27T22:40:00Z
vLLM 默认多模态参数导致 Qwen 3.8 27B 报错

vLLM部署Qwen 3.8 27B时,默认参数限制了图片和视频输入,导致报错。通过删除`--limit-mm-per-prompt.image 2`和`--limit-mm-per-prompt.video 0`并重启Docker,问题得到解决,模型恢复正常。

vLLM 默认多模态参数导致 Qwen 3.8 27B 报错

Andy Stewart Andy Stewart · 2026-08-27T16:00:00Z
KServe 集成 KEDA:基于 vLLM 指标自动扩缩容

本文介绍如何为KServe模型服务接入KEDA,实现基于vLLM指标的自动扩缩容。通过安装KEDA和Prometheus,配置InferenceService和ServiceMonitor,利用vLLM暴露的请求指标,KEDA查询Prometheus数据并驱动HPA调整副本数。实测验证了服务从1个副本扩至2个再缩回1个的完整流程,有效平衡突发请求与资源利用率。

KServe 集成 KEDA:基于 vLLM 指标自动扩缩容

探索云原生 探索云原生 · 2026-08-26T20:00:00Z
EP223:Ollama对比vLLM与SGLang

本文对比了三种开源模型推理引擎:Ollama适合本地开发,vLLM适合高并发服务,SGLang适合多轮对话和智能体场景。此外,简述了Claude文本水印技术原理、Git常用命令、Kafka与RabbitMQ的区别,以及12个热门Agent技能仓库。

EP223:Ollama对比vLLM与SGLang

ByteByteGo Newsletter ByteByteGo Newsletter · 2026-08-22T15:31:34Z
【vLLM 学习】Distributed

本文介绍vLLM框架及其Helm图表部署方法,并展示一个使用Ray Data进行多节点分布式离线批处理推理的Python示例。示例通过LLMPredictor类调用Llama-2模型,配置采样参数、张量并行和实例数,从S3读取文本数据,批量生成文本并输出结果。

【vLLM 学习】Distributed

HyperAI超神经 HyperAI超神经 · 2026-08-22T09:53:44Z
如何使用vLLM扩展AI代理的LLM推理

本教程介绍如何使用vLLM扩展AI代理的LLM推理。文章解释了LLM推理的预填充和解码阶段,以及AI代理工作负载为何难以服务。vLLM通过连续批处理、PagedAttention和前缀缓存优化并发推理。教程演示了在本地安装vLLM、启动服务器,并通过OpenAI兼容API连接AI代理的步骤,最后讨论了这些优化技术的重要性及适用场景。

如何使用vLLM扩展AI代理的LLM推理

freeCodeCamp.org freeCodeCamp.org · 2026-08-17T20:49:36Z
7个自托管推理服务器终极对比:vLLM与SGLang谁领跑

自托管推理服务器的选择取决于工作负载类型,而非仅看吞吐量或显卡。单模型方案(如vLLM、SGLang)性能最优,但多模型运维成本高;多模型方案(如LocalAI、SIE)省心但单模型性能有妥协。实际生产常需混合使用:vLLM或SGLang处理大模型,SIE管理小模型集群,TEI负责嵌入与重排,Ollama适合开发原型。

7个自托管推理服务器终极对比:vLLM与SGLang谁领跑

极道 极道 · 2026-08-17T02:54:00Z

vLLM 是加速大语言模型推理的框架,通过高效KV缓存管理减少内存浪费。文章提供Helm图表部署配置,并演示解耦预填充示例:启动预填充和解码两个实例,通过代理服务器传输KV缓存,实现请求处理,包含安装依赖、启动服务及测试请求的完整流程。

【vLLM 学习】Disaggregated Prefill

HyperAI超神经 HyperAI超神经 · 2026-08-07T07:49:38Z
KServe 工作流程:从 InferenceService 到 vLLM 服务

KServe是基于Kubernetes的AI推理平台,分为控制面和数据面。用户提交InferenceService后,Webhook校验配置,Controller根据modelFormat匹配ServingRuntime,合并配置创建Deployment、Service和HTTPRoute。Pod启动时注入PVC存储,HuggingFaceServer自动选择vLLM作为推理后端,加载模型并执行推理。请求经Envoy Proxy转发至Predictor Pod,由vLLM在GPU上完成推理。

KServe 工作流程:从 InferenceService 到 vLLM 服务

探索云原生 探索云原生 · 2026-08-01T20:00:00Z

vLLM是加速大语言模型推理的框架,实现KV缓存内存零浪费。本文提供Helm图表部署配置,并展示使用OpenAI入口点兼容Cohere SDK的Rerank API示例,通过vLLM服务BAAI/bge-reranker-base模型,演示v1和v2客户端调用重排序功能。

【vLLM 学习】Cohere Rerank Client

HyperAI超神经 HyperAI超神经 · 2026-07-30T03:22:14Z
一个 Deployment 就能跑 vLLM,为什么还需要 KServe?

KServe是Kubernetes上的AI推理平台,用于管理模型服务。本文介绍从零安装KServe Standard模式和Envoy Gateway,通过PVC部署Qwen2.5-0.5B-Instruct模型。步骤包括安装cert-manager、Envoy Gateway、创建Gateway、安装KServe,然后下载模型、创建PV/PVC和InferenceService,最后通过OpenAI兼容接口请求API。KServe将模型地址、Runtime、GPU资源和访问入口统一收敛到InferenceService中,简化推理服务管理。

一个 Deployment 就能跑 vLLM,为什么还需要 KServe?

探索云原生 探索云原生 · 2026-07-28T20:00:00Z
在Kubernetes中使用vLLM运行自托管的大型语言模型(LLM)

本文介绍了在Kubernetes环境中自托管大型语言模型(LLM)的设置,使用vLLM作为推理引擎,LINSTOR提供持久存储。自托管可降低成本、提高控制力,并满足数据合规要求。通过创建持久卷声明和密钥,部署vLLM推理服务器,确保模型权重缓存以加快重启速度,支持高并发请求,适合混合AI应用。

在Kubernetes中使用vLLM运行自托管的大型语言模型(LLM)

Cloud Native Computing Foundation Cloud Native Computing Foundation · 2026-07-16T11:00:00Z
KVarN:华为用于KVCache量化的原生vLLM后端

华为开源的KVarN是一种KV Cache量化技术,通过Hadamard旋转和双轴方差归一化,有效解决大模型推理中的显存瓶颈。该技术在2-bit量化下保持接近FP16的精度,显存占用降低至原来的三分之一到五分之一,吞吐量超越FP16,且无需校准,已集成至vLLM框架。

KVarN:华为用于KVCache量化的原生vLLM后端

极道 极道 · 2026-06-04T22:18:00Z

本文介绍了如何在内网升级vLLM及AI模型。建议定期更新vLLM以获取新特性,通过简单命令安装新版vLLM,并使用huggingface-cli下载新模型。将新环境和模型打包后,部署到内网机器上,注意保持路径一致,避免不兼容问题。最终成功部署了Qwen 3.6模型。

内网升级vLLM及模型教程

tlanyan tlanyan · 2026-06-02T03:28:19Z
vLLM的Rust前端PR了,预处理吞吐量直接翻了5倍!

在新加坡的 PyTorch 会议上,Bugen Zhao 介绍了 vLLM 团队用 Rust 重写 Python 前端的工作,以解决高并发下的性能瓶颈。Rust 前端的吞吐量提升约 5.16 倍,CPU 占用降低,长尾延迟收敛,用户无需额外操作,Rust 二进制文件已打包进 Python Wheel,支持主要 API。

vLLM的Rust前端PR了,预处理吞吐量直接翻了5倍!

迷途小书童 迷途小书童 · 2026-05-31T10:37:43Z
使用vLLM + Qwen3.5部署内网AI笔记

本文介绍了如何在内网使用vLLM和Qwen3.5部署AI模型。部署环境要求为NVIDIA A100/V100 GPU和Ubuntu 22.04 LTS系统。首先安装GPU驱动和CUDA Toolkit,然后通过UV管理Python环境并安装vLLM。接着,使用Hugging Face CLI下载Qwen3.5模型并配置运行参数。最后,利用Nginx进行负载均衡,以确保多GPU的高效使用。

使用vLLM + Qwen3.5部署内网AI笔记

tlanyan tlanyan · 2026-05-25T10:39:20Z
理解 KV Cache:Attention、P/D 分离与 vLLM 的页式显存管理

本文探讨了大语言模型中KV Cache的产生与管理及其在推理过程中的重要性。KV Cache通过缓存历史K/V向量,优化生成过程并减少计算复杂度。Prefill阶段处理所有输入,而Decode阶段逐步生成输出,二者需分离以提升性能。vLLM采用页式内存管理,解决内存碎片问题,提升存储效率,确保高效的推理系统。

理解 KV Cache:Attention、P/D 分离与 vLLM 的页式显存管理

Steins;Lab Steins;Lab · 2026-05-06T16:28:41Z

本文讨论了从单机到多节点分布式推理部署的架构变化,强调了流水线并行(PP)与张量并行(TP)的结合使用。通过与Ray框架集成,vLLM实现了高效的分布式推理,管理集群资源并协调任务。文章还介绍了Ray集群的搭建、vLLM的配置及生产环境的优化建议,包括网络通信、性能调优和监控等关键步骤。

vLLM集成Ray分布式推理模型部署实战

安志合的学习博客 安志合的学习博客 · 2026-05-05T12:50:03Z
月之暗面最强模型 Kimi-K2.6 正式开源 —— 附 vLLM 部署实战

Kimi-K2.6是Moonshot AI于4月20日发布的开源大语言模型,具备长上下文推理和多模态理解能力。文章介绍了模型的下载、部署及性能基准测试,强调其在多项评测中的优异表现。Kimi-K2.6支持工具调用和视觉-语言输入,适合多种应用场景。

月之暗面最强模型 Kimi-K2.6 正式开源 —— 附 vLLM 部署实战

探索云原生 探索云原生 · 2026-04-22T20:00:00Z
  • <<
  • <
  • 1 (current)
  • 2
  • 3
  • >
  • >>
👤 个人中心
在公众号发送验证码完成验证
登录验证
在本设备完成一次验证即可继续使用

完成下面两步后,将自动完成登录并继续当前操作。

1 关注公众号
小红花技术领袖公众号二维码
小红花技术领袖
如果当前 App 无法识别二维码,请在微信搜索并关注该公众号
2 发送验证码
在公众号对话中发送下面 4 位验证码
友情链接: MOGE.AI 九胧科技 1tok 菜鸟教程 Remio.AI DeekSeek连连 53AI 神龙海外代理IP IPIPGO全球代理IP 东波哥的博客 匡优考试在线考试系统 开源服务指南 蓝莺IM Solo 独立开发者社区 AI酷站导航 极客Fun 我爱水煮鱼 周报生成器 He3.app 简单简历 白鲸出海 T沙龙 职友集 TechParty 蟒周刊 Best AI Music Generator 模力方舟 Gitee AI

小红花技术领袖俱乐部
小红花·文摘:汇聚分发优质内容
小红花技术领袖俱乐部
Copyright © 2021-
粤ICP备2022094092号-1
公众号 小红花技术领袖俱乐部公众号二维码
视频号 小红花技术领袖俱乐部视频号二维码