vLLM是一个加速大语言模型推理的框架,解决了内存管理瓶颈。它提供Helm图表用于应用部署,支持配置、自动扩缩容和资源管理,允许用户灵活配置和管理自定义Kubernetes对象和多种模板。
IBM、Red Hat和Google Cloud在2026年KubeCon欧洲大会上宣布将开源推理框架llm-d捐赠给云原生计算基金会(CNCF)。llm-d旨在通过Kubernetes简化大语言模型的推理,支持多种加速器,提高效率并降低成本。该框架提供可重复的基准测试和兼容性,推动AI推理成为云原生基础设施的重要组成部分。
DeepSeek推出的DualPath推理框架通过引入存储至解码引擎的路径,解决了I/O瓶颈,离线推理吞吐量提升1.87倍,在线服务提升1.96倍,有效利用闲置带宽,显著降低延迟。
我正在开发一个纯 Rust、零依赖的音频 AI 推理框架 lele,专注于语音交互,支持高效的模型编译与优化,并提供多种音频特征提取功能。
Mini-SGLang是一个轻量级、高性能的大语言模型推理框架,旨在简化复杂推理系统。它支持本地和在线部署,兼容OpenAI接口,具备高性能、可读性和多场景应用,适合大规模推理与测试。
Mini-SGLang是一个轻量级高性能推理框架,旨在简化大型语言模型的推理系统,支持本地和在线部署,提供OpenAI兼容API,适合大规模在线推理和批量测试。
vLLM-Omni是一个高效的推理框架,支持文本、图像、视频和音频输入,具备低延迟执行能力。它适用于多模态助手、大规模媒体处理和实时多媒体应用,支持非自回归架构和并行生成模型。
KTransformers是趋境科技与清华大学联合研发的高性能异构推理框架,专注于大模型推理。该框架通过CPU与GPU协同优化算力利用,提升推理效率,支持低算力环境下的大模型应用。其论文入选国际顶会SOSP 2025,获得全球认可,并与主流框架SGLang合作,推动开发者创新。
本文介绍了一种实时检测大规模数据集异常的推理异常检测框架(RADF)。该框架利用自动化算法选择和超参数调优技术(mSelect),具备快速分类和根本原因确定的能力。实验结果显示,RADF在多个公共基准数据集上的AUC值超过0.85,优于现有模型,证明了其在异常检测中的有效性。
本文介绍了在NVIDIA GeForce RTX 5090上安装和配置驱动程序及推理框架(如TLLM、VLLM和SGLANG),提供了详细的命令和环境设置,并测试了不同模型的性能和显存占用。
vLLM 是一款优化的大语言模型推理框架,最新版本 v1.0 提升了推理速度和硬件利用率,支持多 GPU 并行推理,具备 PagedAttention 技术和灵活的 API 设计。未来将持续优化推理效率和扩展性。
vLLM 是一款加速大语言模型推理的框架,解决了内存管理瓶颈,实现了 KV 缓存内存的零浪费。它支持多种量化技术和 LoRA 适配器,并提供离线推理的示例和使用指南。
vLLM 是一款加速大语言模型推理的框架,解决了内存管理瓶颈,实现了几乎零浪费的 KV 缓存。该框架支持 CPU 卸载和 LMCache,并提供示例代码和配置说明,方便用户进行实验和开发。
调度系统通过GPU加速运筹学和机器学习算法,提升了性能和稳定性。为解决性能、稳定性和扩展性问题,采用TritonServer推理框架进行二次开发,优化计算任务调度。经过多次架构迭代,构建了高性能、可扩展的OR+ML混合推理框架,未来将支持不同GPU型号及多级缓存和分布式推理。
vLLM是一个开源的大语言模型推理框架,采用PagedAttention机制优化KV缓存,提升了吞吐量和响应速度。2025年发布的v1版本重构了核心架构,增强了系统稳定性和推理效率,并支持多种调度特性。尽管仍在开发中,vLLM已成为热门项目,提供丰富的教程和模型案例,帮助用户快速上手。
本研究提出了SeriesBench基准,旨在解决多模态大语言模型在理解复杂叙事剧集方面的不足。该基准包含105部剧集和28个任务,采用新标注方法和叙事推理框架,显示现有模型在叙事理解上仍面临挑战,并提供了提升性能的路径。
本研究提出了“双引擎思维框架”(DEoT),旨在解决传统推理框架在开放式问题中的不足。实验结果表明,DEoT在复杂问题上的胜率达到77-86%。
上个月,AI大模型推理框架vLLM发布v1.0版本,计算效率显著提升,推理速度提高1.7倍,支持百亿参数模型的高效部署。同时,hyper.ai官网上线了vLLM入门教程,提供丰富的公共数据集,帮助研究人员快速掌握vLLM。
ReasonFlux是一个多层次的LLM推理框架,通过结构化思维模板和层次化强化学习提高推理效率和可解释性。它在多个数学推理数据集上表现出色,展示了小模型的潜力和广泛应用前景。
vLLM 是一款加速大语言模型推理的框架,解决了内存管理瓶颈,支持在 x86 CPU 上运行。它使用 BF16 数据类型,兼容 AVX512 指令集。用户可通过 Docker 或源代码构建,建议使用 TCMalloc 提升性能,并合理配置 CPU 核心和 KV 缓存以优化并行处理能力。
完成下面两步后,将自动完成登录并继续当前操作。