小红花·文摘
  • 首页
  • 广场
  • 排行榜🏆
  • 直播
  • FAQ
Dify.AI
基于SGLang的大模型推理实践——从benchmark方法论到部署方案选型与调优

随着大语言模型(LLM)的快速发展,模型规模不断增大,对推理部署的要求也越来越高。在实际项目中,如何高效地在GPU集群上部署和优化大模型推理,已经成为AI基础设施团队面临的核心挑战之一。本文基于多个实际项目的经验积累,系统性地介绍大模型推理部署的方法论、部署方案选型、性能调优以及常见问题的解决方案。

基于SGLang的大模型推理实践——从benchmark方法论到部署方案选型与调优

亚马逊AWS官方博客
亚马逊AWS官方博客 · 2026-07-21T05:47:53Z
KServe 入门:部署第一个 vLLM 推理服务

在 Kubernetes 上启动一个推理服务并不难,vLLM + Deployment 就能跑起来。但是服务多起来以后,模型从哪里加载、使用哪个 Runtime、GPU 怎么分配、服务怎么暴露,这些配置很快就会散落在一堆 YAML 里。KServe 就是用来解决模型服务管理问题的。 本文从零安装 KServe Standard 模式和 Envoy Gateway,通过本地 PVC 部署...

KServe 入门:部署第一个 vLLM 推理服务

探索云原生
探索云原生 · 2026-07-19T20:00:00Z
WAIC 2026 | 摩尔线程首次公开多项训练推理实践成果,三大“AI工厂”持续释放算力价值

WAIC 2026 | 摩尔线程首次公开多项训练推理实践成果,三大“AI工厂”持续释放算力价值

量子位
量子位 · 2026-07-19T06:23:00Z
数据集汇总丨英伟达开源Nemotron系列数据集,超10T tokens+40M 条后训练样本,覆盖数学推理/代码生成/多语言对话

训练数据在大模型竞争中至关重要,NVIDIA推出的Nemotron系列数据集强调数据质量和任务适配性,涵盖通用文本预训练、监督微调和代码生成等核心能力,推动模型训练从数量向精准转变。这些数据集为大模型研究提供系统性支持,提升模型能力。

数据集汇总丨英伟达开源Nemotron系列数据集,超10T tokens+40M 条后训练样本,覆盖数学推理/代码生成/多语言对话

HyperAI超神经
HyperAI超神经 · 2026-07-17T08:06:36Z
ABot-AgentOS——具备多模态记忆的通用智能体操作系统:Agent Harness层(含上下文管理和验证系统)、LLM、记忆作为大脑,自主调用下层导航、操作、运控相关的技能

ABot-AgentOS是一种通用机器人智能体操作系统,旨在解决具身智能中的推理与执行、泛化和持久记忆等挑战。该系统结合多模态感知、记忆和推理,支持机器人在物理世界中的长期交互。通过边缘-云协同架构,ABot-AgentOS能够高效执行任务并优化技能,其多模态记忆系统确保机器人持续学习和利用经验,提升智能体整体能力。

ABot-AgentOS——具备多模态记忆的通用智能体操作系统:Agent Harness层(含上下文管理和验证系统)、LLM、记忆作为大脑,自主调用下层导航、操作、运控相关的技能

结构之法 算法之道
结构之法 算法之道 · 2026-07-17T07:56:33Z

卡内基梅隆大学与国际金融管理学院的研究提出了SR2AM架构,将大语言模型的决策过程分为三个系统,显著提升了30B参数模型的性能,达到685B至1T参数级别,同时减少了25.8%至95.3%的token消耗。该架构通过自我调节模块优化了规划与执行的平衡,提高了效率与准确性,实验结果表明SR2AM在不同规模模型上均有效,能够动态分配计算资源。

一分钟读论文:《SR2AM:自我调节模拟规划如何实现高效Agent推理》

Micropaper
Micropaper · 2026-07-16T00:00:00Z
一分钟读论文:《Procedural Memory Distillation:Agent经验复用的程序性记忆蒸馏》

Semih Yavuz等人的研究提出了一种新方法,将过程性信号转化为可复用的程序性记忆,从而提升语言模型的性能。该方法通过三级抽象和协同进化,确保模型在推理时无需外部记忆模块,减少延迟并提高效率。实验结果表明,PMD在LIVECODEBENCH基准上相较于传统方法有显著提升,并在不同难度问题上表现一致。

一分钟读论文:《Procedural Memory Distillation:Agent经验复用的程序性记忆蒸馏》

Micropaper
Micropaper · 2026-07-16T00:00:00Z
Thinking Machines推出的Inkling现已在AI Gateway上可用

Inkling是Thinking Machines推出的通用AI模型,支持推理和编程等多种任务。用户可通过AI Gateway访问,设置为thinkingmachines/inkling。该平台提供统一API,能够跟踪使用情况和成本,并支持自定义报告和预算管理。

Thinking Machines推出的Inkling现已在AI Gateway上可用

Vercel News
Vercel News · 2026-07-15T00:00:00Z
CLaRa:通过连续潜在推理连接检索与生成

CLaRa(连续潜在推理)是一种通过嵌入式压缩和联合优化提升检索增强生成(RAG)模型性能的统一框架。它采用基于问答和释义监督的SCP框架,生成语义丰富的压缩向量,从而减少输入生成器的文档长度。CLaRa通过单一语言建模损失进行端到端训练,实验结果表明其在多个问答基准上表现优异,达到了先进的压缩和重排序性能。

CLaRa:通过连续潜在推理连接检索与生成

Apple Machine Learning Research
Apple Machine Learning Research · 2026-07-15T00:00:00Z

大型语言模型(LLM)在生产环境中的应用可能导致延迟和成本增加。优化策略包括测量延迟、减少输出令牌、使用小模型处理简单任务、减少模型调用次数、设计可缓存的提示、添加多层缓存、控制上下文预算、批处理非交互式工作、优化批处理、管理缓存和上下文长度、基准测试优化效果、实施流量控制和优雅降级。这些方法能有效降低延迟和成本,提高系统效率。

在生产环境中减少大型语言模型延迟和推理成本的12种方法

KDnuggets
KDnuggets · 2026-07-14T12:00:33Z
在线教程|9B 小模型也能复杂推理,基于 Qwen3.5-9B,Qwythos 融合 Claude 推理经验实现能力跃升

Empero 开源了 Qwythos-9B-Claude-Mythos-5-1M,这是一款增强推理能力的小模型,拥有 90 亿参数。该模型通过高质量数据提升复杂推理任务的表现,支持长上下文和工具调用,拓展了多模态应用。HyperAI 提供了快速部署和测试的资源,方便开发者使用。

在线教程|9B 小模型也能复杂推理,基于 Qwen3.5-9B,Qwythos 融合 Claude 推理经验实现能力跃升

HyperAI超神经
HyperAI超神经 · 2026-07-14T05:59:31Z
内在语言揭秘:人类思考为何离不开词语生成?

语言不仅是思想的表达工具,也是思维生成的关键。内在语言帮助人们构建和明确想法,促进推理和创造。语言的自回归特性影响思维路径,个体思维与社会经验相连,促进认知和情感调节。未来智能系统可能结合潜空间推理与语言生成,语言在智能发展中将扮演重要角色。

内在语言揭秘:人类思考为何离不开词语生成?

极道
极道 · 2026-07-14T00:01:00Z
ICML 26杰出论文:清华JustGRPO攻克dLLM推理瓶颈;告别简单指令测试:Agents Last Exam 全面评估智能体长程专业能力

清华大学团队在ICML 26上获得杰出论文奖,提出了JustGRPO模型,解决了扩散语言模型(dLLM)在数学和编程推理中的灵活性陷阱问题。该模型在GSM8K基准测试中取得89.1%的准确率,展示了其推理潜力。

ICML 26杰出论文:清华JustGRPO攻克dLLM推理瓶颈;告别简单指令测试:Agents Last Exam 全面评估智能体长程专业能力

HyperAI超神经
HyperAI超神经 · 2026-07-13T03:28:59Z
Cohere推出硬件感知的动态推测解码:推理速度翻倍

Cohere推出了动态推测解码技术,能够根据显卡状态实时调整猜字数量,从而解决了固定数量导致的速度瓶颈。该技术在不同批次大小下优化性能,提升推理速度,特别是在强化学习和大模型服务中表现突出。动态方案确保在各种环境下的稳定性,避免了传统方法的速度波动问题,并已整合进vLLM框架,用户可直接受益。

Cohere推出硬件感知的动态推测解码:推理速度翻倍

极道
极道 · 2026-07-12T00:56:00Z
AI论文评审:自一致性提升语言模型中的链式思维推理

自一致性是一种新型解码策略,通过生成多个独立推理路径并选择最一致的答案,显著提升大型语言模型的推理能力。该方法克服了传统链式思维的局限,允许模型在选择答案前探索多种可能性,从而提高准确性。实验表明,自一致性在算术、常识和符号推理任务中表现优异,证明更好的推理不一定依赖于更大的模型或额外的训练。

AI论文评审:自一致性提升语言模型中的链式思维推理

freeCodeCamp.org
freeCodeCamp.org · 2026-07-08T18:55:53Z

本文探讨了如何将开源语言模型转化为可用的API服务,涵盖模型推理、请求调度和显存管理等技术细节。强调了LLM推理过程,包括输入文本和生成下一个token的预测,介绍了模型生命周期、文件结构、量化技术及其对显存的影响,并讨论了服务框架选择和并发处理的重要性。

大语言模型推理服务知识梳理

Fernweh
Fernweh · 2026-07-08T13:39:46Z
DeepSeek秘密造芯!专攻推理,一年前已启动,招聘全程不公开

DeepSeek正在秘密开发自研AI推理芯片,以降低对英伟达的依赖。该项目已启动一年,目前处于早期阶段,DeepSeek与多家芯片设计和制造公司接洽。公司计划通过自研芯片应对算力需求变化,专注于推理场景以降低功耗和成本。2026年,DeepSeek完成首轮融资,筹集约510亿元人民币,资金将用于扩建算力中心和人才团队。

DeepSeek秘密造芯!专攻推理,一年前已启动,招聘全程不公开

量子位
量子位 · 2026-07-08T04:47:04Z
早报|曝苹果折叠屏iPhone已在量产/DeepSeek或自研AI推理芯片/今年618手机销量同比下滑13%

DeepSeek正在开发自研AI推理芯片,以减少对英伟达的依赖,目前项目处于早期阶段。苹果的折叠屏iPhone已进入量产,预计生产1000万部。618购物节期间,中国智能手机销量同比下降13%。小米计划在未来三年内在AI领域投入600亿元,并调整小爱同学架构。

早报|曝苹果折叠屏iPhone已在量产/DeepSeek或自研AI推理芯片/今年618手机销量同比下滑13%

爱范儿
爱范儿 · 2026-07-08T00:07:58Z
八大开源模型推理路径对比:GLM DeepSeek Qwen

八个主流大语言模型在解答同一道概率题时表现出显著的思维路径差异。GLM 5.2表现自信,修正较少;而DeepSeek V4 Pro则频繁自我怀疑,思维过程复杂。可视化树状图显示了模型的认知风格,指出自我怀疑与模型性能之间的关系尚不明确,需进一步研究。

八大开源模型推理路径对比:GLM DeepSeek Qwen

极道
极道 · 2026-07-07T02:58:00Z
语言模型中的全局工作空间:Anthropic最新可解释性发现

Anthropic的研究揭示了Claude语言模型中的“J空间”,这是一个激活少量概念以进行推理的小型工作区。研究发现Claude能够在心中记住概念而不影响输出,并能识别“虚假”标签,显示其对监控的意识。删除J空间后,Claude在复杂推理中的表现显著下降。这一发现对AI的可解释性和安全性具有重要意义,可能影响未来的AI对齐和隐私讨论。

语言模型中的全局工作空间:Anthropic最新可解释性发现

极道
极道 · 2026-07-06T23:53:00Z
  • <<
  • <
  • 1 (current)
  • 2
  • 3
  • >
  • >>
👤 个人中心
在公众号发送验证码完成验证
登录验证
在本设备完成一次验证即可继续使用

完成下面两步后,将自动完成登录并继续当前操作。

1 关注公众号
小红花技术领袖公众号二维码
小红花技术领袖
如果当前 App 无法识别二维码,请在微信搜索并关注该公众号
2 发送验证码
在公众号对话中发送下面 4 位验证码
小红花技术领袖俱乐部
小红花·文摘:汇聚分发优质内容
小红花技术领袖俱乐部
Copyright © 2021-
粤ICP备2022094092号-1
公众号 小红花技术领袖俱乐部公众号二维码
视频号 小红花技术领袖俱乐部视频号二维码