小红花·文摘
  • 首页
  • AI Tokens🪙
  • 排行榜🏆
  • 直播
  • FAQ
Dify.AI
测量Transformer推理性能

本文介绍如何测量Transformer模型推理性能,核心指标包括延迟、首令牌时间(TTFT)、每输出令牌时间(TPOT)、吞吐量、内存使用和每令牌成本。测量需区分预填充和解码阶段,使用墙钟计时或CUDA事件,并注意GPU同步和预热。并发请求测试可评估吞吐量,多GPU可复制或分区模型。最终需结合成本与质量评估系统效率。

测量Transformer推理性能

MachineLearningMastery.com MachineLearningMastery.com · 2026-08-04T14:00:56Z
阿里云:真武芯片超节点已成功适配Qwen3.8,上线百炼提供推理服务

阿里真武M890超节点成功适配Qwen3.8,上线阿里云百炼平台,成为国内首个运行超2万亿参数大模型的超节点。该超节点通过高速互联芯片实现64张GPU卡800GB/s连接,显存达9TB,支持大规模MoE模型,推理性能最高提升1.5倍,显著降低推理成本。

阿里云:真武芯片超节点已成功适配Qwen3.8,上线百炼提供推理服务

量子位 量子位 · 2026-07-23T06:58:23Z
OpenAI与博通推出优化大语言模型推理的芯片

OpenAI与博通联合推出Jalapeño智能处理器,旨在提升大语言模型的推理性能。该处理器在九个月内完成设计与生产,优化了计算、内存和网络资源,预计将显著提高每瓦特性能,支持未来多代AI模型,推动AI更快、更可靠和更普及。

OpenAI与博通推出优化大语言模型推理的芯片

OpenAI OpenAI · 2026-06-24T06:00:00Z
动态批处理:实用指南

动态批处理通过实时组合多个推理请求,提高GPU利用率并减少延迟。语义缓存在请求到达推理队列前识别并重用相似查询的响应,从而降低成本和延迟。Redis为AI工作负载提供高效的实时数据平台,优化推理性能。

动态批处理:实用指南

Redis Blog Redis Blog · 2026-06-21T00:00:00Z
推理阿尔法:在AMD上最大化前沿模型

DigitalOcean致力于为下一代AI提供高性能基础设施,专注于在AMD GPU上托管大型语言模型(LLMs)。通过深度优化软件堆栈,显著提升了推理性能并降低了成本。研究表明,优化硬件与软件的互动可以提高效率,未来将发布针对不同前沿模型的技术优化分析。

推理阿尔法:在AMD上最大化前沿模型

The DigitalOcean Blog The DigitalOcean Blog · 2026-06-10T14:27:49Z
下一代大模型推理网络架构:ZCube如何有效破解网络瓶颈?

ZCube架构通过扁平化网络设计解决了PD分离部署中的网络拥塞问题,相较于传统ROFT架构,在成本、吞吐量和延迟上均有显著提升,降低了结构性拥塞的发生概率,提升了推理性能和成本效率。

下一代大模型推理网络架构:ZCube如何有效破解网络瓶颈?

实时互动网 实时互动网 · 2026-05-21T03:12:07Z
我们如何在DigitalOcean NVIDIA HGX™ B300 GPU Droplets上构建最具性能的DeepSeek V3.2、MiniMax-M2.5和Qwen 3.5 397B

DigitalOcean推出DeepSeek V3.2、MiniMax-M2.5和Qwen 3.5 397B,优化了硬件和软件,提升了推理速度和效率,满足现代AI应用的低延迟需求。

我们如何在DigitalOcean NVIDIA HGX™ B300 GPU Droplets上构建最具性能的DeepSeek V3.2、MiniMax-M2.5和Qwen 3.5 397B

The DigitalOcean Blog The DigitalOcean Blog · 2026-04-28T09:00:00Z
DeepSeek-V4发布,华为云首发适配

华为云于4月24日发布并开源DeepSeek-V4模型,该模型支持百万Token超长上下文,提升了推理性能和经济性。新模型已被金山办公、360等企业接入,支持高效API服务,优化了调度和计算效率。

DeepSeek-V4发布,华为云首发适配

量子位 量子位 · 2026-04-24T10:10:16Z
最强开源模型 DeepSeek V4 发布,1M上下文,运行成本大降

DeepSeek V4 发布,具备 1M 上下文和显著提升的代码能力,推理性能接近顶尖模型。新注意力机制降低计算需求,支持更多请求。V4 Pro 价格上涨,但在知识和推理任务上表现优异。现已上线官网和 API,无法自行部署。

最强开源模型 DeepSeek V4 发布,1M上下文,运行成本大降

小众软件 小众软件 · 2026-04-24T04:05:20Z

PyTorch 2引入torch.export功能,允许将模型导出为静态图以优化推理性能。自定义操作可通过无状态的torch.ops或有状态的torch.classes定义。导出时需避免数据依赖形状和控制流,以确保模型可静态表示。导出的模型可在Python中保存和加载,但在C++中需使用AOTInductor或Executorch进行优化和编译,确保模型无图断裂是推理的关键。

PyTorch 导出

Lei Mao's Log Book Lei Mao's Log Book · 2026-03-31T07:00:00Z
迎接高性能、低成本推理的新标准:NVIDIA Dynamo 1.0现已向DigitalOcean客户开放

NVIDIA Dynamo 1.0在GTC发布,现已为DigitalOcean客户提供,推理性能提升7倍,成本降低。结合DigitalOcean的Agentic Inference Cloud,客户可高效部署,优化推理工作负载,支持GPU集群,提升吞吐量和降低延迟。

迎接高性能、低成本推理的新标准:NVIDIA Dynamo 1.0现已向DigitalOcean客户开放

The DigitalOcean Blog The DigitalOcean Blog · 2026-03-19T22:13:37Z
DigitalOcean的Agentic推理云如何通过NVIDIA GPU为Workato实现67%的推理成本降低

Workato的AI研究实验室与DigitalOcean合作,利用NVIDIA Dynamo和vLLM优化推理性能。通过引入KV感知路由,显著提高了GPU的吞吐量和响应速度,分别提升67%和降低79%的延迟,从而降低了推理成本和所需GPU数量。

DigitalOcean的Agentic推理云如何通过NVIDIA GPU为Workato实现67%的推理成本降低

The DigitalOcean Blog The DigitalOcean Blog · 2026-03-03T04:55:00Z
英伟达宣布因内存供应紧张 其AI工作站DGX SPARK从3,999美元涨价到4,699美元

由于内存供应紧张,英伟达将迷你 AI 工作站 DGX SPARK 的价格从 3,999 美元上涨至 4,699 美元,涨幅达18%。该工作站支持本地运行200B参数模型,推理性能达到1petaFLOP。

英伟达宣布因内存供应紧张 其AI工作站DGX SPARK从3,999美元涨价到4,699美元

蓝点网 蓝点网 · 2026-03-02T00:30:31Z
在Amazon SageMaker AI和Amazon Bedrock上高效服务数十个微调模型与vLLM

为解决多模型AI服务的闲置GPU成本问题,我们与vLLM社区合作开发了Multi-LoRA技术,允许多个模型共享同一GPU,优化MoE模型的推理性能。该技术通过保持原始权重不变,仅调整小型适配器,显著提升了输出速度并降低了延迟,适用于多个开源MoE模型,并已在Amazon SageMaker和Bedrock上实现。

在Amazon SageMaker AI和Amazon Bedrock上高效服务数十个微调模型与vLLM

vLLM Blog vLLM Blog · 2026-02-26T00:00:00Z

文章讨论了AI基础设施的最新动态,重点在于硬件加速和智能体记忆层的进展。ntransformer和Taalas ASIC优化了推理性能,Aethene和zclaw则提出了智能体记忆和边缘部署的新思路。企业AI正向规模化发展,推理成本成为关键挑战。

AI Infra Brief|硬件加速与智能体记忆层突破(2026.02.23)

dotNET跨平台 dotNET跨平台 · 2026-02-24T00:01:38Z

谷歌发布Gemini 3.1 Pro,推理性能是3 Pro的两倍,支持复杂任务生成3D可视化内容。该模型在多模态理解和长上下文方面有显著提升,用户反馈良好,定价与前代相同,智能成本持续下降,推动大模型发展。

谷歌突发Gemini 3.1 Pro!首次采用「.1」版本号,推理性能×2的那种

量子位 量子位 · 2026-02-20T01:25:54Z
Mooncake正式加入PyTorch生态系统

Mooncake正式加入PyTorch生态系统,专注于开放治理和与PyTorch社区的长期合作。它提供高效的通信和存储基础设施,支持分散的LLM架构,提升推理性能。Mooncake的功能包括预填充与解码分离、全局KVCache重用、弹性专家并行和容错分布式后端,已被多家知名企业广泛采用。

Mooncake正式加入PyTorch生态系统

Home | KVCache.ai Home | KVCache.ai · 2026-02-12T00:00:00Z

讯飞星火X2大模型发布,推理性能提升50%,在数学和逻辑推理等核心能力上表现优异。该模型基于国产算力,支持多语言,广泛应用于医疗、教育和汽车等领域,推动行业升级,彰显国产AI实力。

神仙打架+1!讯飞星火X2硬核亮相,行业深度全面升级

量子位 量子位 · 2026-02-11T15:46:31Z

面壁智能推出的全模态大模型MiniCPM-o 4.5与众智FlagOS系统合作,实现对六大主流AI芯片的快速适配,推理性能显著优于原生方案。FlagOS提供高效的跨芯片软件栈,确保模型在多硬件上高效运行,推动AI技术广泛应用。

“一次开发,跨芯运行”:众智FlagOS与面壁智能联手,破解 AI大模型跨芯适配难题

量子位 量子位 · 2026-02-06T06:01:12Z

MIT研究团队提出递归语言模型RLM,解决大模型在处理超长文本时的上下文腐烂问题。RLM通过交互式Python环境动态拆解任务,实现千万级token处理能力,显著提升推理性能,无需修改模型架构。

真·开外挂!MIT新研究:架构0改动,让大模型解锁千万级上下文

量子位 量子位 · 2026-01-19T03:59:54Z
  • <<
  • <
  • 1 (current)
  • 2
  • 3
  • >
  • >>
👤 个人中心
在公众号发送验证码完成验证
登录验证
在本设备完成一次验证即可继续使用

完成下面两步后,将自动完成登录并继续当前操作。

1 关注公众号
小红花技术领袖公众号二维码
小红花技术领袖
如果当前 App 无法识别二维码,请在微信搜索并关注该公众号
2 发送验证码
在公众号对话中发送下面 4 位验证码
友情链接: MOGE.AI 九胧科技 1tok 菜鸟教程 Remio.AI DeekSeek连连 53AI 神龙海外代理IP IPIPGO全球代理IP 东波哥的博客 匡优考试在线考试系统 开源服务指南 蓝莺IM Solo 独立开发者社区 AI酷站导航 极客Fun 我爱水煮鱼 周报生成器 He3.app 简单简历 白鲸出海 T沙龙 职友集 TechParty 蟒周刊 Best AI Music Generator 模力方舟 Gitee AI

小红花技术领袖俱乐部
小红花·文摘:汇聚分发优质内容
小红花技术领袖俱乐部
Copyright © 2021-
粤ICP备2022094092号-1
公众号 小红花技术领袖俱乐部公众号二维码
视频号 小红花技术领袖俱乐部视频号二维码