小红花·文摘
  • 首页
  • 广场
  • 排行榜🏆
  • 直播
  • FAQ
Dify.AI
英伟达Blackwell张量核心真相:矩阵乘法竟变内存泄漏重灾区

在B200上跑矩阵乘法根本不用线程堆,malloc一个内存块就能把它召唤出来,这听起来像黑客帝国还是像英伟达疯了? 黑威尔Blackwell架构把GPU矩阵乘法从"一群人一起算"变成了"一个人下单、一群人收快递",张量核心(Tensor Core)自带独立内存、异步执行、还能内存泄漏,NVIDIA B200正在重写整个CUDA编程范式。...

英伟达Blackwell张量核心真相:矩阵乘法竟变内存泄漏重灾区

极道
极道 · 2026-07-18T06:01:00Z

嘿嘿,一番摸索,给挖出来了! Blackwell 原生支持 INT4 满血算力!

从未公开!震惊了!Blackwell 原生支持 INT4 满血算力

千千
千千 · 2026-07-11T12:53:53Z
Claude与Blackwell Ultra相遇:Anthropic的模型现已在Azure上运行于NVIDIA GB300

Anthropic的Claude模型现已在微软Azure上运行,利用NVIDIA GB300 Blackwell Ultra GPU,企业可以构建自主和特定领域的AI代理。这一合作增强了开发者的能力,使AI代理能够深度嵌入业务中,提升效率并降低成本。

Claude与Blackwell Ultra相遇:Anthropic的模型现已在Azure上运行于NVIDIA GB300

NVIDIA Blog
NVIDIA Blog · 2026-06-29T17:00:19Z

本文探讨了GPU算子工程的最新趋势,包括Hopper架构的TMA和wgmma特性、FP8到FP4的精度降低、ThunderKittens库的简化编程模型,以及编译器自动化优化算子的未来。强调理解硬件执行模型的重要性,以有效利用新工具和指令,整体方法论围绕数据复用、访存优化和性能分析展开,旨在提升算子开发效率。

【GPU 算子工程】趋势:TMA、Blackwell、ThunderKittens 与编译器协同

土法炼钢兴趣小组的博客
土法炼钢兴趣小组的博客 · 2026-06-28T00:00:00Z
最快、最大、最强:NVIDIA Blackwell 在 MLPerf Training 6.0 中横扫

NVIDIA Blackwell在MLPerf Training 6.0中表现卓越,成为最快、最大、最强的AI训练平台,支持高达8192个GPU,展现出卓越的性能和可靠性。其创新技术如NVFP4和高带宽NVLink提升了训练效率,确保了生产环境的稳定性和快速恢复能力。

最快、最大、最强:NVIDIA Blackwell 在 MLPerf Training 6.0 中横扫

NVIDIA Blog
NVIDIA Blog · 2026-06-16T15:00:36Z
Napier芯片快Blackwell 13倍,每瓦强17倍,一柜顶九柜

Tensordyne公司推出的Napier AI芯片采用3nm工艺,专为AI推理优化。其每瓦token吞吐量比英伟达Blackwell高17倍,每秒高13倍。Napier芯片通过将乘法运算转化为加法,大幅提升能效,功耗仅300W。一个机柜可支持万亿参数模型,预计年收益可达3300万美元,已进入生产阶段,需求预计超过2亿美元。

Napier芯片快Blackwell 13倍,每瓦强17倍,一柜顶九柜

极道
极道 · 2026-06-15T22:12:00Z
NVIDIA Blackwell在首个代理AI基础设施基准测试中领先

NVIDIA Blackwell在首个代理AI基础设施基准测试中表现出色,GB300 NVL72每兆瓦的性能是Hopper的20倍。AgentPerf基于真实编码工作流,评估系统在代理AI任务中的表现,帮助企业优化基础设施投资。

NVIDIA Blackwell在首个代理AI基础设施基准测试中领先

NVIDIA Blog
NVIDIA Blog · 2026-06-12T21:00:08Z
Verda部署Supermicro最新液冷式NVIDIA Blackwell加速型系统

Verda选择Supermicro的NVIDIA GPU加速型系统,以提升其在欧洲的AI云基础设施。该平台支持大语言模型训练和企业级AI,满足市场对NVIDIA AI基础设施的需求。同时,Verda采用可再生能源运营,利用数据中心余热为1.5万户家庭供暖,推动可持续发展。

Verda部署Supermicro最新液冷式NVIDIA Blackwell加速型系统

全球TMT-美通国际
全球TMT-美通国际 · 2026-06-10T06:49:36Z
NVIDIA Blackwell GPU内存架构的演变

NVIDIA的Blackwell架构将在2024年推出,解决GPU内存限制问题。通过双芯片设计和统一的CPU-GPU内存,Blackwell显著提升了内存容量和带宽,使大型模型如Llama 3 70B能够在单个超级芯片上运行,简化了部署并减少了多GPU通信的复杂性。这一架构使AI工程师能更专注于模型开发。

NVIDIA Blackwell GPU内存架构的演变

freeCodeCamp.org
freeCodeCamp.org · 2026-04-21T17:44:01Z
模块化:2026年NVIDIA GTC上的模块化:基于Blackwell的MAX、Mojo内核移植以及B200上的DeepSeek V3

在NVIDIA GTC展会上,我们展示了基于MAX框架的FLUX图像生成和Mojo编程的CUTLASS内核移植。DeepSeek V3在云端运行,提供实时指标,欢迎到3004号展位交流。

模块化:2026年NVIDIA GTC上的模块化:基于Blackwell的MAX、Mojo内核移植以及B200上的DeepSeek V3

Modular Blog
Modular Blog · 2026-03-16T00:00:00Z
最新数据显示,NVIDIA Blackwell Ultra在代理AI应用中提供高达50倍的性能提升和35倍的成本降低

微软和Oracle等云服务商正在大规模部署NVIDIA GB300 NVL72系统,以支持低延迟和长上下文的AI应用。NVIDIA Blackwell平台的广泛应用降低了每个token的成本,GB300 NVL72在低延迟和长上下文场景中表现优异,推动了AI编程助手的快速发展。

最新数据显示,NVIDIA Blackwell Ultra在代理AI应用中提供高达50倍的性能提升和35倍的成本降低

NVIDIA Blog
NVIDIA Blog · 2026-02-16T17:00:40Z
领先的推理提供商通过NVIDIA Blackwell上的开源模型将AI成本降低至10倍

Baseten、DeepInfra、Fireworks AI和Together AI通过NVIDIA Blackwell平台优化推理堆栈,显著降低各行业的每个token成本。MIT研究表明,基础设施和算法效率每年可将推理成本降低10倍。医疗、游戏和客户服务等领域的公司利用开源模型和NVIDIA Blackwell实现了成本节约和响应时间提升。

领先的推理提供商通过NVIDIA Blackwell上的开源模型将AI成本降低至10倍

NVIDIA Blog
NVIDIA Blog · 2026-02-12T16:00:46Z
推动vLLM WideEP和大规模服务在Blackwell平台上的成熟(第一部分)

vLLM团队在NVIDIA GB200平台上优化性能,实现26.2K预填TPGS和10.1K解码TPGS,较H200提升3-5倍。通过低精度操作、内核融合和权重卸载等技术,显著提升计算效率和带宽利用率。

推动vLLM WideEP和大规模服务在Blackwell平台上的成熟(第一部分)

vLLM Blog
vLLM Blog · 2026-02-03T00:00:00Z
在NVIDIA Blackwell上优化GPT-OSS性能:推动帕累托前沿

vLLM与NVIDIA合作,在Blackwell GPU上优化gpt-oss-120b模型,提升性能。通过FlashInfer集成、内核融合和运行时改进,实现最大吞吐量提高38%和最佳交互性提升13%。这些优化增强了模型在高并发场景下的表现。

在NVIDIA Blackwell上优化GPT-OSS性能:推动帕累托前沿

vLLM Blog
vLLM Blog · 2026-02-01T00:00:00Z
宣布推出由 NVIDIA RTX PRO 6000 Blackwell 服务器版 GPU 加速的 Amazon EC2 G7e 实例

亚马逊正式发布 EC2 G7e 实例,采用 NVIDIA RTX PRO 6000 Blackwell GPU,显著提升生成式人工智能和图形工作负载的性能。与 G6e 实例相比,推理性能提升高达 2.3 倍,支持更大模型和多 GPU 任务,网络带宽提升四倍。G7e 实例现已在美国东部地区上线,适用于机器学习工作负载。

宣布推出由 NVIDIA RTX PRO 6000 Blackwell 服务器版 GPU 加速的 Amazon EC2 G7e 实例

亚马逊AWS官方博客
亚马逊AWS官方博客 · 2026-01-20T07:59:20Z
NVIDIA RTX PRO 5000 72GB Blackwell显卡现已上市,扩展桌面智能AI的内存选项

NVIDIA RTX PRO 5000 72GB显卡已上市,具备强大的AI能力,适合开发者和设计师。其72GB内存支持复杂的AI工作流,显著提升图像和文本生成性能,优化创意与工程设计流程。

NVIDIA RTX PRO 5000 72GB Blackwell显卡现已上市,扩展桌面智能AI的内存选项

NVIDIA Blog
NVIDIA Blog · 2025-12-18T16:00:28Z
Supermicro扩大NVIDIA Blackwell架构产品系列

Super Micro Computer推出全新4U与2U液冷NVIDIA HGX B300系统,提升GPU密度与能源效率,适用于超大规模数据中心与AI工厂,最大化空间利用并降低电力消耗。

Supermicro扩大NVIDIA Blackwell架构产品系列

全球TMT-美通国际
全球TMT-美通国际 · 2025-12-12T06:59:40Z
英伟达开发人工智能GPU位置验证技术 利用服务器通信延迟感知芯片所在国家

英伟达开发了一种人工智能GPU位置验证技术,通过通信延迟识别GPU所在国家,以防止芯片走私。该技术以可选软件形式提供,监测数据中心健康状况,并强调无法远程禁用GPU。首个应用于此技术的是最新的Blackwell芯片,旨在满足美国政府的要求。

英伟达开发人工智能GPU位置验证技术 利用服务器通信延迟感知芯片所在国家

蓝点网
蓝点网 · 2025-12-11T03:27:43Z
专家混合架构驱动最智能的前沿AI模型,在NVIDIA Blackwell NVL72上运行速度提升10倍

当前最先进的开源模型如Kimi K2 Thinking和Mistral Large 3采用专家混合架构(MoE),在NVIDIA GB200 NVL72上运行速度提升10倍。MoE模型通过激活特定“专家”提高效率,降低计算成本,已成为前沿模型的标准。NVIDIA的协同设计解决了MoE模型的扩展瓶颈,显著提升了性能和能效。

专家混合架构驱动最智能的前沿AI模型,在NVIDIA Blackwell NVL72上运行速度提升10倍

NVIDIA Blog
NVIDIA Blog · 2025-12-03T16:00:32Z
英伟达市值剑指五万亿大关,Blackwell 领跑,Rubin 接力,AI 基建即将迎来需求爆炸

在2025年秋季GTC大会上,英伟达的黄仁勋展示了Blackwell平台的强大性能,预计将出货600万处理器,速度提升九倍,降低AI生成成本。同时,英伟达与诺基亚合作开发6G技术,推动AI与通信的深度融合,强调AI是未来经济增长的核心动力。

英伟达市值剑指五万亿大关,Blackwell 领跑,Rubin 接力,AI 基建即将迎来需求爆炸

爱范儿
爱范儿 · 2025-10-29T06:00:40Z
  • <<
  • <
  • 1 (current)
  • 2
  • 3
  • >
  • >>
👤 个人中心
在公众号发送验证码完成验证
登录验证
在本设备完成一次验证即可继续使用

完成下面两步后,将自动完成登录并继续当前操作。

1 关注公众号
小红花技术领袖公众号二维码
小红花技术领袖
如果当前 App 无法识别二维码,请在微信搜索并关注该公众号
2 发送验证码
在公众号对话中发送下面 4 位验证码
小红花技术领袖俱乐部
小红花·文摘:汇聚分发优质内容
小红花技术领袖俱乐部
Copyright © 2021-
粤ICP备2022094092号-1
公众号 小红花技术领袖俱乐部公众号二维码
视频号 小红花技术领袖俱乐部视频号二维码