英伟达Blackwell架构将张量核心升级为独立协处理器,配备专属内存,矩阵乘法可由单线程异步发射,结果存入专用空间,无需线程集体等待。但需手动管理内存,易致泄漏,且读取结果需128线程。此设计彻底改变CUDA编程范式,从集体协作转向流水线分工,凸显张量核心从指令到独立单元的转变。
文章揭示了Blackwell架构原生支持INT4满血算力,通过修改cutlass代码或CUBIN后处理,可解锁SM100/SM110及RTX 5090的INT4/E0M3算力,吞吐与FP4 E2M1相当,支持混乘,未来可提升本地llama.cpp推理性能。
Anthropic的Claude模型现已在微软Azure上运行,利用NVIDIA GB300 Blackwell Ultra GPU,企业可以构建自主和特定领域的AI代理。这一合作增强了开发者的能力,使AI代理能够深度嵌入业务中,提升效率并降低成本。
本文探讨了GPU算子工程的最新趋势,包括Hopper架构的TMA和wgmma特性、FP8到FP4的精度降低、ThunderKittens库的简化编程模型,以及编译器自动化优化算子的未来。强调理解硬件执行模型的重要性,以有效利用新工具和指令,整体方法论围绕数据复用、访存优化和性能分析展开,旨在提升算子开发效率。
NVIDIA Blackwell在MLPerf Training 6.0中表现卓越,成为最快、最大、最强的AI训练平台,支持高达8192个GPU,展现出卓越的性能和可靠性。其创新技术如NVFP4和高带宽NVLink提升了训练效率,确保了生产环境的稳定性和快速恢复能力。
Tensordyne公司推出的Napier AI芯片采用3nm工艺,专为AI推理优化。其每瓦token吞吐量比英伟达Blackwell高17倍,每秒高13倍。Napier芯片通过将乘法运算转化为加法,大幅提升能效,功耗仅300W。一个机柜可支持万亿参数模型,预计年收益可达3300万美元,已进入生产阶段,需求预计超过2亿美元。
NVIDIA Blackwell在首个代理AI基础设施基准测试中表现出色,GB300 NVL72每兆瓦的性能是Hopper的20倍。AgentPerf基于真实编码工作流,评估系统在代理AI任务中的表现,帮助企业优化基础设施投资。
Verda选择Supermicro的NVIDIA GPU加速型系统,以提升其在欧洲的AI云基础设施。该平台支持大语言模型训练和企业级AI,满足市场对NVIDIA AI基础设施的需求。同时,Verda采用可再生能源运营,利用数据中心余热为1.5万户家庭供暖,推动可持续发展。
NVIDIA的Blackwell架构将在2024年推出,解决GPU内存限制问题。通过双芯片设计和统一的CPU-GPU内存,Blackwell显著提升了内存容量和带宽,使大型模型如Llama 3 70B能够在单个超级芯片上运行,简化了部署并减少了多GPU通信的复杂性。这一架构使AI工程师能更专注于模型开发。
在NVIDIA GTC展会上,我们展示了基于MAX框架的FLUX图像生成和Mojo编程的CUTLASS内核移植。DeepSeek V3在云端运行,提供实时指标,欢迎到3004号展位交流。
微软和Oracle等云服务商正在大规模部署NVIDIA GB300 NVL72系统,以支持低延迟和长上下文的AI应用。NVIDIA Blackwell平台的广泛应用降低了每个token的成本,GB300 NVL72在低延迟和长上下文场景中表现优异,推动了AI编程助手的快速发展。
Baseten、DeepInfra、Fireworks AI和Together AI通过NVIDIA Blackwell平台优化推理堆栈,显著降低各行业的每个token成本。MIT研究表明,基础设施和算法效率每年可将推理成本降低10倍。医疗、游戏和客户服务等领域的公司利用开源模型和NVIDIA Blackwell实现了成本节约和响应时间提升。
vLLM团队在NVIDIA GB200平台上优化性能,实现26.2K预填TPGS和10.1K解码TPGS,较H200提升3-5倍。通过低精度操作、内核融合和权重卸载等技术,显著提升计算效率和带宽利用率。
vLLM与NVIDIA合作,在Blackwell GPU上优化gpt-oss-120b模型,提升性能。通过FlashInfer集成、内核融合和运行时改进,实现最大吞吐量提高38%和最佳交互性提升13%。这些优化增强了模型在高并发场景下的表现。
亚马逊正式发布 EC2 G7e 实例,采用 NVIDIA RTX PRO 6000 Blackwell GPU,显著提升生成式人工智能和图形工作负载的性能。与 G6e 实例相比,推理性能提升高达 2.3 倍,支持更大模型和多 GPU 任务,网络带宽提升四倍。G7e 实例现已在美国东部地区上线,适用于机器学习工作负载。
NVIDIA RTX PRO 5000 72GB显卡已上市,具备强大的AI能力,适合开发者和设计师。其72GB内存支持复杂的AI工作流,显著提升图像和文本生成性能,优化创意与工程设计流程。
Super Micro Computer推出全新4U与2U液冷NVIDIA HGX B300系统,提升GPU密度与能源效率,适用于超大规模数据中心与AI工厂,最大化空间利用并降低电力消耗。
英伟达开发了一种人工智能GPU位置验证技术,通过通信延迟识别GPU所在国家,以防止芯片走私。该技术以可选软件形式提供,监测数据中心健康状况,并强调无法远程禁用GPU。首个应用于此技术的是最新的Blackwell芯片,旨在满足美国政府的要求。
当前最先进的开源模型如Kimi K2 Thinking和Mistral Large 3采用专家混合架构(MoE),在NVIDIA GB200 NVL72上运行速度提升10倍。MoE模型通过激活特定“专家”提高效率,降低计算成本,已成为前沿模型的标准。NVIDIA的协同设计解决了MoE模型的扩展瓶颈,显著提升了性能和能效。
在2025年秋季GTC大会上,英伟达的黄仁勋展示了Blackwell平台的强大性能,预计将出货600万处理器,速度提升九倍,降低AI生成成本。同时,英伟达与诺基亚合作开发6G技术,推动AI与通信的深度融合,强调AI是未来经济增长的核心动力。
完成下面两步后,将自动完成登录并继续当前操作。