英伟达以129.3亿美元收购开源AI平台Hugging Face,交易金额暗藏表情符和品牌色梗。此举旨在掌控开源生态,被视为下一代CUDA,以巩固其统治地位。创始人牺牲个人收益,换取英伟达长期支持,以应对巨头竞争。该交易被视为时代最重要的并购,可能锁定未来AI标准。
TensorSharp 是纯 .NET LLM 推理引擎,三天内接入 GLM-5.3-Flash 和 Qwen3.8-Flash-Next 新架构。它支持进程内推理,性能上 decode 速度翻倍,prefill 持平,并强调正确性验证和部署便捷性。对 .NET 团队,这标志着前沿模型架构跟进加速,值得纳入 PoC 评估。
英伟达拟以129亿美元收购Hugging Face,类似微软收购GitHub,旨在掌控开源模型生态。开源模型因成本低、易运行,正抢占市场,威胁OpenAI和Anthropic。此举确保开发者继续使用英伟达CUDA软件栈,巩固其硬件主导地位。开发者应构建适应模型变化的系统,而非依赖单一默认。
CUDA Graph在多流执行中效果有限,仅能消除CPU开销导致的GPU气泡,无法解决其他流中阻塞内核引起的气泡。若GPU利用率已高,启用CUDA Graph收益甚微,不应过度投入。仅当气泡主要由CPU开销造成时,启用才可能有益,但需验证分析痕迹的准确性。
NVIDIA与Apollo、BlackRock等机构合作建立融资平台,动员超5000亿美元第三方资本支持AI基础设施建设,将AI工厂打造为可投资资产类别,其价值在于CUDA软件性能提升和硬件可重新部署。此举旨在解决资本获取不均,推动AI从研究转向生产,形成“更多算力→更好AI→更多收入”的良性循环。
摩尔线程完成开源库CV-CUDA在MUSA上的兼容支持,使视觉处理任务可从CPU迁移至国产GPU,提升图像预处理与数据流水线效率。实测中几何变换、缩放等算子加速明显,适用于多模态训练、视频理解、智能制造等场景,并持续优化生态。
AI智能体Prime Agent发现手写CUDA内核在RTX 3090上性能比Triton自动生成代码慢15%,调整分块尺寸无效,瓶颈不在共享内存。AI辅助编程正从“写代码”进化到“发现人类想不到的优化方向”,人类仍负责最终修复。
HAMi是CNCF孵化项目,用于Kubernetes GPU共享。Kubernetes DRA(动态资源分配)自v1.34起GA,支持可消耗容量,使调度器原生处理GPU切片请求,但仅跟踪承诺,不执行运行时限制。HAMi保留其核心执行层(拦截CUDA调用),并推出HAMi-DRA驱动和webhook,将传统扩展资源转换为DRA声明,实现向后兼容。两者互补,DRA负责调度,HAMi-core负责强制限制,生产环境需按版本和供应商选择模式。
英伟达CUDA生态面临AI编程Agent挑战,初创公司Infinity用AI花10小时为d-Matrix搭建类CUDA软件,引发关注。但专家认为,CUDA近20年积累的库、验证工具和开发者生态难以轻易颠覆,推理市场或成突破口,护城河正从代码存量转向验证优化生态。
本文介绍IBM研究团队将CUDA内核优化知识自动迁移至Apple Silicon的MLX框架。他们扩展K-Search进化搜索框架,通过概念映射表将CUDA优化策略转化为MLX/Metal原生策略,在注意力内核上达到0.97倍原生性能,在Mamba SSM内核上实现20倍预填充加速,展示了跨硬件优化知识迁移的可行性。
梁文锋认为国产AI芯片迎来历史性机遇,AI和TileLang等技术可快速构建生态,打破英伟达CUDA垄断。未来一年内国产芯片生态问题将解决,主要瓶颈在产能。公司聚焦持续学习以实现AGI,不追求暴利,保持克制和开源,组织灵活,重视成本效率,并计划与华为合作,推动国产算力发展。
英伟达Blackwell架构将张量核心升级为独立协处理器,配备专属内存,矩阵乘法可由单线程异步发射,结果存入专用空间,无需线程集体等待。但需手动管理内存,易致泄漏,且读取结果需128线程。此设计彻底改变CUDA编程范式,从集体协作转向流水线分工,凸显张量核心从指令到独立单元的转变。
本文讨论了一种多路视频播放器的设计,旨在实现高效解码和渲染。通过硬件加速解码和零拷贝技术,直接将解码后的视频数据传输到GPU,避免带宽瓶颈。设计中使用CUDA进行图像处理,并通过环形缓冲区管理解码线程,确保视频与音频同步,最终实现跨平台的多视频同步播放解决方案。
六家AI芯片公司放弃传统硬件缓存和线程模型,采用软件管理的SRAM和数据流架构,以优化计算效率和降低能耗。这种设计强调显式数据放置和顺序执行,推动了AI专用芯片的发展。
Jaiveer Singh是NVIDIA的机器人软件工程师,负责Isaac ROS项目,旨在加速机器人开发。他通过开源软件和CUDA库,帮助开发者构建自主机器人和人形机器人,并强调开源的重要性,认为它能增强开发者的信心,促进机器人技术的发展。
Tensor Core 是专用的矩阵计算单元,利用 MMA 指令实现高效的矩阵乘加运算。FP16 Tensor Core 的吞吐量可达 72.8 TFLOP/s,显著高于 FP32 的 16 TFLOP/s。使用 Tensor Core 时,数据传输速度常成为瓶颈,因此需要优化数据布局和访存策略。CUDA 的 wmma API 简化了 Tensor Core 的使用,而高性能库如 CUTLASS 则能更精细地控制数据布局。
CUTLASS 是 NVIDIA 开源的 CUDA C++ 模板库,旨在优化 GEMM(矩阵乘法)性能。它将 GEMM 拆分为五层结构,支持多种精度和形状的配置。通过模板化设计,CUTLASS 提供高性能的可复用组件,简化布局管理。CuTe 作为统一的布局代数,提升了编程的灵活性和可维护性。
本文讨论了在多卡训练中通过重叠通信与计算提高效率的方法。重叠分为三个层次:第一层使用cp.async在内核内实现异步加载,第二层通过CUDA流实现内核间的并发,第三层利用NCCL在分布式环境中实现通信与计算的重叠。重叠可以隐藏等待时间,但也会导致资源争抢和同步开销。
本文介绍了CUDA kernel的基本构建,包括向量加法的实现、线程索引、同步机制和启动配置。强调了grid-stride loop的优势,使kernel与数据规模解耦,并介绍了__syncthreads()的使用注意事项。建议block大小应为128至512,避免使用过小的block,并强调CUDA错误检查的重要性,以确保程序的稳定性和性能。
本文介绍了GPU的执行模型,包括线程层次结构、物理映射和SIMT执行模型。CUDA的并行模型分为grid、block和thread,block在SM上调度,warp是32个线程的执行单位。分支发散会导致性能下降,occupancy是SM上驻留warp的比率,影响延迟隐藏。高occupancy并不总是意味着高性能,需要综合考虑寄存器和共享内存的使用。
完成下面两步后,将自动完成登录并继续当前操作。