小红花·文摘
  • 首页
  • AI Tokens🪙
  • 排行榜🏆
  • 直播
  • FAQ
英伟达买下Hugging Face的真正算盘

英伟达以129.3亿美元收购开源AI平台Hugging Face,交易金额暗藏表情符和品牌色梗。此举旨在掌控开源生态,被视为下一代CUDA,以巩固其统治地位。创始人牺牲个人收益,换取英伟达长期支持,以应对巨头竞争。该交易被视为时代最重要的并购,可能锁定未来AI标准。

英伟达买下Hugging Face的真正算盘

硕鼠的博客站 硕鼠的博客站 · 2026-09-06T00:30:00Z
纯 .NET 手写 CUDA kernel,GLM-5.3-Flash decode 跑出 llama.cpp 的 2 倍 - 张善友

TensorSharp 是纯 .NET LLM 推理引擎,三天内接入 GLM-5.3-Flash 和 Qwen3.8-Flash-Next 新架构。它支持进程内推理,性能上 decode 速度翻倍,prefill 持平,并强调正确性验证和部署便捷性。对 .NET 团队,这标志着前沿模型架构跟进加速,值得纳入 PoC 评估。

纯 .NET 手写 CUDA kernel,GLM-5.3-Flash decode 跑出 llama.cpp 的 2 倍 - 张善友

张善友 张善友 · 2026-08-28T23:54:00Z
英伟达斥资129亿美元,确保开源模型运行于自家芯片

英伟达拟以129亿美元收购Hugging Face,类似微软收购GitHub,旨在掌控开源模型生态。开源模型因成本低、易运行,正抢占市场,威胁OpenAI和Anthropic。此举确保开发者继续使用英伟达CUDA软件栈,巩固其硬件主导地位。开发者应构建适应模型变化的系统,而非依赖单一默认。

英伟达斥资129亿美元,确保开源模型运行于自家芯片

The New Stack The New Stack · 2026-08-28T15:43:25Z

CUDA Graph在多流执行中效果有限,仅能消除CPU开销导致的GPU气泡,无法解决其他流中阻塞内核引起的气泡。若GPU利用率已高,启用CUDA Graph收益甚微,不应过度投入。仅当气泡主要由CPU开销造成时,启用才可能有益,但需验证分析痕迹的准确性。

多流执行上下文中的CUDA Graph

Lei Mao's Log Book Lei Mao's Log Book · 2026-08-20T07:00:00Z
NVIDIA AI工厂算力正成为可投资资产类别

NVIDIA与Apollo、BlackRock等机构合作建立融资平台,动员超5000亿美元第三方资本支持AI基础设施建设,将AI工厂打造为可投资资产类别,其价值在于CUDA软件性能提升和硬件可重新部署。此举旨在解决资本获取不均,推动AI从研究转向生产,形成“更多算力→更好AI→更多收入”的良性循环。

NVIDIA AI工厂算力正成为可投资资产类别

NVIDIA Blog NVIDIA Blog · 2026-08-12T00:38:21Z
摩尔线程完成开源库CV-CUDA在MUSA上的兼容支持 助力国产GPU视觉计算生态升级

摩尔线程完成开源库CV-CUDA在MUSA上的兼容支持,使视觉处理任务可从CPU迁移至国产GPU,提升图像预处理与数据流水线效率。实测中几何变换、缩放等算子加速明显,适用于多模态训练、视频理解、智能制造等场景,并持续优化生态。

摩尔线程完成开源库CV-CUDA在MUSA上的兼容支持 助力国产GPU视觉计算生态升级

实时互动网 实时互动网 · 2026-08-11T07:38:28Z
Kimi K3配Prime Agent查CUDA内核:发现人写的跑不过机器自动的

AI智能体Prime Agent发现手写CUDA内核在RTX 3090上性能比Triton自动生成代码慢15%,调整分块尺寸无效,瓶颈不在共享内存。AI辅助编程正从“写代码”进化到“发现人类想不到的优化方向”,人类仍负责最终修复。

Kimi K3配Prime Agent查CUDA内核:发现人写的跑不过机器自动的

极道 极道 · 2026-08-08T10:42:00Z
Kubernetes DRA会取代HAMi吗?

HAMi是CNCF孵化项目,用于Kubernetes GPU共享。Kubernetes DRA(动态资源分配)自v1.34起GA,支持可消耗容量,使调度器原生处理GPU切片请求,但仅跟踪承诺,不执行运行时限制。HAMi保留其核心执行层(拦截CUDA调用),并推出HAMi-DRA驱动和webhook,将传统扩展资源转换为DRA声明,实现向后兼容。两者互补,DRA负责调度,HAMi-core负责强制限制,生产环境需按版本和供应商选择模式。

Kubernetes DRA会取代HAMi吗?

Cloud Native Computing Foundation Cloud Native Computing Foundation · 2026-08-07T11:30:00Z
老黄垒20年的CUDA护城河,AI刚刚用10小时凿开了

英伟达CUDA生态面临AI编程Agent挑战,初创公司Infinity用AI花10小时为d-Matrix搭建类CUDA软件,引发关注。但专家认为,CUDA近20年积累的库、验证工具和开发者生态难以轻易颠覆,推理市场或成突破口,护城河正从代码存量转向验证优化生态。

老黄垒20年的CUDA护城河,AI刚刚用10小时凿开了

量子位 量子位 · 2026-08-05T05:53:38Z
从CUDA到MLX:K-Search如何将数十年的内核专业知识带到Apple Silicon

本文介绍IBM研究团队将CUDA内核优化知识自动迁移至Apple Silicon的MLX框架。他们扩展K-Search进化搜索框架,通过概念映射表将CUDA优化策略转化为MLX/Metal原生策略,在注意力内核上达到0.97倍原生性能,在Mamba SSM内核上实现20倍预填充加速,展示了跨硬件优化知识迁移的可行性。

从CUDA到MLX:K-Search如何将数十年的内核专业知识带到Apple Silicon

The Berkeley Artificial Intelligence Research Blog The Berkeley Artificial Intelligence Research Blog · 2026-07-29T09:00:00Z

梁文锋认为国产AI芯片迎来历史性机遇,AI和TileLang等技术可快速构建生态,打破英伟达CUDA垄断。未来一年内国产芯片生态问题将解决,主要瓶颈在产能。公司聚焦持续学习以实现AGI,不追求暴利,保持克制和开源,组织灵活,重视成本效率,并计划与华为合作,推动国产算力发展。

梁文锋投资人会议文字稿修正稿

像清水一般清澈透明 像清水一般清澈透明 · 2026-07-24T13:12:18Z
英伟达Blackwell张量核心真相:矩阵乘法竟变内存泄漏重灾区

英伟达Blackwell架构将张量核心升级为独立协处理器,配备专属内存,矩阵乘法可由单线程异步发射,结果存入专用空间,无需线程集体等待。但需手动管理内存,易致泄漏,且读取结果需128线程。此设计彻底改变CUDA编程范式,从集体协作转向流水线分工,凸显张量核心从指令到独立单元的转变。

英伟达Blackwell张量核心真相:矩阵乘法竟变内存泄漏重灾区

极道 极道 · 2026-07-18T06:01:00Z
如何设计一个帧级别对齐的多源视频播放器

本文讨论了一种多路视频播放器的设计,旨在实现高效解码和渲染。通过硬件加速解码和零拷贝技术,直接将解码后的视频数据传输到GPU,避免带宽瓶颈。设计中使用CUDA进行图像处理,并通过环形缓冲区管理解码线程,确保视频与音频同步,最终实现跨平台的多视频同步播放解决方案。

如何设计一个帧级别对齐的多源视频播放器

Rust.cc Rust.cc · 2026-07-10T06:14:02Z
六家对手发现CUDA弱点:不约而同扔掉硬件缓存和线程

六家AI芯片公司放弃传统硬件缓存和线程模型,采用软件管理的SRAM和数据流架构,以优化计算效率和降低能耗。这种设计强调显式数据放置和顺序执行,推动了AI专用芯片的发展。

六家对手发现CUDA弱点:不约而同扔掉硬件缓存和线程

极道 极道 · 2026-07-10T03:34:00Z
Jaiveer Singh如何帮助机器人和开发者加速进程

Jaiveer Singh是NVIDIA的机器人软件工程师,负责Isaac ROS项目,旨在加速机器人开发。他通过开源软件和CUDA库,帮助开发者构建自主机器人和人形机器人,并强调开源的重要性,认为它能增强开发者的信心,促进机器人技术的发展。

Jaiveer Singh如何帮助机器人和开发者加速进程

NVIDIA Blog NVIDIA Blog · 2026-06-30T15:00:49Z

Tensor Core 是专用的矩阵计算单元,利用 MMA 指令实现高效的矩阵乘加运算。FP16 Tensor Core 的吞吐量可达 72.8 TFLOP/s,显著高于 FP32 的 16 TFLOP/s。使用 Tensor Core 时,数据传输速度常成为瓶颈,因此需要优化数据布局和访存策略。CUDA 的 wmma API 简化了 Tensor Core 的使用,而高性能库如 CUTLASS 则能更精细地控制数据布局。

【GPU 算子工程】Tensor Core 与 MMA:wmma、mma.sync 与数据布局

土法炼钢兴趣小组的博客 土法炼钢兴趣小组的博客 · 2026-06-28T00:00:00Z

CUTLASS 是 NVIDIA 开源的 CUDA C++ 模板库,旨在优化 GEMM(矩阵乘法)性能。它将 GEMM 拆分为五层结构,支持多种精度和形状的配置。通过模板化设计,CUTLASS 提供高性能的可复用组件,简化布局管理。CuTe 作为统一的布局代数,提升了编程的灵活性和可维护性。

【GPU 算子工程】CUTLASS 与 CuTe:模板化 GEMM 与布局代数

土法炼钢兴趣小组的博客 土法炼钢兴趣小组的博客 · 2026-06-28T00:00:00Z

本文讨论了在多卡训练中通过重叠通信与计算提高效率的方法。重叠分为三个层次:第一层使用cp.async在内核内实现异步加载,第二层通过CUDA流实现内核间的并发,第三层利用NCCL在分布式环境中实现通信与计算的重叠。重叠可以隐藏等待时间,但也会导致资源争抢和同步开销。

【GPU 算子工程】通信与计算重叠:NCCL collective 与 kernel overlap

土法炼钢兴趣小组的博客 土法炼钢兴趣小组的博客 · 2026-06-28T00:00:00Z

本文介绍了CUDA kernel的基本构建,包括向量加法的实现、线程索引、同步机制和启动配置。强调了grid-stride loop的优势,使kernel与数据规模解耦,并介绍了__syncthreads()的使用注意事项。建议block大小应为128至512,避免使用过小的block,并强调CUDA错误检查的重要性,以确保程序的稳定性和性能。

【GPU 算子工程】写第一个 CUDA kernel:索引、同步与启动配置

土法炼钢兴趣小组的博客 土法炼钢兴趣小组的博客 · 2026-06-27T00:00:00Z

本文介绍了GPU的执行模型,包括线程层次结构、物理映射和SIMT执行模型。CUDA的并行模型分为grid、block和thread,block在SM上调度,warp是32个线程的执行单位。分支发散会导致性能下降,occupancy是SM上驻留warp的比率,影响延迟隐藏。高occupancy并不总是意味着高性能,需要综合考虑寄存器和共享内存的使用。

【GPU 算子工程】GPU 执行模型:SM、warp、线程层次与 occupancy

土法炼钢兴趣小组的博客 土法炼钢兴趣小组的博客 · 2026-06-27T00:00:00Z
  • <<
  • <
  • 1 (current)
  • 2
  • 3
  • >
  • >>
👤 个人中心
在公众号发送验证码完成验证
登录验证
在本设备完成一次验证即可继续使用

完成下面两步后,将自动完成登录并继续当前操作。

1 关注公众号
小红花技术领袖公众号二维码
小红花技术领袖
如果当前 App 无法识别二维码,请在微信搜索并关注该公众号
2 发送验证码
在公众号对话中发送下面 4 位验证码
小红花技术领袖俱乐部
小红花·文摘:汇聚分发优质内容
小红花技术领袖俱乐部
Copyright © 2021-
粤ICP备2022094092号-1
公众号 小红花技术领袖俱乐部公众号二维码
视频号 小红花技术领袖俱乐部视频号二维码