小红花·文摘
  • 首页
  • 广场
  • 排行榜🏆
  • 直播
  • FAQ
Dify.AI
如何设计一个帧级别对齐的多源视频播放器

本文讨论了一种多路视频播放器的设计,旨在实现高效解码和渲染。通过硬件加速解码和零拷贝技术,直接将解码后的视频数据传输到GPU,避免带宽瓶颈。设计中使用CUDA进行图像处理,并通过环形缓冲区管理解码线程,确保视频与音频同步,最终实现跨平台的多视频同步播放解决方案。

如何设计一个帧级别对齐的多源视频播放器

Rust.cc
Rust.cc · 2026-07-10T06:14:02Z
六家对手发现CUDA弱点:不约而同扔掉硬件缓存和线程

六家AI芯片公司放弃传统硬件缓存和线程模型,采用软件管理的SRAM和数据流架构,以优化计算效率和降低能耗。这种设计强调显式数据放置和顺序执行,推动了AI专用芯片的发展。

六家对手发现CUDA弱点:不约而同扔掉硬件缓存和线程

极道
极道 · 2026-07-10T03:34:00Z
Jaiveer Singh如何帮助机器人和开发者加速进程

Jaiveer Singh是NVIDIA的机器人软件工程师,负责Isaac ROS项目,旨在加速机器人开发。他通过开源软件和CUDA库,帮助开发者构建自主机器人和人形机器人,并强调开源的重要性,认为它能增强开发者的信心,促进机器人技术的发展。

Jaiveer Singh如何帮助机器人和开发者加速进程

NVIDIA Blog
NVIDIA Blog · 2026-06-30T15:00:49Z

本文讨论了在多卡训练中通过重叠通信与计算提高效率的方法。重叠分为三个层次:第一层使用cp.async在内核内实现异步加载,第二层通过CUDA流实现内核间的并发,第三层利用NCCL在分布式环境中实现通信与计算的重叠。重叠可以隐藏等待时间,但也会导致资源争抢和同步开销。

【GPU 算子工程】通信与计算重叠:NCCL collective 与 kernel overlap

土法炼钢兴趣小组的博客
土法炼钢兴趣小组的博客 · 2026-06-28T00:00:00Z

CUTLASS 是 NVIDIA 开源的 CUDA C++ 模板库,旨在优化 GEMM(矩阵乘法)性能。它将 GEMM 拆分为五层结构,支持多种精度和形状的配置。通过模板化设计,CUTLASS 提供高性能的可复用组件,简化布局管理。CuTe 作为统一的布局代数,提升了编程的灵活性和可维护性。

【GPU 算子工程】CUTLASS 与 CuTe:模板化 GEMM 与布局代数

土法炼钢兴趣小组的博客
土法炼钢兴趣小组的博客 · 2026-06-28T00:00:00Z

Tensor Core 是专用的矩阵计算单元,利用 MMA 指令实现高效的矩阵乘加运算。FP16 Tensor Core 的吞吐量可达 72.8 TFLOP/s,显著高于 FP32 的 16 TFLOP/s。使用 Tensor Core 时,数据传输速度常成为瓶颈,因此需要优化数据布局和访存策略。CUDA 的 wmma API 简化了 Tensor Core 的使用,而高性能库如 CUTLASS 则能更精细地控制数据布局。

【GPU 算子工程】Tensor Core 与 MMA:wmma、mma.sync 与数据布局

土法炼钢兴趣小组的博客
土法炼钢兴趣小组的博客 · 2026-06-28T00:00:00Z

本文介绍了GPU的执行模型,包括线程层次结构、物理映射和SIMT执行模型。CUDA的并行模型分为grid、block和thread,block在SM上调度,warp是32个线程的执行单位。分支发散会导致性能下降,occupancy是SM上驻留warp的比率,影响延迟隐藏。高occupancy并不总是意味着高性能,需要综合考虑寄存器和共享内存的使用。

【GPU 算子工程】GPU 执行模型:SM、warp、线程层次与 occupancy

土法炼钢兴趣小组的博客
土法炼钢兴趣小组的博客 · 2026-06-27T00:00:00Z

本文介绍了CUDA kernel的基本构建,包括向量加法的实现、线程索引、同步机制和启动配置。强调了grid-stride loop的优势,使kernel与数据规模解耦,并介绍了__syncthreads()的使用注意事项。建议block大小应为128至512,避免使用过小的block,并强调CUDA错误检查的重要性,以确保程序的稳定性和性能。

【GPU 算子工程】写第一个 CUDA kernel:索引、同步与启动配置

土法炼钢兴趣小组的博客
土法炼钢兴趣小组的博客 · 2026-06-27T00:00:00Z

本文探讨了AI计算栈中的算子工程,分析了算子在框架、算子库、手写kernel、编译和硬件指令层的关系。强调在特定场景下手写kernel的必要性,如多算子融合和新算子实现。指出性能瓶颈常源于访存,建议使用profiler定位瓶颈后再优化。最后提供了CUDA基础学习路径和性能优化的核心结论。

【GPU 算子工程】全景:算子工程在 AI 计算栈的位置

土法炼钢兴趣小组的博客
土法炼钢兴趣小组的博客 · 2026-06-26T00:00:00Z
摩尔线程MusaCoder开源:首个基于国产全功能GPU全栈训练的代码大模型,性能比肩国际SOTA

摩尔线程发布了开源大模型MusaCoder,专为GPU底层算子生成设计,支持从PyTorch自动生成高性能CUDA/MUSA代码,提升开发效率。MusaCoder在KernelBench评测中表现优异,超越多款主流模型。其全链路训练依托国产MTT S5000集群,验证了国产GPU的强大能力,推动GPU编程和AI技术的创新与应用。

摩尔线程MusaCoder开源:首个基于国产全功能GPU全栈训练的代码大模型,性能比肩国际SOTA

实时互动网
实时互动网 · 2026-06-10T09:59:05Z
字节Agent自主优化GPU内核:挑战英伟达CUDA护城河

字节跳动开发的AI CUDA Agent能够自主优化CUDA代码,其性能超越人类专家40%。该AI通过强化学习快速发现传统编译器无法识别的优化技巧,可能会加剧硬件市场竞争,推动显卡选择不再受限于CUDA。

字节Agent自主优化GPU内核:挑战英伟达CUDA护城河

极道
极道 · 2026-06-03T22:12:00Z
在 Amazon EKS 上使用 NVIDIA GPU Operator 管理自定义 GPU 驱动与 CUDA 工作负载

在Amazon EKS上,使用NVIDIA GPU Operator可以有效管理自定义GPU驱动和CUDA工作负载。EKS通过EC2节点支持GPU工作负载,GPU Operator简化了驱动的安装和管理,确保容器的稳定运行。选择EKS托管节点组可以降低运维负担。同时,结合Kiro和AWS MCP,平台团队能够通过自然语言进行集群巡检和问题排查,从而提升运维效率。

在 Amazon EKS 上使用 NVIDIA GPU Operator 管理自定义 GPU 驱动与 CUDA 工作负载

亚马逊AWS官方博客
亚马逊AWS官方博客 · 2026-06-03T09:22:40Z
官宣!台积电引入英伟达CUDA-X技术,光刻成本最高暴降50%

英伟达与台积电达成深度合作,全面采用其加速计算与人工智能技术,提升芯片设计与生产效率。台积电在光刻、晶体管模拟、数据分析和缺陷检测等领域利用英伟达技术实现显著优化,光刻环节成本效益提升20%-50%。此外,台积电还探索数字孪生技术以提升生产规划效率。

官宣!台积电引入英伟达CUDA-X技术,光刻成本最高暴降50%

TechWeb 全站精华
TechWeb 全站精华 · 2026-06-02T06:04:55Z
Rust拥抱GPU:英伟达官方推CUDA-oxide安全性与编译革命解读

Nvidia推出CUDA-oxide工具,使Rust代码可直接编译为GPU程序,简化了GPU编程。通过在Rust函数上添加#[gpu]标签,编译器自动处理GPU指令,提升了编译效率和安全性。这一创新为AI生成代码提供了更好的类型检查,降低了开发门槛。

Rust拥抱GPU:英伟达官方推CUDA-oxide安全性与编译革命解读

极道
极道 · 2026-05-12T00:49:00Z

本文介绍了如何在PyTorch中实现自定义操作,包括使用C++和CUDA编写自定义函数和类。通过示例代码,展示了如何注册和使用这些自定义操作,确保它们在PyTorch模型和AOTInductor编译的推理程序中正常工作,并讨论了模型导出及推理验证。

PyTorch自定义操作

Lei Mao's Log Book
Lei Mao's Log Book · 2026-05-10T07:00:00Z

NVIDIA 发布了实验性项目 CUDA-Oxide,旨在将 Rust 代码直接编译为 CUDA 内核,支持单源代码工作流。Burn 0.21.0 更新显著提升了分布式训练性能,框架开销降低至原来的八分之一。Symbolic Software 推出的 hpke-ng 实现了更快、更安全的 Rust HPKE,解决了安全问题。Monocurl 是一个交互式数学动画工具,结合了数学表达与动画渲染。

【Rust日报】2026-05-09 NVIDIA 发布 CUDA-Oxide 0.1:实验性 Rust 到 CUDA 编译器

Rust.cc
Rust.cc · 2026-05-09T01:08:14Z
提高`nvptx64-nvidia-cuda`目标的基准

Rust 1.97将于2026年7月9日发布,更新nvptx64-nvidia-cuda目标的PTX ISA版本,移除对2017年及之前GPU架构的支持。这将提升编译器的正确性和性能,但不再支持旧版CUDA驱动或低于7.0的GPU。

提高`nvptx64-nvidia-cuda`目标的基准

Rust Blog
Rust Blog · 2026-05-01T00:00:00Z
DeepSeek发布Tile Kernels:用TileLang榨干GPU并打破CUDA垄断

DeepSeek发布的Tile Kernels通过TileLang优化GPU性能,打破了CUDA的垄断,推动AI工程从模型设计转向系统能力。TileLang简化了GPU开发,支持跨硬件执行,提升了效率。然而,技术进步导致能力差距扩大,顶级团队获得更高效率,而大多数团队难以跟上。这一变化将重塑AI基础设施的竞争格局。

DeepSeek发布Tile Kernels:用TileLang榨干GPU并打破CUDA垄断

极道
极道 · 2026-04-23T12:52:00Z

本文探讨了NVIDIA的CUDA生态系统,包括编译链、高层工具、分层结构、数学库(如cuBLAS和cuDNN)、通信库(如NCCL)及Triton DSL。文章比较了AMD ROCm和华为CANN的定位,分析了CUDA在大模型训练中的重要性和优势,并强调了性能调优工具Nsight的使用,以及FP8训练的潜在问题和解决方案。

【大模型基础设施工程】03:CUDA 生态——cuBLAS、cuDNN、NCCL、Triton、CUTLASS

土法炼钢兴趣小组的博客
土法炼钢兴趣小组的博客 · 2026-04-22T00:00:00Z
黄仁勋都被问毛了:顶级AI厂商在去CUDA?“你的前提就是错的”

黄仁勋在访谈中谈到英伟达的成功与未来,强调其强大的合作伙伴生态系统和对稀缺组件的提前采购承诺。他认为AI工具的普及将推动软件公司快速增长,尽管面临供应链瓶颈,英伟达依然能通过技术创新和高效合作应对挑战。此外,他指出英伟达的架构灵活性使其在AI领域保持竞争力,未来将继续推动加速计算的发展。

黄仁勋都被问毛了:顶级AI厂商在去CUDA?“你的前提就是错的”

量子位
量子位 · 2026-04-19T04:14:11Z
  • <<
  • <
  • 1 (current)
  • 2
  • 3
  • >
  • >>
👤 个人中心
在公众号发送验证码完成验证
登录验证
在本设备完成一次验证即可继续使用

完成下面两步后,将自动完成登录并继续当前操作。

1 关注公众号
小红花技术领袖公众号二维码
小红花技术领袖
如果当前 App 无法识别二维码,请在微信搜索并关注该公众号
2 发送验证码
在公众号对话中发送下面 4 位验证码
友情链接: MOGE.AI 九胧科技 模力方舟 Gitee AI 菜鸟教程 Remio.AI DeekSeek连连 53AI 神龙海外代理IP IPIPGO全球代理IP 东波哥的博客 匡优考试在线考试系统 开源服务指南 蓝莺IM Solo 独立开发者社区 AI酷站导航 极客Fun 我爱水煮鱼 周报生成器 He3.app 简单简历 白鲸出海 T沙龙 职友集 TechParty 蟒周刊 Best AI Music Generator

小红花技术领袖俱乐部
小红花·文摘:汇聚分发优质内容
小红花技术领袖俱乐部
Copyright © 2021-
粤ICP备2022094092号-1
公众号 小红花技术领袖俱乐部公众号二维码
视频号 小红花技术领袖俱乐部视频号二维码