小红花·文摘
  • 首页
  • AI Tokens🪙
  • 排行榜🏆
  • 直播
  • FAQ
摩尔线程开源高性能MATE算子库 释放全功能GPU算力潜能

摩尔线程发布开源高性能算子库MATE,面向生成式AI大模型训练与推理,提供Attention、GEMM、MoE等核心算子,兼容FlashAttention、DeepGEMM等开源生态,并已落地vLLM与SGLang框架。MATE通过多后端优化和JIT编译提升性能,实测单卡吞吐量达国际高端GPU的40%以上,旨在降低开发者迁移成本,推动国产AI算力生态发展。

摩尔线程开源高性能MATE算子库 释放全功能GPU算力潜能

实时互动网 实时互动网 · 2026-09-07T07:53:52Z
AIVC只是前菜!复旦提出生命算子,统一生命建模

复旦大学王烁团队提出“生命算子”框架,将生命视为多尺度动力系统,通过感知、演化、生成三类算子及尺度桥,实现从细胞到器官的跨尺度推演。该框架已在消化内镜、肾癌、心脏等领域应用,并孵化Cardio-World项目,旨在构建可验证的虚拟临床系统,推动医疗智能发展。

AIVC只是前菜!复旦提出生命算子,统一生命建模

量子位 量子位 · 2026-09-01T04:12:49Z
毕昇编译器核心AscendNPU IR开源,华为架构师海丽娟详解技术进展,支持Triton等算子生态

华为AscendNPU IR编译器架构师海丽娟在技术沙龙中介绍了其开源底座,该底座基于MLIR构建,提供Tile级抽象,支持多语言接入昇腾硬件,适配A2/A3至昇腾950架构,优化CV流水并行、寄存器融合、SIMT支持及多核切分,提升算子开发效率。项目已开源,社区提供任务和免费算力。

毕昇编译器核心AscendNPU IR开源,华为架构师海丽娟详解技术进展,支持Triton等算子生态

HyperAI超神经 HyperAI超神经 · 2026-08-18T09:13:09Z
太初元碁携手上海人工智能实验室举办AI4S和新型模型架构算子优化赛

上海人工智能实验室举办KernelSwift算子创新大赛,聚焦高性能算子优化与国产算力生态。太初元碁推出AI4S赛道,围绕水稻基因组学模型,要求优化算子并接入Teco-vLLM框架。总奖金池18万,单队最高3万元,完成者获千元Token奖励。报名至8月21日,8月31日前提交代码,提供云服务器与培训支持。

太初元碁携手上海人工智能实验室举办AI4S和新型模型架构算子优化赛

量子位 量子位 · 2026-07-23T01:43:44Z

PD(Placement Driver)作为TiKV的调度中心,通过心跳机制收集集群状态,生成调度建议(Operator),并发送给Region Leader。调度过程异步,Leader可选择执行或跳过建议。PD使用Store心跳提供宏观视图,Region心跳提供精确位置。调度的基本单元是Operator,主要目标是负载均衡和副本管理,决策受限于放置规则和调度限制,以确保系统稳定性。

【TiKV / HTAP 内核】PD 元数据与调度:心跳、算子与调度器

土法炼钢兴趣小组的博客 土法炼钢兴趣小组的博客 · 2026-07-16T00:00:00Z

本文探讨了多表连接的优化策略,包括连接顺序、物理连接算子和分布式连接方法。重点分析了DuckDB和Trino的连接规划,比较了Hash Join和Merge Join的性能,并介绍了动态分区裁剪(DPP)和数据倾斜问题的解决方案。最后,总结了连接规划的关键要素和未来研究方向。

【分布式 OLAP 查询引擎】Join 重排与物理算子选择

土法炼钢兴趣小组的博客 土法炼钢兴趣小组的博客 · 2026-07-07T00:00:00Z
【案例共创】昇腾智学 - AgentArts知识库赋能算子开发学习

本案例介绍了华为昇腾C算子开发的知识助手,旨在提升开发者的学习效率。通过华为云智果平台,整合技术文档,构建知识库,实现精准问答,涵盖知识库创建、文档导入和智能体应用配置等流程,帮助开发者快速掌握相关技能。

【案例共创】昇腾智学 - AgentArts知识库赋能算子开发学习

华为云官方博客 华为云官方博客 · 2026-07-01T10:15:00Z

本文讨论了Flink DataStream API的工作原理,包括作业结构、数据流转换、shuffle策略及其对性能的影响。重点介绍了keyBy操作、ProcessFunction的使用及定时器注册,强调了状态管理在流处理中的重要性,并通过示例展示了事件时间和窗口聚合的处理,简要说明了Flink 2.x版本。

【流式数据处理】DataStream 与算子语义

土法炼钢兴趣小组的博客 土法炼钢兴趣小组的博客 · 2026-07-01T00:00:00Z

本文讨论了GPU访存优化的两个关键问题:合并访问和bank冲突。合并访问通过相邻线程访问相邻地址来提高带宽,而bank冲突是多个线程访问同一bank导致的性能下降。使用padding和向量化技术可以进一步提升带宽利用率。在矩阵转置操作中,使用shared memory可以有效解决访存模式问题。

【GPU 算子工程】访存优化:合并访问、bank conflict 与对齐

土法炼钢兴趣小组的博客 土法炼钢兴趣小组的博客 · 2026-06-28T00:00:00Z

本文探讨了GPU中的驻留率(occupancy)及其对延迟隐藏的重要性。高驻留率并不总是意味着高性能,实际有效带宽在驻留率达到33%时已饱和。提高驻留率可能导致寄存器溢出,从而降低性能。计算密集型内核可通过指令级并行(ILP)实现高效,而不依赖于高驻留率。应平衡驻留率与寄存器使用,避免盲目追求高驻留率。

【GPU 算子工程】Occupancy 与延迟隐藏:寄存器、shared memory 的取舍

土法炼钢兴趣小组的博客 土法炼钢兴趣小组的博客 · 2026-06-28T00:00:00Z

Roofline模型用于判断算子是计算密集型还是内存密集型,算术强度(AI)是关键指标,定义为浮点运算数与内存搬运字节数之比。通过双对数图,Roofline展示了性能与算术强度的关系,分为带宽限制区和算力限制区。优化策略包括提高算术强度,采用算子融合和tiling等方法,以减少内存访问并提升性能。

【GPU 算子工程】Roofline 模型:判断算子是 compute-bound 还是 memory-bound

土法炼钢兴趣小组的博客 土法炼钢兴趣小组的博客 · 2026-06-28T00:00:00Z

本文介绍了NVIDIA的两个调优工具:Nsight Systems和Nsight Compute。Nsight Systems用于分析程序的时间线,找出占用时间最多的kernel;而Nsight Compute则深入分析单个kernel的性能瓶颈。优化流程是先用Systems定位热点,再用Compute分析原因,如访存延迟或计算瓶颈。在没有完整工具链时,可使用CUDA event进行轻量测量。最终目标是提升GPU性能,优化计算效率。

【GPU 算子工程】Nsight 调优工作流:Compute 与 Systems 怎么读

土法炼钢兴趣小组的博客 土法炼钢兴趣小组的博客 · 2026-06-28T00:00:00Z

归约是将数组压缩为标量的基本操作,优化归约的关键在于消除分支发散和bank conflict。通过比较三种版本,顺序寻址和warp shuffle显著提高性能。单遍归约受访存限制,优化需针对真实瓶颈。跨block合并可用两趟kernel或原子加。scan比归约复杂,建议使用CUB库。

【GPU 算子工程】Reduction 与 Scan:warp shuffle、block 级与 grid 级归约

土法炼钢兴趣小组的博客 土法炼钢兴趣小组的博客 · 2026-06-28T00:00:00Z

GEMM(通用矩阵乘)是深度学习中的关键计算。通过优化实现,从朴素实现到共享内存和寄存器分块,显著提高了算术强度。寄存器分块的性能达到6375 GFLOP/s,接近FP32峰值的39%。未来的优化方向包括向量化、预取和更大的tile设计。

【GPU 算子工程】GEMM:从朴素实现到 shared memory tiling 与寄存器分块

土法炼钢兴趣小组的博客 土法炼钢兴趣小组的博客 · 2026-06-28T00:00:00Z

Tensor Core 是专用的矩阵计算单元,利用 MMA 指令实现高效的矩阵乘加运算。FP16 Tensor Core 的吞吐量可达 72.8 TFLOP/s,显著高于 FP32 的 16 TFLOP/s。使用 Tensor Core 时,数据传输速度常成为瓶颈,因此需要优化数据布局和访存策略。CUDA 的 wmma API 简化了 Tensor Core 的使用,而高性能库如 CUTLASS 则能更精细地控制数据布局。

【GPU 算子工程】Tensor Core 与 MMA:wmma、mma.sync 与数据布局

土法炼钢兴趣小组的博客 土法炼钢兴趣小组的博客 · 2026-06-28T00:00:00Z

CUTLASS 是 NVIDIA 开源的 CUDA C++ 模板库,旨在优化 GEMM(矩阵乘法)性能。它将 GEMM 拆分为五层结构,支持多种精度和形状的配置。通过模板化设计,CUTLASS 提供高性能的可复用组件,简化布局管理。CuTe 作为统一的布局代数,提升了编程的灵活性和可维护性。

【GPU 算子工程】CUTLASS 与 CuTe:模板化 GEMM 与布局代数

土法炼钢兴趣小组的博客 土法炼钢兴趣小组的博客 · 2026-06-28T00:00:00Z

本文讨论了softmax和LayerNorm等内存绑定算子的优化方法。softmax通过减去最大值来避免数值溢出,在线softmax则通过增量维护最大值和总和来减少遍数。LayerNorm采用Welford算法进行单遍均值和方差计算。逐元素融合技术将多个操作合并为一个kernel,显著减少访存次数,提高性能。整体优化策略强调数值稳定性和减少访存。

【GPU 算子工程】Softmax、LayerNorm 与逐元素融合

土法炼钢兴趣小组的博客 土法炼钢兴趣小组的博客 · 2026-06-28T00:00:00Z

FlashAttention通过分块在线softmax优化Transformer的注意力机制,显著降低显存和计算速度瓶颈。它采用流式计算,避免物化整个分数矩阵,减少内存访问,提高效率。实测表明,FlashAttention在长序列处理上具有显著优势,并在反向传播时通过重算降低显存需求。

【GPU 算子工程】FlashAttention:在线 softmax 与 IO-aware 注意力

土法炼钢兴趣小组的博客 土法炼钢兴趣小组的博客 · 2026-06-28T00:00:00Z

Triton 是一种新型编程模型,简化了深度学习算子的开发。它通过编译器自动处理访存合并、共享内存管理和指令调度,减少了手动编码的复杂性。Triton 采用 tile 视角,允许开发者专注于数据块的处理,配合 autotune 功能自动优化配置,提升性能。总体而言,Triton 提高了开发效率,适合大多数自定义算子,但在极限性能和特定场景下仍需使用 CUDA。

【GPU 算子工程】Triton:tile 级编程模型与 autotune

土法炼钢兴趣小组的博客 土法炼钢兴趣小组的博客 · 2026-06-28T00:00:00Z

本文讨论了Kernel Fusion技术,强调其在减少HBM往返和提升memory-bound算子性能方面的重要性。通过将相邻算子合并为一个kernel,减少数据搬运,实验证明加速比随融合链长度线性增长。融合类型包括逐元素融合和归约融合,但在中间结果复用和资源不足的情况下需谨慎使用。现代编译器如PyTorch和TensorFlow自动化融合过程,以提高效率。

【GPU 算子工程】Kernel Fusion 与 epilogue:减少 HBM 往返

土法炼钢兴趣小组的博客 土法炼钢兴趣小组的博客 · 2026-06-28T00:00:00Z
  • <<
  • <
  • 1 (current)
  • 2
  • 3
  • >
  • >>
👤 个人中心
在公众号发送验证码完成验证
登录验证
在本设备完成一次验证即可继续使用

完成下面两步后,将自动完成登录并继续当前操作。

1 关注公众号
小红花技术领袖公众号二维码
小红花技术领袖
如果当前 App 无法识别二维码,请在微信搜索并关注该公众号
2 发送验证码
在公众号对话中发送下面 4 位验证码
友情链接: MOGE.AI 九胧科技 1tok 菜鸟教程 Remio.AI DeekSeek连连 53AI 神龙海外代理IP IPIPGO全球代理IP 东波哥的博客 匡优考试在线考试系统 开源服务指南 蓝莺IM Solo 独立开发者社区 AI酷站导航 极客Fun 我爱水煮鱼 周报生成器 He3.app 简单简历 白鲸出海 T沙龙 职友集 TechParty 蟒周刊 Best AI Music Generator 模力方舟 Gitee AI

小红花技术领袖俱乐部
小红花·文摘:汇聚分发优质内容
小红花技术领袖俱乐部
Copyright © 2021-
粤ICP备2022094092号-1
公众号 小红花技术领袖俱乐部公众号二维码
视频号 小红花技术领袖俱乐部视频号二维码