小红花·文摘
  • 首页
  • 广场
  • 排行榜🏆
  • 直播
  • FAQ
Dify.AI

GEMM(通用矩阵乘)是深度学习中的关键计算。通过优化实现,从朴素实现到共享内存和寄存器分块,显著提高了算术强度。寄存器分块的性能达到6375 GFLOP/s,接近FP32峰值的39%。未来的优化方向包括向量化、预取和更大的tile设计。

【GPU 算子工程】GEMM:从朴素实现到 shared memory tiling 与寄存器分块

土法炼钢兴趣小组的博客
土法炼钢兴趣小组的博客 · 2026-06-28T00:00:00Z

CUTLASS 是 NVIDIA 开源的 CUDA C++ 模板库,旨在优化 GEMM(矩阵乘法)性能。它将 GEMM 拆分为五层结构,支持多种精度和形状的配置。通过模板化设计,CUTLASS 提供高性能的可复用组件,简化布局管理。CuTe 作为统一的布局代数,提升了编程的灵活性和可维护性。

【GPU 算子工程】CUTLASS 与 CuTe:模板化 GEMM 与布局代数

土法炼钢兴趣小组的博客
土法炼钢兴趣小组的博客 · 2026-06-28T00:00:00Z
DeepSeek开源通用矩阵乘法库,300行代码加速V3、R1,R2被曝五月前问世

DeepGEMM 是一款开源的 FP8 GEMM 库,支持密集型和专家混合计算,在 Hopper GPU 上可实现超过 1350 TFLOPS 的性能。该库代码简洁,仅有 300 行,适合学习 FP8 矩阵乘法。DeepSeek 计划在 5 月前发布新一代 R2 模型,以提升代码生成能力。

DeepSeek开源通用矩阵乘法库,300行代码加速V3、R1,R2被曝五月前问世

机器之心
机器之心 · 2025-02-26T03:25:20Z

MMA(矩阵乘法和累加)是GEMM的核心操作。CuTe提供API以配置MMA原子和瓦片,支持更大规模的问题解决。本文讨论了CuTe的瓦片MMA配置、布局及API示例,展示了如何优化性能,通过静态共享内存和线程划分来实现。

CuTe 瓦片 MMA

Lei Mao's Log Book
Lei Mao's Log Book · 2025-01-09T08:00:00Z

Triton 是一种基于 Python 的编程语言和编译器,专为高效编写 DNN 计算内核而设计,能够在现代 GPU 上运行,支持分组 GEMM 内核,并通过静态调度实现高吞吐量。

【Triton 教程】分组 GEMM

HyperAI超神经
HyperAI超神经 · 2025-01-08T02:53:36Z

cuBLAS GEMM API对输入输出矩阵的存储格式有严格要求。若矩阵为列主序格式,可直接使用;若为行主序格式,设置参数时易出错。本文讨论了矩阵转置与列主序存储的关系,以及在不同情况下如何使用cuBLAS GEMM API。

cuBLAS GEMM API在列主序和行主序矩阵中的使用

Lei Mao's Log Book
Lei Mao's Log Book · 2024-12-12T08:00:00Z

Apache TVM 是一个支持 CPU 和 GPU 的深度学习编译框架,提供抽象接口和优化算法调度以提升性能。教程展示了如何通过分块和向量化等技术优化矩阵乘法,显著提高计算速度。用户可通过简单代码实现高效性能,建议自行测试。

【TVM 教程】如何在 CPU 上优化 GEMM

HyperAI超神经
HyperAI超神经 · 2024-12-04T07:22:58Z

OpenGeMM是一种新型开放源代码加速平台,旨在解决深度神经网络在资源受限边缘设备上的部署问题。该平台通过参数化的Chisel编码GeMM加速器、轻量级RISC-V处理器和紧耦合的多银行临时存储器,实现了高达99.34%的硬件利用率,吞吐量提升3.58至16.40倍,系统效率可达4.68 TOPS/W。

OpenGeMM: A High-Utilization GeMM Accelerator Generator with Lightweight RISC-V Control and Tight Memory Coupling

BriefGPT - AI 论文速递
BriefGPT - AI 论文速递 · 2024-11-14T00:00:00Z

本研究解决了低精度应用中计算误差显著的问题,提出了一种低秩残差量化矩阵乘法(LRQMM)方法,通过残差补偿引入低秩近似。实验结果表明,LRQMM能将直接量化矩阵乘法的误差降低1到2个数量级,同时在处理大规模矩阵时,计算速度仅降低约20%。

在低比特GEMM残差计算中使用RSVD的方法

BriefGPT - AI 论文速递
BriefGPT - AI 论文速递 · 2024-09-27T00:00:00Z

本论文研究了基于微环共振器的模拟光子结构,用于加速深度神经网络中的通用矩阵乘法,具有出色的吞吐量和能效。作者通过分析三种不同的调制顺序,发现它们对电路级的串扰噪声和光信号损失以及系统级的吞吐量和能量区域能够带来不同程度的影响。评估结果显示,SMWA组织在吞吐量、能效和面积能量效率方面的提升分别多达4.4倍、5倍和5.2倍。

基于微环的非相干光子 GEMM 加速器的比较分析

BriefGPT - AI 论文速递
BriefGPT - AI 论文速递 · 2024-02-05T00:00:00Z

该文介绍了一种使用M2架构的机器学习模型,能够在序列长度和模型维度上进行扩展,从而实现更长的上下文和更好的性能。该模型在非因果伯特模型、ViT图像分类和因果GPT模型三个领域展现出良好的性能。

Monarch Mixer:一个简单的次线性 GEMM 架构

BriefGPT - AI 论文速递
BriefGPT - AI 论文速递 · 2023-10-18T00:00:00Z
  • <<
  • <
  • 1 (current)
  • >
  • >>
👤 个人中心
在公众号发送验证码完成验证
登录验证
在本设备完成一次验证即可继续使用

完成下面两步后,将自动完成登录并继续当前操作。

1 关注公众号
小红花技术领袖公众号二维码
小红花技术领袖
如果当前 App 无法识别二维码,请在微信搜索并关注该公众号
2 发送验证码
在公众号对话中发送下面 4 位验证码
小红花技术领袖俱乐部
小红花·文摘:汇聚分发优质内容
小红花技术领袖俱乐部
Copyright © 2021-
粤ICP备2022094092号-1
公众号 小红花技术领袖俱乐部公众号二维码
视频号 小红花技术领袖俱乐部视频号二维码