小红花·文摘 - 小红花技术领袖俱乐部

在Cache Lab中，任务是优化32x32、64x64和61x67矩阵的转置，旨在减少缓存未命中。通过矩阵分块和循环展开技术，针对不同矩阵大小采用不同优化策略，以提高性能并降低缓存未命中次数。优化不仅依赖数学，还需理解硬件特性。

CSAPP缓存实验II：优化矩阵转置

Louis Aeilot's Blog ·

本文讨论了矩阵转置的优化，重点在于减少缓存未命中的情况。针对32x32、64x64和61x67三种矩阵，采用了矩阵分块和循环展开技术。32x32矩阵使用8x8分块，61x67矩阵采用16x16分块，64x64矩阵结合4x4和8x8分块及临时存储进行优化。优化后的代码显著减少了缓存未命中次数，提升了性能。

CSAPP缓存实验II：优化矩阵转置

Louis Aeilot's Blog ·

常见Python标准库函数的非常规用法

常见Python标准库函数的非常规用法

KDnuggets ·

CuTe是一个C++模板库，提供CUDA内核中的高级布局和张量操作。本文介绍了如何使用CuTe实现矩阵转置的CUDA内核，探讨了共享内存的使用及优化方法，包括避免共享内存银行冲突的技巧，并通过性能对比展示了CuTe在CUDA编程中的优势。

CuTe 矩阵转置

Lei Mao's Log Book ·

CUDA矩阵转置要点

CUDA矩阵转置要点

李文举 ·