CUDA线程块执行顺序会影响L2缓存命中与GEMM性能。文章介绍了线性、分组2D面板、Morton和异或等swizzle算法,并用Triton进行基准测试。结果显示,预测的缓存命中率与实际吞吐量几乎不相关,列主序明显慢于行主序,原因可能在于DRAM访问模式等底层因素。结论是应针对具体配置实测,而非依赖缓存命中率预测。
完成下面两步后,将自动完成登录并继续当前操作。