英伟达Blackwell架构将张量核心升级为独立协处理器,配备专属内存,矩阵乘法可由单线程异步发射,结果存入专用空间,无需线程集体等待。但需手动管理内存,易致泄漏,且读取结果需128线程。此设计彻底改变CUDA编程范式,从集体协作转向流水线分工,凸显张量核心从指令到独立单元的转变。
本文介绍了Oracle Java团队提出的一种扩展HAT编程模型的方法,包含显式张量核心编程的API,旨在使其通用,以便在没有显式张量指令的加速器上处理通过HAT张量核心API表达的计算。
完成下面两步后,将自动完成登录并继续当前操作。