FlashAttention是一种IO感知的精确注意力算法,通过分块和在线softmax避免物化完整注意力矩阵,减少HBM读写,提升效率并降低显存占用,虽FLOPs仍为O(n²),但优化了硬件执行路径,使长序列训练更可行。
Flash Attention 通过分块计算 Q、K、V,避免存储 seq_len×seq_len 的 softmax 中间矩阵,减少 HBM 访问,使注意力内存随序列长度近似线性增长。虽然 FLOP 更高,但注意力受内存带宽限制,因此速度更快,并支持长序列训练。
完成下面两步后,将自动完成登录并继续当前操作。