不是算得慢,是搬得慢:深入浅出 FlashAttention 四代
注意力真正的瓶颈不是 O(N²) 的计算量,而是中间矩阵在显存里的来回搬运。从 FA1 的 IO 感知、FA2 的并行重构、FA3 的异步流水与 FP8,到 FA4 应对「不对称扩展」的协同设计——四代 FlashAttention 就是一部算法追着硬件跑的历史。
注意力真正的瓶颈不是 O(N²) 的计算量,而是中间矩阵在显存里的来回搬运。从 FA1 的 IO 感知、FA2 的并行重构、FA3 的异步流水与 FP8,到 FA4 应对「不对称扩展」的协同设计——四代 FlashAttention 就是一部算法追着硬件跑的历史。