FlashAttention 如何在不近似的情况下加速

Understanding FlashAttention Pt 1: Personal Notes

这篇笔记深入剖析了 FlashAttention 的核心机制:它并非通过近似算法牺牲精度,而是通过 Tiling、Online Softmax 和 Recomputation 三大技术,将计算过程转化为对 GPU 内存层级友好的 IO 感知操作。文章指出,现代 AI 硬件的瓶颈往往不在计算速度,而在数据搬运。FlashAttention 通过将巨大的中间矩阵拆解为小块,在高速的片上内存(SRAM)中完成计算并立即丢弃,避免了频繁读写高带宽内存(HBM)。这种策略虽然可能增加少量算术运算,却大幅降低了内存流量,从而实现了真正的加速。从 FlashAttention-1 到 FlashAttention-4,这一理念不断演进,完美适配了从 Hopper 到 Blackwell 的硬件架构,证明了在算法设计中,理解数据流动比单纯追求 FLOP 数更为关键。

核心区别在于,Dense FlashAttention 是一种精确的注意力算法:它并没有用低秩、稀疏、内核化或近似公式来替代 softmax 注意力。

同日更多故事

2026-09-14