JA EN

#flash-attention

2 記事

01 ·Transformerの仕組み·★ 会員·論文·13分で読めます FlashAttentionを1から — 計算を増やして速くする逆説 FlashAttention: Fast and Memory-Efficient Exact Attention with IO-Awareness FlashAttentionは逆伝播でわざと同じ計算をやり直します。演算回数は増えるのに速い——GPUでは掛け算よりデータの運搬のほうが高いからです。HBMとSRAMの往復を数えるところから、タイリングを阻むsoftmaxの壁、それを壊すオンラインsoftmaxの漸化式、そして現場でバックエンドが静かにフォールバックする落とし穴までを前提知識ゼロから追います。 02 ·計算機アーキテクチャ·★ 会員·論文·12分で読めます GPUのメモリ階層 — HBM・SRAM・レジスタと「移動が支配する」現実 FlashAttention: Fast and Memory-Efficient Exact Attention with IO-Awareness GPUの速さを決めているのは演算器ではなく、レジスタ・共有メモリ・L2・HBMのどこにデータを置き、何回運ぶかです。階層の容量と帯域の桁、演算強度とタイル化、階層ごとに引くルーフライン、そして「FLOPsを増やしたのに速くなる」FlashAttentionまでを前提知識ゼロから追います。