用語集 › flashattention
GLOSSARY
flashattention
GPUのメモリ移動を減らす高速なAttention実装
2本の論文題名に登場
定義
attention を GPU の高速な on-chip メモリ上でブロックごとに計算し、巨大な注意行列を主メモリに書き出さずに済ませる実装。近似ではなく通常の attention と同じ結果を返しつつ、メモリを系列長に対し線形に抑え実行時間も縮める。長い文脈長を実用にした基盤技術で、主要ライブラリに標準搭載。
論文題名での読み方
固有名。定番の高速化手法
この語が出てくる解説
- FlashAttentionを1から — 計算を増やして速くする逆説FlashAttention: Fast and Memory-Efficient Exact Attention with IO-Awareness
- GPUのメモリ階層 — HBM・SRAM・レジスタと「移動が支配する」現実FlashAttention: Fast and Memory-Efficient Exact Attention with IO-Awareness