PaperLens
紙
学生版
社会人版
JA
EN
◐
Googleでログイン
ログイン
読む
ホーム
論文精読
新着
教科書
深める
体系
ラボ
業界地図
みんなの貢献
用語集
自分
探す
読み放題
マイページ
#flash-attention
2 記事
01
2026-08-27
·
Transformerの仕組み
·
★ 会員
·
論文
·
13分で読めます
FlashAttentionを1から — 計算を増やして速くする逆説
FlashAttention: Fast and Memory-Efficient Exact Attention with IO-Awareness
FlashAttentionは逆伝播でわざと同じ計算をやり直します。演算回数は増えるのに速い——GPUでは掛け算よりデータの運搬のほうが高いからです。HBMとSRAMの往復を数えるところから、タイリングを阻むsoftmaxの壁、それを壊すオンラインsoftmaxの漸化式、そして現場でバックエンドが静かにフォールバックする落とし穴までを前提知識ゼロから追います。
02
2026-08-22
·
計算機アーキテクチャ
·
★ 会員
·
論文
·
12分で読めます
GPUのメモリ階層 — HBM・SRAM・レジスタと「移動が支配する」現実
FlashAttention: Fast and Memory-Efficient Exact Attention with IO-Awareness
GPUの速さを決めているのは演算器ではなく、レジスタ・共有メモリ・L2・HBMのどこにデータを置き、何回運ぶかです。階層の容量と帯域の桁、演算強度とタイル化、階層ごとに引くルーフライン、そして「FLOPsを増やしたのに速くなる」FlashAttentionまでを前提知識ゼロから追います。