JA EN

#roofline

2 記事

01 ·計算機アーキテクチャ·★ 会員·論文·12分で読めます GPUのメモリ階層 — HBM・SRAM・レジスタと「移動が支配する」現実 FlashAttention: Fast and Memory-Efficient Exact Attention with IO-Awareness GPUの速さを決めているのは演算器ではなく、レジスタ・共有メモリ・L2・HBMのどこにデータを置き、何回運ぶかです。階層の容量と帯域の桁、演算強度とタイル化、階層ごとに引くルーフライン、そして「FLOPsを増やしたのに速くなる」FlashAttentionまでを前提知識ゼロから追います。 02 ·計算機アーキテクチャ·★ 会員·11分で読めます メモリの壁を1から — なぜ演算より転送が高いのか 掛け算より、数を運ぶほうが高い。配線の充放電という物理から出発して、DRAMのレイテンシがなぜ縮まないのか、メモリ階層の桁、リトルの法則、マシンバランスとルーフラインまで。最後に、目の前のカーネルが計算律速か帯域律速かを自分で切り分けられるところまで持っていきます。