JA EN

#memory-bandwidth

2 記事

01 ·Transformerの仕組み·★ 会員·論文·13分で読めます FlashAttentionを1から — 計算を増やして速くする逆説 FlashAttention: Fast and Memory-Efficient Exact Attention with IO-Awareness FlashAttentionは逆伝播でわざと同じ計算をやり直します。演算回数は増えるのに速い——GPUでは掛け算よりデータの運搬のほうが高いからです。HBMとSRAMの往復を数えるところから、タイリングを阻むsoftmaxの壁、それを壊すオンラインsoftmaxの漸化式、そして現場でバックエンドが静かにフォールバックする落とし穴までを前提知識ゼロから追います。 02 ·計算量と評価·★ 会員·10分で読めます 計算量と実測が食い違うとき — キャッシュ・分岐・メモリ帯域 同じO(n)のコードが実測では桁で違う——O記法が意図的に捨てている「メモリの現実」を、キャッシュ階層・分岐予測・メモリ帯域の3つの側面から解き明かす。