PaperLens
紙
学生版
社会人版
JA
EN
◐
Googleでログイン
ログイン
読む
ホーム
論文精読
新着
教科書
深める
体系
ラボ
業界地図
みんなの貢献
用語集
自分
探す
読み放題
マイページ
#memory-bandwidth
2 記事
01
2026-08-27
·
Transformerの仕組み
·
★ 会員
·
論文
·
13分で読めます
FlashAttentionを1から — 計算を増やして速くする逆説
FlashAttention: Fast and Memory-Efficient Exact Attention with IO-Awareness
FlashAttentionは逆伝播でわざと同じ計算をやり直します。演算回数は増えるのに速い——GPUでは掛け算よりデータの運搬のほうが高いからです。HBMとSRAMの往復を数えるところから、タイリングを阻むsoftmaxの壁、それを壊すオンラインsoftmaxの漸化式、そして現場でバックエンドが静かにフォールバックする落とし穴までを前提知識ゼロから追います。
02
2026-08-13
·
計算量と評価
·
★ 会員
·
10分で読めます
計算量と実測が食い違うとき — キャッシュ・分岐・メモリ帯域
同じO(n)のコードが実測では桁で違う——O記法が意図的に捨てている「メモリの現実」を、キャッシュ階層・分岐予測・メモリ帯域の3つの側面から解き明かす。