JA EN

#gpu

7 記事

01 ·推論・高速化·★ 会員·論文·15分で読めます GPUメモリ不足サバイバル — OOMの原因と対処の全パターン Training Deep Nets with Sublinear Memory Cost `CUDA out of memory` は、最後に失敗した確保だけを報告する不親切なエラーです。犯人はたいてい、すでに載っている側にいます。何がVRAMを食うのかを5つの箱に分けて数え、パラメータ1個あたり16バイトという学習の固定費を出し、そこから勾配チェックポイント・オプティマイザ圧縮・オフロード・KVキャッシュ管理・断片化まで、打ち手を副作用の小さい順に。 02 ·Transformerの仕組み·★ 会員·論文·13分で読めます FlashAttentionを1から — 計算を増やして速くする逆説 FlashAttention: Fast and Memory-Efficient Exact Attention with IO-Awareness FlashAttentionは逆伝播でわざと同じ計算をやり直します。演算回数は増えるのに速い——GPUでは掛け算よりデータの運搬のほうが高いからです。HBMとSRAMの往復を数えるところから、タイリングを阻むsoftmaxの壁、それを壊すオンラインsoftmaxの漸化式、そして現場でバックエンドが静かにフォールバックする落とし穴までを前提知識ゼロから追います。 03 ·クラウドと運用·★ 会員·13分で読めます GPUクラウドの経済学 — 借りるか・買うか・予約するか 同じGPUには4つの値段が同時についている。オンデマンド・予約・スポット・自前を1本の式で比べ、損益分岐の稼働率、中断込みのスポット実効単価、コミットの消化率、そして請求書に隠れる項目までを掛け算と割り算だけで追う。 04 ·計算機アーキテクチャ·★ 会員·論文·12分で読めます GPUのメモリ階層 — HBM・SRAM・レジスタと「移動が支配する」現実 FlashAttention: Fast and Memory-Efficient Exact Attention with IO-Awareness GPUの速さを決めているのは演算器ではなく、レジスタ・共有メモリ・L2・HBMのどこにデータを置き、何回運ぶかです。階層の容量と帯域の桁、演算強度とタイル化、階層ごとに引くルーフライン、そして「FLOPsを増やしたのに速くなる」FlashAttentionまでを前提知識ゼロから追います。 05 ·アクセラレータ·★ 会員·論文·10分で読めます AIアクセラレータの設計様式 — GPU/NPU/TPUは何が違うのか In-Datacenter Performance Analysis of a Tensor Processing Unit GPU・TPU・NPUは「汎用性をどこまで捨てて行列積に振るか」の答えが違う3つの流儀。シストリックアレイの仕組み、データフロー設計、量子化との共進化を、比喩→式→コードの順で前提知識ゼロから解説する。 06 ·並列・分散·★ 会員·12分で読めます GPUはなぜ速いのか — 実行モデルと並列化の限界 CPUとGPUは「速い」の定義が違います。トランジスタ予算の使い道、32スレッドを束ねるSIMTとワープ、分岐発散で性能が落ちる理由、占有率とレジスタ圧。最後はAmdahlの法則で「どこまで速くなるか」を着手前に見積もり、プロファイラのどの指標を見てCPU律速に気づくかまで降ります。 07 ·数値計算·★ 会員·10分で読めます 行列積のコスト — AIの計算はほぼここに帰着する なぜGEMMが全てなのか。O(n³)の内訳、メモリ帯域と演算強度、GPUが速い理由、タイル化の直感。最後に、AIモデルの学習・推論に必要なFLOPsを自分の手で見積もれるところまで持っていきます。