PaperLens
紙
学生版
社会人版
JA
EN
◐
Googleでログイン
ログイン
読む
ホーム
論文精読
新着
教科書
深める
体系
ラボ
業界地図
みんなの貢献
用語集
自分
探す
読み放題
マイページ
#gpu
7 記事
01
2026-08-27
·
推論・高速化
·
★ 会員
·
論文
·
15分で読めます
GPUメモリ不足サバイバル — OOMの原因と対処の全パターン
Training Deep Nets with Sublinear Memory Cost
`CUDA out of memory` は、最後に失敗した確保だけを報告する不親切なエラーです。犯人はたいてい、すでに載っている側にいます。何がVRAMを食うのかを5つの箱に分けて数え、パラメータ1個あたり16バイトという学習の固定費を出し、そこから勾配チェックポイント・オプティマイザ圧縮・オフロード・KVキャッシュ管理・断片化まで、打ち手を副作用の小さい順に。
02
2026-08-27
·
Transformerの仕組み
·
★ 会員
·
論文
·
13分で読めます
FlashAttentionを1から — 計算を増やして速くする逆説
FlashAttention: Fast and Memory-Efficient Exact Attention with IO-Awareness
FlashAttentionは逆伝播でわざと同じ計算をやり直します。演算回数は増えるのに速い——GPUでは掛け算よりデータの運搬のほうが高いからです。HBMとSRAMの往復を数えるところから、タイリングを阻むsoftmaxの壁、それを壊すオンラインsoftmaxの漸化式、そして現場でバックエンドが静かにフォールバックする落とし穴までを前提知識ゼロから追います。
03
2026-08-26
·
クラウドと運用
·
★ 会員
·
13分で読めます
GPUクラウドの経済学 — 借りるか・買うか・予約するか
同じGPUには4つの値段が同時についている。オンデマンド・予約・スポット・自前を1本の式で比べ、損益分岐の稼働率、中断込みのスポット実効単価、コミットの消化率、そして請求書に隠れる項目までを掛け算と割り算だけで追う。
04
2026-08-22
·
計算機アーキテクチャ
·
★ 会員
·
論文
·
12分で読めます
GPUのメモリ階層 — HBM・SRAM・レジスタと「移動が支配する」現実
FlashAttention: Fast and Memory-Efficient Exact Attention with IO-Awareness
GPUの速さを決めているのは演算器ではなく、レジスタ・共有メモリ・L2・HBMのどこにデータを置き、何回運ぶかです。階層の容量と帯域の桁、演算強度とタイル化、階層ごとに引くルーフライン、そして「FLOPsを増やしたのに速くなる」FlashAttentionまでを前提知識ゼロから追います。
05
2026-08-13
·
アクセラレータ
·
★ 会員
·
論文
·
10分で読めます
AIアクセラレータの設計様式 — GPU/NPU/TPUは何が違うのか
In-Datacenter Performance Analysis of a Tensor Processing Unit
GPU・TPU・NPUは「汎用性をどこまで捨てて行列積に振るか」の答えが違う3つの流儀。シストリックアレイの仕組み、データフロー設計、量子化との共進化を、比喩→式→コードの順で前提知識ゼロから解説する。
06
2026-08-06
·
並列・分散
·
★ 会員
·
12分で読めます
GPUはなぜ速いのか — 実行モデルと並列化の限界
CPUとGPUは「速い」の定義が違います。トランジスタ予算の使い道、32スレッドを束ねるSIMTとワープ、分岐発散で性能が落ちる理由、占有率とレジスタ圧。最後はAmdahlの法則で「どこまで速くなるか」を着手前に見積もり、プロファイラのどの指標を見てCPU律速に気づくかまで降ります。
07
2026-08-05
·
数値計算
·
★ 会員
·
10分で読めます
行列積のコスト — AIの計算はほぼここに帰着する
なぜGEMMが全てなのか。O(n³)の内訳、メモリ帯域と演算強度、GPUが速い理由、タイル化の直感。最後に、AIモデルの学習・推論に必要なFLOPsを自分の手で見積もれるところまで持っていきます。