PaperLens
紙
学生版
社会人版
JA
EN
◐
Googleでログイン
ログイン
読む
ホーム
論文精読
新着
教科書
深める
体系
ラボ
業界地図
みんなの貢献
用語集
自分
探す
読み放題
マイページ
体系
› 計算アルゴリズム
並列・分散
並列化の限界・GPUの実行モデル・分散学習の通信
01
2026-08-06
·
並列・分散
·
★ 会員
·
12分で読めます
GPUはなぜ速いのか — 実行モデルと並列化の限界
CPUとGPUは「速い」の定義が違います。トランジスタ予算の使い道、32スレッドを束ねるSIMTとワープ、分岐発散で性能が落ちる理由、占有率とレジスタ圧。最後はAmdahlの法則で「どこまで速くなるか」を着手前に見積もり、プロファイラのどの指標を見てCPU律速に気づくかまで降ります。
02
2026-08-06
·
並列・分散
·
★ 会員
·
13分で読めます
分散学習を1から — データ並列・モデル並列・通信がボトルネックになるとき
なぜ1台に載らないのかをメモリの内訳から出発し、データ並列とall-reduce、ZeRO/FSDPが何を分割するのか、テンソル並列とパイプライン並列を順に。最後は通信量と計算量の比で「どこで頭打ちになるか」を自分で見積もり、勾配蓄積・NCCLの設定・ハングの切り分けまで降ります。
03
2026-08-27
·
並列・分散
·
★ 会員
·
12分で読めます
並行処理を1から — ロック・アトミック・メモリモデル
データ競合はなぜ起きるのか、なぜテストで再現しないのかを前提知識ゼロから解説。ロック・アトミック操作・CAS・メモリモデルまで、比喩と式とコードで順に積み上げます。