JA EN
体系 › 計算アルゴリズム

並列・分散

並列化の限界・GPUの実行モデル・分散学習の通信

01 ·並列・分散·★ 会員·12分で読めます GPUはなぜ速いのか — 実行モデルと並列化の限界 CPUとGPUは「速い」の定義が違います。トランジスタ予算の使い道、32スレッドを束ねるSIMTとワープ、分岐発散で性能が落ちる理由、占有率とレジスタ圧。最後はAmdahlの法則で「どこまで速くなるか」を着手前に見積もり、プロファイラのどの指標を見てCPU律速に気づくかまで降ります。 02 ·並列・分散·★ 会員·13分で読めます 分散学習を1から — データ並列・モデル並列・通信がボトルネックになるとき なぜ1台に載らないのかをメモリの内訳から出発し、データ並列とall-reduce、ZeRO/FSDPが何を分割するのか、テンソル並列とパイプライン並列を順に。最後は通信量と計算量の比で「どこで頭打ちになるか」を自分で見積もり、勾配蓄積・NCCLの設定・ハングの切り分けまで降ります。 03 ·並列・分散·★ 会員·12分で読めます 並行処理を1から — ロック・アトミック・メモリモデル データ競合はなぜ起きるのか、なぜテストで再現しないのかを前提知識ゼロから解説。ロック・アトミック操作・CAS・メモリモデルまで、比喩と式とコードで順に積み上げます。