JA EN

#numerical

6 記事

01 ·数値計算·★ 会員·18分で読めます 【実装】自動微分を自作する — 100行のミニPyTorch Valueクラス1つから始めて、演算子オーバーロード・トポロジカル順序・勾配の加算までを組み上げ、その上にニューラルネットを載せて学習させます。設計の理由を辿ると、zero_grad() や retain_graph が仕様の暗記ではなく必然に変わります。 02 ·数値計算·無料·14分で読めます 自動微分の仕組み — PyTorchの魔法を1から loss.backward() と書くだけで何百万個ものパラメータの微分が出てくるのはなぜか。計算グラフ・連鎖律・前進モードと後退モードを前提知識ゼロから解き、40行のミニautogradまで自作します。 03 ·数値計算·★ 会員·論文·12分で読めます FFTを1から理解する — なぜ畳み込みが掛け算になるのか An Algorithm for the Machine Calculation of Complex Fourier Series (Cooley & Tukey 音を周波数に分解するフーリエ変換を、比喩→回転する針の直感→DFTの式→分割統治のFFTの順に前提知識ゼロから解説。畳み込みがなぜ周波数領域では掛け算1回になるのか、多項式の積の視点で腹落ちさせる。 04 ·並列・分散·★ 会員·12分で読めます GPUはなぜ速いのか — 実行モデルと並列化の限界 CPUとGPUは「速い」の定義が違います。トランジスタ予算の使い道、32スレッドを束ねるSIMTとワープ、分岐発散で性能が落ちる理由、占有率とレジスタ圧。最後はAmdahlの法則で「どこまで速くなるか」を着手前に見積もり、プロファイラのどの指標を見てCPU律速に気づくかまで降ります。 05 ·数値計算·★ 会員·10分で読めます 行列積のコスト — AIの計算はほぼここに帰着する なぜGEMMが全てなのか。O(n³)の内訳、メモリ帯域と演算強度、GPUが速い理由、タイル化の直感。最後に、AIモデルの学習・推論に必要なFLOPsを自分の手で見積もれるところまで持っていきます。 06 ·数値計算·★ 会員·10分で読めます 行列積のコスト — AIの計算はほぼここに帰着する なぜGEMMが全てなのか。O(n³)の内訳、メモリ帯域と演算強度、GPUが速い理由、タイル化の直感。最後に、AIモデルの学習・推論に必要なFLOPsを自分の手で見積もれるところまで持っていきます。