JA EN

#pytorch

5 記事

01 ·蒸留と圧縮·★ 会員·論文·15分で読めます 【実装】蒸留を自作する — 100行で小さなモデルを育てる Distilling the Knowledge in a Neural Network 蒸留の損失は20行で書けます。にもかかわらず自作するとほぼ全員が同じ場所で転ぶ — KLの向き、reductionの選び方、T²の付け忘れ。教師の凍結から損失、訓練ループ、教師なしベースラインとの比較、温度スイープ、そして「実装が壊れていないこと」を確かめる4つの検算までを、100行のコードで通します。 02 ·Transformerの仕組み·★ 会員·論文·19分で読めます 【実装】ミニGPTを自作する — 300行の言語モデル Attention Is All You Need PyTorchで文字単位のミニGPTを最初から組む。トークナイザ・因果マスク付き自己注意・学習ループ・温度サンプリングまでを1本のコードとして通し、シェイクスピアの文体が立ち上がるまでを追う。 03 ·生成モデル·★ 会員·論文·15分で読めます 【実装】拡散モデルを自作する — MNISTからはじめる Denoising Diffusion Probabilistic Models 28×28の手書き数字で拡散モデルを最小構成から組み上げます。ノイズスケジュールが満たすべき2条件、UNetにステップ番号を注入する方法、サンプリングの最後にノイズを足し直す理由まで、自分で書いて初めて詰まる場所を順に潰していきます。 04 ·線形代数·無料·14分で読めます テンソルと形状操作 — einsumが読めれば論文が読める 論文の Σ_j A_ij B_jk と、コードの x.transpose(1,2) は同じことを言っています。その橋渡しをするのが einsum 記法です。軸・ブロードキャスト・縮約という3つの道具だけで、Attentionの実装が1行で書けるところまで。 05 ·数値計算·無料·14分で読めます 自動微分の仕組み — PyTorchの魔法を1から loss.backward() と書くだけで何百万個ものパラメータの微分が出てくるのはなぜか。計算グラフ・連鎖律・前進モードと後退モードを前提知識ゼロから解き、40行のミニautogradまで自作します。