JA EN

#implementation

5 記事

01 ·蒸留と圧縮·★ 会員·論文·15分で読めます 【実装】蒸留を自作する — 100行で小さなモデルを育てる Distilling the Knowledge in a Neural Network 蒸留の損失は20行で書けます。にもかかわらず自作するとほぼ全員が同じ場所で転ぶ — KLの向き、reductionの選び方、T²の付け忘れ。教師の凍結から損失、訓練ループ、教師なしベースラインとの比較、温度スイープ、そして「実装が壊れていないこと」を確かめる4つの検算までを、100行のコードで通します。 02 ·Transformerの仕組み·★ 会員·論文·15分で読めます 【実装】BPEトークナイザを自作する — マージ規則を学習し、日本語で殴られる Neural Machine Translation of Rare Words with Subword Units BPEの学習器とエンコーダを自分で書く。マージ規則が「順序付きの手順書」であること、素朴な数え直しをどう捨てるか、日本語では語彙の先頭数千枠が「文字を組み立てる」ことに消える理由、語彙サイズを振る実験の正しい測り方までを実装の手触りで追う。 03 ·Transformerの仕組み·★ 会員·論文·19分で読めます 【実装】ミニGPTを自作する — 300行の言語モデル Attention Is All You Need PyTorchで文字単位のミニGPTを最初から組む。トークナイザ・因果マスク付き自己注意・学習ループ・温度サンプリングまでを1本のコードとして通し、シェイクスピアの文体が立ち上がるまでを追う。 04 ·生成モデル·★ 会員·論文·15分で読めます 【実装】拡散モデルを自作する — MNISTからはじめる Denoising Diffusion Probabilistic Models 28×28の手書き数字で拡散モデルを最小構成から組み上げます。ノイズスケジュールが満たすべき2条件、UNetにステップ番号を注入する方法、サンプリングの最後にノイズを足し直す理由まで、自分で書いて初めて詰まる場所を順に潰していきます。 05 ·エージェント·★ 会員·論文·12分で読めます 【実装】エージェントループを自作する — ツール呼び出しの最小形 ReAct: Synergizing Reasoning and Acting in Language Models 「AIエージェント」の中心はwhile文ひとつです。JSON関数呼び出しの形、ReActが残した設計、そして事故のほとんどが集まる停止条件までを、フレームワークを使わない40行のコードとして1から組み上げます。