JA EN

#nlp

11 記事

01 ·Transformerの仕組み·★ 会員·論文·15分で読めます 【実装】BPEトークナイザを自作する — マージ規則を学習し、日本語で殴られる Neural Machine Translation of Rare Words with Subword Units BPEの学習器とエンコーダを自分で書く。マージ規則が「順序付きの手順書」であること、素朴な数え直しをどう捨てるか、日本語では語彙の先頭数千枠が「文字を組み立てる」ことに消える理由、語彙サイズを振る実験の正しい測り方までを実装の手触りで追う。 02 ·Transformerの仕組み·★ 会員·論文·15分で読めます 【実装】BPEトークナイザを自作する — マージ規則を学習し、日本語で殴られる Neural Machine Translation of Rare Words with Subword Units BPEの学習器とエンコーダを自分で書く。マージ規則が「順序付きの手順書」であること、素朴な数え直しをどう捨てるか、日本語では語彙の先頭数千枠が「文字を組み立てる」ことに消える理由、語彙サイズを振る実験の正しい測り方までを実装の手触りで追う。 03 ·Transformerの仕組み·★ 会員·論文·19分で読めます 【実装】ミニGPTを自作する — 300行の言語モデル Attention Is All You Need PyTorchで文字単位のミニGPTを最初から組む。トークナイザ・因果マスク付き自己注意・学習ループ・温度サンプリングまでを1本のコードとして通し、シェイクスピアの文体が立ち上がるまでを追う。 04 ·Transformerの仕組み·★ 会員·論文·19分で読めます 【実装】ミニGPTを自作する — 300行の言語モデル Attention Is All You Need PyTorchで文字単位のミニGPTを最初から組む。トークナイザ・因果マスク付き自己注意・学習ループ・温度サンプリングまでを1本のコードとして通し、シェイクスピアの文体が立ち上がるまでを追う。 05 ·Transformerの仕組み·★ 会員·論文·12分で読めます エンコーダとデコーダ — BERTとGPTの分岐点 BERT: Pre-training of Deep Bidirectional Transformers for Language Understanding 同じTransformerから生まれたBERTとGPTを分けたのは、注意の表を隠すマスク1枚だった。双方向と自己回帰の違いを式と動く図で確かめ、なぜ生成側が主流になり、それでもエンコーダが検索と分類の現場で使われ続けるのかを解く。 06 ·Transformerの仕組み·★ 会員·論文·12分で読めます エンコーダとデコーダ — BERTとGPTの分岐点 BERT: Pre-training of Deep Bidirectional Transformers for Language Understanding 同じTransformerから生まれたBERTとGPTを分けたのは、注意の表を隠すマスク1枚だった。双方向と自己回帰の違いを式と動く図で確かめ、なぜ生成側が主流になり、それでもエンコーダが検索と分類の現場で使われ続けるのかを解く。 07 ·Transformerの仕組み·無料·論文·13分で読めます トークナイザを1から — LLMが世界を切り刻む単位 Neural Machine Translation of Rare Words with Subword Units LLMは文字も単語も読んでいない。BPEがどう語彙を作るか、SentencePieceが何を解決したか、なぜ日本語は同じ内容で損をするのか、語彙サイズを増やすと何と何が交換されるのかを、前提知識ゼロから手計算とコードで追う。 08 ·Transformerの仕組み·無料·論文·13分で読めます トークナイザを1から — LLMが世界を切り刻む単位 Neural Machine Translation of Rare Words with Subword Units LLMは文字も単語も読んでいない。BPEがどう語彙を作るか、SentencePieceが何を解決したか、なぜ日本語は同じ内容で損をするのか、語彙サイズを増やすと何と何が交換されるのかを、前提知識ゼロから手計算とコードで追う。 09 ·RAG・検索拡張·無料·論文·9分で読めます 埋め込み(Embedding)を1から理解する — word2vecの直感から文脈化埋め込みまで Efficient Estimation of Word Representations in Vector Space 「王様 − 男 + 女 ≈ 女王」はなぜ成り立つのか。単語を数値の座標に変える埋め込みを、地図の比喩→分布仮説→word2vecの式→numpyコード→BERT以降の文脈化埋め込み→RAG実務の順で、前提知識ゼロから解説します。 10 ·論文解説·★ 会員·論文·14分で読めます 論文解説 Attention Is All You Need — 再帰を捨てたモデルは何を証明したのか Attention Is All You Need Transformerの原論文を、本文だけを根拠に読み解く。スケーリング付き内積注意の式、なぜルートd_kで割るのか、アブレーションが暴いた設計の急所、そして論文自身が認めた限界まで。 11 ·Transformerの仕組み·無料·10分で読めます Attention機構を1から理解する — Transformerの心臓部を絵解きで ChatGPTの中核technology「自己注意機構」を、前提知識ゼロから比喩→直感→行列計算→numpyコードの順で解説。数式アレルギーでも読める入門記事。