JA EN

#gpt

3 記事

01 ·Transformerの仕組み·★ 会員·論文·19分で読めます 【実装】ミニGPTを自作する — 300行の言語モデル Attention Is All You Need PyTorchで文字単位のミニGPTを最初から組む。トークナイザ・因果マスク付き自己注意・学習ループ・温度サンプリングまでを1本のコードとして通し、シェイクスピアの文体が立ち上がるまでを追う。 02 ·Transformerの仕組み·★ 会員·論文·12分で読めます エンコーダとデコーダ — BERTとGPTの分岐点 BERT: Pre-training of Deep Bidirectional Transformers for Language Understanding 同じTransformerから生まれたBERTとGPTを分けたのは、注意の表を隠すマスク1枚だった。双方向と自己回帰の違いを式と動く図で確かめ、なぜ生成側が主流になり、それでもエンコーダが検索と分類の現場で使われ続けるのかを解く。 03 ·モデル系統図鑑·★ 会員·13分で読めます GPT系譜 — GPT-1から現在までの設計思想 GPT-1からGPT-4o・推論モデルまで、各世代で「何を変え、何を変えなかったのか」を追う。設計の中心にあるのは一貫して『次の一語を当てる』だけの機械で、変わったのは規模・学習の順序・出力の躾け方だった。