JA EN
体系 › AI

Transformerの仕組み

Attention・位置エンコーディング・アーキテクチャの解剖

01 ·Transformerの仕組み·無料·10分で読めます Attention機構を1から理解する — Transformerの心臓部を絵解きで ChatGPTの中核technology「自己注意機構」を、前提知識ゼロから比喩→直感→行列計算→numpyコードの順で解説。数式アレルギーでも読める入門記事。 02 ·Transformerの仕組み·無料·論文·13分で読めます 位置エンコーディングを1から理解する(絶対位置からRoPEまで) Attention Is All You Need Transformerは素のままでは語順を知らない。なぜ位置情報が要るのかから始めて、sin/cosの絶対位置、学習型、そして現代LLMの標準であるRoPEまでを段階的に解説。「なぜ回転が相対位置を表せるのか」を式で示す。 03 ·Transformerの仕組み·無料·論文·13分で読めます トークナイザを1から — LLMが世界を切り刻む単位 Neural Machine Translation of Rare Words with Subword Units LLMは文字も単語も読んでいない。BPEがどう語彙を作るか、SentencePieceが何を解決したか、なぜ日本語は同じ内容で損をするのか、語彙サイズを増やすと何と何が交換されるのかを、前提知識ゼロから手計算とコードで追う。 04 ·Transformerの仕組み·★ 会員·論文·11分で読めます Attentionの変種図鑑 — MQA・GQA・スライディング窓・線形注意 Fast Transformer Decoding: One Write-Head is All You Need MQA・GQA・スライディング窓・線形注意は、それぞれ勝手に生まれた別々の工夫ではありません。KVキャッシュの大きさを決める一本の掛け算式があり、変種は「どの項を叩いたか」で分類できます。系譜を式の上に並べ直すと、何を捨てて何を得たのかが一目で見えます。 05 ·Transformerの仕組み·無料·論文·13分で読めます Transformer完全解剖 — 埋め込みから出力まで一気通貫 Attention Is All You Need 「今日は」と打ってから「いい天気」が返るまで、たった1つのトークンが何を持たされ、どこで書き換えられ、最後にどうやって言葉に戻るのか。分かち書き・埋め込み・位置・注意・フィードフォワード・残差・出力ヘッドまで、部品を並べるのではなく1本の旅として通しで歩く地図。 06 ·Transformerの仕組み·★ 会員·論文·13分で読めます FlashAttentionを1から — 計算を増やして速くする逆説 FlashAttention: Fast and Memory-Efficient Exact Attention with IO-Awareness FlashAttentionは逆伝播でわざと同じ計算をやり直します。演算回数は増えるのに速い——GPUでは掛け算よりデータの運搬のほうが高いからです。HBMとSRAMの往復を数えるところから、タイリングを阻むsoftmaxの壁、それを壊すオンラインsoftmaxの漸化式、そして現場でバックエンドが静かにフォールバックする落とし穴までを前提知識ゼロから追います。 07 ·Transformerの仕組み·★ 会員·論文·13分で読めます 長文脈LLMの技術 — RoPE補間からリング注意まで Extending Context Window of Large Language Models via Positional Interpolation 「コンテキスト長128K」の中身は、性格の違う二つの壁を別々に越えた結果です。位置の壁を越える位置補間・NTK・YaRN、計算の壁を越える窓とリング注意、そして越えられたかを測るneedle試験の読み方を、前提知識ゼロから順に追います。 08 ·Transformerの仕組み·★ 会員·論文·12分で読めます エンコーダとデコーダ — BERTとGPTの分岐点 BERT: Pre-training of Deep Bidirectional Transformers for Language Understanding 同じTransformerから生まれたBERTとGPTを分けたのは、注意の表を隠すマスク1枚だった。双方向と自己回帰の違いを式と動く図で確かめ、なぜ生成側が主流になり、それでもエンコーダが検索と分類の現場で使われ続けるのかを解く。 09 ·Transformerの仕組み·★ 会員·論文·15分で読めます 【実装】BPEトークナイザを自作する — マージ規則を学習し、日本語で殴られる Neural Machine Translation of Rare Words with Subword Units BPEの学習器とエンコーダを自分で書く。マージ規則が「順序付きの手順書」であること、素朴な数え直しをどう捨てるか、日本語では語彙の先頭数千枠が「文字を組み立てる」ことに消える理由、語彙サイズを振る実験の正しい測り方までを実装の手触りで追う。 10 ·Transformerの仕組み·★ 会員·論文·19分で読めます 【実装】ミニGPTを自作する — 300行の言語モデル Attention Is All You Need PyTorchで文字単位のミニGPTを最初から組む。トークナイザ・因果マスク付き自己注意・学習ループ・温度サンプリングまでを1本のコードとして通し、シェイクスピアの文体が立ち上がるまでを追う。 11 ·Transformerの仕組み·★ 会員·論文·18分で読めます 論文解説: Qwen3.8-Next の設計 — 精度・効率・学習安定性を1つの問題として解く On the Design of Qwen3.8-Next Architecture: Evaluation, Efficiency, and Training Stability Qwen3.8-Flash-Next の設計報告を1から読み解く。GDNハイブリッド、QSA、Gated Residual、N-gram埋め込みの4部品を、論文が使った「損失・コスト・安定性」の3軸で追う。 12 ·Transformerの仕組み·★ 会員·論文·15分で読めます 論文解説: Gated DeltaNet はなぜ4bit量子化に耐えるのか — ハイブリッド27BのNVFP4 W4A4 Why Gated DeltaNet Survives 4-Bit Quantization: NVFP4 W4A4 for the Recurrent Half of a Hybrid 27B LLM ハイブリッドLLMの再帰層(Gated DeltaNet)は4bit量子化に弱い、という通説を実測で否定した論文の解説。ゲートの対数パラメータ化とdelta則の上書きが、なぜ量子化ノイズを消してしまうのかを1から追う。 13 ·Transformerの仕組み·★ 会員·論文·15分で読めます 論文解説: 最初の1枚を基準にするのをやめる — Scal3R の複数参照・相対姿勢クエリ Scal3R: Learning Efficient Multi-Relative Pose Query for Scalable Online 3D Reconstruction 長い動画で3D復元モデルが崩壊する原因を「最初のフレームを基準にした外挿」に特定し、凍結したバックボーンへ約1%の学習トークンを足すだけで直した論文を、前提知識ゼロから解説する。