PaperLens
紙
学生版
社会人版
JA
EN
◐
Googleでログイン
ログイン
読む
ホーム
論文精読
新着
教科書
深める
体系
ラボ
業界地図
みんなの貢献
用語集
自分
探す
読み放題
マイページ
#nlp
11 記事
01
2026-08-27
·
Transformerの仕組み
·
★ 会員
·
論文
·
15分で読めます
【実装】BPEトークナイザを自作する — マージ規則を学習し、日本語で殴られる
Neural Machine Translation of Rare Words with Subword Units
BPEの学習器とエンコーダを自分で書く。マージ規則が「順序付きの手順書」であること、素朴な数え直しをどう捨てるか、日本語では語彙の先頭数千枠が「文字を組み立てる」ことに消える理由、語彙サイズを振る実験の正しい測り方までを実装の手触りで追う。
02
2026-08-27
·
Transformerの仕組み
·
★ 会員
·
論文
·
15分で読めます
【実装】BPEトークナイザを自作する — マージ規則を学習し、日本語で殴られる
Neural Machine Translation of Rare Words with Subword Units
BPEの学習器とエンコーダを自分で書く。マージ規則が「順序付きの手順書」であること、素朴な数え直しをどう捨てるか、日本語では語彙の先頭数千枠が「文字を組み立てる」ことに消える理由、語彙サイズを振る実験の正しい測り方までを実装の手触りで追う。
03
2026-08-27
·
Transformerの仕組み
·
★ 会員
·
論文
·
19分で読めます
【実装】ミニGPTを自作する — 300行の言語モデル
Attention Is All You Need
PyTorchで文字単位のミニGPTを最初から組む。トークナイザ・因果マスク付き自己注意・学習ループ・温度サンプリングまでを1本のコードとして通し、シェイクスピアの文体が立ち上がるまでを追う。
04
2026-08-27
·
Transformerの仕組み
·
★ 会員
·
論文
·
19分で読めます
【実装】ミニGPTを自作する — 300行の言語モデル
Attention Is All You Need
PyTorchで文字単位のミニGPTを最初から組む。トークナイザ・因果マスク付き自己注意・学習ループ・温度サンプリングまでを1本のコードとして通し、シェイクスピアの文体が立ち上がるまでを追う。
05
2026-08-27
·
Transformerの仕組み
·
★ 会員
·
論文
·
12分で読めます
エンコーダとデコーダ — BERTとGPTの分岐点
BERT: Pre-training of Deep Bidirectional Transformers for Language Understanding
同じTransformerから生まれたBERTとGPTを分けたのは、注意の表を隠すマスク1枚だった。双方向と自己回帰の違いを式と動く図で確かめ、なぜ生成側が主流になり、それでもエンコーダが検索と分類の現場で使われ続けるのかを解く。
06
2026-08-27
·
Transformerの仕組み
·
★ 会員
·
論文
·
12分で読めます
エンコーダとデコーダ — BERTとGPTの分岐点
BERT: Pre-training of Deep Bidirectional Transformers for Language Understanding
同じTransformerから生まれたBERTとGPTを分けたのは、注意の表を隠すマスク1枚だった。双方向と自己回帰の違いを式と動く図で確かめ、なぜ生成側が主流になり、それでもエンコーダが検索と分類の現場で使われ続けるのかを解く。
07
2026-08-22
·
Transformerの仕組み
·
無料
·
論文
·
13分で読めます
トークナイザを1から — LLMが世界を切り刻む単位
Neural Machine Translation of Rare Words with Subword Units
LLMは文字も単語も読んでいない。BPEがどう語彙を作るか、SentencePieceが何を解決したか、なぜ日本語は同じ内容で損をするのか、語彙サイズを増やすと何と何が交換されるのかを、前提知識ゼロから手計算とコードで追う。
08
2026-08-22
·
Transformerの仕組み
·
無料
·
論文
·
13分で読めます
トークナイザを1から — LLMが世界を切り刻む単位
Neural Machine Translation of Rare Words with Subword Units
LLMは文字も単語も読んでいない。BPEがどう語彙を作るか、SentencePieceが何を解決したか、なぜ日本語は同じ内容で損をするのか、語彙サイズを増やすと何と何が交換されるのかを、前提知識ゼロから手計算とコードで追う。
09
2026-08-13
·
RAG・検索拡張
·
無料
·
論文
·
9分で読めます
埋め込み(Embedding)を1から理解する — word2vecの直感から文脈化埋め込みまで
Efficient Estimation of Word Representations in Vector Space
「王様 − 男 + 女 ≈ 女王」はなぜ成り立つのか。単語を数値の座標に変える埋め込みを、地図の比喩→分布仮説→word2vecの式→numpyコード→BERT以降の文脈化埋め込み→RAG実務の順で、前提知識ゼロから解説します。
10
2026-08-03
·
論文解説
·
★ 会員
·
論文
·
14分で読めます
論文解説 Attention Is All You Need — 再帰を捨てたモデルは何を証明したのか
Attention Is All You Need
Transformerの原論文を、本文だけを根拠に読み解く。スケーリング付き内積注意の式、なぜルートd_kで割るのか、アブレーションが暴いた設計の急所、そして論文自身が認めた限界まで。
11
2026-07-24
·
Transformerの仕組み
·
無料
·
10分で読めます
Attention機構を1から理解する — Transformerの心臓部を絵解きで
ChatGPTの中核technology「自己注意機構」を、前提知識ゼロから比喩→直感→行列計算→numpyコードの順で解説。数式アレルギーでも読める入門記事。