PaperLens
紙
学生版
社会人版
JA
EN
◐
Googleでログイン
ログイン
読む
ホーム
論文精読
新着
教科書
深める
体系
ラボ
業界地図
みんなの貢献
用語集
自分
探す
読み放題
マイページ
#bpe
2 記事
01
2026-08-27
·
Transformerの仕組み
·
★ 会員
·
論文
·
15分で読めます
【実装】BPEトークナイザを自作する — マージ規則を学習し、日本語で殴られる
Neural Machine Translation of Rare Words with Subword Units
BPEの学習器とエンコーダを自分で書く。マージ規則が「順序付きの手順書」であること、素朴な数え直しをどう捨てるか、日本語では語彙の先頭数千枠が「文字を組み立てる」ことに消える理由、語彙サイズを振る実験の正しい測り方までを実装の手触りで追う。
02
2026-08-22
·
Transformerの仕組み
·
無料
·
論文
·
13分で読めます
トークナイザを1から — LLMが世界を切り刻む単位
Neural Machine Translation of Rare Words with Subword Units
LLMは文字も単語も読んでいない。BPEがどう語彙を作るか、SentencePieceが何を解決したか、なぜ日本語は同じ内容で損をするのか、語彙サイズを増やすと何と何が交換されるのかを、前提知識ゼロから手計算とコードで追う。