PaperLens
紙
学生版
社会人版
JA
EN
◐
Googleでログイン
ログイン
読む
ホーム
論文精読
新着
教科書
深める
体系
ラボ
業界地図
みんなの貢献
用語集
自分
探す
読み放題
マイページ
#speculative-decoding
1 記事
01
2026-08-12
·
推論・高速化
·
★ 会員
·
論文
·
11分で読めます
投機的デコーディングを1から解説 — 小さな下書きモデルで、出力を一切変えずにLLMを速くする
Fast Inference from Transformers via Speculative Decoding
小型モデルに数トークン先まで下書きさせ、大型モデルが一括検証する「投機的デコーディング」。出力分布を数学的に変えないまま2〜3倍速くなる仕組みを、採択率αの直感とともに原論文から解説する。