JA EN

#speculative-decoding

1 記事

01 ·推論・高速化·★ 会員·論文·11分で読めます 投機的デコーディングを1から解説 — 小さな下書きモデルで、出力を一切変えずにLLMを速くする Fast Inference from Transformers via Speculative Decoding 小型モデルに数トークン先まで下書きさせ、大型モデルが一括検証する「投機的デコーディング」。出力分布を数学的に変えないまま2〜3倍速くなる仕組みを、採択率αの直感とともに原論文から解説する。