JA EN

#inference

50 記事

01 ·推論・高速化·★ 会員·論文·16分で読めます 論文解説: 訓練データが1問でも、オンポリシー蒸留は数百ステップ伸び続ける Rethinking On-Policy Distillation of Large Language Models II: One Training Example 訓練クエリを1問に絞ってもオンポリシー蒸留は数百ステップ改善し続け、フルデータの伸びの大半を回収する。論文はその理由を「状態カバレッジ」と「吸収率」の2つで説明し、OPDはデータ過多・アルゴリズム不足だと結論づける。 02 ·推論・高速化·★ 会員·論文·15分で読めます 論文解説: Random Attention — KVキャッシュの追い出しは「ランダムで十分」だった Random Attention: Rethinking KV Cache Eviction for Efficient Reasoning KVキャッシュから何を捨てるかを決める「重要度スコア」は、ほとんど効いていなかった。プロンプトだけ守って残りをヘッドごとに一様ランダムで捨てるだけで最強手法と同等の精度、しかもvLLMで32〜43%速い。4モデル×6タスクの実測と、なぜそうなるかの2つの対照実験を読み解きます。 03 ·推論・高速化·★ 会員·論文·15分で読めます 論文解説: Random Attention — KVキャッシュの追い出しは「ランダムで十分」だった Random Attention: Rethinking KV Cache Eviction for Efficient Reasoning KVキャッシュから何を捨てるかを決める「重要度スコア」は、ほとんど効いていなかった。プロンプトだけ守って残りをヘッドごとに一様ランダムで捨てるだけで最強手法と同等の精度、しかもvLLMで32〜43%速い。4モデル×6タスクの実測と、なぜそうなるかの2つの対照実験を読み解きます。 04 ·Transformerの仕組み·★ 会員·論文·15分で読めます 論文解説: Gated DeltaNet はなぜ4bit量子化に耐えるのか — ハイブリッド27BのNVFP4 W4A4 Why Gated DeltaNet Survives 4-Bit Quantization: NVFP4 W4A4 for the Recurrent Half of a Hybrid 27B LLM ハイブリッドLLMの再帰層(Gated DeltaNet)は4bit量子化に弱い、という通説を実測で否定した論文の解説。ゲートの対数パラメータ化とdelta則の上書きが、なぜ量子化ノイズを消してしまうのかを1から追う。 05 ·推論・高速化·★ 会員·論文·18分で読めます 論文解説: LatentPress — 圧縮した文脈を、テキストにも画像にも戻さずLLMに直接読ませる LatentPress: Context Compression Beyond Text and Vision 長い会話履歴や文書を「テキストの要約」でも「画像」でもなく、凍結したLLMがそのまま読める連続ベクトル(ソフトトークン)に書き込む手法。LongMemEvalで7.70倍圧縮しながら非圧縮を上回った論文を、前提知識ゼロから解説する。 06 ·推論・高速化·★ 会員·論文·18分で読めます 論文解説: LatentPress — 圧縮した文脈を、テキストにも画像にも戻さずLLMに直接読ませる LatentPress: Context Compression Beyond Text and Vision 長い会話履歴や文書を「テキストの要約」でも「画像」でもなく、凍結したLLMがそのまま読める連続ベクトル(ソフトトークン)に書き込む手法。LongMemEvalで7.70倍圧縮しながら非圧縮を上回った論文を、前提知識ゼロから解説する。 07 ·推論・高速化·★ 会員·論文·13分で読めます 論文解説: Language Models Can Control Their Own Attention — モデルに「どこを見るか」を宣言させる Language Models Can Control Their Own Attention 長文脈のデコードでは、モデルは毎ステップKVキャッシュを丸ごと読み直している。Declarative Attention は、モデル自身に思考の中で「次はどこを見る」と宣言させ、推論エンジンがその宣言からアテンションマスクを作る。既製モデルにゼロショットで適用して注意トークンを52.0%/31.1%削減した論文を解説する。 08 ·推論・高速化·★ 会員·論文·13分で読めます 論文解説: Language Models Can Control Their Own Attention — モデルに「どこを見るか」を宣言させる Language Models Can Control Their Own Attention 長文脈のデコードでは、モデルは毎ステップKVキャッシュを丸ごと読み直している。Declarative Attention は、モデル自身に思考の中で「次はどこを見る」と宣言させ、推論エンジンがその宣言からアテンションマスクを作る。既製モデルにゼロショットで適用して注意トークンを52.0%/31.1%削減した論文を解説する。 09 ·推論・高速化·★ 会員·論文·14分で読めます 論文解説: Compile by Training — 自然言語の仕様を「手元で動く関数」にコンパイルする Compile by Training: Turning Natural-Language Specifications into Local Neural Functions 「メールを緊急か後回しかに分けて」——そんな曖昧な仕様を、約1分の学習でローカル実行できる小さな関数に変える手法。論文 Compile by Training を、比喩→仕組み→式→実測値の順で1から解説します。 10 ·推論・高速化·★ 会員·論文·14分で読めます 論文解説: Compile by Training — 自然言語の仕様を「手元で動く関数」にコンパイルする Compile by Training: Turning Natural-Language Specifications into Local Neural Functions 「メールを緊急か後回しかに分けて」——そんな曖昧な仕様を、約1分の学習でローカル実行できる小さな関数に変える手法。論文 Compile by Training を、比喩→仕組み→式→実測値の順で1から解説します。 11 ·推論・高速化·★ 会員·論文·16分で読めます 論文解説 SMELT — 「同じ層をもう一周」は、予算を揃えても得なのか SMELT: Scaling Laws for Compute-Matched MoE Looped Transformers 層を積むかわりに同じ層をもう一度通す「ループ型Transformer」を、FLOPs・総パラメータ・KVキャッシュの3予算を揃えてMoEで検証した論文。中央半分を2周するSMELTが学習FLOPsを6.8〜18.0%節約したと報告する。 12 ·推論・高速化·★ 会員·論文·16分で読めます 論文解説 SMELT — 「同じ層をもう一周」は、予算を揃えても得なのか SMELT: Scaling Laws for Compute-Matched MoE Looped Transformers 層を積むかわりに同じ層をもう一度通す「ループ型Transformer」を、FLOPs・総パラメータ・KVキャッシュの3予算を揃えてMoEで検証した論文。中央半分を2周するSMELTが学習FLOPsを6.8〜18.0%節約したと報告する。 13 ·推論・高速化·★ 会員·論文·15分で読めます 論文解説: Normalized Low-Rank Adaptation — LoRAの「入口行列」を正規化するだけで効く理由 Normalized Low-Rank Adaptation LoRAのダウン射影行列Aを「ランク方向に単位長へそろえる」だけで、収束・安定性・忘却耐性が改善する。原題 Normalized Low-Rank Adaptation (NoRA) を、隠れた前処理行列という視点から1から解説する。 14 ·推論・高速化·★ 会員·論文·18分で読めます 論文解説: 本番トラフィックから事後学習へ — 社内200アプリを1つの自前LLMに寄せる From Production Traffic to Post-Training: Building a Self-Hosted LLM That Covers the Corporate Request Mix データ所在地の制約で自前ホストせざるを得ない企業が、増え続けるモデル群を1つに畳む方法。本番の失敗を人手で分類し、弱い3軸それぞれにGRPO専門家を作り、SLERPで重みを混ぜる。3種類の報酬ハッキングの実例つき。 15 ·推論・高速化·★ 会員·論文·15分で読めます 論文解説: On-Policy Distillationは本当に蒸留しているのか — ノイズまみれの教師から自己改善へ Does On-Policy Distillation Really Distill? From Noisy Teacher to Self-Improvement 教師モデルの採点は3〜5割が誤っているのに、生徒はなぜか同じだけ伸びる。On-Policy Distillationの改善が「教師の真似」ではなく「低確率トークンの抑制」から来ていることを突き止め、教師を捨てた手法OPSAに至った論文を、前提知識ゼロから解説する。 16 ·推論・高速化·★ 会員·論文·17分で読めます 論文解説: DART-SD — ツール呼び出しエージェントの「ダイヤ型の解空間」を壊さずに学習する DART-SD: Diamond-topology Aware Retrieval and Tuning for Self-Distillation of Multi-Turn Tool-Calling Agents 順不同のサブゴールを含む多ターンのツール呼び出しでは、正解の集合が『ダイヤ格子』状に広がる。軌跡まるごとの模倣がなぜそれを潰すのか、状態グラフで『最初に転んだ地点』を特定してそこから先だけを直す学習で何が変わるのかを、前提知識ゼロから解説する。 17 ·推論・高速化·★ 会員·論文·15分で読めます 論文解説: CyberFactory — 野生のCVEを「実行できる訓練問題」に変える CyberFactory: Scaling Cyber Security Capabilities with Instances from the Wild 実世界のCVEを実行・検証できるタスクへ変換し、再利用可能な「脆弱性解析スキル」で教師の軌跡を合成してモデルに内面化させるオープンソース基盤。CyberGymで Pass@1 58.1%。 18 ·推論・高速化·★ 会員·論文·15分で読めます 論文解説 TTPO: 正解ラベルなしで、テストの最中にモデルを鍛える TTPO: Test-Time Policy Optimization 多数決で作った疑似ラベルは競技数学では約85%外れる。それでも学習が成立するのはなぜか。賛成した出力は蒸留し、反対した出力はRLで罰するという「非対称」な設計を、前提知識ゼロから解説する。 19 ·推論・高速化·★ 会員·論文·19分で読めます 論文解説: Self-OPD — 教師モデルなしで、画像生成モデルが自分を蒸留する Self-OPD: On-Policy Distillation for Flow Matching Models without Teacher 教師モデルを使わず、生成の各ステップで自分の分身をK本つくって採点し、良い枝に引き寄せ悪い枝から遠ざける。フローマッチング系画像生成のアライメント手法 Self-OPD を、前提知識ゼロから解説します。 20 ·推論・高速化·★ 会員·論文·12分で読めます 論文解説 WarpSAC: 強化学習の「安定化装置」は、データが潤沢になると足枷に変わる WarpSAC: Towards the Pinnacle of Scalable Off-policy RL by Rethinking Exploration and Exploitation GPU並列シミュレータで経験データが桁違いに増えると、SACの正規化やclipped double-Qといった「安定化装置」は助けから足枷に変わる。論文は3本の軸を切り分け、データ状況に応じて安定化装置を外すという処方箋(WarpSAC)を示した。 21 ·蒸留と圧縮·★ 会員·論文·13分で読めます 蒸留・量子化・枝刈りの使い分け — 小さくする3つの道 Distilling the Knowledge in a Neural Network モデルを小さくする道は3本あります。数値の目盛りを粗くする量子化、重みそのものを間引く枝刈り、小さいモデルに作り直す蒸留。圧縮率・精度・実装コストの三軸で正面から比べ、「訓練を伴うものを先に、量子化を最後に」という組み合わせ順序の理由まで、前提知識ゼロから。 22 ·蒸留と圧縮·★ 会員·論文·13分で読めます 蒸留・量子化・枝刈りの使い分け — 小さくする3つの道 Distilling the Knowledge in a Neural Network モデルを小さくする道は3本あります。数値の目盛りを粗くする量子化、重みそのものを間引く枝刈り、小さいモデルに作り直す蒸留。圧縮率・精度・実装コストの三軸で正面から比べ、「訓練を伴うものを先に、量子化を最後に」という組み合わせ順序の理由まで、前提知識ゼロから。 23 ·推論・高速化·★ 会員·論文·15分で読めます 構造化出力と制約デコーディング — JSONを壊さない仕組み Efficient Guided Generation for Large Language Models 「JSONで返して」とお願いする代わりに、文法的に許されないトークンを出す前に確率ゼロへ落とす — 制約デコーディングの仕組みを、logitマスクから語彙のインデックス化、function callingの裏側、そして「構文は守れても中身は守れない」限界まで1から解説する。 24 ·推論・高速化·★ 会員·論文·15分で読めます 構造化出力と制約デコーディング — JSONを壊さない仕組み Efficient Guided Generation for Large Language Models 「JSONで返して」とお願いする代わりに、文法的に許されないトークンを出す前に確率ゼロへ落とす — 制約デコーディングの仕組みを、logitマスクから語彙のインデックス化、function callingの裏側、そして「構文は守れても中身は守れない」限界まで1から解説する。 25 ·推論・高速化·★ 会員·14分で読めます プロンプトキャッシュとコンテキスト設計 — 前方一致という一本の制約が、請求額を桁で変える 同じシステムプロンプトを毎回読み直させて、毎回その分を払っていませんか。プロンプトキャッシュは前方一致でしか効かない——この一点だけで、コンテキストに何をどの順で置くべきかが決まります。先頭に現在時刻を1つ入れただけで全滅する理由と、TTLを読み違えて逆に25%高くなる事故まで。 26 ·推論・高速化·★ 会員·14分で読めます プロンプトキャッシュとコンテキスト設計 — 前方一致という一本の制約が、請求額を桁で変える 同じシステムプロンプトを毎回読み直させて、毎回その分を払っていませんか。プロンプトキャッシュは前方一致でしか効かない——この一点だけで、コンテキストに何をどの順で置くべきかが決まります。先頭に現在時刻を1つ入れただけで全滅する理由と、TTLを読み違えて逆に25%高くなる事故まで。 27 ·Transformerの仕組み·★ 会員·論文·13分で読めます 長文脈LLMの技術 — RoPE補間からリング注意まで Extending Context Window of Large Language Models via Positional Interpolation 「コンテキスト長128K」の中身は、性格の違う二つの壁を別々に越えた結果です。位置の壁を越える位置補間・NTK・YaRN、計算の壁を越える窓とリング注意、そして越えられたかを測るneedle試験の読み方を、前提知識ゼロから順に追います。 28 ·推論・高速化·無料·論文·13分で読めます LLMサービングを1から — vLLM・連続バッチングで、GPUを遊ばせない Efficient Memory Management for Large Language Model Serving with PagedAttention モデルが動くことと、100人ぶんのリクエストを捌けることは別の問題です。重みも答えも変えず、投げる順番とまとめ方だけで同じGPUの処理量が何倍も変わる——その理屈を演算強度・連続バッチング・PagedAttentionの3点から追い、スループットとレイテンシが同時には良くならない理由と実測値の読み方まで。 29 ·推論・高速化·無料·論文·13分で読めます LLMサービングを1から — vLLM・連続バッチングで、GPUを遊ばせない Efficient Memory Management for Large Language Model Serving with PagedAttention モデルが動くことと、100人ぶんのリクエストを捌けることは別の問題です。重みも答えも変えず、投げる順番とまとめ方だけで同じGPUの処理量が何倍も変わる——その理屈を演算強度・連続バッチング・PagedAttentionの3点から追い、スループットとレイテンシが同時には良くならない理由と実測値の読み方まで。 30 ·推論・高速化·★ 会員·13分で読めます 推論コスト削減の実務 — 何から手を付けるか 量子化も蒸留も効きますが、たいていの現場ではその前に「品質を1ミリも賭けずに済む手」が残っています。請求書を4つの数に分解し、キャッシュ→バッチング→短縮→圧縮の順に並べ替える。各手の効き方と、順序を間違えたときに何が壊れるかまで。 31 ·推論・高速化·★ 会員·13分で読めます 推論コスト削減の実務 — 何から手を付けるか 量子化も蒸留も効きますが、たいていの現場ではその前に「品質を1ミリも賭けずに済む手」が残っています。請求書を4つの数に分解し、キャッシュ→バッチング→短縮→圧縮の順に並べ替える。各手の効き方と、順序を間違えたときに何が壊れるかまで。 32 ·推論・高速化·★ 会員·論文·15分で読めます GPUメモリ不足サバイバル — OOMの原因と対処の全パターン Training Deep Nets with Sublinear Memory Cost `CUDA out of memory` は、最後に失敗した確保だけを報告する不親切なエラーです。犯人はたいてい、すでに載っている側にいます。何がVRAMを食うのかを5つの箱に分けて数え、パラメータ1個あたり16バイトという学習の固定費を出し、そこから勾配チェックポイント・オプティマイザ圧縮・オフロード・KVキャッシュ管理・断片化まで、打ち手を副作用の小さい順に。 33 ·推論・高速化·★ 会員·論文·15分で読めます GPUメモリ不足サバイバル — OOMの原因と対処の全パターン Training Deep Nets with Sublinear Memory Cost `CUDA out of memory` は、最後に失敗した確保だけを報告する不親切なエラーです。犯人はたいてい、すでに載っている側にいます。何がVRAMを食うのかを5つの箱に分けて数え、パラメータ1個あたり16バイトという学習の固定費を出し、そこから勾配チェックポイント・オプティマイザ圧縮・オフロード・KVキャッシュ管理・断片化まで、打ち手を副作用の小さい順に。 34 ·Transformerの仕組み·★ 会員·論文·13分で読めます FlashAttentionを1から — 計算を増やして速くする逆説 FlashAttention: Fast and Memory-Efficient Exact Attention with IO-Awareness FlashAttentionは逆伝播でわざと同じ計算をやり直します。演算回数は増えるのに速い——GPUでは掛け算よりデータの運搬のほうが高いからです。HBMとSRAMの往復を数えるところから、タイリングを阻むsoftmaxの壁、それを壊すオンラインsoftmaxの漸化式、そして現場でバックエンドが静かにフォールバックする落とし穴までを前提知識ゼロから追います。 35 ·Transformerの仕組み·★ 会員·論文·13分で読めます FlashAttentionを1から — 計算を増やして速くする逆説 FlashAttention: Fast and Memory-Efficient Exact Attention with IO-Awareness FlashAttentionは逆伝播でわざと同じ計算をやり直します。演算回数は増えるのに速い——GPUでは掛け算よりデータの運搬のほうが高いからです。HBMとSRAMの往復を数えるところから、タイリングを阻むsoftmaxの壁、それを壊すオンラインsoftmaxの漸化式、そして現場でバックエンドが静かにフォールバックする落とし穴までを前提知識ゼロから追います。 36 ·アクセラレータ·★ 会員·10分で読めます 推論チップ戦国時代 — Groq・Cerebras・LPUの設計思想 推論専用チップが乱立するのは、デコードが計算ではなく読み出しで律速されるからです。SRAM全載せ(Groq/LPU)とウェハスケール(Cerebras)という2つの答え、ソフト側の反撃、そしてベンチマーク数値を鵜呑みにせず市場を読むための式を、前提知識ゼロから解説します。 37 ·Transformerの仕組み·★ 会員·論文·11分で読めます Attentionの変種図鑑 — MQA・GQA・スライディング窓・線形注意 Fast Transformer Decoding: One Write-Head is All You Need MQA・GQA・スライディング窓・線形注意は、それぞれ勝手に生まれた別々の工夫ではありません。KVキャッシュの大きさを決める一本の掛け算式があり、変種は「どの項を叩いたか」で分類できます。系譜を式の上に並べ直すと、何を捨てて何を得たのかが一目で見えます。 38 ·推論・高速化·★ 会員·論文·23分で読めます 論文解説: Agentic ESOpt — 逆伝播をやめて「モデルを揺らす」だけで、長丁場のLLMエージェントを鍛える Agentic ESOpt: Fine-Tuning Long-Horizon LLM Agents with Minimal GPU Requirements 勾配を一切計算せず、パラメータにノイズを足した分身をG体走らせて良かった方向へ寄せるだけ——推論と同じGPUメモリ(8.41GB)で27Bの全パラメータを更新し、15手必要な数独でGRPOに12.50ポイント差をつけたNUSらの論文を、1から解説する。 39 ·推論・高速化·★ 会員·論文·18分で読めます 論文解説: 正解も強い教師もなしで伸びる — u-OPSD が使う「自分の多数決」 On-Policy Self-Distillation without Any Supervision 模範解答も強い教師モデルも使わず、モデル自身が出した8本の答案の多数決を『特権的な文脈』に仕立てて自己蒸留する u-OPSD(arXiv:2608.06296)を、論文本文だけを根拠に1から解説する。 40 ·推論・高速化·★ 会員·論文·12分で読めます 論文解説: The Personalization Mirage — LLMは「あなた」を勝手に作り上げ、自己申告は逆を指す The Personalization Mirage: How LLMs Fabricate User Profiles, and Why Self-Monitoring Misleads メモリ付きLLMは、ユーザーが一度も言っていない属性をどれだけ「知っている」ことにしてしまうのか。150ペルソナ×6タスク×14万件超の主張を判定したMirageBenchから、全12モデルが35〜49%を過剰推論する実態と、自己申告が控えめなモデルほど実際は捏造が多いという逆転現象を、論文本文に沿って解説する。 41 ·推論・高速化·★ 会員·論文·11分で読めます 投機的デコーディングを1から解説 — 小さな下書きモデルで、出力を一切変えずにLLMを速くする Fast Inference from Transformers via Speculative Decoding 小型モデルに数トークン先まで下書きさせ、大型モデルが一括検証する「投機的デコーディング」。出力分布を数学的に変えないまま2〜3倍速くなる仕組みを、採択率αの直感とともに原論文から解説する。 42 ·推論・高速化·★ 会員·論文·11分で読めます 投機的デコーディングを1から解説 — 小さな下書きモデルで、出力を一切変えずにLLMを速くする Fast Inference from Transformers via Speculative Decoding 小型モデルに数トークン先まで下書きさせ、大型モデルが一括検証する「投機的デコーディング」。出力分布を数学的に変えないまま2〜3倍速くなる仕組みを、採択率αの直感とともに原論文から解説する。 43 ·推論・高速化·★ 会員·論文·11分で読めます 論文解説: DAPD — 蒸留の教師が持つ「カンニングペーパーの幻想」を二重アンカーで断つ DAPD: Dual-Anchored Policy Distillation 模範解答を見た教師から蒸留すると、生徒は本番で「見えない答えを思い出したふり」をする——この privilege illusion の根本原因を情報の非対称性と特定し、二重のアンカーで解消する DAPD (arXiv:2608.01735) を論文本文だけを根拠に解説する。 44 ·推論・高速化·★ 会員·論文·11分で読めます 論文解説: CodeNib — コーディングエージェントにリポジトリの文脈を「配膳」する多ビューデータシステム CodeNib: A Multi-View Data System for Serving Repository Context to Coding Agents コーディングエージェントが毎タスクgrepで探し直す無駄を、リポジトリを「データベース」と見立てて解消するCodeNib(UCサンディエゴら)。字句・密・構造の3ビュー、差分更新、文脈配信ポリシーの実測を、限界まで含めて読み解く。 45 ·推論・高速化·★ 会員·論文·11分で読めます 論文解説: BDH-CQ — 言葉にせずに考えるAI。再帰メモリ×潜在推論がARCのコスト効率を塗り替えた BDH-CQ: In-Context Learning with Recurrent Latent Reasoning 思考の途中経過を一切言語化せず、デモを再帰メモリに書き込み高次元潜在空間の反復計算で解く BDH-CQ (arXiv:2608.09888)。150MパラメータでARC-AGI-1の29.5% pass@2を1タスク$0.0007で達成し、コスト対精度のパレート境界を突破した論文を、本文だけを根拠に解説する。 46 ·推論・高速化·★ 会員·論文·14分で読めます 論文解説: AgentOPSD — 「どのターンが勝敗を分けたか」をベイズ信念の再帰更新で見つけるエージェントRL AgentOPSD: Recursive Self-Distillation for Agentic Reinforcement Learning 長いマルチターン対話の最後に成功/失敗しか教えてくれない環境で、「効いた一手」をどう見つけるか。自己蒸留のギャップをベイズ証拠と読み替え、log-odds空間で信念を再帰更新するAgentOPSDを論文本文から解説。ALFWorld 89.1%の結果、アブレーション、限界まで。 47 ·推論・高速化·★ 会員·10分で読めます LLM量子化を1から解説 — なぜ精度を落としても動くのか 16ビットの重みを4ビットに切り詰めても、モデルは文章を書き続けます。なぜ壊れないのか。スケールとゼロ点という2つの数から始め、重みは落とせるのに活性化が落としにくい理由(外れ値)、PTQとQATの分かれ道、INT8/INT4で実際に起きること、そして「perplexityだけ見て通す」という最も多い評価事故まで。 48 ·推論・高速化·★ 会員·10分で読めます LLM量子化を1から解説 — なぜ精度を落としても動くのか 16ビットの重みを4ビットに切り詰めても、モデルは文章を書き続けます。なぜ壊れないのか。スケールとゼロ点という2つの数から始め、重みは落とせるのに活性化が落としにくい理由(外れ値)、PTQとQATの分かれ道、INT8/INT4で実際に起きること、そして「perplexityだけ見て通す」という最も多い評価事故まで。 49 ·推論・高速化·無料·10分で読めます KVキャッシュを1から理解する — 推論高速化の核心 LLMは1トークンずつ答えを吐きます。素朴に実装すると、1トークン出すたびに文全体を計算し直すという壮大な無駄が生まれる。KとVは過去のぶんが二度と変わらない——この一点だけで計算量が桁で落ちます。代わりに払うのがメモリで、その量は自分で見積もれます。バッチサイズと文脈長がなぜメモリで頭打ちになるのかまで。 50 ·推論・高速化·無料·10分で読めます KVキャッシュを1から理解する — 推論高速化の核心 LLMは1トークンずつ答えを吐きます。素朴に実装すると、1トークン出すたびに文全体を計算し直すという壮大な無駄が生まれる。KとVは過去のぶんが二度と変わらない——この一点だけで計算量が桁で落ちます。代わりに払うのがメモリで、その量は自分で見積もれます。バッチサイズと文脈長がなぜメモリで頭打ちになるのかまで。