JA EN
体系蒸留と圧縮
·★ 会員·論文·10分で読めます

蒸留が失敗するとき — 容量ギャップと過信の伝染

強い教師を使えば強い生徒ができる、とは限りません。器が小さいと平均だけが伝わる容量ギャップ、教師の自信ごと写す過信の伝染、教師が一度も通らない道を生徒が歩く分布シフト — 蒸留が壊れる3つの型を、前提知識ゼロから解きほぐします。

対象textタスクtraining

DAPD: Dual-Anchored Policy Distillation

一次資料 — この記事の根拠

論文の発表 2026-08-03この解説の公開 2026-08-291か月後

Distilling the Knowledge in a Neural NetworkarXiv:1503.02531論文ページ·PDF
Improved Knowledge Distillation via Teacher Assistant: Bridging the Gap Between Student and TeacherarXiv:1902.03393論文ページ·PDF
The False Promise of Imitating Proprietary LLMsarXiv:2305.15717論文ページ·PDF
On-Policy Distillation of Language Models: Learning from Self-Generated MistakesarXiv:2306.13649論文ページ·PDF
DAPD: Dual-Anchored Policy DistillationJianyu Wu, Yizhou Wang, Encheng Su ほか · 2026-08-03 · v1arXiv:2608.01735論文ページ·PDF
原文の要旨(Abstract)を読む

On-policy (self) distillation (OPSD) is increasingly adopted for language-model post-training. It strengthens the teacher with privileged information but can induce a privilege illusion: the student learns privilege-dependent behavior it cannot reproduce from its inference-time context, yet behaves as if the training-time privileged information remained available, ultimately degrading performance. In this paper, we identify information asymmetry between the privileged teacher and the student at inference as the root cause of this failure in OPSD. To resolve this asymmetry, we propose Dual-Anchored Policy Distillation (DAPD), a unified framework with two levels of anchoring. Dual-Path Anchoring (DPA) introduces a self-conditioned bridge and aligns reference and rollout behavior along two matched-information paths, preventing privilege-dependent behavior from being transferred to the inference-time student. Dual-Source Anchoring (DSA) applies these paths in both reference-to-rollout and rollout-to-reference directions, reducing reliance on privileged reference guidance while preserving correctness supervision. Extensive experiments show that DAPD significantly alleviates privilege illusion, outperforming OPSD on Qwen3-4B by +2.00 points on average across tasks. Notably, its gains persist across scales, reaching +2.69 at 4B and +2.78 at 32B.


名人の弟子が、名人にならない理由

将棋の名人に弟子入りしたとします。最善手を毎日そばで見ている。それでも弟子が名人になるとは限りません。理由は3つあります。

1つ目は弟子の。名人の一手の背後には何十手先の読みがあり、読める深さが足りない弟子は手つきだけを覚えて平均的な指し方に落ち着きます。

2つ目は名人が間違えたとき。名人も自信たっぷりに読み違えます。弟子は正しい手と同じ熱心さで、間違った手もその自信ごと写します。

3つ目は局面。名人の棋譜は得意な形に偏っていて、弟子が実戦で入り込む泥沼はそこに出てきません。手本のない場所で、弟子は独りになります。

この3つはそのまま、知識蒸留(Knowledge Distillation)が失敗する3つの型です。順に容量ギャップ過信の伝染分布シフト。蒸留の仕組みそのものは知識蒸留を1からで扱っているので、ここでは「うまくいかないとき何が起きているのか」に絞ります。

目標の式を、もう一度置いておく

何を最小化しているのかを確認します。教師の出力分布 pTp_T に生徒の出力分布 pSp_S を近づけるのが蒸留で、代表的な損失はこう書けます。

L=(1α)CE(y,pS)+αT2KL ⁣(pT(T)pS(T))\mathcal{L} = (1-\alpha)\,\mathrm{CE}(y,\, p_S) + \alpha\, T^2\, \mathrm{KL}\!\left(p_T^{(T)} \,\|\, p_S^{(T)}\right)
(1)

記号を1つずつ。CE(y,pS)\mathrm{CE}(y, p_S) は正解ラベル yy に対する通常の交差エントロピー、つまり「答え合わせ」の項。KL()\mathrm{KL}(\cdot\|\cdot) は2つの確率分布のズレを測る量で、KLダイバージェンスそのもの。TT は温度で、softmax に入れる前にロジットを TT で割って分布をなだらかにします。p(T)p^{(T)} はその分布、α\alpha は2項の混ぜ具合、T2T^2 は温度で薄まった勾配を元に戻す補正です。

要するにこの式は、「正解に合わせつつ、教師が『どれをどれくらい迷ったか』まで真似しなさい」と命じています。失敗の3つの型は、すべてこの命令の副作用です。

失敗①: 容量ギャップ — 器が小さいと、平均が返ってくる

まず注目すべきは、この式のどこにも「生徒がそれを表現できるか」という条件が入っていないことです。損失は「教師に近づけ」としか言わない。近づけない生徒にも、同じ命令が出続けます。

生徒のパラメータ数が足りない、層が浅い、というときに起きるのがこれです。器の小さいモデルは教師の細かい起伏を再現できず、ならした平均に落ち着きます。多肢選択で言えば、教師が「Aが80%、Bが15%」と切れ味よく答えるところを、生徒は「Aが45%、Bが30%、Cが25%」とぼやけた分布で返す。損失は下がっているのに正答率が伸びない、という状態です。

FIG 1次数スライダーを左端まで下げると、どれだけ訓練しても曲線が的に届かない。これが容量不足の側の失敗で、右端の過学習と対になっている

この「ならし」の理由は、式(1)のKLの向きです。KL(pTpS)\mathrm{KL}(p_T \| p_S) は教師を基準にした量なので、教師が確率を置いた場所すべてに生徒も置かないと大きな罰を受け、逆に教師が確率0の場所に生徒が置いても罰は軽い。この非対称性のため、表現力が足りない生徒は、教師の山を1つ選ぶのではなく全部の山にまたがってベタッと広がる方向へ押されます。mode averaging(モードの平均化)です。

厄介なのは、この失敗が教師を強くすると悪化しうることです。差が開くほど再現不可能な構造が増え、平均化が進む。Teacher Assistant を提案した研究(arXiv:1902.03393)は、教師を大きくしていくと生徒の精度が途中から下がる現象を報告し、中間サイズのモデルを挟んで段階的に蒸留する対処を示しました。名人ではなく二段上の兄弟子から習うほうが伸びる、ということです。見分け方は単純で、生徒の出力エントロピーが教師より一貫して高いなら容量ギャップを疑う。

この先にあるもの

§

ここから先は会員限定です

解説記事371本・教科書26章・学生モード48単元・論文精読6本が、月額¥490ですべて読み放題になります。新しい解説は毎日3本ずつ増えます。いつでも解約でき、解約後も期間の終わりまで読めます。

会員の方はログインすると続きが表示されます

参考文献

  1. Distilling the Knowledge in a Neural Network. arXiv:1503.02531論文ページ·PDF
  2. Improved Knowledge Distillation via Teacher Assistant: Bridging the Gap Between Student and Teacher. arXiv:1902.03393論文ページ·PDF
  3. The False Promise of Imitating Proprietary LLMs. arXiv:2305.15717論文ページ·PDF
  4. On-Policy Distillation of Language Models: Learning from Self-Generated Mistakes. arXiv:2306.13649論文ページ·PDF
  5. Jianyu Wu, Yizhou Wang, Encheng Su, Chen Tang et al.. (2026-08-03) DAPD: Dual-Anchored Policy Distillation. arXiv:2608.01735論文ページ·PDF

本記事は上記論文の本文にもとづいて執筆しています。数値・主張は原典を優先してください。

コメント

コメントにはログインが必要です