JA EN
体系推論・高速化
·★ 会員·論文·11分で読めます

論文解説: DAPD — 蒸留の教師が持つ「カンニングペーパーの幻想」を二重アンカーで断つ

模範解答を見た教師から蒸留すると、生徒は本番で「見えない答えを思い出したふり」をする——この privilege illusion の根本原因を情報の非対称性と特定し、二重のアンカーで解消する DAPD (arXiv:2608.01735) を論文本文だけを根拠に解説する。

対象textタスクinference

DAPD: Dual-Anchored Policy Distillation

一次資料 — この記事の根拠

論文の発表 2026-08-03この解説の公開 2026-08-12同月

DAPD: Dual-Anchored Policy DistillationJianyu Wu, Yizhou Wang, Encheng Su ほか · 2026-08-03 · v1arXiv:2608.01735論文ページ·PDF
原文の要旨(Abstract)を読む

On-policy (self) distillation (OPSD) is increasingly adopted for language-model post-training. It strengthens the teacher with privileged information but can induce a privilege illusion: the student learns privilege-dependent behavior it cannot reproduce from its inference-time context, yet behaves as if the training-time privileged information remained available, ultimately degrading performance. In this paper, we identify information asymmetry between the privileged teacher and the student at inference as the root cause of this failure in OPSD. To resolve this asymmetry, we propose Dual-Anchored Policy Distillation (DAPD), a unified framework with two levels of anchoring. Dual-Path Anchoring (DPA) introduces a self-conditioned bridge and aligns reference and rollout behavior along two matched-information paths, preventing privilege-dependent behavior from being transferred to the inference-time student. Dual-Source Anchoring (DSA) applies these paths in both reference-to-rollout and rollout-to-reference directions, reducing reliance on privileged reference guidance while preserving correctness supervision. Extensive experiments show that DAPD significantly alleviates privilege illusion, outperforming OPSD on Qwen3-4B by +2.00 points on average across tasks. Notably, its gains persist across scales, reaching +2.69 at 4B and +2.78 at 32B.


先生がカンニングペーパーを持って教えると何が起きるか

数学の家庭教師が、模範解答を手元に置いたまま教えているところを想像してください。教え方は的確です。ところが生徒は、解き方だけでなく「手元に答えがある人の振る舞い」まで真似してしまい、本番で行き詰まったとき根拠もなく「たしか答えは36/7だったはず」と書いてしまう——。

前半は比喩ですが、「36/7」は実際のモデル出力です。論文のFigure 4に、AIME24の幾何問題で導出に失敗したモデルが "I recall that the answer is likely 36/7" と述べて誤答する実例があります(§4.2)。

今回の論文 DAPD (Dual-Anchored Policy Distillation)(arXiv:2608.01735)は、LLMのポストトレーニングで広く使われる On-policy self-distillation(OPSD、オンポリシー自己蒸留) がこの症状——特権情報の幻想(privilege illusion)——を起こす根本原因を「教師と生徒の情報の非対称性」と特定し、二重のアンカーで解消します。Qwen3-4Bで6ベンチマーク平均+2.00ポイント、32Bでも+2.78ポイントと、スケールしても消えない改善を報告しています(§1)。

前提: OPSDとは何をする学習か

蒸留(distillation)は、教師モデルの「次トークンの確率分布」を生徒モデルに真似させる学習法です。オンポリシー蒸留はさらに、生徒自身が生成した途中経過(ロールアウト)の各位置で教える方式で、生徒が実際に迷い込む場所で指導するぶん、学習時と本番のズレが小さくなります。

OPSDの面白い点は、教師が別モデルではなく「模範解答を見せられた自分自身」であること(§2.1)。同じモデル pθp_\theta から、条件だけが違う2つの分布を作ります(xx は問題文、yy はロールアウト、yy^* は模範解答、tt はトークン位置)。

OPSDは Cross を教師、None を生徒として次を最小化します(§2.1)。

LOPSD=E ⁣[1yt=1yD ⁣(sg ⁣[pCross]pNone)]\mathcal{L}_{\mathrm{OPSD}}=\mathbb{E}\!\left[\frac{1}{|y|}\sum_{t=1}^{|y|}\mathrm{D}\!\left(\operatorname{sg}\!\left[p_{\mathrm{Cross}}\right]\,\|\,p_{\mathrm{None}}\right)\right]
(1)

言い換えると「自分の書きかけ答案の各位置で、模範解答を見た自分の分布に、見ていない自分の分布を近づける」です。D\mathrm{D} は分布間の距離(ダイバージェンス)——ここに実際何を置くかはKL情報量の記事で扱っています——、sg[]\operatorname{sg}[\cdot] は教師側に勾配を流さない印、y|y| はロールアウトの長さです。

FIG 1蒸留は「確率分布のかたち」を教える学習。温度で分布が尖ったり平らになる感覚を掴むと「教師分布に合わせる」の意味が体感できる。この論文もロジットを温度1.1で割ってから合わせている(§A.6)

生徒は本番でカンペを持っていない

ここに構造的な穴があります。教師(Cross)は訓練中ずっと模範解答という特権情報を見ているのに、生徒は推論時にそれを見られません。論文はこの症状を行動レベルで数えます。「導出の失敗を自認した直後に、記憶や参照元から引いたかのように答えを断言し、誤答する」出力が wrong claims(不当な断言) です(§2.1, §C.2)。

Qwen3の5スケール平均で、OPSDの訓練が進むと wrong claims は生成1万件あたり13.0件から37.0件へ増え、同じ期間に推論スコア(AIME24/25・HMMT25のAvg@12)は59.56から53.24へ低下します(§2.1)。幻想の進行と性能劣化が連動しているのです。

先行研究は特権情報の信号をフィルタや再重み付けで加工してきましたが、論文はこれを構造的に不十分と診断します。信号をいくら加工しても、特権情報を持つ教師が、持たない生徒を直接教える構図が残るからです(§1, §2.2)。

この先にあるもの

§

ここから先は会員限定です

解説記事371本・教科書26章・学生モード48単元・論文精読6本が、月額¥490ですべて読み放題になります。新しい解説は毎日3本ずつ増えます。いつでも解約でき、解約後も期間の終わりまで読めます。

会員の方はログインすると続きが表示されます

参考文献

  1. Jianyu Wu, Yizhou Wang, Encheng Su, Chen Tang et al.. (2026-08-03) DAPD: Dual-Anchored Policy Distillation. arXiv:2608.01735論文ページ·PDF

本記事は上記論文の本文にもとづいて執筆しています。数値・主張は原典を優先してください。

コメント

コメントにはログインが必要です