論文解説: DAPD — 蒸留の教師が持つ「カンニングペーパーの幻想」を二重アンカーで断つ
模範解答を見た教師から蒸留すると、生徒は本番で「見えない答えを思い出したふり」をする——この privilege illusion の根本原因を情報の非対称性と特定し、二重のアンカーで解消する DAPD (arXiv:2608.01735) を論文本文だけを根拠に解説する。
DAPD: Dual-Anchored Policy Distillation
一次資料 — この記事の根拠
論文の発表 2026-08-03→この解説の公開 2026-08-12同月
DAPD: Dual-Anchored Policy DistillationJianyu Wu, Yizhou Wang, Encheng Su ほか · 2026-08-03 · v1arXiv:2608.01735論文ページ·PDF原文の要旨(Abstract)を読む
On-policy (self) distillation (OPSD) is increasingly adopted for language-model post-training. It strengthens the teacher with privileged information but can induce a privilege illusion: the student learns privilege-dependent behavior it cannot reproduce from its inference-time context, yet behaves as if the training-time privileged information remained available, ultimately degrading performance. In this paper, we identify information asymmetry between the privileged teacher and the student at inference as the root cause of this failure in OPSD. To resolve this asymmetry, we propose Dual-Anchored Policy Distillation (DAPD), a unified framework with two levels of anchoring. Dual-Path Anchoring (DPA) introduces a self-conditioned bridge and aligns reference and rollout behavior along two matched-information paths, preventing privilege-dependent behavior from being transferred to the inference-time student. Dual-Source Anchoring (DSA) applies these paths in both reference-to-rollout and rollout-to-reference directions, reducing reliance on privileged reference guidance while preserving correctness supervision. Extensive experiments show that DAPD significantly alleviates privilege illusion, outperforming OPSD on Qwen3-4B by +2.00 points on average across tasks. Notably, its gains persist across scales, reaching +2.69 at 4B and +2.78 at 32B.
先生がカンニングペーパーを持って教えると何が起きるか
数学の家庭教師が、模範解答を手元に置いたまま教えているところを想像してください。教え方は的確です。ところが生徒は、解き方だけでなく「手元に答えがある人の振る舞い」まで真似してしまい、本番で行き詰まったとき根拠もなく「たしか答えは36/7だったはず」と書いてしまう——。
前半は比喩ですが、「36/7」は実際のモデル出力です。論文のFigure 4に、AIME24の幾何問題で導出に失敗したモデルが "I recall that the answer is likely 36/7" と述べて誤答する実例があります(§4.2)。
今回の論文 DAPD (Dual-Anchored Policy Distillation)(arXiv:2608.01735)は、LLMのポストトレーニングで広く使われる On-policy self-distillation(OPSD、オンポリシー自己蒸留) がこの症状——特権情報の幻想(privilege illusion)——を起こす根本原因を「教師と生徒の情報の非対称性」と特定し、二重のアンカーで解消します。Qwen3-4Bで6ベンチマーク平均+2.00ポイント、32Bでも+2.78ポイントと、スケールしても消えない改善を報告しています(§1)。
前提: OPSDとは何をする学習か
蒸留(distillation)は、教師モデルの「次トークンの確率分布」を生徒モデルに真似させる学習法です。オンポリシー蒸留はさらに、生徒自身が生成した途中経過(ロールアウト)の各位置で教える方式で、生徒が実際に迷い込む場所で指導するぶん、学習時と本番のズレが小さくなります。
OPSDの面白い点は、教師が別モデルではなく「模範解答を見せられた自分自身」であること(§2.1)。同じモデル から、条件だけが違う2つの分布を作ります( は問題文、 はロールアウト、 は模範解答、 はトークン位置)。
- None分布 — 問題文と書きかけだけを見た、本番と同じ条件の自分
- Cross分布 — 模範解答つきで同じ書きかけを見た、「カンペを持った」自分
OPSDは Cross を教師、None を生徒として次を最小化します(§2.1)。
言い換えると「自分の書きかけ答案の各位置で、模範解答を見た自分の分布に、見ていない自分の分布を近づける」です。 は分布間の距離(ダイバージェンス)——ここに実際何を置くかはKL情報量の記事で扱っています——、 は教師側に勾配を流さない印、 はロールアウトの長さです。
生徒は本番でカンペを持っていない
ここに構造的な穴があります。教師(Cross)は訓練中ずっと模範解答という特権情報を見ているのに、生徒は推論時にそれを見られません。論文はこの症状を行動レベルで数えます。「導出の失敗を自認した直後に、記憶や参照元から引いたかのように答えを断言し、誤答する」出力が wrong claims(不当な断言) です(§2.1, §C.2)。
Qwen3の5スケール平均で、OPSDの訓練が進むと wrong claims は生成1万件あたり13.0件から37.0件へ増え、同じ期間に推論スコア(AIME24/25・HMMT25のAvg@12)は59.56から53.24へ低下します(§2.1)。幻想の進行と性能劣化が連動しているのです。
コメント
コメントにはログインが必要です