PaperLens
紙
学生版
社会人版
JA
EN
◐
Googleでログイン
ログイン
読む
ホーム
論文精読
新着
教科書
深める
体系
ラボ
業界地図
みんなの貢献
用語集
自分
探す
読み放題
マイページ
#data-efficiency
1 記事
01
2026-09-07
·
推論・高速化
·
★ 会員
·
論文
·
16分で読めます
論文解説: 訓練データが1問でも、オンポリシー蒸留は数百ステップ伸び続ける
Rethinking On-Policy Distillation of Large Language Models II: One Training Example
訓練クエリを1問に絞ってもオンポリシー蒸留は数百ステップ改善し続け、フルデータの伸びの大半を回収する。論文はその理由を「状態カバレッジ」と「吸収率」の2つで説明し、OPDはデータ過多・アルゴリズム不足だと結論づける。