JA EN

#data-efficiency

1 記事

01 ·推論・高速化·★ 会員·論文·16分で読めます 論文解説: 訓練データが1問でも、オンポリシー蒸留は数百ステップ伸び続ける Rethinking On-Policy Distillation of Large Language Models II: One Training Example 訓練クエリを1問に絞ってもオンポリシー蒸留は数百ステップ改善し続け、フルデータの伸びの大半を回収する。論文はその理由を「状態カバレッジ」と「吸収率」の2つで説明し、OPDはデータ過多・アルゴリズム不足だと結論づける。