JA EN

#rejection-sampling

1 記事

01 ·蒸留と圧縮·★ 会員·論文·11分で読めます 蒸留データの設計 — 教師に何を答えさせるか DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning 蒸留で生徒の性能を決めるのは、教師の賢さより「教師に何を問うたか」です。合成データの作り方、カバレッジの設計、難問へ偏らせる理由、正しさのフィルタ、そしてDeepSeek-R1の蒸留がなぜ効いたのかを、前提知識ゼロから解説します。