JA EN

#data-curation

2 記事

01 ·蒸留と圧縮·★ 会員·論文·11分で読めます 蒸留データの設計 — 教師に何を答えさせるか DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning 蒸留で生徒の性能を決めるのは、教師の賢さより「教師に何を問うたか」です。合成データの作り方、カバレッジの設計、難問へ偏らせる理由、正しさのフィルタ、そしてDeepSeek-R1の蒸留がなぜ効いたのかを、前提知識ゼロから解説します。 02 ·学習手法・アライメント·★ 会員·論文·12分で読めます データセット構築の実務 — 集める・洗う・混ぜる Self-Instruct: Aligning Language Models with Self-Generated Instructions モデルを作る仕事の大半は、実はデータセットを作る仕事です。母集団の設計、品質フィルタの閾値の決め方、テストへの漏れの検査、配合比が決めてしまう周回数、合成データの使いどころ、アノテーションのガイドライン設計までを、前提知識ゼロから1から解説します。