JA EN

#synthetic-data

5 記事

01 ·推論・高速化·★ 会員·論文·14分で読めます 論文解説: Compile by Training — 自然言語の仕様を「手元で動く関数」にコンパイルする Compile by Training: Turning Natural-Language Specifications into Local Neural Functions 「メールを緊急か後回しかに分けて」——そんな曖昧な仕様を、約1分の学習でローカル実行できる小さな関数に変える手法。論文 Compile by Training を、比喩→仕組み→式→実測値の順で1から解説します。 02 ·蒸留と圧縮·★ 会員·論文·11分で読めます 蒸留データの設計 — 教師に何を答えさせるか DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning 蒸留で生徒の性能を決めるのは、教師の賢さより「教師に何を問うたか」です。合成データの作り方、カバレッジの設計、難問へ偏らせる理由、正しさのフィルタ、そしてDeepSeek-R1の蒸留がなぜ効いたのかを、前提知識ゼロから解説します。 03 ·学習手法・アライメント·★ 会員·論文·12分で読めます データセット構築の実務 — 集める・洗う・混ぜる Self-Instruct: Aligning Language Models with Self-Generated Instructions モデルを作る仕事の大半は、実はデータセットを作る仕事です。母集団の設計、品質フィルタの閾値の決め方、テストへの漏れの検査、配合比が決めてしまう周回数、合成データの使いどころ、アノテーションのガイドライン設計までを、前提知識ゼロから1から解説します。 04 ·エージェント·★ 会員·論文·17分で読めます 論文解説: FACET — 指示・環境・解答・採点を「同じ実行状態」に接地させる課題合成 FACET: Preserving Source Intent and Executable State in Terminal Task Synthesis ターミナル課題は「指示文・環境・模範解答・採点器」の4点セット。FACETは環境を先に建てて動かし、その実現済み状態を全部品の共通の地面にすることで整合を取る。7万件のスキルから6,078課題を作り、1.2Kの成功軌跡だけでQwen3.5を4B/9B/27Bとも底上げした論文を1から解説する。 05 ·エージェント·★ 会員·論文·15分で読めます 論文解説: Recursive Synthesis — 検証済みタスクを「増築」して、長時間ターミナル課題を4万件量産する Recursive Synthesis for Long-Horizon Terminal Tasks 1件数百〜数千ドルかかる長時間ターミナルタスクを、検証済みの種から再帰的に増築して約$0.05で量産するRST。15ラウンドで37,484件、模範解答は中央値67行から374行へ難化し、その軌跡でQwen3.5をSFT+PPOで実際に強くした——Tencentらのデータ合成論文を1から解説する。