JA EN

#distillation

27 記事

01 ·推論・高速化·★ 会員·論文·16分で読めます 論文解説: 訓練データが1問でも、オンポリシー蒸留は数百ステップ伸び続ける Rethinking On-Policy Distillation of Large Language Models II: One Training Example 訓練クエリを1問に絞ってもオンポリシー蒸留は数百ステップ改善し続け、フルデータの伸びの大半を回収する。論文はその理由を「状態カバレッジ」と「吸収率」の2つで説明し、OPDはデータ過多・アルゴリズム不足だと結論づける。 02 ·★ 会員·論文·12分で読めます 論文解説: LLaDA-Image — 画像だけで土台を作り、2〜4ステップまで蒸留する完全公開レシピ LLaDA-Image: Building Strong Image Generators with Fully Open Training Recipes 画像とテキストの対データに頼らず、まず「画像だけ」で生成の土台を作る学習レシピ。6BのDiTをゼロから訓練し2〜4ステップ推論まで蒸留した LLaDA-Image を、論文本文の設計判断に沿って1から解説する。 03 ·推論・高速化·★ 会員·論文·14分で読めます 論文解説: Compile by Training — 自然言語の仕様を「手元で動く関数」にコンパイルする Compile by Training: Turning Natural-Language Specifications into Local Neural Functions 「メールを緊急か後回しかに分けて」——そんな曖昧な仕様を、約1分の学習でローカル実行できる小さな関数に変える手法。論文 Compile by Training を、比喩→仕組み→式→実測値の順で1から解説します。 04 ·★ 会員·論文·20分で読めます 論文解説: SolarWM — 5秒で学習して1時間歩き回れる動画ワールドモデルを、データごと全部開ける SolarWM: Open Data and Scalable Training for Long-Horizon Video World Models 10個のデータセットを143万クリップの統一契約に揃える「データエンジン」と、4種類の動画生成バックボーンをそのまま活かす3段階の学習レシピ。5秒の系列だけで学習した因果モデルが、分〜時間スケールのロールアウトを続ける。 05 ·エージェント·★ 会員·論文·19分で読めます 論文解説: UI-Venus-2 — 画面を見て操作するAIを、ベンチマークから実運用へ UI-Venus-2 Technical Report スマホ・ブラウザ・デスクトップを画面だけ見て操作するGUIエージェント UI-Venus-2 の技術報告書を、前提知識ゼロから解説。環境・タスク・検証を同時に広げる設計と、その限界までを論文本文だけを根拠に読む。 06 ·エージェント·★ 会員·論文·22分で読めます 論文解説: Training Agents to Evolve with Their Harness — ハーネスごと進化するエージェントを訓練する Training Agents to Evolve with Their Harness: TaoLive Digital Avatar Agent Technical Report プロンプトやツール定義を毎週書き換える本番環境で、小型モデルはなぜ壊れるのか。淘宝ライブのAIアバター配信を動かすチームが提案する Harness-Aware Training(HAT)を、比喩から数式・実測値・限界まで1から解説する。 07 ·★ 会員·論文·19分で読めます 論文解説: DreamX-Creator — 音と映像を「同時に」作る7Bモデルと、2Kへの1ステップ仕上げ DreamX-Creator: Democratizing Native Audio-Video Generation at 2K Resolution 音声と映像を1つの生成過程で同時に denoise する7Bモデルの論文を、前提知識ゼロから解説。ゲート付き交差注意・モダリティ別の強化学習・1ステップ2K仕上げの3点と、著者自身が置いている重い留保まで読む。 08 ·推論・高速化·★ 会員·論文·17分で読めます 論文解説: DART-SD — ツール呼び出しエージェントの「ダイヤ型の解空間」を壊さずに学習する DART-SD: Diamond-topology Aware Retrieval and Tuning for Self-Distillation of Multi-Turn Tool-Calling Agents 順不同のサブゴールを含む多ターンのツール呼び出しでは、正解の集合が『ダイヤ格子』状に広がる。軌跡まるごとの模倣がなぜそれを潰すのか、状態グラフで『最初に転んだ地点』を特定してそこから先だけを直す学習で何が変わるのかを、前提知識ゼロから解説する。 09 ·推論・高速化·★ 会員·論文·15分で読めます 論文解説 TTPO: 正解ラベルなしで、テストの最中にモデルを鍛える TTPO: Test-Time Policy Optimization 多数決で作った疑似ラベルは競技数学では約85%外れる。それでも学習が成立するのはなぜか。賛成した出力は蒸留し、反対した出力はRLで罰するという「非対称」な設計を、前提知識ゼロから解説する。 10 ·★ 会員·論文·12分で読めます 論文解説: On-Policy Self-Distillation in Diffusion Models — 報酬を「途中の的」に翻訳する On-Policy Self-Distillation in Diffusion Models 画像生成モデルを報酬で鍛えるとき、完成画像への点数は「途中のデノイズをどう直すか」を教えてくれない。DiffusionOPSD は報酬の勾配から中間予測の具体的な的を作り、自分自身のEMA版を教師にして当てはめる。要旨に書かれた範囲で、その仕組みと限界を1から解説する。 11 ·蒸留と圧縮·★ 会員·論文·13分で読めます オンポリシー蒸留 — 生徒自身の出力で教わる On-Policy Self-Distillation without Any Supervision 教師の書いた文を写経するのが従来の蒸留、生徒が書いた文に教師が赤を入れるのがオンポリシー蒸留です。違いは損失の式のたった1か所。その1か所が露出バイアスを消し、蒸留を強化学習の一種に変え、u-OPSD や AgentOPSD のような自己蒸留への入口になります。 12 ·蒸留と圧縮·★ 会員·論文·13分で読めます 蒸留・量子化・枝刈りの使い分け — 小さくする3つの道 Distilling the Knowledge in a Neural Network モデルを小さくする道は3本あります。数値の目盛りを粗くする量子化、重みそのものを間引く枝刈り、小さいモデルに作り直す蒸留。圧縮率・精度・実装コストの三軸で正面から比べ、「訓練を伴うものを先に、量子化を最後に」という組み合わせ順序の理由まで、前提知識ゼロから。 13 ·蒸留と圧縮·★ 会員·論文·12分で読めます 蒸留レシピ図鑑 — logit・feature・attention・self をどう使い分けるか Distilling the Knowledge in a Neural Network 蒸留のレシピは「教師のどこを学生に合わせるか」で決まります。出力(logit)・中間層(FitNet)・注意行列・自己蒸留の4種を、1枚の表と4本の式で並べ、教師がAPI越しなのか同族アーキなのかといった条件から選び方を決める地図にします。 14 ·蒸留と圧縮·無料·論文·11分で読めます 蒸留の数学 — なぜ「柔らかい答え」から学べるのか Distilling the Knowledge in a Neural Network 蒸留の損失はなぜ KL(教師||生徒) なのか、温度Tは何をしているのか、そして実装で必ず出てくる T² 倍は何の補正なのか。ソフトラベルが正解ラベルより多くを語る理由を、式の導出と動く図で1から追います。 15 ·蒸留と圧縮·★ 会員·論文·14分で読めます エージェントを蒸留する — 長い軌跡をどう圧縮するか ReAct: Synergizing Reasoning and Acting in Language Models エージェントの蒸留では、学ぶ単位が「一問一答」から「一局」に変わります。数万トークンの軌跡に対して返ってくる採点は最後の○×ひとつ。この落差をどう埋めるのか — ターン単位のクレジット割当、軌跡の濾過とオンポリシー化、ツール使用の継承を、前提知識ゼロから解きほぐし、長距離エージェントの論文群への地図にします。 16 ·蒸留と圧縮·★ 会員·論文·10分で読めます 蒸留が失敗するとき — 容量ギャップと過信の伝染 DAPD: Dual-Anchored Policy Distillation 強い教師を使えば強い生徒ができる、とは限りません。器が小さいと平均だけが伝わる容量ギャップ、教師の自信ごと写す過信の伝染、教師が一度も通らない道を生徒が歩く分布シフト — 蒸留が壊れる3つの型を、前提知識ゼロから解きほぐします。 17 ·蒸留と圧縮·★ 会員·論文·12分で読めます 蒸留モデルの評価 — 「教師に近い」は良い指標か The False Promise of Imitating Proprietary LLMs 蒸留した生徒モデルを「教師との一致率」で採点すると、教師の誤りを忠実に写した生徒ほど高得点になります。一致率が数学的に何を保証して何を保証しないのか、分布の外で何が崩れるのか、合成データ経由のベンチマーク汚染をどう検査するのか — 蒸留モデルの評価設計を前提知識ゼロから組み立てます。 18 ·蒸留と圧縮·★ 会員·論文·11分で読めます 蒸留データの設計 — 教師に何を答えさせるか DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning 蒸留で生徒の性能を決めるのは、教師の賢さより「教師に何を問うたか」です。合成データの作り方、カバレッジの設計、難問へ偏らせる理由、正しさのフィルタ、そしてDeepSeek-R1の蒸留がなぜ効いたのかを、前提知識ゼロから解説します。 19 ·蒸留と圧縮·★ 会員·論文·15分で読めます 【実装】蒸留を自作する — 100行で小さなモデルを育てる Distilling the Knowledge in a Neural Network 蒸留の損失は20行で書けます。にもかかわらず自作するとほぼ全員が同じ場所で転ぶ — KLの向き、reductionの選び方、T²の付け忘れ。教師の凍結から損失、訓練ループ、教師なしベースラインとの比較、温度スイープ、そして「実装が壊れていないこと」を確かめる4つの検算までを、100行のコードで通します。 20 ·RAG・検索拡張·★ 会員·論文·18分で読めます 論文解説: WeMM-Embedding — 文も画像も動画も「同じ物差し」に載せるWeChatの埋め込みモデル WeMM-Embedding: WeChat Multi-Modal Embedding Technical Report テキスト・画像・動画・文書とその混合を1本のベクトルに落とすWeMM-Embedding(2B/4B/9B)のテクニカルレポートを解説。統一ペア形式、<embedding>トークン、マトリョーシカ次元、2段階学習と蒸留を、論文の数値だけで1から読み解く。 21 ·LLM — 大規模言語モデル·★ 会員·論文·13分で読めます 知識蒸留を1から — 大きなモデルを小さく写す Distilling the Knowledge in a Neural Network 正解ラベルには「犬と猫は似ている」と書かれていません。でも訓練済みモデルの出力にはそれが入っている — この差が知識蒸留の全部です。ソフトラベルと温度つきsoftmax、T²の由来、系列レベル蒸留、合成データ蒸留、そしてDeepSeek-R1が推論の手続きごと小さいモデルへ写した話まで、前提知識ゼロから。 22 ·推論・高速化·★ 会員·13分で読めます 推論コスト削減の実務 — 何から手を付けるか 量子化も蒸留も効きますが、たいていの現場ではその前に「品質を1ミリも賭けずに済む手」が残っています。請求書を4つの数に分解し、キャッシュ→バッチング→短縮→圧縮の順に並べ替える。各手の効き方と、順序を間違えたときに何が壊れるかまで。 23 ·モデル系統図鑑·無料·12分で読めます DeepSeek系を1から — MoEと蒸留で殴り込んだ系譜 MoE・MLA・GRPO・蒸留という4つの道具でオープンLLMの勢力図を塗り替えたDeepSeekの系譜を、V2/V3/R1の設計判断に沿って前提知識ゼロから解説。話題になった学習コストの数字の読み方と、蒸留モデルの正しい使いどころまで。 24 ·★ 会員·論文·15分で読めます 論文解説: S²VOPD — 教師を強くする代わりに、生徒の目を曇らせる Self-Supervised Visual On-Policy Distillation 正解ラベルも報酬も強い教師も使わずに視覚VLMを伸ばす S²VOPD を、論文本文に沿って解説。生徒側の画像だけを劣化させて「情報の非対称性」を作る反転の発想と、効く拡張・効かない拡張の切り分けを扱う。 25 ·推論・高速化·★ 会員·論文·18分で読めます 論文解説: 正解も強い教師もなしで伸びる — u-OPSD が使う「自分の多数決」 On-Policy Self-Distillation without Any Supervision 模範解答も強い教師モデルも使わず、モデル自身が出した8本の答案の多数決を『特権的な文脈』に仕立てて自己蒸留する u-OPSD(arXiv:2608.06296)を、論文本文だけを根拠に1から解説する。 26 ·★ 会員·論文·12分で読めます 論文解説: JoyAI-Video-Edit — 未来のフレームを待たずに、720p・約30FPSで動画を編集し続ける自己回帰拡散 JoyAI-Video-Edit: Real-Time Open-Ended Video Editing with Autoregressive Diffusion 「背景を雪山に変えて」と指示すると、流れ込むライブ映像がその場で編集されて返ってくる——JDのJoyAI-Video-Editを論文本文から解説。チャンク自己回帰化・ソース錨付き蒸留(SA-DMD)・長時間ロールアウト蒸留の3段構えで、16Bモデルが720pを約30FPSで編集し続ける仕組みを追う。 27 ·推論・高速化·★ 会員·論文·11分で読めます 論文解説: DAPD — 蒸留の教師が持つ「カンニングペーパーの幻想」を二重アンカーで断つ DAPD: Dual-Anchored Policy Distillation 模範解答を見た教師から蒸留すると、生徒は本番で「見えない答えを思い出したふり」をする——この privilege illusion の根本原因を情報の非対称性と特定し、二重のアンカーで解消する DAPD (arXiv:2608.01735) を論文本文だけを根拠に解説する。