PaperLens
紙
学生版
社会人版
JA
EN
◐
Googleでログイン
ログイン
読む
ホーム
論文精読
新着
教科書
深める
体系
ラボ
業界地図
みんなの貢献
用語集
自分
探す
読み放題
マイページ
#distillation
27 記事
01
2026-09-07
·
推論・高速化
·
★ 会員
·
論文
·
16分で読めます
論文解説: 訓練データが1問でも、オンポリシー蒸留は数百ステップ伸び続ける
Rethinking On-Policy Distillation of Large Language Models II: One Training Example
訓練クエリを1問に絞ってもオンポリシー蒸留は数百ステップ改善し続け、フルデータの伸びの大半を回収する。論文はその理由を「状態カバレッジ」と「吸収率」の2つで説明し、OPDはデータ過多・アルゴリズム不足だと結論づける。
02
2026-09-05
·
★ 会員
·
論文
·
12分で読めます
論文解説: LLaDA-Image — 画像だけで土台を作り、2〜4ステップまで蒸留する完全公開レシピ
LLaDA-Image: Building Strong Image Generators with Fully Open Training Recipes
画像とテキストの対データに頼らず、まず「画像だけ」で生成の土台を作る学習レシピ。6BのDiTをゼロから訓練し2〜4ステップ推論まで蒸留した LLaDA-Image を、論文本文の設計判断に沿って1から解説する。
03
2026-09-05
·
推論・高速化
·
★ 会員
·
論文
·
14分で読めます
論文解説: Compile by Training — 自然言語の仕様を「手元で動く関数」にコンパイルする
Compile by Training: Turning Natural-Language Specifications into Local Neural Functions
「メールを緊急か後回しかに分けて」——そんな曖昧な仕様を、約1分の学習でローカル実行できる小さな関数に変える手法。論文 Compile by Training を、比喩→仕組み→式→実測値の順で1から解説します。
04
2026-09-04
·
★ 会員
·
論文
·
20分で読めます
論文解説: SolarWM — 5秒で学習して1時間歩き回れる動画ワールドモデルを、データごと全部開ける
SolarWM: Open Data and Scalable Training for Long-Horizon Video World Models
10個のデータセットを143万クリップの統一契約に揃える「データエンジン」と、4種類の動画生成バックボーンをそのまま活かす3段階の学習レシピ。5秒の系列だけで学習した因果モデルが、分〜時間スケールのロールアウトを続ける。
05
2026-09-03
·
エージェント
·
★ 会員
·
論文
·
19分で読めます
論文解説: UI-Venus-2 — 画面を見て操作するAIを、ベンチマークから実運用へ
UI-Venus-2 Technical Report
スマホ・ブラウザ・デスクトップを画面だけ見て操作するGUIエージェント UI-Venus-2 の技術報告書を、前提知識ゼロから解説。環境・タスク・検証を同時に広げる設計と、その限界までを論文本文だけを根拠に読む。
06
2026-09-03
·
エージェント
·
★ 会員
·
論文
·
22分で読めます
論文解説: Training Agents to Evolve with Their Harness — ハーネスごと進化するエージェントを訓練する
Training Agents to Evolve with Their Harness: TaoLive Digital Avatar Agent Technical Report
プロンプトやツール定義を毎週書き換える本番環境で、小型モデルはなぜ壊れるのか。淘宝ライブのAIアバター配信を動かすチームが提案する Harness-Aware Training(HAT)を、比喩から数式・実測値・限界まで1から解説する。
07
2026-09-02
·
★ 会員
·
論文
·
19分で読めます
論文解説: DreamX-Creator — 音と映像を「同時に」作る7Bモデルと、2Kへの1ステップ仕上げ
DreamX-Creator: Democratizing Native Audio-Video Generation at 2K Resolution
音声と映像を1つの生成過程で同時に denoise する7Bモデルの論文を、前提知識ゼロから解説。ゲート付き交差注意・モダリティ別の強化学習・1ステップ2K仕上げの3点と、著者自身が置いている重い留保まで読む。
08
2026-09-02
·
推論・高速化
·
★ 会員
·
論文
·
17分で読めます
論文解説: DART-SD — ツール呼び出しエージェントの「ダイヤ型の解空間」を壊さずに学習する
DART-SD: Diamond-topology Aware Retrieval and Tuning for Self-Distillation of Multi-Turn Tool-Calling Agents
順不同のサブゴールを含む多ターンのツール呼び出しでは、正解の集合が『ダイヤ格子』状に広がる。軌跡まるごとの模倣がなぜそれを潰すのか、状態グラフで『最初に転んだ地点』を特定してそこから先だけを直す学習で何が変わるのかを、前提知識ゼロから解説する。
09
2026-08-31
·
推論・高速化
·
★ 会員
·
論文
·
15分で読めます
論文解説 TTPO: 正解ラベルなしで、テストの最中にモデルを鍛える
TTPO: Test-Time Policy Optimization
多数決で作った疑似ラベルは競技数学では約85%外れる。それでも学習が成立するのはなぜか。賛成した出力は蒸留し、反対した出力はRLで罰するという「非対称」な設計を、前提知識ゼロから解説する。
10
2026-08-31
·
★ 会員
·
論文
·
12分で読めます
論文解説: On-Policy Self-Distillation in Diffusion Models — 報酬を「途中の的」に翻訳する
On-Policy Self-Distillation in Diffusion Models
画像生成モデルを報酬で鍛えるとき、完成画像への点数は「途中のデノイズをどう直すか」を教えてくれない。DiffusionOPSD は報酬の勾配から中間予測の具体的な的を作り、自分自身のEMA版を教師にして当てはめる。要旨に書かれた範囲で、その仕組みと限界を1から解説する。
11
2026-08-29
·
蒸留と圧縮
·
★ 会員
·
論文
·
13分で読めます
オンポリシー蒸留 — 生徒自身の出力で教わる
On-Policy Self-Distillation without Any Supervision
教師の書いた文を写経するのが従来の蒸留、生徒が書いた文に教師が赤を入れるのがオンポリシー蒸留です。違いは損失の式のたった1か所。その1か所が露出バイアスを消し、蒸留を強化学習の一種に変え、u-OPSD や AgentOPSD のような自己蒸留への入口になります。
12
2026-08-29
·
蒸留と圧縮
·
★ 会員
·
論文
·
13分で読めます
蒸留・量子化・枝刈りの使い分け — 小さくする3つの道
Distilling the Knowledge in a Neural Network
モデルを小さくする道は3本あります。数値の目盛りを粗くする量子化、重みそのものを間引く枝刈り、小さいモデルに作り直す蒸留。圧縮率・精度・実装コストの三軸で正面から比べ、「訓練を伴うものを先に、量子化を最後に」という組み合わせ順序の理由まで、前提知識ゼロから。
13
2026-08-29
·
蒸留と圧縮
·
★ 会員
·
論文
·
12分で読めます
蒸留レシピ図鑑 — logit・feature・attention・self をどう使い分けるか
Distilling the Knowledge in a Neural Network
蒸留のレシピは「教師のどこを学生に合わせるか」で決まります。出力(logit)・中間層(FitNet)・注意行列・自己蒸留の4種を、1枚の表と4本の式で並べ、教師がAPI越しなのか同族アーキなのかといった条件から選び方を決める地図にします。
14
2026-08-29
·
蒸留と圧縮
·
無料
·
論文
·
11分で読めます
蒸留の数学 — なぜ「柔らかい答え」から学べるのか
Distilling the Knowledge in a Neural Network
蒸留の損失はなぜ KL(教師||生徒) なのか、温度Tは何をしているのか、そして実装で必ず出てくる T² 倍は何の補正なのか。ソフトラベルが正解ラベルより多くを語る理由を、式の導出と動く図で1から追います。
15
2026-08-29
·
蒸留と圧縮
·
★ 会員
·
論文
·
14分で読めます
エージェントを蒸留する — 長い軌跡をどう圧縮するか
ReAct: Synergizing Reasoning and Acting in Language Models
エージェントの蒸留では、学ぶ単位が「一問一答」から「一局」に変わります。数万トークンの軌跡に対して返ってくる採点は最後の○×ひとつ。この落差をどう埋めるのか — ターン単位のクレジット割当、軌跡の濾過とオンポリシー化、ツール使用の継承を、前提知識ゼロから解きほぐし、長距離エージェントの論文群への地図にします。
16
2026-08-29
·
蒸留と圧縮
·
★ 会員
·
論文
·
10分で読めます
蒸留が失敗するとき — 容量ギャップと過信の伝染
DAPD: Dual-Anchored Policy Distillation
強い教師を使えば強い生徒ができる、とは限りません。器が小さいと平均だけが伝わる容量ギャップ、教師の自信ごと写す過信の伝染、教師が一度も通らない道を生徒が歩く分布シフト — 蒸留が壊れる3つの型を、前提知識ゼロから解きほぐします。
17
2026-08-29
·
蒸留と圧縮
·
★ 会員
·
論文
·
12分で読めます
蒸留モデルの評価 — 「教師に近い」は良い指標か
The False Promise of Imitating Proprietary LLMs
蒸留した生徒モデルを「教師との一致率」で採点すると、教師の誤りを忠実に写した生徒ほど高得点になります。一致率が数学的に何を保証して何を保証しないのか、分布の外で何が崩れるのか、合成データ経由のベンチマーク汚染をどう検査するのか — 蒸留モデルの評価設計を前提知識ゼロから組み立てます。
18
2026-08-29
·
蒸留と圧縮
·
★ 会員
·
論文
·
11分で読めます
蒸留データの設計 — 教師に何を答えさせるか
DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning
蒸留で生徒の性能を決めるのは、教師の賢さより「教師に何を問うたか」です。合成データの作り方、カバレッジの設計、難問へ偏らせる理由、正しさのフィルタ、そしてDeepSeek-R1の蒸留がなぜ効いたのかを、前提知識ゼロから解説します。
19
2026-08-29
·
蒸留と圧縮
·
★ 会員
·
論文
·
15分で読めます
【実装】蒸留を自作する — 100行で小さなモデルを育てる
Distilling the Knowledge in a Neural Network
蒸留の損失は20行で書けます。にもかかわらず自作するとほぼ全員が同じ場所で転ぶ — KLの向き、reductionの選び方、T²の付け忘れ。教師の凍結から損失、訓練ループ、教師なしベースラインとの比較、温度スイープ、そして「実装が壊れていないこと」を確かめる4つの検算までを、100行のコードで通します。
20
2026-08-27
·
RAG・検索拡張
·
★ 会員
·
論文
·
18分で読めます
論文解説: WeMM-Embedding — 文も画像も動画も「同じ物差し」に載せるWeChatの埋め込みモデル
WeMM-Embedding: WeChat Multi-Modal Embedding Technical Report
テキスト・画像・動画・文書とその混合を1本のベクトルに落とすWeMM-Embedding(2B/4B/9B)のテクニカルレポートを解説。統一ペア形式、<embedding>トークン、マトリョーシカ次元、2段階学習と蒸留を、論文の数値だけで1から読み解く。
21
2026-08-27
·
LLM — 大規模言語モデル
·
★ 会員
·
論文
·
13分で読めます
知識蒸留を1から — 大きなモデルを小さく写す
Distilling the Knowledge in a Neural Network
正解ラベルには「犬と猫は似ている」と書かれていません。でも訓練済みモデルの出力にはそれが入っている — この差が知識蒸留の全部です。ソフトラベルと温度つきsoftmax、T²の由来、系列レベル蒸留、合成データ蒸留、そしてDeepSeek-R1が推論の手続きごと小さいモデルへ写した話まで、前提知識ゼロから。
22
2026-08-27
·
推論・高速化
·
★ 会員
·
13分で読めます
推論コスト削減の実務 — 何から手を付けるか
量子化も蒸留も効きますが、たいていの現場ではその前に「品質を1ミリも賭けずに済む手」が残っています。請求書を4つの数に分解し、キャッシュ→バッチング→短縮→圧縮の順に並べ替える。各手の効き方と、順序を間違えたときに何が壊れるかまで。
23
2026-08-25
·
モデル系統図鑑
·
無料
·
12分で読めます
DeepSeek系を1から — MoEと蒸留で殴り込んだ系譜
MoE・MLA・GRPO・蒸留という4つの道具でオープンLLMの勢力図を塗り替えたDeepSeekの系譜を、V2/V3/R1の設計判断に沿って前提知識ゼロから解説。話題になった学習コストの数字の読み方と、蒸留モデルの正しい使いどころまで。
24
2026-08-22
·
★ 会員
·
論文
·
15分で読めます
論文解説: S²VOPD — 教師を強くする代わりに、生徒の目を曇らせる
Self-Supervised Visual On-Policy Distillation
正解ラベルも報酬も強い教師も使わずに視覚VLMを伸ばす S²VOPD を、論文本文に沿って解説。生徒側の画像だけを劣化させて「情報の非対称性」を作る反転の発想と、効く拡張・効かない拡張の切り分けを扱う。
25
2026-08-13
·
推論・高速化
·
★ 会員
·
論文
·
18分で読めます
論文解説: 正解も強い教師もなしで伸びる — u-OPSD が使う「自分の多数決」
On-Policy Self-Distillation without Any Supervision
模範解答も強い教師モデルも使わず、モデル自身が出した8本の答案の多数決を『特権的な文脈』に仕立てて自己蒸留する u-OPSD(arXiv:2608.06296)を、論文本文だけを根拠に1から解説する。
26
2026-08-13
·
★ 会員
·
論文
·
12分で読めます
論文解説: JoyAI-Video-Edit — 未来のフレームを待たずに、720p・約30FPSで動画を編集し続ける自己回帰拡散
JoyAI-Video-Edit: Real-Time Open-Ended Video Editing with Autoregressive Diffusion
「背景を雪山に変えて」と指示すると、流れ込むライブ映像がその場で編集されて返ってくる——JDのJoyAI-Video-Editを論文本文から解説。チャンク自己回帰化・ソース錨付き蒸留(SA-DMD)・長時間ロールアウト蒸留の3段構えで、16Bモデルが720pを約30FPSで編集し続ける仕組みを追う。
27
2026-08-12
·
推論・高速化
·
★ 会員
·
論文
·
11分で読めます
論文解説: DAPD — 蒸留の教師が持つ「カンニングペーパーの幻想」を二重アンカーで断つ
DAPD: Dual-Anchored Policy Distillation
模範解答を見た教師から蒸留すると、生徒は本番で「見えない答えを思い出したふり」をする——この privilege illusion の根本原因を情報の非対称性と特定し、二重のアンカーで解消する DAPD (arXiv:2608.01735) を論文本文だけを根拠に解説する。