JA EN

#self-distillation

3 記事

01 ·推論・高速化·★ 会員·論文·17分で読めます 論文解説: DART-SD — ツール呼び出しエージェントの「ダイヤ型の解空間」を壊さずに学習する DART-SD: Diamond-topology Aware Retrieval and Tuning for Self-Distillation of Multi-Turn Tool-Calling Agents 順不同のサブゴールを含む多ターンのツール呼び出しでは、正解の集合が『ダイヤ格子』状に広がる。軌跡まるごとの模倣がなぜそれを潰すのか、状態グラフで『最初に転んだ地点』を特定してそこから先だけを直す学習で何が変わるのかを、前提知識ゼロから解説する。 02 ·蒸留と圧縮·★ 会員·論文·12分で読めます 蒸留レシピ図鑑 — logit・feature・attention・self をどう使い分けるか Distilling the Knowledge in a Neural Network 蒸留のレシピは「教師のどこを学生に合わせるか」で決まります。出力(logit)・中間層(FitNet)・注意行列・自己蒸留の4種を、1枚の表と4本の式で並べ、教師がAPI越しなのか同族アーキなのかといった条件から選び方を決める地図にします。 03 ·推論・高速化·★ 会員·論文·14分で読めます 論文解説: AgentOPSD — 「どのターンが勝敗を分けたか」をベイズ信念の再帰更新で見つけるエージェントRL AgentOPSD: Recursive Self-Distillation for Agentic Reinforcement Learning 長いマルチターン対話の最後に成功/失敗しか教えてくれない環境で、「効いた一手」をどう見つけるか。自己蒸留のギャップをベイズ証拠と読み替え、log-odds空間で信念を再帰更新するAgentOPSDを論文本文から解説。ALFWorld 89.1%の結果、アブレーション、限界まで。