PaperLens
紙
学生版
社会人版
JA
EN
◐
Googleでログイン
ログイン
読む
ホーム
論文精読
新着
教科書
深める
体系
ラボ
業界地図
みんなの貢献
用語集
自分
探す
読み放題
マイページ
#temperature
3 記事
01
2026-08-29
·
蒸留と圧縮
·
無料
·
論文
·
11分で読めます
蒸留の数学 — なぜ「柔らかい答え」から学べるのか
Distilling the Knowledge in a Neural Network
蒸留の損失はなぜ KL(教師||生徒) なのか、温度Tは何をしているのか、そして実装で必ず出てくる T² 倍は何の補正なのか。ソフトラベルが正解ラベルより多くを語る理由を、式の導出と動く図で1から追います。
02
2026-08-29
·
蒸留と圧縮
·
★ 会員
·
論文
·
15分で読めます
【実装】蒸留を自作する — 100行で小さなモデルを育てる
Distilling the Knowledge in a Neural Network
蒸留の損失は20行で書けます。にもかかわらず自作するとほぼ全員が同じ場所で転ぶ — KLの向き、reductionの選び方、T²の付け忘れ。教師の凍結から損失、訓練ループ、教師なしベースラインとの比較、温度スイープ、そして「実装が壊れていないこと」を確かめる4つの検算までを、100行のコードで通します。
03
2026-08-27
·
LLM — 大規模言語モデル
·
★ 会員
·
論文
·
13分で読めます
知識蒸留を1から — 大きなモデルを小さく写す
Distilling the Knowledge in a Neural Network
正解ラベルには「犬と猫は似ている」と書かれていません。でも訓練済みモデルの出力にはそれが入っている — この差が知識蒸留の全部です。ソフトラベルと温度つきsoftmax、T²の由来、系列レベル蒸留、合成データ蒸留、そしてDeepSeek-R1が推論の手続きごと小さいモデルへ写した話まで、前提知識ゼロから。