PaperLens
紙
学生版
社会人版
JA
EN
◐
Googleでログイン
ログイン
読む
ホーム
論文精読
新着
教科書
深める
体系
ラボ
業界地図
みんなの貢献
用語集
自分
探す
読み放題
マイページ
#training
33 記事
01
2026-08-29
·
蒸留と圧縮
·
★ 会員
·
論文
·
13分で読めます
オンポリシー蒸留 — 生徒自身の出力で教わる
On-Policy Self-Distillation without Any Supervision
教師の書いた文を写経するのが従来の蒸留、生徒が書いた文に教師が赤を入れるのがオンポリシー蒸留です。違いは損失の式のたった1か所。その1か所が露出バイアスを消し、蒸留を強化学習の一種に変え、u-OPSD や AgentOPSD のような自己蒸留への入口になります。
02
2026-08-29
·
蒸留と圧縮
·
★ 会員
·
論文
·
13分で読めます
オンポリシー蒸留 — 生徒自身の出力で教わる
On-Policy Self-Distillation without Any Supervision
教師の書いた文を写経するのが従来の蒸留、生徒が書いた文に教師が赤を入れるのがオンポリシー蒸留です。違いは損失の式のたった1か所。その1か所が露出バイアスを消し、蒸留を強化学習の一種に変え、u-OPSD や AgentOPSD のような自己蒸留への入口になります。
03
2026-08-29
·
蒸留と圧縮
·
★ 会員
·
論文
·
12分で読めます
蒸留レシピ図鑑 — logit・feature・attention・self をどう使い分けるか
Distilling the Knowledge in a Neural Network
蒸留のレシピは「教師のどこを学生に合わせるか」で決まります。出力(logit)・中間層(FitNet)・注意行列・自己蒸留の4種を、1枚の表と4本の式で並べ、教師がAPI越しなのか同族アーキなのかといった条件から選び方を決める地図にします。
04
2026-08-29
·
蒸留と圧縮
·
★ 会員
·
論文
·
12分で読めます
蒸留レシピ図鑑 — logit・feature・attention・self をどう使い分けるか
Distilling the Knowledge in a Neural Network
蒸留のレシピは「教師のどこを学生に合わせるか」で決まります。出力(logit)・中間層(FitNet)・注意行列・自己蒸留の4種を、1枚の表と4本の式で並べ、教師がAPI越しなのか同族アーキなのかといった条件から選び方を決める地図にします。
05
2026-08-29
·
蒸留と圧縮
·
無料
·
論文
·
11分で読めます
蒸留の数学 — なぜ「柔らかい答え」から学べるのか
Distilling the Knowledge in a Neural Network
蒸留の損失はなぜ KL(教師||生徒) なのか、温度Tは何をしているのか、そして実装で必ず出てくる T² 倍は何の補正なのか。ソフトラベルが正解ラベルより多くを語る理由を、式の導出と動く図で1から追います。
06
2026-08-29
·
蒸留と圧縮
·
無料
·
論文
·
11分で読めます
蒸留の数学 — なぜ「柔らかい答え」から学べるのか
Distilling the Knowledge in a Neural Network
蒸留の損失はなぜ KL(教師||生徒) なのか、温度Tは何をしているのか、そして実装で必ず出てくる T² 倍は何の補正なのか。ソフトラベルが正解ラベルより多くを語る理由を、式の導出と動く図で1から追います。
07
2026-08-29
·
蒸留と圧縮
·
★ 会員
·
論文
·
14分で読めます
エージェントを蒸留する — 長い軌跡をどう圧縮するか
ReAct: Synergizing Reasoning and Acting in Language Models
エージェントの蒸留では、学ぶ単位が「一問一答」から「一局」に変わります。数万トークンの軌跡に対して返ってくる採点は最後の○×ひとつ。この落差をどう埋めるのか — ターン単位のクレジット割当、軌跡の濾過とオンポリシー化、ツール使用の継承を、前提知識ゼロから解きほぐし、長距離エージェントの論文群への地図にします。
08
2026-08-29
·
蒸留と圧縮
·
★ 会員
·
論文
·
10分で読めます
蒸留が失敗するとき — 容量ギャップと過信の伝染
DAPD: Dual-Anchored Policy Distillation
強い教師を使えば強い生徒ができる、とは限りません。器が小さいと平均だけが伝わる容量ギャップ、教師の自信ごと写す過信の伝染、教師が一度も通らない道を生徒が歩く分布シフト — 蒸留が壊れる3つの型を、前提知識ゼロから解きほぐします。
09
2026-08-29
·
蒸留と圧縮
·
★ 会員
·
論文
·
10分で読めます
蒸留が失敗するとき — 容量ギャップと過信の伝染
DAPD: Dual-Anchored Policy Distillation
強い教師を使えば強い生徒ができる、とは限りません。器が小さいと平均だけが伝わる容量ギャップ、教師の自信ごと写す過信の伝染、教師が一度も通らない道を生徒が歩く分布シフト — 蒸留が壊れる3つの型を、前提知識ゼロから解きほぐします。
10
2026-08-29
·
蒸留と圧縮
·
★ 会員
·
論文
·
11分で読めます
蒸留データの設計 — 教師に何を答えさせるか
DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning
蒸留で生徒の性能を決めるのは、教師の賢さより「教師に何を問うたか」です。合成データの作り方、カバレッジの設計、難問へ偏らせる理由、正しさのフィルタ、そしてDeepSeek-R1の蒸留がなぜ効いたのかを、前提知識ゼロから解説します。
11
2026-08-29
·
蒸留と圧縮
·
★ 会員
·
論文
·
11分で読めます
蒸留データの設計 — 教師に何を答えさせるか
DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning
蒸留で生徒の性能を決めるのは、教師の賢さより「教師に何を問うたか」です。合成データの作り方、カバレッジの設計、難問へ偏らせる理由、正しさのフィルタ、そしてDeepSeek-R1の蒸留がなぜ効いたのかを、前提知識ゼロから解説します。
12
2026-08-29
·
蒸留と圧縮
·
★ 会員
·
論文
·
15分で読めます
【実装】蒸留を自作する — 100行で小さなモデルを育てる
Distilling the Knowledge in a Neural Network
蒸留の損失は20行で書けます。にもかかわらず自作するとほぼ全員が同じ場所で転ぶ — KLの向き、reductionの選び方、T²の付け忘れ。教師の凍結から損失、訓練ループ、教師なしベースラインとの比較、温度スイープ、そして「実装が壊れていないこと」を確かめる4つの検算までを、100行のコードで通します。
13
2026-08-29
·
蒸留と圧縮
·
★ 会員
·
論文
·
15分で読めます
【実装】蒸留を自作する — 100行で小さなモデルを育てる
Distilling the Knowledge in a Neural Network
蒸留の損失は20行で書けます。にもかかわらず自作するとほぼ全員が同じ場所で転ぶ — KLの向き、reductionの選び方、T²の付け忘れ。教師の凍結から損失、訓練ループ、教師なしベースラインとの比較、温度スイープ、そして「実装が壊れていないこと」を確かめる4つの検算までを、100行のコードで通します。
14
2026-08-27
·
学習手法・アライメント
·
無料
·
論文
·
14分で読めます
学習が壊れた時の診断学 — loss発散・NaN・停滞の切り分け
On the difficulty of training Recurrent Neural Networks
学習が壊れる形は「発散」「NaN」「停滞」の3つしかありません。損失曲線の形から原因を絞り込む対応表を軸に、なぜ発散するのかを式と動く図で押さえ、NaNの発生地点を特定するコード、停滞の切り分け手順までを前提知識ゼロから解説します。
15
2026-08-27
·
学習手法・アライメント
·
無料
·
論文
·
14分で読めます
学習が壊れた時の診断学 — loss発散・NaN・停滞の切り分け
On the difficulty of training Recurrent Neural Networks
学習が壊れる形は「発散」「NaN」「停滞」の3つしかありません。損失曲線の形から原因を絞り込む対応表を軸に、なぜ発散するのかを式と動く図で押さえ、NaNの発生地点を特定するコード、停滞の切り分け手順までを前提知識ゼロから解説します。
16
2026-08-27
·
LLM — 大規模言語モデル
·
★ 会員
·
論文
·
13分で読めます
知識蒸留を1から — 大きなモデルを小さく写す
Distilling the Knowledge in a Neural Network
正解ラベルには「犬と猫は似ている」と書かれていません。でも訓練済みモデルの出力にはそれが入っている — この差が知識蒸留の全部です。ソフトラベルと温度つきsoftmax、T²の由来、系列レベル蒸留、合成データ蒸留、そしてDeepSeek-R1が推論の手続きごと小さいモデルへ写した話まで、前提知識ゼロから。
17
2026-08-27
·
LLM — 大規模言語モデル
·
★ 会員
·
論文
·
13分で読めます
知識蒸留を1から — 大きなモデルを小さく写す
Distilling the Knowledge in a Neural Network
正解ラベルには「犬と猫は似ている」と書かれていません。でも訓練済みモデルの出力にはそれが入っている — この差が知識蒸留の全部です。ソフトラベルと温度つきsoftmax、T²の由来、系列レベル蒸留、合成データ蒸留、そしてDeepSeek-R1が推論の手続きごと小さいモデルへ写した話まで、前提知識ゼロから。
18
2026-08-27
·
深層学習の基礎
·
★ 会員
·
論文
·
17分で読めます
ハイパーパラメータ探索 — 勘・グリッド・ベイズ最適化
Random Search for Hyper-Parameter Optimization
学習率やバッチサイズは勾配が教えてくれないので、探すしかありません。なぜグリッドサーチが弱いのか、探索空間を対数で切る理由、ベイズ最適化の獲得関数が何を数えているのか、早期打ち切りが探索アルゴリズムより効く理由を、Optunaのコードと現場の落とし穴まで含めて前提知識ゼロから解説します。
19
2026-08-27
·
深層学習の基礎
·
★ 会員
·
論文
·
17分で読めます
ハイパーパラメータ探索 — 勘・グリッド・ベイズ最適化
Random Search for Hyper-Parameter Optimization
学習率やバッチサイズは勾配が教えてくれないので、探すしかありません。なぜグリッドサーチが弱いのか、探索空間を対数で切る理由、ベイズ最適化の獲得関数が何を数えているのか、早期打ち切りが探索アルゴリズムより効く理由を、Optunaのコードと現場の落とし穴まで含めて前提知識ゼロから解説します。
20
2026-08-27
·
推論・高速化
·
★ 会員
·
論文
·
15分で読めます
GPUメモリ不足サバイバル — OOMの原因と対処の全パターン
Training Deep Nets with Sublinear Memory Cost
`CUDA out of memory` は、最後に失敗した確保だけを報告する不親切なエラーです。犯人はたいてい、すでに載っている側にいます。何がVRAMを食うのかを5つの箱に分けて数え、パラメータ1個あたり16バイトという学習の固定費を出し、そこから勾配チェックポイント・オプティマイザ圧縮・オフロード・KVキャッシュ管理・断片化まで、打ち手を副作用の小さい順に。
21
2026-08-27
·
学習手法・アライメント
·
★ 会員
·
論文
·
18分で読めます
DPOとその後 — RLHFを単純化する系譜
Direct Preference Optimization: Your Language Model is Secretly a Reward Model
報酬モデルを別に建てずに選好から直接学ぶDPOの導出を、KL制約付き最大化の閉形式解から一段ずつ追う。さらにDPOの過学習を数式で説明したIPO、ペアを要求しないKTO、価値モデルを捨ててオンラインへ戻ったGRPOまでを「何を消したか」で整理し、手元のデータの形から選ぶ基準をまとめる。
22
2026-08-27
·
学習手法・アライメント
·
★ 会員
·
論文
·
11分で読めます
継続学習と破滅的忘却 — 学び続けるモデルの難しさ
Overcoming catastrophic forgetting in neural networks
追加学習させると前にできていたことが崩れる「破滅的忘却」を、重みが共有資源であるという一点から説明する。EWC・リプレイ・LoRA差し替えという3つの処方を式と動く図で追い、それでも実務が「昔のデータを混ぜて学習し直す」に落ち着く理由までを前提知識なしで解説。
23
2026-08-25
·
深層学習の基礎
·
★ 会員
·
論文
·
20分で読めます
重みの初期化と正則化 — 学習が始まる条件・続く条件
Understanding the Difficulty of Training Deep Feedforward Neural Networks
同じ設計図でも、重みに入れた乱数の大きさひとつで学習は始まりも止まりもします。分散の伝播からXavier・He初期化を導き、続いてweight decayとdropoutが「学習が続く条件」をどう作るかを、動く図とPyTorch実装、現場の落とし穴まで含めて前提知識なしで解説します。
24
2026-08-25
·
深層学習の基礎
·
★ 会員
·
論文
·
20分で読めます
重みの初期化と正則化 — 学習が始まる条件・続く条件
Understanding the Difficulty of Training Deep Feedforward Neural Networks
同じ設計図でも、重みに入れた乱数の大きさひとつで学習は始まりも止まりもします。分散の伝播からXavier・He初期化を導き、続いてweight decayとdropoutが「学習が続く条件」をどう作るかを、動く図とPyTorch実装、現場の落とし穴まで含めて前提知識なしで解説します。
25
2026-08-25
·
深層学習の基礎
·
無料
·
論文
·
15分で読めます
活性化関数を1から — なぜ非線形が必要なのか
Delving Deep into Rectifiers: Surpassing Human-Level Performance on ImageNet Classification
層を何段積んでも、活性化関数がなければ1段と同じことしかできない——その一行の証明から始めて、sigmoidが捨てられReLUが勝ち、いまのLLMがSiLU/SwiGLUに落ち着くまでを、傾きを実際に触れる動く図とともに辿ります。
26
2026-08-25
·
深層学習の基礎
·
無料
·
論文
·
15分で読めます
活性化関数を1から — なぜ非線形が必要なのか
Delving Deep into Rectifiers: Surpassing Human-Level Performance on ImageNet Classification
層を何段積んでも、活性化関数がなければ1段と同じことしかできない——その一行の証明から始めて、sigmoidが捨てられReLUが勝ち、いまのLLMがSiLU/SwiGLUに落ち着くまでを、傾きを実際に触れる動く図とともに辿ります。
27
2026-08-22
·
深層学習の基礎
·
★ 会員
·
論文
·
13分で読めます
正規化レイヤー全史 — BatchNormからRMSNormまで
Batch Normalization: Accelerating Deep Network Training by Reducing Internal Covariate Shift
深層学習を「実際に深くできるもの」に変えた正規化レイヤーを前提知識ゼロから辿る。BatchNormが効く理由をめぐる内部共変量シフト論争、LayerNormがバッチ軸を捨てた理由、そしてLLMが一様にRMSNormへ行き着いた理由まで。
28
2026-08-22
·
深層学習の基礎
·
★ 会員
·
論文
·
13分で読めます
正規化レイヤー全史 — BatchNormからRMSNormまで
Batch Normalization: Accelerating Deep Network Training by Reducing Internal Covariate Shift
深層学習を「実際に深くできるもの」に変えた正規化レイヤーを前提知識ゼロから辿る。BatchNormが効く理由をめぐる内部共変量シフト論争、LayerNormがバッチ軸を捨てた理由、そしてLLMが一様にRMSNormへ行き着いた理由まで。
29
2026-08-22
·
学習手法・アライメント
·
★ 会員
·
論文
·
14分で読めます
混合精度学習 — fp16/bf16/fp8で壊れずに速くする
Mixed Precision Training
同じモデルを半分のビット数で学習させると、速くなる代わりに勾配が0やinfに化けます。壊れ方の正体(アンダーフローとオーバーフロー)から出発し、loss scalingが何をしている一手なのか、bf16はなぜそれを不要にしたのか、fp8で何が戻ってきたのかを順に。最後はPyTorch AMPの設定と、クリップ順序を間違えて静かに事故る典型例まで。
30
2026-08-22
·
学習手法・アライメント
·
★ 会員
·
論文
·
14分で読めます
混合精度学習 — fp16/bf16/fp8で壊れずに速くする
Mixed Precision Training
同じモデルを半分のビット数で学習させると、速くなる代わりに勾配が0やinfに化けます。壊れ方の正体(アンダーフローとオーバーフロー)から出発し、loss scalingが何をしている一手なのか、bf16はなぜそれを不要にしたのか、fp8で何が戻ってきたのかを順に。最後はPyTorch AMPの設定と、クリップ順序を間違えて静かに事故る典型例まで。
31
2026-08-22
·
学習手法・アライメント
·
★ 会員
·
論文
·
14分で読めます
学習率スケジュール — warmupとcosineの理由
Attention Is All You Need
学習率は固定の数字ではなく、訓練の最初から最後まで動かす曲線です。なぜ最初にわざと遅く走る(warmup)のか、なぜ余弦カーブで落とす(cosine)のか、バッチサイズを変えたら何を一緒に動かすのか。式・動く図・PyTorch実装・現場の落とし穴まで前提知識なしで解説します。
32
2026-08-22
·
学習手法・アライメント
·
★ 会員
·
論文
·
14分で読めます
学習率スケジュール — warmupとcosineの理由
Attention Is All You Need
学習率は固定の数字ではなく、訓練の最初から最後まで動かす曲線です。なぜ最初にわざと遅く走る(warmup)のか、なぜ余弦カーブで落とす(cosine)のか、バッチサイズを変えたら何を一緒に動かすのか。式・動く図・PyTorch実装・現場の落とし穴まで前提知識なしで解説します。
33
2026-08-06
·
並列・分散
·
★ 会員
·
13分で読めます
分散学習を1から — データ並列・モデル並列・通信がボトルネックになるとき
なぜ1台に載らないのかをメモリの内訳から出発し、データ並列とall-reduce、ZeRO/FSDPが何を分割するのか、テンソル並列とパイプライン並列を順に。最後は通信量と計算量の比で「どこで頭打ちになるか」を自分で見積もり、勾配蓄積・NCCLの設定・ハングの切り分けまで降ります。