JA EN
体系 › AI

学習手法・アライメント

事前学習・SFT・RLHF/DPO・ファインチューニング

01 ·学習手法・アライメント·★ 会員·論文·13分で読めます Instruction Tuning と RLHF を1から解説 — 指示に従うモデルはどう作られるか Training language models to follow instructions with human feedback 事前学習しただけのモデルが指示に従わないのは能力不足ではなく目的関数のずれ。InstructGPT論文(Ouyang et al., 2022)の本文だけを根拠に、SFT→報酬モデル→強化学習の3段を式まで追い、「1.3Bが175Bを人間評価で上回った」という主張と、論文自身が認めた限界を§番号付きで読む。 02 ·学習手法・アライメント·★ 会員·論文·14分で読めます 学習率スケジュール — warmupとcosineの理由 Attention Is All You Need 学習率は固定の数字ではなく、訓練の最初から最後まで動かす曲線です。なぜ最初にわざと遅く走る(warmup)のか、なぜ余弦カーブで落とす(cosine)のか、バッチサイズを変えたら何を一緒に動かすのか。式・動く図・PyTorch実装・現場の落とし穴まで前提知識なしで解説します。 03 ·学習手法・アライメント·★ 会員·論文·14分で読めます 混合精度学習 — fp16/bf16/fp8で壊れずに速くする Mixed Precision Training 同じモデルを半分のビット数で学習させると、速くなる代わりに勾配が0やinfに化けます。壊れ方の正体(アンダーフローとオーバーフロー)から出発し、loss scalingが何をしている一手なのか、bf16はなぜそれを不要にしたのか、fp8で何が戻ってきたのかを順に。最後はPyTorch AMPの設定と、クリップ順序を間違えて静かに事故る典型例まで。 04 ·学習手法・アライメント·★ 会員·論文·12分で読めます データセット構築の実務 — 集める・洗う・混ぜる Self-Instruct: Aligning Language Models with Self-Generated Instructions モデルを作る仕事の大半は、実はデータセットを作る仕事です。母集団の設計、品質フィルタの閾値の決め方、テストへの漏れの検査、配合比が決めてしまう周回数、合成データの使いどころ、アノテーションのガイドライン設計までを、前提知識ゼロから1から解説します。 05 ·学習手法・アライメント·★ 会員·論文·18分で読めます DPOとその後 — RLHFを単純化する系譜 Direct Preference Optimization: Your Language Model is Secretly a Reward Model 報酬モデルを別に建てずに選好から直接学ぶDPOの導出を、KL制約付き最大化の閉形式解から一段ずつ追う。さらにDPOの過学習を数式で説明したIPO、ペアを要求しないKTO、価値モデルを捨ててオンラインへ戻ったGRPOまでを「何を消したか」で整理し、手元のデータの形から選ぶ基準をまとめる。 06 ·学習手法・アライメント·★ 会員·論文·11分で読めます 継続学習と破滅的忘却 — 学び続けるモデルの難しさ Overcoming catastrophic forgetting in neural networks 追加学習させると前にできていたことが崩れる「破滅的忘却」を、重みが共有資源であるという一点から説明する。EWC・リプレイ・LoRA差し替えという3つの処方を式と動く図で追い、それでも実務が「昔のデータを混ぜて学習し直す」に落ち着く理由までを前提知識なしで解説。 07 ·学習手法・アライメント·無料·論文·14分で読めます 学習が壊れた時の診断学 — loss発散・NaN・停滞の切り分け On the difficulty of training Recurrent Neural Networks 学習が壊れる形は「発散」「NaN」「停滞」の3つしかありません。損失曲線の形から原因を絞り込む対応表を軸に、なぜ発散するのかを式と動く図で押さえ、NaNの発生地点を特定するコード、停滞の切り分け手順までを前提知識ゼロから解説します。 08 ·学習手法・アライメント·★ 会員·15分で読めます データとモデルのバージョン管理 — 再現できない実験は存在しない 「精度92%出ました」を半年後に再現できないなら、それは実験ではなく逸話です。中身からidを作るコンテンツアドレス、入力から出力への系譜(リネージ)、そして「どこまで固定すると割に合うか」の3段階を、ハッシュの式・マニフェストのコード・現場の落とし穴まで前提知識ゼロから解説します。 09 ·学習手法・アライメント·★ 会員·論文·14分で読めます 論文解説: ABSeeker — 答えから逆算して「良い一手」を採点する、長距離検索エージェントの訓練法 ABSeeker: Training Long-Horizon Search Agents via Answer-Backtracked Credit Assignment 何十手もWeb検索を重ねるエージェントの訓練では「最後に正解したか」しか報酬がなく、途中の良い一手も悪い一手も同じ扱いになる。答えから手がかりを逆算して全ステップを採点するABC(Answer-Backtracked Credit Assignment)と、それで訓練された4BモデルABSeekerを、論文本文に沿って1から解説する。 10 ·学習手法・アライメント·★ 会員·論文·12分で読めます 論文解説 PAWBench — 動画生成は「起こりうる未来の確率」まで当てられるのか PAWBench: How Far Are We from Probabilistically Aligned World Modeling? 動画生成モデルを世界モデルと呼ぶなら、もっともらしい1本ではなく、同じ初期状態から繰り返し生成したときの分布が正しくなければならない。PAWBench はその確率的整合を50シナリオ・11モデルで測り、どのモデルも要件を揃えられないことを示した論文です。 11 ·学習手法・アライメント·★ 会員·論文·15分で読めます 論文解説: PaperGym — 論文1本を「採点基準つきの練習場」に変えて研究計画を学習させる PaperGym: Rubric-Centered Evolution for Research-Plan Generation 研究計画には正解がないので強化学習の「環境」が作れない。論文を4つの引き出しに分解し、問いと採点基準を別々の引き出しから作ることで、言い換えでは点が取れない練習場を20,000本ぶん自動生成した研究を、前提知識ゼロから解説する。 12 ·学習手法・アライメント·★ 会員·論文·18分で読めます 論文解説: StudentSim — 「その生徒そのもの」を訓練で作る学習者シミュレータ StudentSim: Training LLM-based Student Simulators AI家庭教師を鍛えるための『練習台になる生徒』を、実際の学習記録から訓練して作る枠組み。行動忠実度(F)と指導反応性(R)という2軸の定義から、プール学習→生徒別特化の2段パイプライン、報酬モデルとしての応用までを1から解説する。 13 ·学習手法・アライメント·★ 会員·論文·19分で読めます 論文解説: It Takes Two to Match — 検索の「両側」をRLで共進化させるCoGR It Takes Two to Match: Co-Evolving Generative Retriever with Reinforcement Learning 検索の一段目を、クエリ側とアイテム側の2つのLLMに「キーワードを書かせる」ことで作り直す論文。両者を強化学習で交互に鍛えて語彙を歩み寄らせるCoGRを、前提知識ゼロから解説する。

執筆予定