JA EN

#alignment

6 記事

01 ·エージェント·★ 会員·論文·15分で読めます 論文解説: SecOPD — トークン1個ずつ採点して、適応的プロンプトインジェクションを1桁下げる SecOPD: Mitigating Adaptive Prompt Injections by On-Policy Distillation 防御用に微調整したLLMも、適応的なプロンプトインジェクションにはほぼ100%破られてきた。原因は「出力全体に1つの点数」しか与えない訓練にある。注入前のきれいな入力を見た教師にトークン単位で採点させるSecOPDを、前提知識ゼロから解説する。 02 ·評価と審判·★ 会員·論文·12分で読めます 報酬ハッキング — 測り方を決めると、そこが壊れる Concrete Problems in AI Safety 指標を決めた瞬間から、その指標は壊れ始める。Goodhartの法則がなぜ統計的に避けられないのかを代理報酬のずれから説明し、ボートレースの周回からRLHFの冗長化・おべっか・テストのハードコードまで実例で追い、最適化圧と真の性能の乖離を検出する方法とKL正則化などの現実的な対策を扱う。 03 ·学習手法・アライメント·★ 会員·論文·18分で読めます DPOとその後 — RLHFを単純化する系譜 Direct Preference Optimization: Your Language Model is Secretly a Reward Model 報酬モデルを別に建てずに選好から直接学ぶDPOの導出を、KL制約付き最大化の閉形式解から一段ずつ追う。さらにDPOの過学習を数式で説明したIPO、ペアを要求しないKTO、価値モデルを捨ててオンラインへ戻ったGRPOまでを「何を消したか」で整理し、手元のデータの形から選ぶ基準をまとめる。 04 ·LLM — 大規模言語モデル·★ 会員·論文·10分で読めます アライメント概説 — RLHFからConstitutional AIまで Training language models to follow instructions with human feedback アライメントとは何と何を揃える作業なのかを、目的・仕様・代理の3層に分けて整理する。RLHFもDPOもConstitutional AIも「報酬 − 参照モデルから離れた罰」という同じ骨格を解いていること、代理を押し切ると必ず報酬ハッキングが出ること、無害さを強めた分だけ有用さが削れる取引の構造を、式と実装の落とし穴まで含めて解説する。 05 ·学習手法・アライメント·★ 会員·論文·13分で読めます Instruction Tuning と RLHF を1から解説 — 指示に従うモデルはどう作られるか Training language models to follow instructions with human feedback 事前学習しただけのモデルが指示に従わないのは能力不足ではなく目的関数のずれ。InstructGPT論文(Ouyang et al., 2022)の本文だけを根拠に、SFT→報酬モデル→強化学習の3段を式まで追い、「1.3Bが175Bを人間評価で上回った」という主張と、論文自身が認めた限界を§番号付きで読む。 06 ·学習手法・アライメント·★ 会員·論文·13分で読めます Instruction Tuning と RLHF を1から解説 — 指示に従うモデルはどう作られるか Training language models to follow instructions with human feedback 事前学習しただけのモデルが指示に従わないのは能力不足ではなく目的関数のずれ。InstructGPT論文(Ouyang et al., 2022)の本文だけを根拠に、SFT→報酬モデル→強化学習の3段を式まで追い、「1.3Bが175Bを人間評価で上回った」という主張と、論文自身が認めた限界を§番号付きで読む。