JA EN

#preference-learning

1 記事

01 ·学習手法・アライメント·★ 会員·論文·18分で読めます DPOとその後 — RLHFを単純化する系譜 Direct Preference Optimization: Your Language Model is Secretly a Reward Model 報酬モデルを別に建てずに選好から直接学ぶDPOの導出を、KL制約付き最大化の閉形式解から一段ずつ追う。さらにDPOの過学習を数式で説明したIPO、ペアを要求しないKTO、価値モデルを捨ててオンラインへ戻ったGRPOまでを「何を消したか」で整理し、手元のデータの形から選ぶ基準をまとめる。