PaperLens
紙
学生版
社会人版
JA
EN
◐
Googleでログイン
ログイン
読む
ホーム
論文精読
新着
教科書
深める
体系
ラボ
業界地図
みんなの貢献
用語集
自分
探す
読み放題
マイページ
#constitutional-ai
1 記事
01
2026-08-27
·
LLM — 大規模言語モデル
·
★ 会員
·
論文
·
10分で読めます
アライメント概説 — RLHFからConstitutional AIまで
Training language models to follow instructions with human feedback
アライメントとは何と何を揃える作業なのかを、目的・仕様・代理の3層に分けて整理する。RLHFもDPOもConstitutional AIも「報酬 − 参照モデルから離れた罰」という同じ骨格を解いていること、代理を押し切ると必ず報酬ハッキングが出ること、無害さを強めた分だけ有用さが削れる取引の構造を、式と実装の落とし穴まで含めて解説する。