JA EN

#constitutional-ai

1 記事

01 ·LLM — 大規模言語モデル·★ 会員·論文·10分で読めます アライメント概説 — RLHFからConstitutional AIまで Training language models to follow instructions with human feedback アライメントとは何と何を揃える作業なのかを、目的・仕様・代理の3層に分けて整理する。RLHFもDPOもConstitutional AIも「報酬 − 参照モデルから離れた罰」という同じ骨格を解いていること、代理を押し切ると必ず報酬ハッキングが出ること、無害さを強めた分だけ有用さが削れる取引の構造を、式と実装の落とし穴まで含めて解説する。