JA EN

#instruction-tuning

1 記事

01 ·学習手法・アライメント·★ 会員·論文·13分で読めます Instruction Tuning と RLHF を1から解説 — 指示に従うモデルはどう作られるか Training language models to follow instructions with human feedback 事前学習しただけのモデルが指示に従わないのは能力不足ではなく目的関数のずれ。InstructGPT論文(Ouyang et al., 2022)の本文だけを根拠に、SFT→報酬モデル→強化学習の3段を式まで追い、「1.3Bが175Bを人間評価で上回った」という主張と、論文自身が認めた限界を§番号付きで読む。