用語集 › reward
GLOSSARY
reward
報酬。強化学習で行動の良さを表す値
5本の論文題名に登場
定義
強化学習で、ある行動や出力がどれだけ望ましいかを表す数値の信号。方策はこの値の期待値を上げる方向に更新される。言語モデルでは人間の選好から学んだ報酬モデルが人手評価の代わりを務めるが、報酬の抜け穴を突く報酬ハッキングが起きやすく、設計の質がそのまま挙動に出る。
論文題名での読み方
強化学習の学習信号
この語が出てくる解説
- DPOとその後 — RLHFを単純化する系譜Direct Preference Optimization: Your Language Model is Secretly a Reward Model
- 論文解説: SA-MRPO — 満点の科目を勉強し続けるな。飽和した報酬から勾配を引きはがすLearn What's Left, Not What's Mastered: Saturation Aware Advantage Reweighting for Multi-Reward Policy Optimization
- 論文解説: OSReward — AIの「採点者」は信用できるか。コンピュータ操作エージェントの報酬を測り直すOSReward: Instituting Standardized Evaluation for Cross-Platform Computer-Use Reward Models