用語集 › policy
GLOSSARY
policy
一般には方針。RLでは行動を決める関数
4本の論文題名に登場
定義
強化学習で、状態を受け取ってどの行動を取るかを決める関数のこと。学習の対象はこの関数そのもので、方策勾配法などはこれを直接更新する。言語モデルをRLで調整する場合はモデル自身が方策にあたる。日常語の「方針・規約」とは別の技術用語。
論文題名での読み方
強化学習の中心概念
この語が出てくる解説
- 論文解説: 訓練データが1問でも、オンポリシー蒸留は数百ステップ伸び続けるRethinking On-Policy Distillation of Large Language Models II: One Training Example
- 論文解説: SecOPD — トークン1個ずつ採点して、適応的プロンプトインジェクションを1桁下げるSecOPD: Mitigating Adaptive Prompt Injections by On-Policy Distillation
- 論文解説: On-Policy Distillationは本当に蒸留しているのか — ノイズまみれの教師から自己改善へDoes On-Policy Distillation Really Distill? From Noisy Teacher to Self-Improvement