用語集 › on-policy
GLOSSARY
on-policy
方策オン型。今の方策自身が集めた経験で学ぶ
9本の論文題名に登場
定義
学習に使うデータを、いま改善しようとしている方策自身が生成した経験に限る強化学習の方式。訓練分布と方策が一致するため挙動が安定しやすい反面、更新のたびにデータを取り直す必要がありサンプル効率は低い。過去や他者のデータを再利用する off-policy と対をなす。
論文題名での読み方
強化学習の学習方式
この語が出てくる解説
- 論文解説: 訓練データが1問でも、オンポリシー蒸留は数百ステップ伸び続けるRethinking On-Policy Distillation of Large Language Models II: One Training Example
- 論文解説: SecOPD — トークン1個ずつ採点して、適応的プロンプトインジェクションを1桁下げるSecOPD: Mitigating Adaptive Prompt Injections by On-Policy Distillation
- 論文解説: On-Policy Distillationは本当に蒸留しているのか — ノイズまみれの教師から自己改善へDoes On-Policy Distillation Really Distill? From Noisy Teacher to Self-Improvement