PaperLens
紙
学生版
社会人版
JA
EN
◐
Googleでログイン
ログイン
読む
ホーム
論文精読
新着
教科書
深める
体系
ラボ
業界地図
みんなの貢献
用語集
自分
探す
読み放題
マイページ
#multi-objective
1 記事
01
2026-08-21
·
LLM — 大規模言語モデル
·
★ 会員
·
論文
·
16分で読めます
論文解説: SA-MRPO — 満点の科目を勉強し続けるな。飽和した報酬から勾配を引きはがす
Learn What's Left, Not What's Mastered: Saturation Aware Advantage Reweighting for Multi-Reward Policy Optimization
報酬を複数使うRL学習では、すでに満点に近い目的にも勾配予算が配られ続ける。SA-MRPO (arXiv:2608.16072) は目的ごとの「飽和率」を測って重みを割り引き、伸びしろの残る目的へ最適化の力を回す。論文本文だけを根拠に、仕組みと限界を解説する。