JA EN

#multi-objective

1 記事

01 ·LLM — 大規模言語モデル·★ 会員·論文·16分で読めます 論文解説: SA-MRPO — 満点の科目を勉強し続けるな。飽和した報酬から勾配を引きはがす Learn What's Left, Not What's Mastered: Saturation Aware Advantage Reweighting for Multi-Reward Policy Optimization 報酬を複数使うRL学習では、すでに満点に近い目的にも勾配予算が配られ続ける。SA-MRPO (arXiv:2608.16072) は目的ごとの「飽和率」を測って重みを割り引き、伸びしろの残る目的へ最適化の力を回す。論文本文だけを根拠に、仕組みと限界を解説する。