JA EN

#off-policy

1 記事

01 ·推論・高速化·★ 会員·論文·12分で読めます 論文解説 WarpSAC: 強化学習の「安定化装置」は、データが潤沢になると足枷に変わる WarpSAC: Towards the Pinnacle of Scalable Off-policy RL by Rethinking Exploration and Exploitation GPU並列シミュレータで経験データが桁違いに増えると、SACの正規化やclipped double-Qといった「安定化装置」は助けから足枷に変わる。論文は3本の軸を切り分け、データ状況に応じて安定化装置を外すという処方箋(WarpSAC)を示した。