PaperLens
紙
学生版
社会人版
JA
EN
◐
Googleでログイン
ログイン
読む
ホーム
論文精読
新着
教科書
深める
体系
ラボ
業界地図
みんなの貢献
用語集
自分
探す
読み放題
マイページ
#evolution-strategies
1 記事
01
2026-08-22
·
推論・高速化
·
★ 会員
·
論文
·
23分で読めます
論文解説: Agentic ESOpt — 逆伝播をやめて「モデルを揺らす」だけで、長丁場のLLMエージェントを鍛える
Agentic ESOpt: Fine-Tuning Long-Horizon LLM Agents with Minimal GPU Requirements
勾配を一切計算せず、パラメータにノイズを足した分身をG体走らせて良かった方向へ寄せるだけ——推論と同じGPUメモリ(8.41GB)で27Bの全パラメータを更新し、15手必要な数独でGRPOに12.50ポイント差をつけたNUSらの論文を、1から解説する。