JA EN
体系エージェント
·★ 会員·論文·11分で読めます

論文解説: EnvACE — 環境まで自分で演じる「world rehearsal」がエージェントRLの環境不足を解く

ツール実行環境を一切呼ばずに、LLM自身が「行動役」と「環境役」を交互に演じて強化学習する EnvACE を論文本文から解説。役割別GRPO、テスト時の脳内リハーサル、4ベンチマークでの結果と限界まで。

対象textタスクagents

EnvACE: Internalizing Environment Dynamics via World Rehearsal for Agentic Reinforcement Learning

一次資料 — この記事の根拠

論文の発表 2026-08-06この解説の公開 2026-08-12同月

EnvACE: Internalizing Environment Dynamics via World Rehearsal for Agentic Reinforcement LearningZishan Xu, Zhiyuan Yao, Yuxin Chen ほか · 2026-08-06 · v1arXiv:2608.06197論文ページ·PDF
原文の要旨(Abstract)を読む

Training large language model agents for long-horizon tool use typically relies on interactions with real or synthesized executable environments, whose construction and verification are costly, or on external simulators that are difficult to ground. We introduce EnvACE, an agentic reinforcement learning method that replaces external environment interaction during training with world rehearsal. The policy alternates between acting and rehearsal: it first generates a tool call, then plays the role of the environment to produce the response induced by that action, and conditions subsequent decisions on the rehearsed response. Both roles are jointly optimized end-to-end using task-success rewards. Through world rehearsal, the policy internalizes the relationship between actions and their environment responses in its parameters, yielding an agent world model that directly supports decision making. Across BFCL-v4, tau^2-Bench, VitaBench, and FinMCP-Bench, EnvACE achieves strong and transferable performance, outperforming environment-scaling baselines in the overall evaluation. Controlled studies further show that world rehearsal consistently improves policy learning across model scales. At test time, the internalized world model enables private rehearsal before committed execution, yielding further gains under a moderate rehearsal budget without additional external interaction. Our findings establish world rehearsal as a new path toward scaling LLM agent training beyond the constraints of external environments. Our code is publicly available at https://github.com/Within-yao/EnvACE.


素振りだけで上達する、は可能か

将棋の棋士は、盤に駒を並べなくても頭の中で対局できます。「この手を指せば、相手はこう返すはず」という応手の予測が頭に入っているからです。強い棋士は「指し手の選び方」だけでなく、「盤面が自分の手にどう反応するか」まで内面化している、と言い換えられます。

LLMエージェント——外部ツールを呼び出しながらタスクをこなすAI——の訓練に、この発想をそのまま持ち込んだのが今回の論文 EnvACE です。従来のエージェント訓練は、実際に動くAPIやデータベースを相手に何度も対話して学ぶのが基本でした。EnvACEは、環境の応答までモデル自身に演じさせる「world rehearsal(世界リハーサル)」によって、訓練中に外部環境を一度も呼ばずにツール使用を学習します。そして4つのエージェント系ベンチマークで、環境を作り込む従来手法を総合評価で上回った、というのが論文の主な主張です(Abstract)。

何が問題なのか: 「練習相手」が高くつく

ツールを使うエージェントを強化学習(RL)で鍛えるには、行動のたびに「環境からの応答」が要ります。tool call を投げたら結果が返り、それを見て次の手を打つ。この繰り返しで軌跡(trajectory)ができ、最後にタスク成功の報酬が与えられます。問題は、その応答を誰が返すのかです。

論文は既存の選択肢を2系統に整理しています(§1)。

  1. 実行可能な環境を用意する: 本物または合成したAPI・DB。応答は正確だが、構築と検証のコストが高く、環境が複雑になるほど正しさの検証自体が難しくなる。
  2. LLMシミュレータに応答させる: 安くて柔軟だが、応答が不正確・非一貫になりがちで、結局は実環境による接地(grounding)が必要になる。

どちらの道も「外部の応答供給者」への依存から抜けられず、環境をモデル化する能力はエージェント本体の外側に置かれたまま——これが論文の問題意識です。優れたエージェントは、タスクを解くだけでなく「環境が自分の行動にどう応答するか」も自らモデル化すべきだ、と論文は主張します(§1)。

発想の転換: 一人二役で軌跡を紡ぐ

EnvACEの答えはシンプルで、1つのポリシー(同じLLM)に2つの役を演じさせることです(§4.1)。

リハーサルで生成した応答を履歴に追記し、次の行動はその自作の応答を前提に決める。行動→応答→行動→…と、軌跡全体をモデルが独りで紡いでいきます。もはや外部との対話ではなく「ポリシー自身が展開する過程」です。役はプロンプト上の役割指定で切り替わりますが、パラメータは共有。訓練を重ねるうちに「この操作をすると環境はこう返す」という対応関係がパラメータに刻まれ、ポリシーそのものがエージェント用の世界モデルになる——これが表題の「内面化(internalize)」の意味です。

両役とも中身はLLMのトークン生成なので、出力の散らばりはサンプリング温度で制御します。実際、論文では実験の目的に応じて役割ごとに温度を使い分けています(行動空間を広く探索したい実験では両役とも温度1.0、再現性を重視する役は0.01など。§5.1)。

FIG 1温度が高いほど出力分布は平らになり、リハーサルされる「環境の応答」も多様になる。低くすれば決定的になり再現性が上がる

仕組みを式で追う

論文はツール対話タスクを有限ホライズンのPOMDP(部分観測マルコフ決定過程)として定式化します(§3)。各ステップ tt で、ポリシー πθ\pi_\theta は履歴 hth_t から行動を選び、通常なら環境が観測を返します。EnvACEはこの「観測を返す側」もポリシーに割り当てます(§4.1)。まず行動役が動きます。

はステップ の行動(tool call や最終回答)、 はそれまでの対話履歴、 は「行動役として振る舞え」という役割指定です。つまり「これまでに起きたことを全部見て、行動役の顔で次の一手を出す」と言っているだけの式です。 は「確率的に選ぶ」の意味なので、同じ履歴からでもロールアウトごとに違う手が出ます。続いてリハーサル役が応答を作ります。

この先にあるもの

§

ここから先は会員限定です

解説記事371本・教科書26章・学生モード48単元・論文精読6本が、月額¥490ですべて読み放題になります。新しい解説は毎日3本ずつ増えます。いつでも解約でき、解約後も期間の終わりまで読めます。

会員の方はログインすると続きが表示されます

参考文献

  1. Zishan Xu, Zhiyuan Yao, Yuxin Chen, Yifu Guo et al.. (2026-08-06) EnvACE: Internalizing Environment Dynamics via World Rehearsal for Agentic Reinforcement Learning. arXiv:2608.06197論文ページ·PDF

本記事は上記論文の本文にもとづいて執筆しています。数値・主張は原典を優先してください。

コメント

コメントにはログインが必要です