◉ CLOSE READING
ReAct: 推論と行動を相乗させる言語モデル
ReAct: Synergizing Reasoning and Acting in Language Models
Abstract要旨
While large language models (LLMs) have demonstrated impressive performance across tasks in language understanding and interactive decision making, their abilities for reasoning (e.g. chain-of-thought prompting) and acting (e.g. action plan generation) have primarily been studied as separate topics.
大規模言語モデル(LLM)は言語理解でも対話的な意思決定でも目覚ましい性能を見せてきたが、その「推論する力」(chain-of-thoughtプロンプトなど)と「行動する力」(行動計画の生成など)は、これまで主に別々の話題として研究されてきた。
While で始まる1文目は要旨の定型で、「〜ではあるが」と既存研究をいったん認める型。この論文が埋めたい溝は have primarily been studied as separate topics(別々に研究されてきた)の一語に集約されていて、以降の全部がこの分離を解消する話になる。e.g. の後に具体例を1つだけ挿す書き方も定型なので、括弧の中は読み飛ばして骨だけ拾える。
interactive decision making対話的な意思決定
環境から観測を受け取り、行動を返す、を繰り返して目標に到達する問題設定
chain-of-thought prompting思考連鎖プロンプト
答えの前に途中の考えを文章で書かせる指示の出し方
In this paper, we explore the use of LLMs to generate both reasoning traces and task-specific actions in an interleaved manner, allowing for greater synergy between the two: reasoning traces help the model induce, track, and update action plans as well as handle exceptions, while actions allow it to interface with and gather additional information from external sources such as knowledge bases or environments.
本論文では、推論の軌跡とタスク固有の行動を交互に生成させるようLLMを使うことを探る。こうすると両者の相乗が強まる。推論の軌跡は行動計画を立て、追跡し、更新するのを助け、例外の処理も助ける。一方で行動は、知識ベースや環境といった外部の情報源に接続し、そこから追加の情報を集めることを可能にする。
コロンの後ろが主張の中身。A help …, while B allow … と対句で書くことで「推論←→行動」の双方向性を一文で示している。in an interleaved manner(交互に)が手法名 ReAct の実体そのもので、ここを読み落とすと以降の図がすべて分からなくなる。induce, track, and update の3語並列は論文でよく使う「動詞の三つ揃え」で、訳すときは無理に1語に潰さない。
interleaved交互に差し挟んだ
2種類のものを1本の列の中で入れ違いに並べること
reasoning trace推論の軌跡
モデルが出力した考えの連なり。結果ではなく過程そのものを指す
synergy相乗
片方ずつより組み合わせた方が良くなること。題名の Synergizing の名詞形
We apply our approach, named ReAct, to a diverse set of language and decision making tasks and demonstrate its effectiveness over state-of-the-art baselines in addition to improved human interpretability and trustworthiness.
この手法を ReAct と名付け、言語タスクと意思決定タスクの幅広い集合に適用して、最先端のベースラインを上回る有効性を示す。加えて、人間から見た解釈しやすさと信頼性も向上する。
手法名を導入する定型は our approach, named X。demonstrate its effectiveness over 〜 は「〜より効くことを示す」で、比較対象は必ず over の後ろに来る。in addition to 以下は性能とは別軸の売り(人が読めること)で、この論文が後年よく引かれた理由でもある。
state-of-the-art baseline最先端のベースライン
比較対象として置く、その時点で最も強い既存手法
前提知識 — prompting と in-context example
この論文の実験はモデルを訓練し直していない。重みは固定したまま、入力の冒頭に「お手本」を数個貼り付けて、その続きを書かせているだけ。この貼り付ける手本を in-context example(文脈内の例)と呼び、やり方全体を prompting と呼ぶ。
手本が数個なら few-shot、1個なら one-shot。ReAct の場合、この手本は「Thought(考え) → Action(行動) → Observation(観測)」を人間が手で書いた一連の記録で、モデルは同じ形式を真似して続きを書く。
重みを更新する fine-tuning(微調整)は、この論文では3章の後半でだけ追加実験として出てくる。
Concretely, on question answering (HotpotQA) and fact verification (Fever), ReAct overcomes prevalent issues of hallucination and error propagation in chain-of-thought reasoning by interacting with a simple Wikipedia API, and generating human-like task-solving trajectories that are more interpretable than baselines without reasoning traces.
具体的には、質問応答(HotpotQA)と事実検証(Fever)において、ReAct は単純な Wikipedia API とやり取りすることで、chain-of-thought 推論に蔓延する幻覚と誤りの伝播という問題を克服し、推論の軌跡を持たないベースラインより解釈しやすい、人間らしい問題解決の軌跡を生成する。
Concretely は「ここから数字と具体例に入る」という合図で、要旨の後半はほぼ必ずこの語か Specifically で始まる。overcome A by doing B の型で、克服する問題(幻覚・誤りの伝播)と手段(Wikipedia API との対話)が一文に同居しているので、by の前後で切って読むと速い。prevalent は「あちこちで見られる」で、批判をやわらかく言う語。
hallucination幻覚
モデルが事実でないことを事実として書いてしまうこと
error propagation誤りの伝播
途中の1つの誤りが後続の推論を全部引きずって壊すこと
Furthermore, on two interactive decision making benchmarks (ALFWorld and WebShop), ReAct outperforms imitation and reinforcement learning methods by an absolute success rate of 34% and 10% respectively, while being prompted with only one or two in-context examples.
さらに、2つの対話的意思決定ベンチマーク(ALFWorld と WebShop)では、ReAct は模倣学習・強化学習の手法を、成功率の絶対値でそれぞれ34%と10%上回る。しかもプロンプトに入れた手本は1〜2個だけである。
by an absolute success rate of 34% の absolute は「相対改善率ではなく差そのもの」という宣言で、論文で数字を盛らない誠実さを示す語。respectively は直前に並べた2つの対象に順番どおり対応させる語で、これを見たら必ず前の並びを数え直す。while being prompted with only … は「たったこれだけの入力で」という譲歩節で、主張の効き目はここにある。
absolute success rate成功率の絶対値
改善幅をパーセントポイントで示したもの。相対的な倍率ではない
benchmarkベンチマーク
手法どうしを同じ条件で比べるための標準タスクとデータ
1 Introduction序論
A unique feature of human intelligence is the ability to seamlessly combine task-oriented actions with verbal reasoning (or inner speech, Alderson-Day & Fernyhough, 2015), which has been theorized to play an important role in human cognition for enabling self-regulation or strategization (Vygotsky, 1987; Luria, 1965; Fernyhough, 2010) and maintaining a working memory (Baddeley, 1992).
人間の知能に固有の特徴のひとつは、課題に向けた行動と言語による推論(あるいは内言)を、継ぎ目なく組み合わせられることである。これは人間の認知において、自己制御や戦略立案を可能にし、作業記憶を保持するうえで重要な役割を果たすと理論づけられてきた。
AI論文の序論が心理学の引用から始まるのは、手法の動機を「人間はそうしている」に置く型。which has been theorized to 〜 は「〜と理論づけられてきた」で、自分の主張ではなく他分野の定説を借りていることを明示する受動態。ここで出た combine A with B が、そのままこの論文の設計思想になる。
verbal reasoning言語による推論
頭の中で言葉にして考えること。ここでは inner speech と同義に使われている
working memory作業記憶
作業中の情報を一時的に保持しておく心的な作業台
Consider the example of cooking up a dish in the kitchen. Between any two specific actions, we may reason in language in order to track progress (“now that everything is cut, I should heat up the pot of water”), to handle exceptions or adjust the plan according to the situation (“I don’t have salt, so let me use soy sauce and pepper instead”), and to realize when external information is needed (“how do I prepare dough? Let me search on the Internet”).
台所で料理を作る場面を考えてみよう。ある行動と次の行動のあいだで、私たちは言語で考える。進み具合を追うため(「全部切り終わったから、次は湯を沸かそう」)、例外に対処したり状況に応じて計画を直すため(「塩がないから、代わりに醤油と胡椒でいこう」)、そして外部の情報が要ると気づくため(「生地はどう作るんだったか。ネットで調べよう」)。
Consider the example of 〜 は読者を具体例に引き込む常套句。ここが重要なのは、括弧内の3つの引用が後の Section 2 に出てくる「思考の種類」(進捗追跡・例外処理・情報探索)とそのまま対応している点で、序論の比喩が手法の設計仕様になっている。to 不定詞3連(to track / to handle / to realize)の並列を見つけると、著者が数え上げているのが分かる。
handle exceptions例外に対処する
想定どおりにいかない事態が起きたときに立て直すこと
On one hand, properly prompted large language models (LLMs) have demonstrated emergent capabilities to carry out several steps of reasoning traces to derive answers from questions in arithmetic, commonsense, and symbolic reasoning tasks (Wei et al., 2022).
一方では、適切にプロンプトを与えられた大規模言語モデルが、算術・常識・記号推論のタスクにおいて、質問から答えを導くために推論の軌跡を数ステップ進める、創発的な能力を示してきた。
On one hand … On the other hand … で先行研究を2陣営に割るのは序論の骨格。properly prompted は「プロンプト次第で」という含みがあり、能力がモデルに常在するとは言い切らない慎重な書き方。emergent capabilities は当時流行の語で、「規模を上げたら勝手に出てきた能力」を指す。
emergent capabilities創発的な能力
明示的に学習させていないのに規模を上げると現れる能力
symbolic reasoning記号推論
記号の操作規則にしたがって答えを出す種類の推論
前提知識 — chain-of-thought(CoT)とは
質問をそのまま与えて答えだけ書かせるのではなく、「順を追って考えよう」と促し、途中の考えを文章で出力させてから答えを書かせるやり方。Wei et al. (2022) が示した。
途中の考えを書かせるだけで算術や常識推論の正答率が上がるのがこの手法の面白さだが、考えはモデルの内部知識だけから出てくるので、事実を確かめる手段がない。この論文はまさにそこ(static black box)を突いている。
この論文には CoT-SC も出てくる。CoT を温度0.7で21本サンプリングし、多数決で答えを決める self-consistency 版のこと。
However, this “chain-of-thought” reasoning is a static black box, in that the model uses its own internal representations to generate thoughts and is not grounded in the external world, which limits its ability to reason reactively or update its knowledge. This can lead to issues like fact hallucination and error propagation over the reasoning process (Figure 1 (1b)).
しかし、この「思考連鎖」推論は静的なブラックボックスである。というのも、モデルは自分の内部表現だけを使って思考を生成しており、外部世界に接地していないからだ。そのため、状況に反応して推論を立て直したり、知識を更新したりする力が制限される。結果として、事実の幻覚や、推論過程を通じた誤りの伝播といった問題が起こりうる。
この段落が論文全体の敵を名指ししている。in that 〜 は「〜という点で」と直前の断定の根拠を足す接続で、because より限定が強い。static(静的)と後で出る dynamic reasoning が対、grounded(接地した)と後の more grounded, fact-driven が対になっていて、この2組の対義語を押さえると3章以降の評価の読み筋がそのまま通る。
static black box静的なブラックボックス
外から中身も見えず、途中で入力も足せない箱、という批判の比喩
grounded接地した
言葉が外部の実体や観測に結びついていること。AIでは長く使われる基本語
Beyond such simple embodied tasks to interact with a few blocks, there have not been studies on how reasoning and acting can be combined in a synergistic manner for general task solving, and if such a combination can bring systematic benefits compared to reasoning or acting alone.
数個の積み木を操作するような単純な身体性タスクを超えたところでは、一般的な課題解決のために推論と行動をどう相乗的に組み合わせられるか、またその組み合わせが推論だけ・行動だけと比べて体系的な利益をもたらすのか、という研究はまだ存在しない。
there have not been studies on 〜 は研究の空白を宣言する定型で、序論のここが「なぜこの論文が要るか」の中心。and if 〜 で2つ目の問い(そもそも得なのか)を足しているので、論文の実験はこの2問に答える形で設計されている。compared to reasoning or acting alone が、後に出てくる CoT のみ/Act のみのベースライン設計の予告。
embodied task身体性タスク
身体や環境の操作をともなうタスク。ロボットやシミュレータ上の家事など
ReAct prompts LLMs to generate both verbal reasoning traces and actions pertaining to a task in an interleaved manner, which allows the model to perform dynamic reasoning to create, maintain, and adjust high-level plans for acting (reason to act), while also interact with the external environments (e.g. Wikipedia) to incorporate additional information into reasoning (act to reason).
ReAct は、タスクに関わる言語的な推論の軌跡と行動の両方を、交互に生成するようLLMに促す。これによりモデルは、行動のための高水準な計画を作り、保ち、調整するという動的な推論を行える(行動するために推論する)。同時に外部環境(たとえば Wikipedia)と対話し、追加の情報を推論に取り込める(推論するために行動する)。
この一文が手法の定義そのもの。reason to act / act to reason という括弧の対句が、題名の Synergizing の中身を2語ずつで言い切っている場所で、以後の章でも何度も参照される。pertaining to は relating to の硬い言い方。which allows … while also … は主語が離れて読みにくいが、allows の主語は前文全体(交互に生成させること)である。
dynamic reasoning動的な推論
途中で入ってくる観測に応じて考えを変えていける推論。static の対
high-level plan高水準な計画
個々の操作ではなく、目標を段階に割った粗い筋書き
原文の Figure 1 (1) は、この4方式で HotpotQA の同じ1問を解かせて並べている。
原文 Figure 1 (1) の構成を、本文の記述から起こしたもの。ベースラインは ReAct の軌跡から要素を削って作られる(3.2 Baselines)ため、この4つは独立した手法ではなく1本の系列の削り違いである。
§
ここから先は会員限定です
続きの精読と用語集は会員向けです。月額¥490、いつでも解約できます。
コメント
コメントにはログインが必要です