論文解説: MerchantBench — LLMエージェントは1年間ネットショップを経営できるか。人間の27.3%しか稼げない理由
365日のEC店舗経営シミュレーションでLLMエージェントの「長期一貫性」を測るMerchantBenchを論文本文から解説。最良構成でも人間の平均純資産の27.3%にとどまる理由を、活動の減衰・早すぎる撤退・証拠に合わない方針固定化という失敗パターンから読み解く。
MerchantBench: Benchmarking LLM Agents for Long-Term Coherence in E-Commerce Operations
一次資料 — この記事の根拠
論文の発表 2026-07-31→この解説の公開 2026-08-13同月
MerchantBench: Benchmarking LLM Agents for Long-Term Coherence in E-Commerce OperationsQiming Shi, Yulong Tao, Linbo Jin ほか · 2026-07-31 · v2arXiv:2607.28956論文ページ·PDF原文の要旨(Abstract)を読む
Large language model agents are increasingly evaluated as autonomous tool users, yet most benchmarks focus on bounded tasks with immediate success criteria. Real-world deployments often require Long-Term Coherence, the capacity to preserve purposeful behavior across extended horizons while adapting decisions to accumulated evidence. Evaluating this capacity requires a persistent environment in which actions constrain future choices, feedback arrives at heterogeneous delays, and incoherent behavior produces measurable cumulative effects. Seller-side e-commerce provides a suitable setting for this evaluation through recurrent and interdependent decisions over Product Sourcing, Listing and Pricing Control, Cash-Flow Management, and Mixed-Latency Feedback Adaptation. We introduce MerchantBench, a 365-day order-level simulation grounded in 98,843 real e-commerce product records and equipped with 26 tools for agent interaction. MerchantBench couples promptly observable Upstream Supplier Events with delayed Downstream Order Outcomes, requiring agents to follow individual order lifecycles and revisit earlier decisions. We evaluate eight LLMs under two agent frameworks in 48 runs, each spanning 365 simulated days. Our results reveal a substantial gap between even the latest LLMs and human participants, with the best LLM configuration attaining only 27.3\% of the mean final net assets achieved by human participants.
AIに1年間、ネットショップを任せてみたら
いま主流のエージェント評価は、数分から数時間で終わり、成否がその場で判定できるタスクが中心です。しかし実世界の仕事の多くは違います。店の経営に「クリア」はなく、今日の判断が来月の選択肢を縛り、失敗の請求書は忘れた頃に届きます。
MerchantBench は、この「終わりのない仕事」でLLMエージェントを測るベンチマークです。実在のEC商品データ98,843件に基づく仮想モールで、エージェントは仕入れ・出品・価格・資金繰りを任され、シミュレーション時間で365日間、店を経営し続けます。8つのLLM×2つのフレームワークで計48回の通年運用を走らせた結果は明快でした——最も稼いだLLM構成でも、人間参加者の平均最終純資産の27.3%にとどまったのです (§Abstract)。
「長期一貫性」とは何か
論文は Long-Term Coherence を「長い時間軸で目的に沿った行動を保ちつつ、蓄積する証拠に合わせて判断を修正し続ける能力」と定義します (§Abstract)。皿洗いは洗い終われば完了ですが、店の経営は「続けること」自体が仕事で、やめた瞬間から資産が溶けはじめます。
これを測る環境には3つの性質が要ります (§Abstract)。①行動が将来を制約する(今日の仕入れは現金を減らす)、②フィードバックがバラバラの遅延で届く(売れたことはすぐ分かるが、返品や悪評は何日も後)、③一貫性を失うと累積被害が数字に出る(罰金と評判低下が積み上がる)。先行のVending-Bench(自販機経営)やRetailBench(96品目の固定カタログ)に対し、MerchantBenchは注文1件ごとのライフサイクルから生じる遅延フィードバックと、実データ由来で季節変動する巨大カタログを上乗せしました。仕入れは一度きりの選択ではなく、通年のポートフォリオ運用になります (§Introduction)。
環境の中身: 実データ98,843商品・365日・26ツール
環境は中国最大級の卸モール「1688」の実データに接地されています。10カテゴリ・36,576サプライヤーの98,843商品それぞれに、2025年6月〜2026年5月の365日分の実需要履歴が付き、「618」「11.11」のセールの山や春節の谷もそのまま残っています (§Real-World Data Grounding)。
商売は在庫を持たないドロップシッピング型。注文が入るたび自動仕入れで現金が減り、配送・受取を経て、後日入金されます (§Order Lifecycle)。事故は二系統あり、上流ではサプライヤーの価格変動・商品取下げ・出荷遅延が確率的に発生し (§Upstream Supplier Simulation)、下流では各注文にキャンセル・在庫切れ・出荷遅れ・返金2種・悪評の6種の異常が潜みます。多くは罰金(返品返金8元、悪評・在庫切れ5元、出荷遅れ3元)と店舗評価の低下を招き、評価が下がると全商品の需要が減ります (§Order Level Simulation, Appendix J)。
エージェントは初期資金2,000元・保証金1,000元・出品枠50でスタートし、12時間ごとの決定ウィンドウで26種のツール(市場レポート、カタログ検索、出品・値付け、資金・注文照会、メモリ読み書きなど)を呼び出します。保証金が尽きれば閉店です (§Agent Interface, §Task Formulation)。
ここで肝になるのが「フィードバックにどれだけ強く反応するか」です。悪い知らせ1件に過剰反応して店中の価格をいじれば方針が発散し、反応しなければ損失が累積する——勾配降下法の学習率とまったく同じ構図です。
目的関数は「1年後の純資産」ただ一つ
環境は部分観測マルコフ決定過程(POMDP)で、時計は1時間刻みに8,760ステップ進みます。途中の報酬はゼロ、評価は最後の資産だけです (§Task Formulation)。
最終スコア=終了時点の現金()+保証金の残り()+輸送中の資金()+未入金の売掛金()。1年間の全判断がこの一つの数字に畳み込まれます。
コメント
コメントにはログインが必要です