JA EN

#long-horizon

4 記事

01 ·エージェント·★ 会員·論文·22分で読めます 論文解説: PILOT in the Loop — 走っている最中に直す「ライブ自己改善」 PILOT in the Loop: Live Self-Improvement for Long-Horizon Agents エージェントの自己改善は、実行が終わってからでは遅い。監督役と作業役を分け、走行中に軌道修正しながらスキルを貯める PILOT を、比喩から仕組み・実測値・限界まで1から解説する。 02 ·エージェント·★ 会員·論文·17分で読めます 論文解説: StateM — モデルの重みを1gも動かさず、Terminal-Bench 2.1で95.3%・実行費15ドルへ StateM: Reaching 95.3% Raw Accuracy, or a \$15 Frontier Run, on Terminal-Bench 2.1 via Harness Scaling 長時間タスクのエージェントは、各ステップを解けるモデルを積んでいても落ちる。StateMは重みを触らず「実行の器」だけを鍛え、Terminal-Bench 2.1で95.3%、最終スコアのAPI費を574.68ドルから約15ドルへ下げたと報告する。ハーネススケーリングという賭けを1から解説する。 03 ·エージェント·★ 会員·論文·12分で読めます 論文解説: MerchantBench — LLMエージェントは1年間ネットショップを経営できるか。人間の27.3%しか稼げない理由 MerchantBench: Benchmarking LLM Agents for Long-Term Coherence in E-Commerce Operations 365日のEC店舗経営シミュレーションでLLMエージェントの「長期一貫性」を測るMerchantBenchを論文本文から解説。最良構成でも人間の平均純資産の27.3%にとどまる理由を、活動の減衰・早すぎる撤退・証拠に合わない方針固定化という失敗パターンから読み解く。 04 ·エージェント·★ 会員·論文·10分で読めます 論文解説: LongHorizon-Harness — 長時間タスクは「実行」ではなく「状態管理」で解く LongHorizon-Harness: Advancing Long-Horizon Agents for Real-World Tasks モデルを一切変えずに、タスク状態を実行の外に置き「管理→実行→監査」のループで回すだけで、長時間タスクの成績が大きく伸びる——Alibaba DreamXチームのハーネス設計論文を、比喩と擬似コードで1から解説する。