PaperLens
紙
学生版
社会人版
JA
EN
◐
Googleでログイン
ログイン
読む
ホーム
論文精読
新着
教科書
深める
体系
ラボ
業界地図
みんなの貢献
用語集
自分
探す
読み放題
マイページ
#harness
9 記事
01
2026-09-04
·
エージェント
·
★ 会員
·
論文
·
17分で読めます
論文解説: HarnessDev — LLMは自分のエージェント・ハーネスを作り、育てられるか
HarnessDev: Can LLMs Create and Evolve Their Own Agent Harness?
エージェントの成績を左右する「モデルの外側」=ハーネスを、LLM自身が一から作り、実行フィードバックで育てられるかを測るベンチマーク HarnessDev を、前提知識ゼロから解説する。作れはするが領域差が激しく、進化の利得は隠されたタスクへほとんど転移しない、という結果を数字で追う。
02
2026-09-03
·
エージェント
·
★ 会員
·
論文
·
22分で読めます
論文解説: Training Agents to Evolve with Their Harness — ハーネスごと進化するエージェントを訓練する
Training Agents to Evolve with Their Harness: TaoLive Digital Avatar Agent Technical Report
プロンプトやツール定義を毎週書き換える本番環境で、小型モデルはなぜ壊れるのか。淘宝ライブのAIアバター配信を動かすチームが提案する Harness-Aware Training(HAT)を、比喩から数式・実測値・限界まで1から解説する。
03
2026-09-03
·
エージェント
·
★ 会員
·
論文
·
21分で読めます
論文解説: StarHarness — モデルを凍結したまま「ハーネス」を進化させる
StarHarness: Evolving Harnesses with Stratified Search for Enterprise Environments
モデルの重みを一切変えず、エージェントを取り巻く「ハーネス」(プロンプト・ツール定義・スキル・MCP・サブエージェント・実行ループ)だけを探索で書き換える。企業向け3ベンチマークで20〜35ポイント改善し、進化に使わなかったタスクにも、別のモデルにも効いた。
04
2026-09-03
·
エージェント
·
★ 会員
·
論文
·
22分で読めます
論文解説: PILOT in the Loop — 走っている最中に直す「ライブ自己改善」
PILOT in the Loop: Live Self-Improvement for Long-Horizon Agents
エージェントの自己改善は、実行が終わってからでは遅い。監督役と作業役を分け、走行中に軌道修正しながらスキルを貯める PILOT を、比喩から仕組み・実測値・限界まで1から解説する。
05
2026-09-03
·
エージェント
·
★ 会員
·
論文
·
16分で読めます
論文解説: AutoSaddler — エージェントの失敗ログから「壊れないハーネス」を自動で育てる
AutoSaddler: Automatic Harness Optimization with Durable Updates from Agent Execution Traces
LLMエージェントの外側を固める「ハーネス」(プロンプト・ツール・ミドルウェア)を、失敗トレースの診断とパッチ生成の反復で自動最適化する枠組みAutoSaddlerを、前提知識ゼロから解説する。GAIA2/SWE-Bench Pro/Terminal-Bench 2.0で基準ハーネスをそれぞれ9.0/9.6/10.0ポイント上回った。
06
2026-08-30
·
エージェント
·
★ 会員
·
論文
·
23分で読めます
論文解説: JIT-Agent — エージェントの「ハーネス」をその場で書き起こすモデル
JIT-Agent: Scaling Harness Intelligence via Just-in-Time Harness Evolution
エージェントの性能はモデルだけで決まらない。記憶・計画・行動・道具の4モジュールからなる「ハーネス」をタスクごとに生成する専用モデル JIT-Agent を、前提知識なしで解説する。
07
2026-08-27
·
エージェント
·
★ 会員
·
論文
·
15分で読めます
エージェント評価 — ベンチとハーネスの作法
SWE-bench: Can Language Models Resolve Real-World GitHub Issues?
エージェントのスコアは「モデルの点」ではなく「モデル+ハーネス+環境+採点規則の点」です。SWE-benchの1件がどんな部品でできているか、手数が伸びると一手の差がなぜ桁で効くか、リポジトリやネットワークから答えが漏れる四つの経路、そして部分点を安全に設計する条件までを1から扱います。
08
2026-08-22
·
エージェント
·
★ 会員
·
論文
·
17分で読めます
論文解説: StateM — モデルの重みを1gも動かさず、Terminal-Bench 2.1で95.3%・実行費15ドルへ
StateM: Reaching 95.3% Raw Accuracy, or a \$15 Frontier Run, on Terminal-Bench 2.1 via Harness Scaling
長時間タスクのエージェントは、各ステップを解けるモデルを積んでいても落ちる。StateMは重みを触らず「実行の器」だけを鍛え、Terminal-Bench 2.1で95.3%、最終スコアのAPI費を574.68ドルから約15ドルへ下げたと報告する。ハーネススケーリングという賭けを1から解説する。
09
2026-08-13
·
エージェント
·
★ 会員
·
論文
·
10分で読めます
論文解説: LongHorizon-Harness — 長時間タスクは「実行」ではなく「状態管理」で解く
LongHorizon-Harness: Advancing Long-Horizon Agents for Real-World Tasks
モデルを一切変えずに、タスク状態を実行の外に置き「管理→実行→監査」のループで回すだけで、長時間タスクの成績が大きく伸びる——Alibaba DreamXチームのハーネス設計論文を、比喩と擬似コードで1から解説する。