JA EN

#swe-bench

8 記事

01 ·エージェント·★ 会員·論文·17分で読めます 論文解説: HarnessDev — LLMは自分のエージェント・ハーネスを作り、育てられるか HarnessDev: Can LLMs Create and Evolve Their Own Agent Harness? エージェントの成績を左右する「モデルの外側」=ハーネスを、LLM自身が一から作り、実行フィードバックで育てられるかを測るベンチマーク HarnessDev を、前提知識ゼロから解説する。作れはするが領域差が激しく、進化の利得は隠されたタスクへほとんど転移しない、という結果を数字で追う。 02 ·エージェント·★ 会員·論文·16分で読めます 論文解説: EarlyEval — エージェント評価を「途中で打ち切って」安くする EarlyEval: Cheaper Agent Evaluation via Early Outcome Prediction エージェントの評価は1回数百ドルかかる。EarlyEvalは「結末は途中の振る舞いから読める」という発見を使い、実行を途中で止めて費用を13〜26%削る。仕組み・実験値・限界を論文本文から解説。 03 ·エージェント·★ 会員·論文·22分で読めます 論文解説: PILOT in the Loop — 走っている最中に直す「ライブ自己改善」 PILOT in the Loop: Live Self-Improvement for Long-Horizon Agents エージェントの自己改善は、実行が終わってからでは遅い。監督役と作業役を分け、走行中に軌道修正しながらスキルを貯める PILOT を、比喩から仕組み・実測値・限界まで1から解説する。 04 ·エージェント·★ 会員·論文·16分で読めます 論文解説: AutoSaddler — エージェントの失敗ログから「壊れないハーネス」を自動で育てる AutoSaddler: Automatic Harness Optimization with Durable Updates from Agent Execution Traces LLMエージェントの外側を固める「ハーネス」(プロンプト・ツール・ミドルウェア)を、失敗トレースの診断とパッチ生成の反復で自動最適化する枠組みAutoSaddlerを、前提知識ゼロから解説する。GAIA2/SWE-Bench Pro/Terminal-Bench 2.0で基準ハーネスをそれぞれ9.0/9.6/10.0ポイント上回った。 05 ·評価と審判·無料·論文·15分で読めます エージェント評価ベンチ地図 — SWE-bench・GAIA・OSWorldは何を測るか SWE-bench: Can Language Models Resolve Real-World GitHub Issues? エージェント評価の代表3本(SWE-bench・GAIA・OSWorld)が実際に何を測っているかを、採点方式の違いから解きほぐす。汚染とリークの4類型、そして発表されたスコアを自分の用途向けに読み替える手順まで。 06 ·エージェント·★ 会員·論文·14分で読めます 論文解説: SWE-bench Science — コーディングエージェントは「科学のコード」を直せるか SWE-bench Science: Can Coding Agents Resolve Engineering Tasks in Science? 科学ソフトウェアの修理をコーディングエージェントに解かせるベンチマーク SWE-bench Science(119タスク・98リポジトリ・20分野)の解説。最良のエージェントでも pass@1 は50%未満で、4つの失敗機構と「科学知識は必ずしも効かない」というアブレーション結果を読み解く。 07 ·エージェント·★ 会員·論文·15分で読めます エージェント評価 — ベンチとハーネスの作法 SWE-bench: Can Language Models Resolve Real-World GitHub Issues? エージェントのスコアは「モデルの点」ではなく「モデル+ハーネス+環境+採点規則の点」です。SWE-benchの1件がどんな部品でできているか、手数が伸びると一手の差がなぜ桁で効くか、リポジトリやネットワークから答えが漏れる四つの経路、そして部分点を安全に設計する条件までを1から扱います。 08 ·エージェント·★ 会員·論文·13分で読めます 論文解説: SWE-Bench ProMax — 多言語・大規模リファクタリングでコーディングエージェントの本当の実力を測る SWE-Bench ProMax: Benchmarking Agents on Large-Scale Multilingual Code Refactoring SWE-benchの飽和と採点欠陥への回答として登場した、7言語・平均11.4ファイル修正の大規模リファクタリングベンチマークを論文本文から解説。最強モデルでも41.2%しか解けない理由と、支配的な失敗モード「やり切らないリファクタリング」を読み解く。