PaperLens
紙
学生版
社会人版
JA
EN
◐
Googleでログイン
ログイン
読む
ホーム
論文精読
新着
教科書
深める
体系
ラボ
業界地図
みんなの貢献
用語集
自分
探す
読み放題
マイページ
#swe-bench
8 記事
01
2026-09-04
·
エージェント
·
★ 会員
·
論文
·
17分で読めます
論文解説: HarnessDev — LLMは自分のエージェント・ハーネスを作り、育てられるか
HarnessDev: Can LLMs Create and Evolve Their Own Agent Harness?
エージェントの成績を左右する「モデルの外側」=ハーネスを、LLM自身が一から作り、実行フィードバックで育てられるかを測るベンチマーク HarnessDev を、前提知識ゼロから解説する。作れはするが領域差が激しく、進化の利得は隠されたタスクへほとんど転移しない、という結果を数字で追う。
02
2026-09-04
·
エージェント
·
★ 会員
·
論文
·
16分で読めます
論文解説: EarlyEval — エージェント評価を「途中で打ち切って」安くする
EarlyEval: Cheaper Agent Evaluation via Early Outcome Prediction
エージェントの評価は1回数百ドルかかる。EarlyEvalは「結末は途中の振る舞いから読める」という発見を使い、実行を途中で止めて費用を13〜26%削る。仕組み・実験値・限界を論文本文から解説。
03
2026-09-03
·
エージェント
·
★ 会員
·
論文
·
22分で読めます
論文解説: PILOT in the Loop — 走っている最中に直す「ライブ自己改善」
PILOT in the Loop: Live Self-Improvement for Long-Horizon Agents
エージェントの自己改善は、実行が終わってからでは遅い。監督役と作業役を分け、走行中に軌道修正しながらスキルを貯める PILOT を、比喩から仕組み・実測値・限界まで1から解説する。
04
2026-09-03
·
エージェント
·
★ 会員
·
論文
·
16分で読めます
論文解説: AutoSaddler — エージェントの失敗ログから「壊れないハーネス」を自動で育てる
AutoSaddler: Automatic Harness Optimization with Durable Updates from Agent Execution Traces
LLMエージェントの外側を固める「ハーネス」(プロンプト・ツール・ミドルウェア)を、失敗トレースの診断とパッチ生成の反復で自動最適化する枠組みAutoSaddlerを、前提知識ゼロから解説する。GAIA2/SWE-Bench Pro/Terminal-Bench 2.0で基準ハーネスをそれぞれ9.0/9.6/10.0ポイント上回った。
05
2026-09-03
·
評価と審判
·
無料
·
論文
·
15分で読めます
エージェント評価ベンチ地図 — SWE-bench・GAIA・OSWorldは何を測るか
SWE-bench: Can Language Models Resolve Real-World GitHub Issues?
エージェント評価の代表3本(SWE-bench・GAIA・OSWorld)が実際に何を測っているかを、採点方式の違いから解きほぐす。汚染とリークの4類型、そして発表されたスコアを自分の用途向けに読み替える手順まで。
06
2026-08-27
·
エージェント
·
★ 会員
·
論文
·
14分で読めます
論文解説: SWE-bench Science — コーディングエージェントは「科学のコード」を直せるか
SWE-bench Science: Can Coding Agents Resolve Engineering Tasks in Science?
科学ソフトウェアの修理をコーディングエージェントに解かせるベンチマーク SWE-bench Science(119タスク・98リポジトリ・20分野)の解説。最良のエージェントでも pass@1 は50%未満で、4つの失敗機構と「科学知識は必ずしも効かない」というアブレーション結果を読み解く。
07
2026-08-27
·
エージェント
·
★ 会員
·
論文
·
15分で読めます
エージェント評価 — ベンチとハーネスの作法
SWE-bench: Can Language Models Resolve Real-World GitHub Issues?
エージェントのスコアは「モデルの点」ではなく「モデル+ハーネス+環境+採点規則の点」です。SWE-benchの1件がどんな部品でできているか、手数が伸びると一手の差がなぜ桁で効くか、リポジトリやネットワークから答えが漏れる四つの経路、そして部分点を安全に設計する条件までを1から扱います。
08
2026-08-12
·
エージェント
·
★ 会員
·
論文
·
13分で読めます
論文解説: SWE-Bench ProMax — 多言語・大規模リファクタリングでコーディングエージェントの本当の実力を測る
SWE-Bench ProMax: Benchmarking Agents on Large-Scale Multilingual Code Refactoring
SWE-benchの飽和と採点欠陥への回答として登場した、7言語・平均11.4ファイル修正の大規模リファクタリングベンチマークを論文本文から解説。最強モデルでも41.2%しか解けない理由と、支配的な失敗モード「やり切らないリファクタリング」を読み解く。