用語集 › swe-bench
GLOSSARY
swe-bench
実GitHub課題でコード修正力を測る評価
4本の論文題名に登場
定義
実在の GitHub リポジトリの課題を材料に、モデルが生成した修正パッチがリポジトリのテストを通るかで採点するベンチマーク。人間の選好や表面的な類似ではなく実行結果で判定するため、コード能力の評価として厳しく、エージェント型システムの標準的な指標になっている。単発の関数を書かせる評価より現実の作業に近い。
論文題名での読み方
コード能力の定番ベンチ
この語が出てくる解説
- エージェント評価ベンチ地図 — SWE-bench・GAIA・OSWorldは何を測るかSWE-bench: Can Language Models Resolve Real-World GitHub Issues?
- 論文解説: SWE-bench Science — コーディングエージェントは「科学のコード」を直せるかSWE-bench Science: Can Coding Agents Resolve Engineering Tasks in Science?
- エージェント評価 — ベンチとハーネスの作法SWE-bench: Can Language Models Resolve Real-World GitHub Issues?