論文解説: FrontierChallenge — 科学の仕事を「最後まで納品できたか」で測る
科学ワークフローを最後まで完遂できるかを測るベンチマーク FrontierChallenge の解説。平均点87.9でも完全達成は20.6%、電気化学では平均94.9でPass Rate 0%。未達の軌跡の75.5%が「完了しました」と述べて終わっていた。
FrontierChallenge: Evaluating Scientific Workflow Completion
一次資料 — この記事の根拠
論文の発表 2026-08-25→この解説の公開 2026-08-29同月
FrontierChallenge: Evaluating Scientific Workflow CompletionLiangcai Su, Zhaopeng Feng, Zhuo Chen ほか · 2026-08-25 · v1arXiv:2608.24979論文ページ·PDF原文の要旨(Abstract)を読む
Scientific agents increasingly analyze data, execute code, and produce research artifacts, yet most benchmarks emphasize final answers, isolated programs, or a single domain. We introduce FrontierChallenge, a cross-domain benchmark comprising 300 end-to-end scientific workflows. In this paper, we release and evaluate 97 of these tasks, spanning quantum chemistry, molecular dynamics, materials characterization, analytical chemistry, life science, and electrochemistry/environment. Each task provides fixed inputs and specifies a bundle of required scientific deliverables. We evaluate twelve frontier models with three agent scaffolds. Pass Rate measures the fraction of tasks satisfying the full-completion criterion, while Avg. Score captures partial progress. Each of the best-performing configurations completed only 20 of the 97 released tasks, yielding a Pass Rate of 20.6%. Partial progress translated especially poorly into complete delivery in analytical chemistry and electrochemistry/environment: Avg. Scores reached 87.6 and 94.9, but the highest Pass Rates were only 4% and 0%. Among non-passing Claude Code trajectories, 75.5% still ended with language claiming completion. These findings show that neither high partial scores nor confident claims of completion reliably indicate that a scientific task has been fully delivered, highlighting the need to evaluate end-to-end workflow execution and the completeness of scientific deliverables together.
「だいたいできています」で受け取れない仕事がある
引っ越しで段ボール10箱のうち9箱が届きました。達成率90%。ただし届かなかった1箱が冷蔵庫のコンセントと工具箱なら、新生活は今日も始まりません。
科学の仕事も同じです。データ解析に必要なのは「答えの数値」だけではありません。再現できる解析スクリプト、1件ごとの表、群統計の表、品質を確認できる図、手順を書いたレポート——全部そろって、はじめて次の人が引き継げます。図が1枚欠ければ、残りの数値が正しいか誰にも検証できない。「9割できた」は、しばしば「引き継げない」と同義です。
FrontierChallenge(arXiv:2608.24979、Apodex Team、2026年8月)は、この落差を測るベンチマークです。
論文が問うている、たったひとつのこと
論文は問いを極端に狭く絞ります(§1)。科学的なタスクとデータが固定されているとき、エージェントは入力処理から最終成果物までワークフローを独力で完了し、タスク契約を完全に満たせるか。
測っているのは「自律的な科学」ではない、と論文は明言します(§1)。研究テーマを立てる仕事は求めていません。目的も入力も成果物も先に決まった上で、決まった仕事を最後まで、互いに矛盾のない形で引き渡せるかだけを見ます。HLE や SWE-bench や OSWorld の評価単位が最終回答・対話トレース・単一プログラムだったのとは、ここが違います(§2)。
ベンチマークの作り: タスクを「契約」として書く
論文は300本の end-to-end 科学ワークフローを集め、うち97本を公開して評価、残る203本は内部の held-out としました(§3)。ORCA・CP2K・LAMMPS・AmberTools・PLUMED などのドメイン専用ソフトを使い、実行可能なコードと根拠に紐づいたレポートを出すことが求められます(§1)。
キモはパッケージの作り方です。各タスクは5要素で構成されます(§3.1): タスク記述、データと文脈を含む固定入力、実行環境のソフトウェアと道具、必要な成果物を列挙した出力契約、完了の条件を定める評価手順。評価の単位は最終回答ではなく、提出された成果物バンドル全体です。付録B.1 の創傷治癒アッセイでは、18枚の顕微鏡画像(2群 × 0/12/24時間 × 反復3回)に対し、解析スクリプト、画像単位の表、群統計の表、要約プロット2枚、方法論レポートの引き渡しが要求されます。
公開97本の内訳は量子化学20・分子動力学16・材料キャラクタリゼーション22・分析化学23・生命科学10・電気化学/環境6、Hard 74本・Medium 23本(§3.2)。ただし論文は釘を刺します。この6ドメインは記述的なスライスであって確率標本ではなく、ドメイン間の差を分野そのものの難易度ランキングと読んではいけない(§3.2)。
2つの指標: Pass Rate と Avg. Score
各タスクの Grader は、必要ファイル・数値・形式・図・コードの実行、そして成果物どうしの整合性を検査して0〜100点の を返します(構成 のタスク )。意味的な判断は Judge(GPT-5.6 Sol、各項目3回)に委譲されますが、Judge もその Grader の一部です(§4.2)。 として、
は中の条件が成り立てば1、そうでなければ0になるスイッチです。要するに は「そのタスクを完全にやり切ったか」の0/1旗で、Pass Rate は旗が立った割合、Avg. Score は素点の平均。99.9という半端な閾値は3回平均の数値ゆらぎを吸収するためだけで、ルーブリックを緩めてはいません(§4.2)。
つまりこの論文は「85点」と「100点」を、質の違いではなく納品できたかどうかの違いとして扱います。85点は、冷蔵庫だけ届いていない状態です。
補足: なぜ部分点は満点に化けないのか
ここは論文の主張ではなく、数字を読むための補助線です。1タスクに 個の必須成果物があり各々を確率 で満たせるなら、全部そろう確率は 。 でも で約0.36。平均点は緩やかに動くのに、完全達成率は指数で落ちます。
コメント
コメントにはログインが必要です