論文解説: ASI-Bench — 手引きを1枚ずつ剥がして、AIの「自力」を測る
同じ研究課題から人間の方法論的な手引きだけを段階的に剥がし、AIエージェントがどこまで自力で進めるかを測るベンチマーク ASI-Bench を、一次資料である論文本文から解説する。平均スコアは50.91→29.10→26.62へ落ち、崩れる場所は「手法選び」ではなかった。
ASI-Bench: At the Dawn of Artificial Superintelligence
一次資料 — この記事の根拠
論文の発表 2026-08-18→この解説の公開 2026-08-27同月
ASI-Bench: At the Dawn of Artificial SuperintelligenceJunwei Zhou, Zhen Sun, Binyu Li ほか · 2026-08-18 · v1arXiv:2608.17271論文ページ·PDF原文の要旨(Abstract)を読む
Artificial superintelligence (ASI) requires AI to move beyond mastering existing knowledge toward exploring the unknown, creating new knowledge, and turning new ideas into verifiable results. However, the capabilities of today's AI systems are still largely built on learning, compressing, and applying existing human knowledge. Accordingly, existing benchmarks primarily test whether AI can produce correct answers based on learned knowledge, or whether it can complete tasks under extensive human guidance. We therefore introduce ASI-Bench, the first benchmark to jointly evaluate AI systems' capabilities of innovative exploration and autonomous scientific execution across general research domains, and the first to progressively withdraw human methodological guidance within the same research project to test how far AI can proceed on its own. Built by over 40 experts with the cost of 31,000+ human hours, ASI-Bench contains 60 project-level research tasks across 11 scientific domains and progressively reduces methodological guidance to test whether AI can independently select methods, conduct research, and produce verifiable results. All tasks undergo expert review, AI-assisted auditing, sandbox execution, and scorer validation. Across 18 state-of-the-art agent--model configurations, the average score drops from 50.91 with full methodological guidance to 29.10 with only the method specified and 26.62 when agents must determine the method themselves. This sharp decline shows that current systems remain heavily dependent on human guidance and are still far from autonomously conducting end-to-end, project-level scientific research. ASI-Bench is open to the world. We invite researchers and builders everywhere to contribute new tasks, challenge the limits of today's AI, and help accelerate humanity's collective path toward artificial superintelligence at https://asibench.apexin.ai/submit.
レシピを1枚ずつ取り上げていく
誰かの料理の腕を測りたいとします。測り方は一つではありません。
- グラム数も火加減も書かれたレシピを渡し、その通りに作らせる
- 「肉じゃがを作って」と料理名だけ告げる
- 冷蔵庫の中身を見せ、「これで夕食を一品」とだけ言う
- 3に加えて、今日は使わない食材もいくつか冷蔵庫に紛れ込ませておく
どれも「料理ができるか」を見ているようで、測っているものは違います。1で測れるのは手順の遂行力です。3で初めて、何を作るかを自分で決める力が問われます。そして4は、余計なものに気を取られないかを見ています。
ASI-Bench(arXiv:2608.17271)がやったのは、これを科学研究でやることでした。研究目的・データ・評価基準は固定したまま、人間が与える方法論的な手引きだけを段階的に引き上げ、AIエージェントがどこまで自力で進めるかを測ります(§2.2)。論文の言葉では、B1が完全な手引き、B2が手法名のみ、B3が研究目的とデータのみ、B4がB3に無関係な情報を混ぜたもの、という4段階です。
なぜ新しいベンチマークが要るのか
論文の問題意識ははっきりしています。今のAIの能力の多くは、人類の既存知識を学習し、圧縮し、適用することの上に立っている。だから既存の評価も、答えが決まっている問題を解けるか、あるいは人間が手順まで指定したタスクを完遂できるかのどちらかに寄っている、というものです(§1)。
論文は表1で既存ベンチマークを並べ、それぞれが分野横断性・手法の自律性・エンドツーエンド実行のうち一部だけを押さえていると整理します(§2.1)。Humanity's Last Exam は分野横断の知識、SciCode は研究レベルのコーディング、Terminal-Bench は長時間のツール操作、PaperBench は再現、MLE-Bench は機械学習エンジニアリング、RE-Bench はオープンエンドなAI研究開発、DiscoveryBench は仮説駆動の発見。どれも重要ですが、目的も評価基準も固定したまま手引きの量だけを動かすという設計は、そこにはなかったというのが論文の主張です。
B1→B4: 手引きの勾配
論文が挙げる代表例は、非線形の2次元力学系のタスクです(§2.2、詳細は付録D)。
- B1: 支配方程式(PDE)も、数値的な定式化も、ソルバの手順も明示される。エージェントは実装して走らせればよい
- B2: 手順が消える。PDEの種類と適した数値解法という手法レベルの情報だけが残り、それを動くコードに翻訳しなければならない
- B3: 手法の情報も消える。観測された時空間データと、科学的な目的と、求められる出力だけ。背後のモデルを自分で推定し、数値解法を選び、実装し、結果を検証する
- B4: B3のまま、事実としては正しいが課題には不要な情報を足す。研究の方向を保てるかを見る
同じ研究プロジェクトの中で責任が人間からAIへ移っていく、という設計です。B3とB4では意図した手法・ソルバを絶対に漏らしてはいけない、と寄稿ガイドラインにも明記されています(付録C)。
手引きの量は、次の一手の選択肢がどれだけ絞られているかと言い換えられます。下の図は softmax の温度で分布の尖り方を変えるものですが、B1は温度が低く一本道に近い状態、B3は温度が高く選択肢が広がった状態、という比喩として動かしてみてください(これは直感を掴むための比喩で、論文がこう述べているわけではありません)。
どうやって作ったか
規模の話も論文の主張の一部です。40人超の専門家が関わり、31,000時間超の人手を投じて、11分野・60本のプロジェクト規模の研究タスクが作られました(§2.2)。分野は数学・物理・化学・生物・天文・材料・地球科学・医学と生物統計・計算機科学・ロボティクス・電気工学です。
作り方は一発勝負ではありません。1,300件超の候補アイデアから始め、5ラウンドのレビュー、1,100件超のレビュー割り当て、2,000件超のタスク改訂を経ています。レビュー観点には情報漏洩と、正しく解かずに高得点を取れてしまう抜け道が含まれます。さらに全タスクが隔離サンドボックスでエンドツーエンド実行され、開発中の実行回数は1,500回を超えました。科学的な誤り・実行の不安定さ・評価のずれが残ったタスクは修正か除外です(§2.2)。
タスク自体も重い。60タスクを完遂する過程は合計で2,600回超のやり取りと2,400回超の実行ステップを含み、エージェントの実行時間は35時間を超えます。
コメント
コメントにはログインが必要です