← ブログに戻る
Ai読了目安 14 分

フロンティアエージェントは研究ワークフローの30パーセントを完了した。それがこの数字だ。

公開日 2026年10月4日
フロンティアエージェントは研究ワークフローの30パーセントを完了した。それがこの数字だ。

スタンフォード大学が Terminal-Bench-Science 0.1 という新しいベンチマークを公開した。その注目の結果は、エージェント周りの宣伝文句に比べるとかなり地味なものだ。このベンチマークでは、専門家が作成した70件の研究ワークフローをフロンティアエージェントに実行させた。最も成績の良かったモデルでも、その30パーセントしか完了できなかった。

30パーセントという数字を覚えておきたい。これは失敗とも勝利とも読めない。タスクを手作業で書いた人たちが公表した、技術の現在地を正直に示す測定値だ。

このベンチマークが実際にテストするもの

タスクは科学ワークフローで、分野の専門家が作成し、エージェントはターミナル上で実行する。この選択は重要だ。ターミナルは、タスクが現実のものとなる作業環境だ。依存関係を実際にインストールし、ファイルを書き、分析を実行し、出力を確認しなければならない。正しいアプローチを説明しても部分点はない。コマンドは動くか、動かないかのどちらかだ。

ワークフローは研究実務から取られており、整ったテストスイートを備えたコーディングタスクよりもはるかに雑然とした対象だ。コーディングのベンチマークには通常、定義された正解があるので自動採点できる。研究作業には正解がないことが多く、だからこそこのようなベンチマークを作るには、リポジトリから引っ張ってくるのではなく、専門家がタスクを書く必要があった。

なぜ30パーセントという捉え方が適切なのか

ベンチマークは合格か不合格かで読まれがちだ。コーディングベンチマークで90点を取るモデルは、ほぼ解決済みと見なされる。同じノリでいえば、研究ワークフローの30パーセントを完了するモデルは、ほとんどの場合失敗していると読めてしまう。

その読み方は、この数字の目的を見落としている。手書きの専門家タスクで30パーセントの完了率とは、エージェントが研究作業の定型部分の3分の1を処理できるということだ。環境構築、既存パイプラインの実行、データクリーニング、標準的な出力の生成などだ。残りの70パーセントは、ワークフローが明示していない判断をタスクが要求する場面か、次の行動を人間が決めなければならない形で手順が破綻する場面だ。

これは有用な切り分けだ。研究室には今日エージェントをどこに向ければよいかを教え、ツール開発者にはギャップがどこにあるかを教えてくれる。

ターミナルこそが面白い部分だ

エージェントをターミナルで動かすのは、仕事が実際に行われる場所でテストするという意図的な選択だ。研究ソフトウェアは大部分がコマンドラインソフトウェアだ。チャットウィンドウしか操作できないモデルは研究室の役に立たない。シェルに座り、ドキュメントを読み、ツールチェーンをインストールし、ビルドが失敗したときに復旧できるモデルは、別次元の有用さを持つ。

また、失敗モードが最も可視化される場所でもある。ターミナルはエラーを隠さない。コマンドが曖昧なメッセージを返したり、スクリプトが中途半端に終わったりすると、エージェントは再試行するか、アプローチを変えるか、停止するかを決めなければならない。この判断ポイントで70パーセントの大半が失われており、整ったテストスイートを持つコーディングベンチマークでは決して浮かび上がらない類のことだ。

Laboratory glassware on a stainless steel bench with a blurred dark screen behind

コーディングベンチマークとの違い

明らかな比較対象はコーディングベンチマークで、これはエージェントの進歩を宣伝する標準的な方法になっている。コーディングベンチマークは通常、リポジトリとテストスイートを伴って提供されるため、正解が定義され、スコアは自動で出る。そのため実行コストが低く比較も容易で、そうした数字が会話を支配している理由でもある。

研究ワークフローはその扱いに抵抗する。単一の正解出力がないことが多く、結果の品質は何をどう測定するかという判断に依存する。だからこそここのタスクはリポジトリから収集するのではなく専門家が書き、ベンチマークはテストの合格率ではなく完了率を報告する。

このトレードオフは、網羅性と引き換えに現実味を得るものだ。コーディングベンチマークは1日に何千回も実行でき、精度の高い数字を出せる。ワークフローベンチマークは遅くノイズも多いが、技術作業の大部分が実際に行われる環境をテストする。どちらも有用であり、以前に広く利用可能だったのは片方だけだ。

なぜこの数字はこのように測定されるのか

完了率は粗い指標であり、著者たちは意図的にそれを選んだ。ワークフローは完了するかしないかであり、それは結果の品質を判断せずとも外部の観察者が検証できる事実だ。エレガンスは採点されない。正しさについて議論もされない。エージェントはワークフローが求めた出力を生み出したか、途中で止まったかのどちらかだ。

その粗さが要点だ。自由形式の研究タスクの品質を採点しようとするベンチマークは、ベンチマーク作者の好みに収束しがちだ。完了率を採点することで、これはニュアンスと引き換えに再現性を得ている。2つの研究室が同じワークフローを実行すれば同じ答えが得られ、それによって数字は引用に値するものになる。

代償は、ほぼ完了したエージェントと即座に失敗したエージェントを区別できないことだ。どちらも失敗として数えられる。これは限界であり、将来のバージョンで対処されるかもしれないが、誰もが同意する粗い数字は、誰も信じない細かい数字に勝る。

この結果が科学研究について語るもの

このベンチマークは、エージェントがまもなく研究を行うという大きな主張に対する静かな答えだ。示しているのは、エージェントが研究を「実行」できるということ、つまり人間がすでに考案した手順を、定型的なステップの増え続ける割合において遂行できるということだ。まだできないのは、手順が未知で誰かが発明しなければならない部分だ。

このギャップは小さなエンジニアリングの詳細ではない。定型作業は科学者の時間の大きな割合を占めており、それを自動化すれば実際のコストと時間を節約できる。またそれは発見を生み出す部分でもない。この区別は、今後数年間でAIが科学に何をもたらすかを予測する誰にとっても重要だ。

この種のベンチマークの読み方

新しいベンチマークには2つの注意点がある。1つ目はバージョン番号だ。これは0.1であり、どのタスクが適切に定式化され、どれが曖昧か著者たちが学ぶにつれてタスクセットは変わる。異なるバージョンのスコアは直接比較できない。

2つ目は、ベンチマークはその著者が選んだワークフローを測定するということだ。科学分野から抽出された70のタスクはサンプルであり、全数調査ではない。30パーセントという数字は、研究作業におけるエージェント能力の全体像を示す良いシグナルだ。次の改訂を生き残るような精密な数字ではない。

注視すべきこと

注視すべき進歩は、見出しのパーセンテージが上がることではない。どのタスクが通り始めるかだ。エージェントが多段階の復旧を要するワークフローを突破し始めるなら、それは真の進歩だ。もし改善がより簡単なセットアップやデータクリーニングのタスクからのみ得られるなら、天井は見出しが示唆するより低い。

低い数字を正直に報告するベンチマークは、誰も再現できない高い数字を報告するものより有用だ。これは前者を行っており、この分野にはもっとそういうものが必要だ。

関連記事