← Zurück zum Blog
Aica. 6 Min. Lesezeit

Frontier-Agenten schlossen 30 Prozent eines Forschungs-Workflows ab. Das ist die Zahl.

Veröffentlicht 4. Okt. 2026
Frontier-Agenten schlossen 30 Prozent eines Forschungs-Workflows ab. Das ist die Zahl.

Stanford hat einen neuen Benchmark namens Terminal-Bench-Science 0.1 veröffentlicht, und das Hauptergebnis ist deutlich weniger aufregend, als das Marketing rund um Agenten es normalerweise ist. Der Benchmark legte 70 von Experten geschriebene Forschungs-Workflows Frontier-Agenten vor. Der beste schaffte 30 Prozent davon.

Dreißig Prozent ist die Zahl, an der man sich festhalten sollte. Sie liest sich weder als Fehlschlag noch als Triumph. Es ist eine ehrliche Messung dessen, wo die Technologie steht, veröffentlicht von Leuten, die die Aufgaben von Hand geschrieben haben.

Was der Benchmark tatsächlich testet

Die Aufgaben sind wissenschaftliche Workflows, geschrieben von Fachleuten, und die Agenten laufen in einem Terminal. Diese Wahl ist wichtig. Ein Terminal ist eine Arbeitsumgebung, in der eine Aufgabe real ist: Man muss tatsächlich die Abhängigkeit installieren, die Datei schreiben, die Analyse ausführen und die Ausgabe überprüfen. Es gibt keine Teilpunkte für die Beschreibung des richtigen Ansatzes. Der Befehl funktioniert entweder oder nicht.

Die Workflows stammen aus der Forschungspraxis, die ein viel unordentlicheres Ziel ist als eine Coding-Aufgabe mit einer sauberen Testsuite. Ein Coding-Benchmark hat normalerweise eine definierte richtige Antwort, sodass er automatisch bewertet werden kann. Forschungsarbeit hat das oft nicht, weshalb der Aufbau eines solchen Benchmarks erforderte, dass Experten die Aufgaben schrieben, anstatt sie aus einem Repository zu ziehen.

Warum 30 Prozent die richtige Einordnung sind

Benchmarks werden tendenziell als bestanden oder durchgefallen gelesen. Ein Modell, das 90 in einem Coding-Benchmark erreicht, wird als nahezu gelöst behandelt. Ein Modell, das 30 Prozent der Forschungs-Workflows abschließt, kann im gleichen Geist als meistens scheiternd gelesen werden.

Diese Lesart verfehlt, wofür die Zahl steht. Dreißig Prozent Abschluss bei von Hand geschriebenen Expertenaufgaben bedeutet, dass die Agenten das routinemäßige Drittel der Forschungsarbeit bewältigen können: Umgebungen einrichten, etablierte Pipelines ausführen, Daten bereinigen, Standardausgaben erzeugen. Die anderen 70 Prozent sind der Bereich, in dem die Aufgabe Urteilsvermögen erfordert, das der Workflow nicht explizit gemacht hat, oder in dem ein Schritt so fehlschlägt, dass ein Mensch entscheiden muss, was als Nächstes zu tun ist.

Das ist eine nützliche Aufteilung. Sie sagt einem Labor, wo es einen Agenten heute einsetzen kann, und sie sagt einem Tool-Entwickler, wo die Lücke ist.

Das Terminal ist der interessante Teil

Agenten in einem Terminal laufen zu lassen, ist eine bewusste Entscheidung, sie dort zu testen, wo die Arbeit stattfindet. Forschungssoftware ist größtenteils Kommandozeilen-Software. Ein Modell, das nur ein Chat-Fenster bedienen kann, hilft einem Labor nicht. Ein Modell, das an einer Shell sitzen, die Dokumentation lesen, eine Toolchain installieren und sich erholen kann, wenn ein Build fehlschlägt, ist eine andere Kategorie von nützlich.

Es ist auch der Ort, an dem die Fehlermodi am sichtbarsten sind. Ein Terminal verbirgt keinen Fehler. Wenn ein Befehl eine mehrdeutige Meldung zurückgibt oder ein Skript halb durchläuft, muss der Agent entscheiden, ob er es erneut versucht, den Ansatz ändert oder aufhört. Dieser Entscheidungspunkt ist der Ort, an dem die meisten der 70 Prozent verloren gehen, und genau das ist die Art von Sache, die ein Coding-Benchmark mit einer sauberen Testsuite nie zutage fördern wird.

Laborgeräte aus Glas auf einer Edelstahlbank mit einem verschwommenen dunklen Bildschirm dahinter

Wie sich das von Coding-Benchmarks unterscheidet

Der offensichtliche Vergleich sind Coding-Benchmarks, die zur Standardmethode geworden sind, um Agentenfortschritt zu bewerben. Ein Coding-Benchmark wird typischerweise mit einem Repository und einer Testsuite geliefert, sodass die richtige Antwort definiert ist und die Bewertung automatisch erfolgt. Das macht ihn kostengünstig auszuführen und einfach zu vergleichen, und deshalb dominieren diese Zahlen die Diskussion.

Forschungs-Workflows widersetzen sich dieser Behandlung. Oft gibt es keine einzige richtige Ausgabe, und die Qualität eines Ergebnisses hängt von der Beurteilung ab, was und wie gemessen werden soll. Deshalb wurden die Aufgaben hier von Experten geschrieben, anstatt aus einem Repository gescraped, und deshalb meldet der Benchmark den Abschluss statt einer Bestehensquote bei Tests.

Der Tausch ist Abdeckung gegen Realismus. Ein Coding-Benchmark kann tausendfach am Tag ausgeführt werden und eine präzise Zahl liefern. Ein Workflow-Benchmark ist langsamer und verrauschter, aber er testet die Umgebung, in der ein großer Teil der technischen Arbeit tatsächlich stattfindet. Beide sind nützlich, und nur einer von ihnen war zuvor breit verfügbar.

Warum die Zahl so gemessen wird

Abschluss ist eine grobe Metrik, und die Autoren haben sie absichtlich gewählt. Ein Workflow wird entweder abgeschlossen oder nicht, und das ist eine Tatsache, die ein außenstehender Beobachter überprüfen kann, ohne die Qualität des Ergebnisses zu beurteilen. Eleganz wird nicht bewertet. Über Korrektheit wird nicht gestritten. Der Agent hat entweder die vom Workflow geforderte Ausgabe erzeugt oder irgendwo vorher aufgehört.

Diese Grobheit ist der Punkt. Benchmarks, die versuchen, Qualität bei offenen Forschungsaufgaben zu bewerten, neigen dazu, im Geschmack des Benchmark-Autors zu kollabieren. Durch die Bewertung des Abschlusses tauscht dieser Benchmark Nuance gegen Reproduzierbarkeit. Zwei Labore, die denselben Workflow ausführen, erhalten dieselbe Antwort, und das macht eine Zahl zitierwürdig.

Der Preis dafür ist, dass er einen Agenten, der fast fertig wurde, nicht von einem unterscheiden kann, der sofort scheiterte. Beide zählen als Fehlschläge. Das ist eine Einschränkung, und eine zukünftige Version könnte sie beheben, aber eine grobe Zahl, auf die sich alle einigen, ist besser als eine feine, der niemand traut.

Was das Ergebnis über wissenschaftliche Arbeit aussagt

Der Benchmark ist eine leise Antwort auf eine laute Behauptung, nämlich dass Agenten bald Forschung betreiben werden. Was er zeigt, ist, dass Agenten Forschung ausführen können, das heißt, sie können eine Prozedur ausführen, die ein Mensch bereits ausgearbeitet hat, über einen wachsenden Anteil routinemäßiger Schritte. Sie können noch nicht den Teil übernehmen, in dem die Prozedur unbekannt ist und jemand sie erfinden muss.

Diese Lücke ist kein kleines technisches Detail. Die Routinearbeit nimmt einen großen Teil der Zeit eines Wissenschaftlers ein, und ihre Automatisierung spart echtes Geld und Stunden. Sie ist auch nicht der Teil, der Entdeckungen hervorbringt. Die Unterscheidung ist wichtig für jeden, der prognostiziert, was KI in den nächsten Jahren mit der Wissenschaft macht.

Wie man solche Benchmarks liest

Zwei Vorsichtsmaßnahmen gelten für jeden neuen Benchmark. Die erste ist die Versionsnummer. Dies ist 0.1, was bedeutet, dass sich der Aufgabensatz ändern wird, während die Autoren lernen, welche Aufgaben gut gestellt und welche mehrdeutig sind. Ergebnisse aus verschiedenen Versionen sind nicht direkt vergleichbar.

Die zweite ist, dass ein Benchmark die Workflows misst, die seine Autoren ausgewählt haben. Siebzig Aufgaben aus wissenschaftlichen Domänen sind eine Stichprobe, keine Volkszählung. Die 30-Prozent-Zahl ist ein gutes Signal für die allgemeine Form der Agentenfähigkeit bei Forschungsarbeit. Sie ist keine präzise Zahl, die die nächste Überarbeitung überstehen wird.

Was zu beobachten ist

Der Fortschritt, den man beobachten sollte, ist nicht, dass die Schlagzeilen-Prozentsatz steigt. Es ist, welche Aufgaben anfangen zu bestehen. Wenn Agenten beginnen, Workflows zu bewältigen, die mehrstufige Wiederherstellung erfordern, ist das ein echter Fortschritt. Wenn der Zuwachs nur von einfacheren Setup- und Datenbereinigungsaufgaben kommt, ist die Obergrenze niedriger, als die Schlagzeile vermuten lässt.

Ein Benchmark, der ehrlich eine niedrige Zahl meldet, ist nützlicher als einer, der eine hohe Zahl meldet, die Leute nicht reproduzieren können. Dieser tut das Erstere, und das Feld braucht mehr davon.

Verwandte Artikel