Benchmarks / Agentisch

Terminal-Bench-Science

TB-Science

Ob ein Agent echte wissenschaftliche Research-Workflows im Terminal zu Ende bringt: 70 von Expert:innen kuratierte Aufgaben über Life, Physical, Earth, Mathematical und Engineering Sciences, bewertet an konkreten Artefakten (Analysen, Simulationen, Beweise, Code, Datenprodukte).

Was dieser Benchmark nicht misst
  • Nicht nur das Modell — jede veröffentlichte 0.1-Zeile nennt ein Agent-Harness (Claude Code, Codex, Grok Build). Die Harness-Wahl verschiebt den Wert.
  • Hypothesenbildung oder Paper-Schreiben — die Aufgaben sind ausführbare Workflows mit versteckten Checkern, keine offene Discovery.
  • Terminal-Bench-2.1-Software-Engineering — TB-Science ist eine separate, härtere Science-Suite. 2.1-Coding-Passraten nicht mit 0.1-Science-Resolution mischen.
Analyse

Warum dieser Benchmark nützlich ist

Für quellenstarke Studierende und Forscher:innen ist das der lebende Science-Agent-Trenner: echte Labor-Workflows, noch weit von der Decke (beste veröffentlichte 0.1-Zeile ist 30 %).

Umfang

Abdeckung

Aufgabenfamilie
Agentisch
Format
70 containerisierte Harbor-Aufgaben. Agenten bekommen Terminal, Dateien und Tools; Grader prüfen das Artefakt mit aufgabenspezifischen Tests. Drei unabhängige Trials pro Aufgabe in der 0.1-Announcement-Tabelle.
Bewertung
Resolution-Rate über 70 Aufgaben (bestanden, wenn der versteckte Checker das Artefakt akzeptiert). VerdictPal-Zeilen nutzen die Announcement-Tabelle vom 27. Aug. 2026, eine Zeile pro Modell mit dem veröffentlichten Harness.
Verantwortliche Stelle
Stanford / Laude Institute / Terminal-Bench
Lesehilfe

So liest du die Scores

Lies die Resolution-Rate mit dem Harness auf der Zeile. Claude Opus 5 + Claude Code führt die 0.1-Tabelle mit 30,0 %; GPT-5.6 Sol + Codex liegt bei 22,4 %. GLM-5.3 ist die stärkste Open-Weight-Zeile mit 8,1 %. Nicht mit Terminal-Bench-2.1-Coding-Headlines vergleichen.

Blinde Flecken

Was er nicht abdeckt

  • Nicht nur das Modell — jede veröffentlichte 0.1-Zeile nennt ein Agent-Harness (Claude Code, Codex, Grok Build). Die Harness-Wahl verschiebt den Wert.
  • Hypothesenbildung oder Paper-Schreiben — die Aufgaben sind ausführbare Workflows mit versteckten Checkern, keine offene Discovery.
  • Terminal-Bench-2.1-Software-Engineering — TB-Science ist eine separate, härtere Science-Suite. 2.1-Coding-Passraten nicht mit 0.1-Science-Resolution mischen.
Scores

Evidenz-Ledger

9 Zeilen
99 Zeilen
30%bester Score
9quellgeprüft
1Quellen
2026-08-27Quelldatum
Terminal-Bench9

official-page · manual

Verteilung

Wo die Zeilen liegen

0255075100

Auf die Skala dieses Benchmarks normalisiert (0–100). Die Tabelle zeigt die Rohwerte.

Zeitverlauf

Neueste Belege

  1. Claude Opus 530% · Terminal-Bench-Science 0.1 announcement
  2. GPT-5.6 Sol22.4% · Terminal-Bench-Science 0.1 announcement
  3. Claude Fable 521.4% · Terminal-Bench-Science 0.1 announcement
  4. Claude Opus 4.810.5% · Terminal-Bench-Science 0.1 announcement
  5. GPT-5.6 Terra8.6% · Terminal-Bench-Science 0.1 announcement

Scores nutzen die eigene Einheit und Skala dieses Benchmarks, keinen universellen Qualitätswert.

#ModellVeröffentlichungScoreHerkunftBeleglage
1Claude Opus 5AnthropicOffizielle 0.1-Tabelle: Claude-Code-Harness, drei Trials × 70 Aufgaben. Nicht mit Terminal-Bench 2.1 mischen.2026-07-2430%
Terminal-Bench-Science 0.1 announcement2026-08-27
Quelle geprüft
2GPT-5.6 SolOpenAIOffizielle 0.1-Tabelle: Codex-Harness. Gleiche Resolution wie Fable 5 bei weniger als einem Drittel der angekündigten Eval-Kosten.2026-07-0922.4%
Terminal-Bench-Science 0.1 announcement2026-08-27
Quelle geprüft
3Claude Fable 5Anthropic2026-06-0921.4%
Terminal-Bench-Science 0.1 announcement2026-08-27
Quelle geprüft
4Claude Opus 4.8Anthropic2026-05-2810.5%
Terminal-Bench-Science 0.1 announcement2026-08-27
Quelle geprüft
5GPT-5.6 TerraOpenAI2026-07-098.6%
Terminal-Bench-Science 0.1 announcement2026-08-27
Quelle geprüft
6GLM-5.3ZhipuStärkste Open-Weight-Zeile auf der 0.1-Announcement-Tabelle.2026-08-148.1%
Terminal-Bench-Science 0.1 announcement2026-08-27
Quelle geprüft
7Kimi K3Moonshot2026-07-167.1%
Terminal-Bench-Science 0.1 announcement2026-08-27
Quelle geprüft
7Grok 4.6xAI2026-08-127.1%
Terminal-Bench-Science 0.1 announcement2026-08-27
Quelle geprüft
9GPT-5.6 LunaOpenAI2026-07-093.3%
Terminal-Bench-Science 0.1 announcement2026-08-27
Quelle geprüft
Methode

Was er abdeckt

Scores aus dem Terminal-Bench-Science-0.1-Announcement (27. Aug. 2026): drei Trials pro Aufgabe, 70 Aufgaben. Arbeit an 0.2 läuft, PR-Deadline 5. Okt. 2026. Offizielles Terminal-Bench 4.0 ist eine andere Software-Engineering-Suite — nicht diese Seite.

Score-Obergrenze

Wo er an Grenzen stößt

Menschliche Expertenzeit ist Research-Workflow-Maßstab. Veröffentlichte 0.1-Resolution-Raten clustern bei oder unter 30 %.

Tools, die ihn ausweisen

Belege

Quellen und weiterführende Lektüre

Fragen zu diesem Benchmark

Jede Antwort unten stammt aus den datierten Feldern dieser Seite. Nichts davon ist zusätzlich für Suchmaschinen geschrieben.

Was misst Terminal-Bench-Science?

Ob ein Agent echte wissenschaftliche Research-Workflows im Terminal zu Ende bringt: 70 von Expert:innen kuratierte Aufgaben über Life, Physical, Earth, Mathematical und Engineering Sciences, bewertet an konkreten Artefakten (Analysen, Simulationen, Beweise, Code, Datenprodukte).

Was beweist ein hoher Terminal-Bench-Science-Wert nicht?

Ein starkes Terminal-Bench-Science-Ergebnis sagt nichts aus über:

  • Nicht nur das Modell — jede veröffentlichte 0.1-Zeile nennt ein Agent-Harness (Claude Code, Codex, Grok Build). Die Harness-Wahl verschiebt den Wert.
  • Hypothesenbildung oder Paper-Schreiben — die Aufgaben sind ausführbare Workflows mit versteckten Checkern, keine offene Discovery.
  • Terminal-Bench-2.1-Software-Engineering — TB-Science ist eine separate, härtere Science-Suite. 2.1-Coding-Passraten nicht mit 0.1-Science-Resolution mischen.

Wie wird Terminal-Bench-Science bewertet?

Resolution-Rate über 70 Aufgaben (bestanden, wenn der versteckte Checker das Artefakt akzeptiert). VerdictPal-Zeilen nutzen die Announcement-Tabelle vom 27. Aug. 2026, eine Zeile pro Modell mit dem veröffentlichten Harness. Aufgabenformat: 70 containerisierte Harbor-Aufgaben. Agenten bekommen Terminal, Dateien und Tools; Grader prüfen das Artefakt mit aufgabenspezifischen Tests. Drei unabhängige Trials pro Aufgabe in der 0.1-Announcement-Tabelle.

Ist Terminal-Bench-Science gesättigt?

Terminal-Bench-Science ist im Atlas derzeit als Aktiv markiert. Kontext zur Obergrenze: Menschliche Expertenzeit ist Research-Workflow-Maßstab. Veröffentlichte 0.1-Resolution-Raten clustern bei oder unter 30 %.

Können Terminal-Bench-Science-Ergebnisse durch Trainingsdaten verunreinigt sein?

Das Kontaminationsrisiko für Terminal-Bench-Science ist als Kontamination niedrig eingestuft. Behandle jede Zeile auf dieser Seite als öffentliche Angabe mit Quelle und Datum, nicht als kontrolliertes Experiment.

The Pack · Redaktionsnewsletter

Neue Tools in dein Postfach. Kostenlos.

Eine kurze E-Mail, wenn ein Tool erscheint oder den Status wechselt. Kein Tracking, keine Drittanbieter-Analytics. Abmeldung mit einem Klick.