Warum dieser Benchmark nützlich ist
Für quellenstarke Studierende und Forscher:innen ist das der lebende Science-Agent-Trenner: echte Labor-Workflows, noch weit von der Decke (beste veröffentlichte 0.1-Zeile ist 30 %).
TB-Science
Ob ein Agent echte wissenschaftliche Research-Workflows im Terminal zu Ende bringt: 70 von Expert:innen kuratierte Aufgaben über Life, Physical, Earth, Mathematical und Engineering Sciences, bewertet an konkreten Artefakten (Analysen, Simulationen, Beweise, Code, Datenprodukte).
Für quellenstarke Studierende und Forscher:innen ist das der lebende Science-Agent-Trenner: echte Labor-Workflows, noch weit von der Decke (beste veröffentlichte 0.1-Zeile ist 30 %).
Lies die Resolution-Rate mit dem Harness auf der Zeile. Claude Opus 5 + Claude Code führt die 0.1-Tabelle mit 30,0 %; GPT-5.6 Sol + Codex liegt bei 22,4 %. GLM-5.3 ist die stärkste Open-Weight-Zeile mit 8,1 %. Nicht mit Terminal-Bench-2.1-Coding-Headlines vergleichen.
Auf die Skala dieses Benchmarks normalisiert (0–100). Die Tabelle zeigt die Rohwerte.
Scores nutzen die eigene Einheit und Skala dieses Benchmarks, keinen universellen Qualitätswert.
| # | Modell | Veröffentlichung | Score | Herkunft | Beleglage |
|---|---|---|---|---|---|
| 1 | Claude Opus 5AnthropicOffizielle 0.1-Tabelle: Claude-Code-Harness, drei Trials × 70 Aufgaben. Nicht mit Terminal-Bench 2.1 mischen. | 2026-07-24 | 30% | Terminal-Bench-Science 0.1 announcement2026-08-27 | Quelle geprüft |
| 2 | GPT-5.6 SolOpenAIOffizielle 0.1-Tabelle: Codex-Harness. Gleiche Resolution wie Fable 5 bei weniger als einem Drittel der angekündigten Eval-Kosten. | 2026-07-09 | 22.4% | Terminal-Bench-Science 0.1 announcement2026-08-27 | Quelle geprüft |
| 3 | Claude Fable 5Anthropic | 2026-06-09 | 21.4% | Terminal-Bench-Science 0.1 announcement2026-08-27 | Quelle geprüft |
| 4 | Claude Opus 4.8Anthropic | 2026-05-28 | 10.5% | Terminal-Bench-Science 0.1 announcement2026-08-27 | Quelle geprüft |
| 5 | GPT-5.6 TerraOpenAI | 2026-07-09 | 8.6% | Terminal-Bench-Science 0.1 announcement2026-08-27 | Quelle geprüft |
| 6 | GLM-5.3ZhipuStärkste Open-Weight-Zeile auf der 0.1-Announcement-Tabelle. | 2026-08-14 | 8.1% | Terminal-Bench-Science 0.1 announcement2026-08-27 | Quelle geprüft |
| 7 | Kimi K3Moonshot | 2026-07-16 | 7.1% | Terminal-Bench-Science 0.1 announcement2026-08-27 | Quelle geprüft |
| 7 | Grok 4.6xAI | 2026-08-12 | 7.1% | Terminal-Bench-Science 0.1 announcement2026-08-27 | Quelle geprüft |
| 9 | GPT-5.6 LunaOpenAI | 2026-07-09 | 3.3% | Terminal-Bench-Science 0.1 announcement2026-08-27 | Quelle geprüft |
Scores aus dem Terminal-Bench-Science-0.1-Announcement (27. Aug. 2026): drei Trials pro Aufgabe, 70 Aufgaben. Arbeit an 0.2 läuft, PR-Deadline 5. Okt. 2026. Offizielles Terminal-Bench 4.0 ist eine andere Software-Engineering-Suite — nicht diese Seite.
Menschliche Expertenzeit ist Research-Workflow-Maßstab. Veröffentlichte 0.1-Resolution-Raten clustern bei oder unter 30 %.
Jede Antwort unten stammt aus den datierten Feldern dieser Seite. Nichts davon ist zusätzlich für Suchmaschinen geschrieben.
Ob ein Agent echte wissenschaftliche Research-Workflows im Terminal zu Ende bringt: 70 von Expert:innen kuratierte Aufgaben über Life, Physical, Earth, Mathematical und Engineering Sciences, bewertet an konkreten Artefakten (Analysen, Simulationen, Beweise, Code, Datenprodukte).
Ein starkes Terminal-Bench-Science-Ergebnis sagt nichts aus über:
Resolution-Rate über 70 Aufgaben (bestanden, wenn der versteckte Checker das Artefakt akzeptiert). VerdictPal-Zeilen nutzen die Announcement-Tabelle vom 27. Aug. 2026, eine Zeile pro Modell mit dem veröffentlichten Harness. Aufgabenformat: 70 containerisierte Harbor-Aufgaben. Agenten bekommen Terminal, Dateien und Tools; Grader prüfen das Artefakt mit aufgabenspezifischen Tests. Drei unabhängige Trials pro Aufgabe in der 0.1-Announcement-Tabelle.
Terminal-Bench-Science ist im Atlas derzeit als Aktiv markiert. Kontext zur Obergrenze: Menschliche Expertenzeit ist Research-Workflow-Maßstab. Veröffentlichte 0.1-Resolution-Raten clustern bei oder unter 30 %.
Das Kontaminationsrisiko für Terminal-Bench-Science ist als Kontamination niedrig eingestuft. Behandle jede Zeile auf dieser Seite als öffentliche Angabe mit Quelle und Datum, nicht als kontrolliertes Experiment.
The Pack · Redaktionsnewsletter
Eine kurze E-Mail, wenn ein Tool erscheint oder den Status wechselt. Kein Tracking, keine Drittanbieter-Analytics. Abmeldung mit einem Klick.