Benchmarks / Agentisch

Terminal-Bench

Terminal-Bench 2.1

Ob ein Agent realistische, containerisierte Terminal-Aufgaben (Terminal-Bench 2.1) erledigen kann: Code debuggen, Dateien bearbeiten, Befehle ausführen und das Artefakt liefern, das der versteckte Checker erwartet. 16 % Gewicht im AA Intelligence Index v4.1.

AgentischSolidAktivNiedriges KontaminationsrisikoSeit 2025
Was dieser Benchmark nicht misst
  • Nicht nur das Modell — Harness, Tools, Retries, Zeitlimits und Container-Setup können Werte stark verschieben.
  • Code-Wartbarkeit — eine bestandene Aufgabe kann trotzdem spröde Skripte oder kaum reviewbare Patches erzeugen.
  • Nicht jeden Entwickler-Workflow — Terminal-Aufgaben liegen näher an agentischem Operieren als an Produktdesign, Frontend-Polish oder langfristiger Repo-Pflege.
Analyse

Warum dieser Benchmark nützlich ist

Redaktionelle Einordnung ausstehendWir veröffentlichen zuerst Methodik und Ledger. Die benchmark-spezifische Analyse folgt nach der Desk-Prüfung.

Umfang

Abdeckung

Aufgabenfamilie
Agentisch
Format
Containerisierte Aufgaben mit Terminal-Umgebung; Agenten arbeiten über Befehle und werden durch aufgabenspezifische Checks bewertet.
Bewertung
Lösungs-/Passrate über auditierte Aufgaben. Agent-Harness und Modell-Paarung immer mitlesen.
Verantwortliche Stelle
Laude Institute / Terminal-Bench
Lesehilfe

So liest du die Scores

Die Lesehilfe steht noch aus. Nutze bis zur Desk-Einordnung Aufgabenformat, Bewertungsmethode und Quelldaten im Ledger.

Blinde Flecken

Was er nicht abdeckt

  • Nicht nur das Modell — Harness, Tools, Retries, Zeitlimits und Container-Setup können Werte stark verschieben.
  • Code-Wartbarkeit — eine bestandene Aufgabe kann trotzdem spröde Skripte oder kaum reviewbare Patches erzeugen.
  • Nicht jeden Entwickler-Workflow — Terminal-Aufgaben liegen näher an agentischem Operieren als an Produktdesign, Frontend-Polish oder langfristiger Repo-Pflege.
Scores

Evidenz-Ledger

69 Zeilen
6969 Zeilen
88.01%bester Score
68quellgeprüft
3Quellen
2026-07-21bis 2026-05-20
52

api · api

Terminal-Bench16

official-page · manual

Vendor claims1

manual-snapshot · manual

Verteilung

Wo die Zeilen liegen

0255075100

Auf die Skala dieses Benchmarks normalisiert (0–100). Die Tabelle zeigt die Rohwerte.

Zeitverlauf

Neueste Belege

  1. GPT-5.6 Sol88.01% ·
  2. GPT-5.6 Terra88.01% ·
  3. Kimi K385.02% ·
  4. Claude Fable 584.64% ·
  5. Grok 4.581.65% ·

Scores nutzen die eigene Einheit und Skala dieses Benchmarks, keinen universellen Qualitätswert.

#ModellVeröffentlichungScoreHerkunftBeleglage
1GPT-5.6 SolOpenAI2026-07-0988.01%
2026-07-21
Quelle geprüft
2GPT-5.6 TerraOpenAI2026-07-0988.01%
2026-07-21
Quelle geprüft
3Kimi K3Moonshot2026-07-1685.02%
2026-07-21
Quelle geprüft
4Claude Fable 5Anthropic2026-06-0984.64%
2026-07-21
Quelle geprüft
1Claude Mythos PreviewAnthropic2026-06-0184.1%
Terminal-Bench 2.0 leaderboard2026-06-02
Quelle geprüft
2GPT 5.5 (Codex CLI)OpenAI2026-04-2382%
Terminal-Bench 2.0 leaderboard2026-05-20
Quelle geprüft
3GPT 5.4 (ForgeCode)OpenAI2026-03-0581.8%
Terminal-Bench 2.0 leaderboard2026-05-20
Quelle geprüft
8Grok 4.5xAI2026-07-0881.65%
2026-07-21
Quelle geprüft
9GPT-5.6 LunaOpenAI2026-07-0980.9%
2026-07-21
Quelle geprüft
10Claude Sonnet 5Anthropic2026-06-3080.52%
2026-07-21
Quelle geprüft
11GPT-5.5 (medium)OpenAI2026-04-2380.52%
2026-07-21
Quelle geprüft
4Claude Opus 4.6 (ForgeCode)Anthropic2026-02-0179.8%
Terminal-Bench 2.0 leaderboard2026-05-20
Quelle geprüft
13GPT-5.5 (high)OpenAI2026-04-2379.4%
2026-07-21
Quelle geprüft
14GLM-5.2Zhipu2026-06-1377.9%
2026-07-21
Quelle geprüft
15Muse Spark 1.1Meta2026-07-0977.9%
2026-07-21
Quelle geprüft
4Gemini 3.5 FlashGoogle2026-05-1976.2%
Terminal-Bench 2.0 leaderboard2026-05-20
Quelle geprüft
5Claude Opus 4.8Anthropic2026-05-2874.6%
Terminal-Bench 2.0 leaderboard2026-05-20
Quelle geprüft
18Qwen3.7 MaxAlibaba2026-05-1974.53%
2026-07-21
Quelle geprüft
19Gemini 3.1 Pro PreviewGoogle2026-02-1973.78%
2026-07-21
Quelle geprüft
20Claude Sonnet 4.6 (Adaptive Reasoning, Max Effort)Anthropic2026-02-1771.16%
2026-07-21
Quelle geprüft
21LongCat-2.0MeituanVendor-gemeldeter LongCat-2.0-Wert; getrennt von auditierten Terminal-Bench-Leaderboard-Zeilen halten, bis ein unabhängiger Lauf vorliegt.2026-06-2970.8%
Meituan LongCat-2.0 release materials2026-06-29
Prüfung nötig
6Qwen 3.7 MaxAlibaba2026-05-2069.7%
Terminal-Bench 2.0 leaderboard2026-05-20
Quelle geprüft
7Claude Opus 4.7 (Adaptive)Anthropic2026-04-1669.4%
Terminal-Bench 2.0 leaderboard2026-05-20
Quelle geprüft
24Claude Sonnet 4.6Anthropic2026-02-1768.4%
Terminal-Bench 2.0 leaderboard2026-06-09
Quelle geprüft
8DeepSeek V4 Pro MaxDeepSeek2026-04-2467.9%
Terminal-Bench 2.0 leaderboard2026-05-20
Quelle geprüft
26Kimi K2.7 CodeMoonshot2026-06-1267.42%
2026-07-21
Quelle geprüft
9Kimi K2.6Moonshot2026-04-2066.7%
Terminal-Bench 2.0 leaderboard2026-05-20
Quelle geprüft
10MiniMax M3MiniMax2026-05-3166%
Terminal-Bench 2.0 leaderboard2026-05-20
Quelle geprüft
29GPT-5.5 (low)OpenAI2026-04-2365.54%
2026-07-21
Quelle geprüft
11Gemini 3.1 ProGoogle2026-02-1965.4%
Terminal-Bench 2.0 leaderboard2026-05-20
Quelle geprüft
31MiMo-V2.5-ProXiaomi2026-04-2265.17%
2026-07-21
Quelle geprüft
32DeepSeek V4 Pro (Reasoning, Max Effort)DeepSeek2026-04-2464.04%
2026-07-21
Quelle geprüft
33Grok 4.3xAI2026-04-3063.8%
Terminal-Bench 2.0 leaderboard2026-06-09
Quelle geprüft
34Muse SparkOther2026-01-0162.17%
2026-07-21
Quelle geprüft
35GLM-5.1Zhipu2026-04-0761.8%
2026-07-21
Quelle geprüft
36Claude Haiku 4.5Anthropic2025-10-0161.4%
Terminal-Bench 2.0 leaderboard2026-06-09
Quelle geprüft
37Qwen 3.7 PlusAlibaba2026-06-0261.05%
2026-07-21
Quelle geprüft
38GPT-5.4 NanoOpenAI2026-03-1760.67%
2026-07-21
Quelle geprüft
39GPT-5.4 MiniOpenAI2026-03-1759.18%
2026-07-21
Quelle geprüft
40Llama 4 ScoutMeta2026-04-0558.6%
Terminal-Bench 2.0 leaderboard2026-06-09
Quelle geprüft
41MiniMax M2.7MiniMax2026-04-1555.43%
2026-07-21
Quelle geprüft
42Claude Opus 4.7 (Non-reasoning, High Effort)Anthropic2026-04-1654.55%
2026-07-21
Quelle geprüft
43Nemotron 3 Ultra 550B A55B (Reasoning)NVIDIA2026-06-0453.93%
2026-07-21
Quelle geprüft
44GPT-5.3 Codex (xhigh)OpenAI2026-02-0553.03%
2026-07-21
Quelle geprüft
45GPT-5.1OpenAI2025-11-1352.43%
2026-07-21
Quelle geprüft
46GPT-5.2OpenAI2025-12-1146.97%
2026-07-21
Quelle geprüft
47Claude Opus 4.6 (Adaptive Reasoning, Max Effort)Anthropic2026-02-0546.21%
2026-07-21
Quelle geprüft
48Kimi K2.5Moonshot2026-01-2745.69%
2026-07-21
Quelle geprüft
49Gemma 4 31B ITGoogle2026-03-0143.45%
2026-07-21
Quelle geprüft
50Gemini 3 ProGoogle2025-11-1841.67%
2026-07-21
Quelle geprüft
51Claude Opus 4.5Anthropic2025-11-2440.91%
2026-07-21
Quelle geprüft
52Gemini 3.5 Flash (medium)Google2026-05-1939.39%
2026-07-21
Quelle geprüft
53Step 3.7 FlashStepFun2026-06-0139.33%
2026-07-21
Quelle geprüft
54Grok 4.20 ReasoningxAI2026-03-0537.88%
2026-07-21
Quelle geprüft
55OpenAI o3OpenAI2025-04-1637.12%
2026-07-21
Quelle geprüft
56North Mini CodeCohere2026-06-0935.58%
2026-07-21
Quelle geprüft
57MiniMax M2.5MiniMax2026-04-0134.85%
2026-07-21
Quelle geprüft
58Gemini 3 Flash PreviewGoogle2025-12-1731.82%
2026-07-21
Quelle geprüft
59Gemini 3.1 Flash LiteGoogle2026-05-0731.09%
2026-07-21
Quelle geprüft
60HyperNova 60B 2605Multiverse2026-05-0618.35%
2026-07-21
Quelle geprüft
61Gemma 4 12B (Reasoning)Google2026-06-0718.18%
2026-07-21
Quelle geprüft
62DeepSeek R1DeepSeek2025-01-2015.91%
2026-07-21
Quelle geprüft
63OpenAI o1OpenAI2024-09-1212.88%
2026-07-21
Quelle geprüft
64Mistral Large 3Mistral2025-12-0211.99%
2026-07-21
Quelle geprüft
65Gemma 4 12B (Non-reasoning)Google2026-06-1011.36%
2026-07-21
Quelle geprüft
66Llama 4 MaverickMeta2026-04-057.87%
2026-07-21
Quelle geprüft
67LFM2.5-8B-A1BLiquid2026-06-084.55%
2026-07-21
Quelle geprüft
68Command ACohere2026-03-150.76%
2026-07-21
Quelle geprüft
69MiniCPM5-1B (Reasoning)OpenBMB2026-06-040%
2026-07-21
Quelle geprüft
Methode

Was er abdeckt

Die Notiz zur Datenqualität steht aus. Jede Ledger-Zeile trägt weiterhin Quellen-URL, Quelldatum und Zeitpunkt des Einlesens.

Score-Obergrenze

Wo er an Grenzen stößt

Noch ist keine Obergrenze erfasst. Wenn sich Scores oben bündeln, kann der Benchmark Frontier-Modelle möglicherweise nicht mehr trennen.

Tools, die ihn ausweisen

Belege

Quellen und weiterführende Lektüre

The Pack · Redaktionsnewsletter

Neue Karten in dein Postfach. Kostenlos.

Eine kurze E-Mail, wenn eine Karte erscheint oder den Status wechselt. Kein Tracking, keine Drittanbieter-Analytics. Abmeldung mit einem Klick.