Benchmarks / Agentisch

Terminal-Bench

Terminal-Bench 2.1

Ob ein Agent realistische, containerisierte Terminal-Aufgaben (Terminal-Bench 2.1 in der öffentlichen AA-API) erledigen kann: Code debuggen, Dateien bearbeiten, Befehle ausführen und das Artefakt liefern, das der versteckte Checker erwartet. Index v4.2 gewichtete diese Suite mit 10 %; Index v4.3 nutzt im Composite Terminal-Bench v4.0.

Was dieser Benchmark nicht misst
  • Nicht nur das Modell — Harness, Tools, Retries, Zeitlimits und Container-Setup können Werte stark verschieben.
  • Code-Wartbarkeit — eine bestandene Aufgabe kann trotzdem spröde Skripte oder kaum reviewbare Patches erzeugen.
  • Nicht jeden Entwickler-Workflow — Terminal-Aufgaben liegen näher an agentischem Operieren als an Produktdesign, Frontend-Polish oder langfristiger Repo-Pflege.
Analyse

Warum dieser Benchmark nützlich ist

Wenn du realistische containerisierte Terminal-Arbeit brauchst — Debug, Dateien, Befehle, Artefakte — als agentisches Ops-Signal. Diese Seite trackt AAs veröffentlichte 2.1-/Hard-Zeilen, nicht das v4.0-Slice im Index v4.3.

Umfang

Abdeckung

Aufgabenfamilie
Agentisch
Format
Containerisierte Aufgaben mit Terminal-Umgebung; Agenten arbeiten über Befehle und werden durch aufgabenspezifische Checks bewertet.
Bewertung
Lösungs-/Passrate über auditierte Aufgaben. Agent-Harness und Modell-Paarung immer mitlesen.
Verantwortliche Stelle
Laude Institute / Terminal-Bench
Lesehilfe

So liest du die Scores

Lösungs-/Passrate auf auditierten Terminal-Bench-2.1-Aufgaben aus der AA-API (`terminalbench_v2_1` / Hard). Frontier-2.1-Passraten liegen in den hohen 80ern bis niedrigen 90ern — das ist die leichtere Suite. Das Coding-Slice von Index v4.3 nutzt Terminal-Bench v4.0 (AA berichtete Astra Max 59,1 % gegen Fable 5.1 52,0 % am 7. Sep. 2026), aber dieser Schlüssel fehlt im API-Payload vom 10. Sep. 2026, daher bleibt dieses Ledger auf 2.1, bis AA v4-Zeilen publiziert. Modell immer mit Harness, Tools, Retries und Zeitlimits lesen.

Blinde Flecken

Was er nicht abdeckt

  • Nicht nur das Modell — Harness, Tools, Retries, Zeitlimits und Container-Setup können Werte stark verschieben.
  • Code-Wartbarkeit — eine bestandene Aufgabe kann trotzdem spröde Skripte oder kaum reviewbare Patches erzeugen.
  • Nicht jeden Entwickler-Workflow — Terminal-Aufgaben liegen näher an agentischem Operieren als an Produktdesign, Frontend-Polish oder langfristiger Repo-Pflege.
Scores

Evidenz-Ledger

189 Zeilen
189189 Zeilen
91.39%bester Score
188quellgeprüft
3Quellen
2026-09-10bis 2026-05-20
172

api · api

Terminal-Bench16

official-page · manual

Vendor claims1

manual-snapshot · manual

Verteilung

Wo die Zeilen liegen

0255075100

Auf die Skala dieses Benchmarks normalisiert (0–100). Die Tabelle zeigt die Rohwerte.

Zeitverlauf

Neueste Belege

  1. Claude Fable 5.191.39% ·
  2. Claude Opus 5 (Adaptive Reasoning, Max Effort)89.14% ·
  3. GPT-6 Astra88.39% ·
  4. Grok 4.688.39% ·
  5. Claude Opus 5 (Adaptive Reasoning, Xhigh Effort)88.01% ·

Scores nutzen die eigene Einheit und Skala dieses Benchmarks, keinen universellen Qualitätswert.

#ModellVeröffentlichungScoreHerkunftBeleglage
1Claude Fable 5.1Anthropic2026-09-0191.39%
2026-09-10
Quelle geprüft
2Claude Opus 5 (Adaptive Reasoning, Max Effort)Anthropic2026-07-2489.14%
2026-09-10
Quelle geprüft
3GPT-6 AstraOpenAI2026-09-0388.39%
2026-09-10
Quelle geprüft
4Grok 4.6xAI2026-08-1288.39%
2026-09-10
Quelle geprüft
5Claude Opus 5 (Adaptive Reasoning, Xhigh Effort)Anthropic2026-07-2488.01%
2026-09-10
Quelle geprüft
6GPT-5.6 SolOpenAI2026-07-0988.01%
2026-09-10
Quelle geprüft
7GPT-5.6 TerraOpenAI2026-07-0988.01%
2026-09-10
Quelle geprüft
8Claude Opus 5 (Adaptive Reasoning, High Effort)Anthropic2026-07-2487.64%
2026-09-10
Quelle geprüft
9Gemini 3.8 FlashGoogle2026-09-0287.64%
2026-09-10
Quelle geprüft
10Claude Opus 5 (Adaptive Reasoning, Medium Effort)Anthropic2026-07-2486.14%
2026-09-10
Quelle geprüft
11Qwen3.8-Flash-NextAlibaba2026-08-2686.14%
2026-09-10
Quelle geprüft
12Gemini 3.7 FlashGoogle2026-08-1385.77%
2026-09-10
Quelle geprüft
13Kimi K3Moonshot2026-07-1685.02%
2026-09-10
Quelle geprüft
14Claude Fable 5Anthropic2026-06-0984.64%
2026-09-10
Quelle geprüft
15GLM-5.3-FlashZhipu2026-08-2684.27%
2026-09-10
Quelle geprüft
16Muse Spark 1.3Meta2026-09-0284.27%
2026-09-10
Quelle geprüft
1Claude Mythos PreviewAnthropic2026-06-0184.1%
Terminal-Bench 2.0 leaderboard2026-06-02
Quelle geprüft
18GLM-5.3Zhipu2026-08-1483.9%
2026-09-10
Quelle geprüft
19Kimi K3 (low)Moonshot2026-07-1682.4%
2026-09-10
Quelle geprüft
20Qwen3.8 2.4T A95BAlibaba2026-08-1282.02%
2026-09-10
Quelle geprüft
2GPT 5.5 (Codex CLI)OpenAI2026-04-2382%
Terminal-Bench 2.0 leaderboard2026-05-20
Quelle geprüft
3GPT 5.4 (ForgeCode)OpenAI2026-03-0581.8%
Terminal-Bench 2.0 leaderboard2026-05-20
Quelle geprüft
23Grok 4.5xAI2026-07-0881.65%
2026-09-10
Quelle geprüft
24Qwen3.8 MaxAlibaba2026-08-0381.27%
2026-09-10
Quelle geprüft
25GPT-5.6 LunaOpenAI2026-07-0980.9%
2026-09-10
Quelle geprüft
26Claude Sonnet 5Anthropic2026-06-3080.52%
2026-09-10
Quelle geprüft
27GPT-5.5 (medium)OpenAI2026-04-2380.52%
2026-09-10
Quelle geprüft
28Muse Spark 1.2Meta2026-08-0580.15%
2026-09-10
Quelle geprüft
4Claude Opus 4.6 (ForgeCode)Anthropic2026-02-0179.8%
Terminal-Bench 2.0 leaderboard2026-05-20
Quelle geprüft
30Qwen3.8 27BAlibaba2026-08-1479.78%
2026-09-10
Quelle geprüft
31GPT-5.5 (high)OpenAI2026-04-2379.4%
2026-09-10
Quelle geprüft
32DeepSeek V4 Flash 0731 (Reasoning, Max Effort)DeepSeek2026-07-3178.65%
2026-09-10
Quelle geprüft
33DeepSeek V4 Pro 0813 (Reasoning, Max Effort)DeepSeek2026-08-1378.65%
2026-09-10
Quelle geprüft
34GLM-5.2Zhipu2026-06-1377.9%
2026-09-10
Quelle geprüft
35Muse Spark 1.1Meta2026-07-0977.9%
2026-09-10
Quelle geprüft
36Gemini 3.6 Flash (high)Google2026-07-2177.53%
2026-09-10
Quelle geprüft
37Claude Opus 5 (Adaptive Reasoning, Low Effort)Anthropic2026-07-2476.4%
2026-09-10
Quelle geprüft
4Gemini 3.5 FlashGoogle2026-05-1976.2%
Terminal-Bench 2.0 leaderboard2026-05-20
Quelle geprüft
39Motif 3Other2026-08-1274.91%
2026-09-10
Quelle geprüft
5Claude Opus 4.8Anthropic2026-05-2874.6%
Terminal-Bench 2.0 leaderboard2026-05-20
Quelle geprüft
41Qwen3.7 MaxAlibaba2026-05-1974.53%
2026-09-10
Quelle geprüft
42DeepSeek V4 Flash Vision (Reasoning, Max Effort)DeepSeek2026-08-2174.16%
2026-09-10
Quelle geprüft
43Gemini 3.1 Pro PreviewGoogle2026-02-1973.78%
2026-09-10
Quelle geprüft
44K2 Horizon 375B A23BOther2026-09-0371.91%
2026-09-10
Quelle geprüft
45Claude Sonnet 4.6 (Adaptive Reasoning, Max Effort)Anthropic2026-02-1771.16%
2026-09-10
Quelle geprüft
46LongCat-2.0MeituanVendor-gemeldeter LongCat-2.0-Wert; getrennt von auditierten Terminal-Bench-Leaderboard-Zeilen halten, bis ein unabhängiger Lauf vorliegt.2026-06-2970.8%
Meituan LongCat-2.0 release materials2026-06-29
Prüfung nötig
47Motif 3 (Beta)Other2026-07-2170.79%
2026-09-10
Quelle geprüft
48KAT Coder Pro V2Other2026-03-2770.04%
2026-09-10
Quelle geprüft
6Qwen 3.7 MaxAlibaba2026-05-2069.7%
Terminal-Bench 2.0 leaderboard2026-05-20
Quelle geprüft
50Agnes 2.5 Pro BetaOther2026-08-2669.66%
2026-09-10
Quelle geprüft
51Apodex 1.1Other2026-08-3069.66%
2026-09-10
Quelle geprüft
7Claude Opus 4.7 (Adaptive)Anthropic2026-04-1669.4%
Terminal-Bench 2.0 leaderboard2026-05-20
Quelle geprüft
53Claude Sonnet 4.6Anthropic2026-02-1768.4%
Terminal-Bench 2.0 leaderboard2026-06-09
Quelle geprüft
8DeepSeek V4 Pro MaxDeepSeek2026-04-2467.9%
Terminal-Bench 2.0 leaderboard2026-05-20
Quelle geprüft
55Nex-N2-ProOther2026-06-0267.79%
2026-09-10
Quelle geprüft
56Kimi K2.7 CodeMoonshot2026-06-1267.42%
2026-09-10
Quelle geprüft
57Agnes 2.5 Pro AlphaOther2026-07-2467.04%
2026-09-10
Quelle geprüft
9Kimi K2.6Moonshot2026-04-2066.7%
Terminal-Bench 2.0 leaderboard2026-05-20
Quelle geprüft
10MiniMax M3MiniMax2026-05-3166%
Terminal-Bench 2.0 leaderboard2026-05-20
Quelle geprüft
60GPT-5.5 (low)OpenAI2026-04-2365.54%
2026-09-10
Quelle geprüft
11Gemini 3.1 ProGoogle2026-02-1965.4%
Terminal-Bench 2.0 leaderboard2026-05-20
Quelle geprüft
62MiMo-V2.5-ProXiaomi2026-04-2265.17%
2026-09-10
Quelle geprüft
63DeepSeek V4 Pro (Reasoning, High Effort)DeepSeek2026-04-2464.79%
2026-09-10
Quelle geprüft
64Hy3Other2026-07-0664.42%
2026-09-10
Quelle geprüft
65Grok 4.3xAI2026-04-3063.8%
Terminal-Bench 2.0 leaderboard2026-06-09
Quelle geprüft
66MiMo-V2.5Xiaomi2026-04-2263.67%
2026-09-10
Quelle geprüft
67Muse SparkOther2026-01-0162.17%
2026-09-10
Quelle geprüft
68GLM-5.1Zhipu2026-04-0761.8%
2026-09-10
Quelle geprüft
69Qwen3.6 PlusAlibaba2026-04-0261.42%
2026-09-10
Quelle geprüft
70Claude Haiku 4.5Anthropic2025-10-0161.4%
Terminal-Bench 2.0 leaderboard2026-06-09
Quelle geprüft
71GPT-5.5 (Non-reasoning)OpenAI2026-04-2361.05%
2026-09-10
Quelle geprüft
72Qwen 3.7 PlusAlibaba2026-06-0261.05%
2026-09-10
Quelle geprüft
73GPT-5.4 NanoOpenAI2026-03-1760.67%
2026-09-10
Quelle geprüft
74Qwen3.6 27B (Reasoning)Alibaba2026-04-2260.67%
2026-09-10
Quelle geprüft
75JT-4.1 Flash 236B A21BOther2026-07-0959.55%
2026-09-10
Quelle geprüft
76GPT-5.4 MiniOpenAI2026-03-1759.18%
2026-09-10
Quelle geprüft
77Llama 4 ScoutMeta2026-04-0558.6%
Terminal-Bench 2.0 leaderboard2026-06-09
Quelle geprüft
78Solar Pro 4Other2026-08-0657.3%
2026-09-10
Quelle geprüft
79DeepSeek V4 Flash (Reasoning, High Effort)DeepSeek2026-04-2456.93%
2026-09-10
Quelle geprüft
80Claude 4.5 Sonnet (Reasoning)Anthropic2025-09-2955.81%
2026-09-10
Quelle geprüft
81Ling 3.0 FlashOther2026-08-0455.43%
2026-09-10
Quelle geprüft
82MiniMax M2.7MiniMax2026-04-1555.43%
2026-09-10
Quelle geprüft
83Inkling (xhigh)Other2026-07-1555.06%
2026-09-10
Quelle geprüft
84Inkling SmallOther2026-07-3055.06%
2026-09-10
Quelle geprüft
85Claude Opus 4.7 (Non-reasoning, High Effort)Anthropic2026-04-1654.55%
2026-09-10
Quelle geprüft
86Nemotron 3 Ultra 550B A55B (Reasoning)NVIDIA2026-06-0453.93%
2026-09-10
Quelle geprüft
87Gemini 3.5 Flash-LiteGoogle2026-07-2153.56%
2026-09-10
Quelle geprüft
88GPT-5.3 Codex (xhigh)OpenAI2026-02-0553.03%
2026-09-10
Quelle geprüft
89GPT-5.1OpenAI2025-11-1352.43%
2026-09-10
Quelle geprüft
90Grok Build 0.1 0616xAI2026-06-1652.06%
2026-09-10
Quelle geprüft
91GLM-5.2 (Non-reasoning)Zhipu2026-06-1651.69%
2026-09-10
Quelle geprüft
92Muse GlimmerMeta2026-08-1051.69%
2026-09-10
Quelle geprüft
93Qwen3.5 397B A17B (Reasoning)Alibaba2026-02-1651.31%
2026-09-10
Quelle geprüft
94Qwen3.6 27B (Non-reasoning)Alibaba2026-04-2251.31%
2026-09-10
Quelle geprüft
95Mistral Medium 3.5Mistral2026-04-2950.56%
2026-09-10
Quelle geprüft
96Qwen3.5 122B A10B (Reasoning)Alibaba2026-02-2447.57%
2026-09-10
Quelle geprüft
97Claude Opus 4.5 (Reasoning)Anthropic2025-11-2446.97%
2026-09-10
Quelle geprüft
98GPT-5.2OpenAI2025-12-1146.97%
2026-09-10
Quelle geprüft
99DeepSeek V3.2 (Reasoning)DeepSeek2025-12-0146.82%
2026-09-10
Quelle geprüft
100Claude Opus 4.6 (Adaptive Reasoning, Max Effort)Anthropic2026-02-0546.21%
2026-09-10
Quelle geprüft
101Gemini 3.5 Flash (minimal)Google2026-05-1946.21%
2026-09-10
Quelle geprüft
102Kimi K2.5Moonshot2026-01-2745.69%
2026-09-10
Quelle geprüft
103GLM-4.7 (Reasoning)Zhipu2025-12-2245.32%
2026-09-10
Quelle geprüft
104Qwen3.6 35B A3B (Reasoning)Alibaba2026-04-1644.94%
2026-09-10
Quelle geprüft
105Solar Open2 250BOther2026-08-1244.19%
2026-09-10
Quelle geprüft
106Qwen3.6 Max PreviewAlibaba2026-04-2043.94%
2026-09-10
Quelle geprüft
107Gemma 4 31B ITGoogle2026-03-0143.45%
2026-09-10
Quelle geprüft
108GLM-5 (Reasoning)Zhipu2026-02-1143.18%
2026-09-10
Quelle geprüft
109GPT-5.2 (medium)OpenAI2025-12-1143.18%
2026-09-10
Quelle geprüft
110GPT-5.4 (low)OpenAI2026-03-0543.18%
2026-09-10
Quelle geprüft
111Ring-2.6-1TOther2026-05-0843.07%
2026-09-10
Quelle geprüft
112Claude Sonnet 4.6 (Non-reasoning, Low Effort)Anthropic2026-02-1742.42%
2026-09-10
Quelle geprüft
113GPT-5.5 Instant (May 2026)OpenAI2026-05-0542.42%
2026-09-10
Quelle geprüft
114Gemini 3 ProGoogle2025-11-1841.67%
2026-09-10
Quelle geprüft
115Qwen3.6 35B A3B (Non-reasoning)Alibaba2026-04-1641.57%
2026-09-10
Quelle geprüft
116Claude Opus 4.5Anthropic2025-11-2440.91%
2026-09-10
Quelle geprüft
117Grok 4.20 0309 (Reasoning)xAI2026-03-1040.91%
2026-09-10
Quelle geprüft
118MiMo-V2-ProXiaomi2026-03-1840.91%
2026-09-10
Quelle geprüft
119K-EXAONE 2.0 0803Other2026-08-1240.45%
2026-09-10
Quelle geprüft
120Gemini 3.5 Flash (medium)Google2026-05-1939.39%
2026-09-10
Quelle geprüft
121GLM-5 (Non-reasoning)Zhipu2026-02-1139.39%
2026-09-10
Quelle geprüft
122Step 3.7 FlashStepFun2026-06-0139.33%
2026-09-10
Quelle geprüft
123A.X-K2Other2026-08-1238.95%
2026-09-10
Quelle geprüft
124Gemini 3 Flash Preview (Reasoning)Google2025-12-1738.64%
2026-09-10
Quelle geprüft
125GPT-5 (medium)OpenAI2025-08-0737.88%
2026-09-10
Quelle geprüft
126GPT-5 Codex (high)OpenAI2025-09-2337.88%
2026-09-10
Quelle geprüft
127Grok 4xAI2025-07-1037.88%
2026-09-10
Quelle geprüft
128Grok 4.20 ReasoningxAI2026-03-0537.88%
2026-09-10
Quelle geprüft
129Kimi K2.6 (Non-reasoning)Other2026-04-2037.88%
2026-09-10
Quelle geprüft
130GPT-5.2 Codex (xhigh)OpenAI2025-12-1137.12%
2026-09-10
Quelle geprüft
131OpenAI o3OpenAI2025-04-1637.12%
2026-09-10
Quelle geprüft
132DeepSeek V4 Pro (Non-reasoning)DeepSeek2026-04-2436.36%
2026-09-10
Quelle geprüft
133MiMo-V2-Omni-0327Xiaomi2026-03-2735.61%
2026-09-10
Quelle geprüft
134MiMo-V2.5-Pro (Non-reasoning)Xiaomi2026-04-2235.61%
2026-09-10
Quelle geprüft
135Qwen3.5 397B A17B (Non-reasoning)Alibaba2026-02-1635.61%
2026-09-10
Quelle geprüft
136North Mini CodeCohere2026-06-0935.58%
2026-09-10
Quelle geprüft
137GPT-5 (high)OpenAI2025-08-0735.21%
2026-09-10
Quelle geprüft
138GPT-5.1 Codex (high)OpenAI2025-11-1334.85%
2026-09-10
Quelle geprüft
139MiMo-V2-OmniXiaomi2026-03-1934.85%
2026-09-10
Quelle geprüft
140MiniMax M2.5MiniMax2026-04-0134.85%
2026-09-10
Quelle geprüft
141GPT-5.5 Instant (June 2026)OpenAI2026-06-2534.83%
2026-09-10
Quelle geprüft
142Claude 4.1 Opus (Reasoning)Anthropic2025-08-0534.34%
2026-09-10
Quelle geprüft
143DeepSeek V4 Flash (Non-reasoning)DeepSeek2026-04-2434.09%
2026-09-10
Quelle geprüft
144Gemini 3 Pro Preview (low)Google2025-11-1834.09%
2026-09-10
Quelle geprüft
145Hy3-preview (Reasoning)Other2026-04-2334.09%
2026-09-10
Quelle geprüft
146Grok 4.3 (Non-reasoning)xAI2026-04-3034.08%
2026-09-10
Quelle geprüft
147GLM-5-TurboZhipu2026-03-1533.33%
2026-09-10
Quelle geprüft
148G9v3-39A5BOther2026-08-0332.58%
2026-09-10
Quelle geprüft
149GLM 5V Turbo (Reasoning)Zhipu2026-04-0132.58%
2026-09-10
Quelle geprüft
150Qwen3.5 27B (Reasoning)Alibaba2026-02-2432.58%
2026-09-10
Quelle geprüft
151Gemini 3 Flash PreviewGoogle2025-12-1731.82%
2026-09-10
Quelle geprüft
152Hy3-preview (Non-reasoning)Other2026-04-2331.82%
2026-09-10
Quelle geprüft
153Gemini 3.1 Flash LiteGoogle2026-05-0731.09%
2026-09-10
Quelle geprüft
154Claude 4 Opus (Reasoning)Anthropic2025-05-2231.06%
2026-09-10
Quelle geprüft
155Kimi K2 ThinkingMoonshot2025-11-0631.06%
2026-09-10
Quelle geprüft
156Ling-2.6-1TOther2026-04-2331.06%
2026-09-10
Quelle geprüft
157MiMo-V2-Flash (Feb 2026)Xiaomi2025-12-1631.06%
2026-09-10
Quelle geprüft
158Grok 4.3 (medium)xAI2026-04-3030.3%
2026-09-10
Quelle geprüft
159JT-35B-FlashOther2026-05-1428.79%
2026-09-10
Quelle geprüft
160MiniMax-M2.1MiniMax2025-12-2328.79%
2026-09-10
Quelle geprüft
161MiMo-V2-Flash (Reasoning)Xiaomi2025-12-1628.03%
2026-09-10
Quelle geprüft
162Ling 3.0 TinyOther2026-08-0627.72%
2026-09-10
Quelle geprüft
163Gemma 4 12B (Reasoning)Google2026-06-0727.34%
2026-09-10
Quelle geprüft
164Granite 4.2 30BOther2026-08-2526.59%
2026-09-10
Quelle geprüft
165GPT-5 (low)OpenAI2025-08-0726.52%
2026-09-10
Quelle geprüft
166Grok 4.3 (low)xAI2026-04-3026.52%
2026-09-10
Quelle geprüft
167Ling 2.6 FlashOther2026-04-2124.34%
2026-09-10
Quelle geprüft
168Nemotron 3.5 LightningNVIDIA2026-08-1124.34%
2026-09-10
Quelle geprüft
169Qwen3 Max ThinkingAlibaba2026-01-2624.24%
2026-09-10
Quelle geprüft
170EXAONE 4.5 33BOther2026-04-0921.35%
2026-09-10
Quelle geprüft
171Granite 4.2 8BOther2026-08-2518.35%
2026-09-10
Quelle geprüft
172JT-MINIOther2026-04-1518.18%
2026-09-10
Quelle geprüft
173Grok 4.20 0309 v2 (Non-reasoning)xAI2026-04-0716.67%
2026-09-10
Quelle geprüft
174DeepSeek R1DeepSeek2025-01-2015.91%
2026-09-10
Quelle geprüft
175Granite 4.2 3BOther2026-08-2513.86%
2026-09-10
Quelle geprüft
176OpenAI o1OpenAI2024-09-1212.88%
2026-09-10
Quelle geprüft
177DiffusionGemma 26B A4BGoogle2026-06-1012.36%
2026-09-10
Quelle geprüft
178Mistral Large 3Mistral2025-12-0211.99%
2026-09-10
Quelle geprüft
179Gemma 4 12B (Non-reasoning)Google2026-06-1011.36%
2026-09-10
Quelle geprüft
180MiniCPM5-2BOpenBMB2026-09-078.61%
2026-09-10
Quelle geprüft
181Llama 4 MaverickMeta2026-04-057.87%
2026-09-10
Quelle geprüft
182Nemotron 3 Nano Omni 30B A3B ReasoningNVIDIA2026-04-296.74%
2026-09-10
Quelle geprüft
183G9v3-3BOther2026-07-235.99%
2026-09-10
Quelle geprüft
184LFM2.5-8B-A1BLiquid2026-06-084.55%
2026-09-10
Quelle geprüft
185Granite 4.1 30BOther2026-04-292.62%
2026-09-10
Quelle geprüft
186Command ACohere2026-03-150.76%
2026-09-10
Quelle geprüft
187MiniCPM-V 4.6 1.3BOpenBMB2026-05-110%
2026-09-10
Quelle geprüft
188MiniCPM5-1B (Non-reasoning)OpenBMB2026-05-250%
2026-09-10
Quelle geprüft
189MiniCPM5-1B (Reasoning)OpenBMB2026-06-040%
2026-09-10
Quelle geprüft
Methode

Was er abdeckt

Dieser Benchmark gehört zur Familie agentisch. Sein Format: Containerisierte Aufgaben mit Terminal-Umgebung; Agenten arbeiten über Befehle und werden durch aufgabenspezifische Checks bewertet. Der Score sollte immer mit Aufgabenformat, Bewertungsmethode, Quelldatum und Benchmark-Version gelesen werden.

Score-Obergrenze

Wo er an Grenzen stößt

Noch ist keine Obergrenze erfasst. Wenn sich Scores oben bündeln, kann der Benchmark Frontier-Modelle möglicherweise nicht mehr trennen.

Tools, die ihn ausweisen

Fragen zu diesem Benchmark

Jede Antwort unten stammt aus den datierten Feldern dieser Seite. Nichts davon ist zusätzlich für Suchmaschinen geschrieben.

Was misst Terminal-Bench?

Ob ein Agent realistische, containerisierte Terminal-Aufgaben (Terminal-Bench 2.1 in der öffentlichen AA-API) erledigen kann: Code debuggen, Dateien bearbeiten, Befehle ausführen und das Artefakt liefern, das der versteckte Checker erwartet. Index v4.2 gewichtete diese Suite mit 10 %; Index v4.3 nutzt im Composite Terminal-Bench v4.0.

Was beweist ein hoher Terminal-Bench-Wert nicht?

Ein starkes Terminal-Bench-Ergebnis sagt nichts aus über:

  • Nicht nur das Modell — Harness, Tools, Retries, Zeitlimits und Container-Setup können Werte stark verschieben.
  • Code-Wartbarkeit — eine bestandene Aufgabe kann trotzdem spröde Skripte oder kaum reviewbare Patches erzeugen.
  • Nicht jeden Entwickler-Workflow — Terminal-Aufgaben liegen näher an agentischem Operieren als an Produktdesign, Frontend-Polish oder langfristiger Repo-Pflege.

Wie wird Terminal-Bench bewertet?

Lösungs-/Passrate über auditierte Aufgaben. Agent-Harness und Modell-Paarung immer mitlesen. Aufgabenformat: Containerisierte Aufgaben mit Terminal-Umgebung; Agenten arbeiten über Befehle und werden durch aufgabenspezifische Checks bewertet.

Ist Terminal-Bench gesättigt?

Terminal-Bench ist im Atlas derzeit als Aktiv markiert.

Können Terminal-Bench-Ergebnisse durch Trainingsdaten verunreinigt sein?

Das Kontaminationsrisiko für Terminal-Bench ist als Kontamination niedrig eingestuft. Behandle jede Zeile auf dieser Seite als öffentliche Angabe mit Quelle und Datum, nicht als kontrolliertes Experiment.

The Pack · Redaktionsnewsletter

Neue Tools in dein Postfach. Kostenlos.

Eine kurze E-Mail, wenn ein Tool erscheint oder den Status wechselt. Kein Tracking, keine Drittanbieter-Analytics. Abmeldung mit einem Klick.