Benchmarks / Agentisch

Terminal-Bench

Terminal-Bench 2.1

Ob ein Agent realistische, containerisierte Terminal-Aufgaben (Terminal-Bench 2.1) erledigen kann: Code debuggen, Dateien bearbeiten, Befehle ausführen und das Artefakt liefern, das der versteckte Checker erwartet. 16 % Gewicht im AA Intelligence Index v4.1.

Was dieser Benchmark nicht misst
  • Nicht nur das Modell — Harness, Tools, Retries, Zeitlimits und Container-Setup können Werte stark verschieben.
  • Code-Wartbarkeit — eine bestandene Aufgabe kann trotzdem spröde Skripte oder kaum reviewbare Patches erzeugen.
  • Nicht jeden Entwickler-Workflow — Terminal-Aufgaben liegen näher an agentischem Operieren als an Produktdesign, Frontend-Polish oder langfristiger Repo-Pflege.
Analyse

Warum dieser Benchmark nützlich ist

Wenn du realistische containerisierte Terminal-Arbeit brauchst — Debug, Dateien, Befehle, Artefakte — als agentisches Ops-Signal mit Gewicht im AA Index v4.1.

Umfang

Abdeckung

Aufgabenfamilie
Agentisch
Format
Containerisierte Aufgaben mit Terminal-Umgebung; Agenten arbeiten über Befehle und werden durch aufgabenspezifische Checks bewertet.
Bewertung
Lösungs-/Passrate über auditierte Aufgaben. Agent-Harness und Modell-Paarung immer mitlesen.
Verantwortliche Stelle
Laude Institute / Terminal-Bench
Lesehilfe

So liest du die Scores

Lösungs-/Passrate auf auditierten Terminal-Bench-2.1-Aufgaben. Modell immer mit Harness, Tools, Retries und Zeitlimits lesen — Scaffolding verschiebt Werte so stark wie das Modell. Die offizielle Seite hat am 28. Aug. 2026 4.0 ausgeliefert; AA und Vals publizieren weiter 2.1, also bleibt diese Seite auf 2.1, bis diese Boards wechseln.

Blinde Flecken

Was er nicht abdeckt

  • Nicht nur das Modell — Harness, Tools, Retries, Zeitlimits und Container-Setup können Werte stark verschieben.
  • Code-Wartbarkeit — eine bestandene Aufgabe kann trotzdem spröde Skripte oder kaum reviewbare Patches erzeugen.
  • Nicht jeden Entwickler-Workflow — Terminal-Aufgaben liegen näher an agentischem Operieren als an Produktdesign, Frontend-Polish oder langfristiger Repo-Pflege.
Scores

Evidenz-Ledger

184 Zeilen
184184 Zeilen
89.14%bester Score
183quellgeprüft
3Quellen
2026-09-01bis 2026-05-20
167

api · api

Terminal-Bench16

official-page · manual

Vendor claims1

manual-snapshot · manual

Verteilung

Wo die Zeilen liegen

0255075100

Auf die Skala dieses Benchmarks normalisiert (0–100). Die Tabelle zeigt die Rohwerte.

Zeitverlauf

Neueste Belege

  1. Claude Opus 5 (Adaptive Reasoning, Max Effort)89.14% ·
  2. Grok 4.688.39% ·
  3. Claude Opus 5 (Adaptive Reasoning, Xhigh Effort)88.01% ·
  4. GPT-5.6 Sol88.01% ·
  5. GPT-5.6 Terra88.01% ·

Scores nutzen die eigene Einheit und Skala dieses Benchmarks, keinen universellen Qualitätswert.

#ModellVeröffentlichungScoreHerkunftBeleglage
1Claude Opus 5 (Adaptive Reasoning, Max Effort)Anthropic2026-07-2489.14%
2026-09-01
Quelle geprüft
2Grok 4.6xAI2026-08-1288.39%
2026-09-01
Quelle geprüft
3Claude Opus 5 (Adaptive Reasoning, Xhigh Effort)Anthropic2026-07-2488.01%
2026-09-01
Quelle geprüft
4GPT-5.6 SolOpenAI2026-07-0988.01%
2026-09-01
Quelle geprüft
5GPT-5.6 TerraOpenAI2026-07-0988.01%
2026-09-01
Quelle geprüft
6Claude Opus 5 (Adaptive Reasoning, High Effort)Anthropic2026-07-2487.64%
2026-09-01
Quelle geprüft
7Claude Opus 5 (Adaptive Reasoning, Medium Effort)Anthropic2026-07-2486.14%
2026-09-01
Quelle geprüft
8Qwen3.8-Flash-NextAlibaba2026-08-2686.14%
2026-09-01
Quelle geprüft
9Gemini 3.7 FlashGoogle2026-08-1385.77%
2026-09-01
Quelle geprüft
10Kimi K3Moonshot2026-07-1685.02%
2026-09-01
Quelle geprüft
11Claude Fable 5Anthropic2026-06-0984.64%
2026-09-01
Quelle geprüft
12GLM-5.3-FlashZhipu2026-08-2684.27%
2026-09-01
Quelle geprüft
1Claude Mythos PreviewAnthropic2026-06-0184.1%
Terminal-Bench 2.0 leaderboard2026-06-02
Quelle geprüft
14GLM-5.3Zhipu2026-08-1483.9%
2026-09-01
Quelle geprüft
15Kimi K3 (low)Moonshot2026-07-1682.4%
2026-09-01
Quelle geprüft
16Qwen3.8 2.4T A95BAlibaba2026-08-1282.02%
2026-09-01
Quelle geprüft
2GPT 5.5 (Codex CLI)OpenAI2026-04-2382%
Terminal-Bench 2.0 leaderboard2026-05-20
Quelle geprüft
3GPT 5.4 (ForgeCode)OpenAI2026-03-0581.8%
Terminal-Bench 2.0 leaderboard2026-05-20
Quelle geprüft
19Grok 4.5xAI2026-07-0881.65%
2026-09-01
Quelle geprüft
20Qwen3.8 MaxAlibaba2026-08-0381.27%
2026-09-01
Quelle geprüft
21GPT-5.6 LunaOpenAI2026-07-0980.9%
2026-09-01
Quelle geprüft
22Claude Sonnet 5Anthropic2026-06-3080.52%
2026-09-01
Quelle geprüft
23GPT-5.5 (medium)OpenAI2026-04-2380.52%
2026-09-01
Quelle geprüft
24Muse Spark 1.2Meta2026-08-0580.15%
2026-09-01
Quelle geprüft
4Claude Opus 4.6 (ForgeCode)Anthropic2026-02-0179.8%
Terminal-Bench 2.0 leaderboard2026-05-20
Quelle geprüft
26Qwen3.8 27BAlibaba2026-08-1479.78%
2026-09-01
Quelle geprüft
27GPT-5.5 (high)OpenAI2026-04-2379.4%
2026-09-01
Quelle geprüft
28DeepSeek V4 Flash 0731 (Reasoning, Max Effort)DeepSeek2026-07-3178.65%
2026-09-01
Quelle geprüft
29DeepSeek V4 Pro 0813 (Reasoning, Max Effort)DeepSeek2026-08-1378.65%
2026-09-01
Quelle geprüft
30GLM-5.2Zhipu2026-06-1377.9%
2026-09-01
Quelle geprüft
31Muse Spark 1.1Meta2026-07-0977.9%
2026-09-01
Quelle geprüft
32Gemini 3.6 Flash (high)Google2026-07-2177.53%
2026-09-01
Quelle geprüft
33Claude Opus 5 (Adaptive Reasoning, Low Effort)Anthropic2026-07-2476.4%
2026-09-01
Quelle geprüft
4Gemini 3.5 FlashGoogle2026-05-1976.2%
Terminal-Bench 2.0 leaderboard2026-05-20
Quelle geprüft
35Motif 3Other2026-08-1274.91%
2026-09-01
Quelle geprüft
5Claude Opus 4.8Anthropic2026-05-2874.6%
Terminal-Bench 2.0 leaderboard2026-05-20
Quelle geprüft
37Qwen3.7 MaxAlibaba2026-05-1974.53%
2026-09-01
Quelle geprüft
38DeepSeek V4 Flash Vision (Reasoning, Max Effort)DeepSeek2026-08-2174.16%
2026-09-01
Quelle geprüft
39Gemini 3.1 Pro PreviewGoogle2026-02-1973.78%
2026-09-01
Quelle geprüft
40Claude Sonnet 4.6 (Adaptive Reasoning, Max Effort)Anthropic2026-02-1771.16%
2026-09-01
Quelle geprüft
41LongCat-2.0MeituanVendor-gemeldeter LongCat-2.0-Wert; getrennt von auditierten Terminal-Bench-Leaderboard-Zeilen halten, bis ein unabhängiger Lauf vorliegt.2026-06-2970.8%
Meituan LongCat-2.0 release materials2026-06-29
Prüfung nötig
42Motif 3 (Beta)Other2026-07-2170.79%
2026-09-01
Quelle geprüft
43KAT Coder Pro V2Other2026-03-2770.04%
2026-09-01
Quelle geprüft
6Qwen 3.7 MaxAlibaba2026-05-2069.7%
Terminal-Bench 2.0 leaderboard2026-05-20
Quelle geprüft
45Agnes 2.5 Pro BetaOther2026-08-2669.66%
2026-09-01
Quelle geprüft
46Apodex 1.1Other2026-08-3069.66%
2026-09-01
Quelle geprüft
7Claude Opus 4.7 (Adaptive)Anthropic2026-04-1669.4%
Terminal-Bench 2.0 leaderboard2026-05-20
Quelle geprüft
48Claude Sonnet 4.6Anthropic2026-02-1768.4%
Terminal-Bench 2.0 leaderboard2026-06-09
Quelle geprüft
8DeepSeek V4 Pro MaxDeepSeek2026-04-2467.9%
Terminal-Bench 2.0 leaderboard2026-05-20
Quelle geprüft
50Nex-N2-ProOther2026-06-0267.79%
2026-09-01
Quelle geprüft
51Kimi K2.7 CodeMoonshot2026-06-1267.42%
2026-09-01
Quelle geprüft
52Agnes 2.5 Pro AlphaOther2026-07-2467.04%
2026-09-01
Quelle geprüft
9Kimi K2.6Moonshot2026-04-2066.7%
Terminal-Bench 2.0 leaderboard2026-05-20
Quelle geprüft
10MiniMax M3MiniMax2026-05-3166%
Terminal-Bench 2.0 leaderboard2026-05-20
Quelle geprüft
55GPT-5.5 (low)OpenAI2026-04-2365.54%
2026-09-01
Quelle geprüft
11Gemini 3.1 ProGoogle2026-02-1965.4%
Terminal-Bench 2.0 leaderboard2026-05-20
Quelle geprüft
57MiMo-V2.5-ProXiaomi2026-04-2265.17%
2026-09-01
Quelle geprüft
58DeepSeek V4 Pro (Reasoning, High Effort)DeepSeek2026-04-2464.79%
2026-09-01
Quelle geprüft
59Hy3Other2026-07-0664.42%
2026-09-01
Quelle geprüft
60Grok 4.3xAI2026-04-3063.8%
Terminal-Bench 2.0 leaderboard2026-06-09
Quelle geprüft
61MiMo-V2.5Xiaomi2026-04-2263.67%
2026-09-01
Quelle geprüft
62Muse SparkOther2026-01-0162.17%
2026-09-01
Quelle geprüft
63GLM-5.1Zhipu2026-04-0761.8%
2026-09-01
Quelle geprüft
64Qwen3.6 PlusAlibaba2026-04-0261.42%
2026-09-01
Quelle geprüft
65Claude Haiku 4.5Anthropic2025-10-0161.4%
Terminal-Bench 2.0 leaderboard2026-06-09
Quelle geprüft
66GPT-5.5 (Non-reasoning)OpenAI2026-04-2361.05%
2026-09-01
Quelle geprüft
67Qwen 3.7 PlusAlibaba2026-06-0261.05%
2026-09-01
Quelle geprüft
68GPT-5.4 NanoOpenAI2026-03-1760.67%
2026-09-01
Quelle geprüft
69Qwen3.6 27B (Reasoning)Alibaba2026-04-2260.67%
2026-09-01
Quelle geprüft
70JT-4.1 Flash 236B A21BOther2026-07-0959.55%
2026-09-01
Quelle geprüft
71GPT-5.4 MiniOpenAI2026-03-1759.18%
2026-09-01
Quelle geprüft
72Llama 4 ScoutMeta2026-04-0558.6%
Terminal-Bench 2.0 leaderboard2026-06-09
Quelle geprüft
73Solar Pro 4Other2026-08-0657.3%
2026-09-01
Quelle geprüft
74DeepSeek V4 Flash (Reasoning, High Effort)DeepSeek2026-04-2456.93%
2026-09-01
Quelle geprüft
75Claude 4.5 Sonnet (Reasoning)Anthropic2025-09-2955.81%
2026-09-01
Quelle geprüft
76Ling 3.0 FlashOther2026-08-0455.43%
2026-09-01
Quelle geprüft
77MiniMax M2.7MiniMax2026-04-1555.43%
2026-09-01
Quelle geprüft
78Inkling (xhigh)Other2026-07-1555.06%
2026-09-01
Quelle geprüft
79Inkling SmallOther2026-07-3055.06%
2026-09-01
Quelle geprüft
80Claude Opus 4.7 (Non-reasoning, High Effort)Anthropic2026-04-1654.55%
2026-09-01
Quelle geprüft
81Nemotron 3 Ultra 550B A55B (Reasoning)NVIDIA2026-06-0453.93%
2026-09-01
Quelle geprüft
82Gemini 3.5 Flash-LiteGoogle2026-07-2153.56%
2026-09-01
Quelle geprüft
83GPT-5.3 Codex (xhigh)OpenAI2026-02-0553.03%
2026-09-01
Quelle geprüft
84GPT-5.1OpenAI2025-11-1352.43%
2026-09-01
Quelle geprüft
85Grok Build 0.1 0616xAI2026-06-1652.06%
2026-09-01
Quelle geprüft
86GLM-5.2 (Non-reasoning)Zhipu2026-06-1651.69%
2026-09-01
Quelle geprüft
87Muse GlimmerMeta2026-08-1051.69%
2026-09-01
Quelle geprüft
88Qwen3.5 397B A17B (Reasoning)Alibaba2026-02-1651.31%
2026-09-01
Quelle geprüft
89Qwen3.6 27B (Non-reasoning)Alibaba2026-04-2251.31%
2026-09-01
Quelle geprüft
90Mistral Medium 3.5Mistral2026-04-2950.56%
2026-09-01
Quelle geprüft
91Qwen3.5 122B A10B (Reasoning)Alibaba2026-02-2447.57%
2026-09-01
Quelle geprüft
92Claude Opus 4.5 (Reasoning)Anthropic2025-11-2446.97%
2026-09-01
Quelle geprüft
93GPT-5.2OpenAI2025-12-1146.97%
2026-09-01
Quelle geprüft
94DeepSeek V3.2 (Reasoning)DeepSeek2025-12-0146.82%
2026-09-01
Quelle geprüft
95Claude Opus 4.6 (Adaptive Reasoning, Max Effort)Anthropic2026-02-0546.21%
2026-09-01
Quelle geprüft
96Gemini 3.5 Flash (minimal)Google2026-05-1946.21%
2026-09-01
Quelle geprüft
97Kimi K2.5Moonshot2026-01-2745.69%
2026-09-01
Quelle geprüft
98GLM-4.7 (Reasoning)Zhipu2025-12-2245.32%
2026-09-01
Quelle geprüft
99Qwen3.6 35B A3B (Reasoning)Alibaba2026-04-1644.94%
2026-09-01
Quelle geprüft
100Solar Open2 250BOther2026-08-1244.19%
2026-09-01
Quelle geprüft
101Qwen3.6 Max PreviewAlibaba2026-04-2043.94%
2026-09-01
Quelle geprüft
102Gemma 4 31B ITGoogle2026-03-0143.45%
2026-09-01
Quelle geprüft
103GLM-5 (Reasoning)Zhipu2026-02-1143.18%
2026-09-01
Quelle geprüft
104GPT-5.2 (medium)OpenAI2025-12-1143.18%
2026-09-01
Quelle geprüft
105GPT-5.4 (low)OpenAI2026-03-0543.18%
2026-09-01
Quelle geprüft
106Ring-2.6-1TOther2026-05-0843.07%
2026-09-01
Quelle geprüft
107Claude Sonnet 4.6 (Non-reasoning, Low Effort)Anthropic2026-02-1742.42%
2026-09-01
Quelle geprüft
108GPT-5.5 Instant (May 2026)OpenAI2026-05-0542.42%
2026-09-01
Quelle geprüft
109Gemini 3 ProGoogle2025-11-1841.67%
2026-09-01
Quelle geprüft
110Qwen3.6 35B A3B (Non-reasoning)Alibaba2026-04-1641.57%
2026-09-01
Quelle geprüft
111Claude Opus 4.5Anthropic2025-11-2440.91%
2026-09-01
Quelle geprüft
112Grok 4.20 0309 (Reasoning)xAI2026-03-1040.91%
2026-09-01
Quelle geprüft
113MiMo-V2-ProXiaomi2026-03-1840.91%
2026-09-01
Quelle geprüft
114K-EXAONE 2.0 0803Other2026-08-1240.45%
2026-09-01
Quelle geprüft
115Gemini 3.5 Flash (medium)Google2026-05-1939.39%
2026-09-01
Quelle geprüft
116GLM-5 (Non-reasoning)Zhipu2026-02-1139.39%
2026-09-01
Quelle geprüft
117Step 3.7 FlashStepFun2026-06-0139.33%
2026-09-01
Quelle geprüft
118A.X-K2Other2026-08-1238.95%
2026-09-01
Quelle geprüft
119Gemini 3 Flash Preview (Reasoning)Google2025-12-1738.64%
2026-09-01
Quelle geprüft
120GPT-5 (medium)OpenAI2025-08-0737.88%
2026-09-01
Quelle geprüft
121GPT-5 Codex (high)OpenAI2025-09-2337.88%
2026-09-01
Quelle geprüft
122Grok 4xAI2025-07-1037.88%
2026-09-01
Quelle geprüft
123Grok 4.20 ReasoningxAI2026-03-0537.88%
2026-09-01
Quelle geprüft
124Kimi K2.6 (Non-reasoning)Other2026-04-2037.88%
2026-09-01
Quelle geprüft
125GPT-5.2 Codex (xhigh)OpenAI2025-12-1137.12%
2026-09-01
Quelle geprüft
126OpenAI o3OpenAI2025-04-1637.12%
2026-09-01
Quelle geprüft
127DeepSeek V4 Pro (Non-reasoning)DeepSeek2026-04-2436.36%
2026-09-01
Quelle geprüft
128MiMo-V2-Omni-0327Xiaomi2026-03-2735.61%
2026-09-01
Quelle geprüft
129MiMo-V2.5-Pro (Non-reasoning)Xiaomi2026-04-2235.61%
2026-09-01
Quelle geprüft
130Qwen3.5 397B A17B (Non-reasoning)Alibaba2026-02-1635.61%
2026-09-01
Quelle geprüft
131North Mini CodeCohere2026-06-0935.58%
2026-09-01
Quelle geprüft
132GPT-5 (high)OpenAI2025-08-0735.21%
2026-09-01
Quelle geprüft
133GPT-5.1 Codex (high)OpenAI2025-11-1334.85%
2026-09-01
Quelle geprüft
134MiMo-V2-OmniXiaomi2026-03-1934.85%
2026-09-01
Quelle geprüft
135MiniMax M2.5MiniMax2026-04-0134.85%
2026-09-01
Quelle geprüft
136GPT-5.5 Instant (June 2026)OpenAI2026-06-2534.83%
2026-09-01
Quelle geprüft
137Claude 4.1 Opus (Reasoning)Anthropic2025-08-0534.34%
2026-09-01
Quelle geprüft
138DeepSeek V4 Flash (Non-reasoning)DeepSeek2026-04-2434.09%
2026-09-01
Quelle geprüft
139Gemini 3 Pro Preview (low)Google2025-11-1834.09%
2026-09-01
Quelle geprüft
140Hy3-preview (Reasoning)Other2026-04-2334.09%
2026-09-01
Quelle geprüft
141Grok 4.3 (Non-reasoning)xAI2026-04-3034.08%
2026-09-01
Quelle geprüft
142GLM-5-TurboZhipu2026-03-1533.33%
2026-09-01
Quelle geprüft
143G9v3-39A5BOther2026-08-0332.58%
2026-09-01
Quelle geprüft
144GLM 5V Turbo (Reasoning)Zhipu2026-04-0132.58%
2026-09-01
Quelle geprüft
145Qwen3.5 27B (Reasoning)Alibaba2026-02-2432.58%
2026-09-01
Quelle geprüft
146Gemini 3 Flash PreviewGoogle2025-12-1731.82%
2026-09-01
Quelle geprüft
147Hy3-preview (Non-reasoning)Other2026-04-2331.82%
2026-09-01
Quelle geprüft
148Gemini 3.1 Flash LiteGoogle2026-05-0731.09%
2026-09-01
Quelle geprüft
149Claude 4 Opus (Reasoning)Anthropic2025-05-2231.06%
2026-09-01
Quelle geprüft
150Kimi K2 ThinkingMoonshot2025-11-0631.06%
2026-09-01
Quelle geprüft
151Ling-2.6-1TOther2026-04-2331.06%
2026-09-01
Quelle geprüft
152MiMo-V2-Flash (Feb 2026)Xiaomi2025-12-1631.06%
2026-09-01
Quelle geprüft
153Grok 4.3 (medium)xAI2026-04-3030.3%
2026-09-01
Quelle geprüft
154JT-35B-FlashOther2026-05-1428.79%
2026-09-01
Quelle geprüft
155MiniMax-M2.1MiniMax2025-12-2328.79%
2026-09-01
Quelle geprüft
156MiMo-V2-Flash (Reasoning)Xiaomi2025-12-1628.03%
2026-09-01
Quelle geprüft
157Ling 3.0 TinyOther2026-08-0627.72%
2026-09-01
Quelle geprüft
158Gemma 4 12B (Reasoning)Google2026-06-0727.34%
2026-09-01
Quelle geprüft
159Granite 4.2 30BOther2026-08-2526.59%
2026-09-01
Quelle geprüft
160GPT-5 (low)OpenAI2025-08-0726.52%
2026-09-01
Quelle geprüft
161Grok 4.3 (low)xAI2026-04-3026.52%
2026-09-01
Quelle geprüft
162Ling 2.6 FlashOther2026-04-2124.34%
2026-09-01
Quelle geprüft
163Nemotron 3.5 LightningNVIDIA2026-08-1124.34%
2026-09-01
Quelle geprüft
164Qwen3 Max ThinkingAlibaba2026-01-2624.24%
2026-09-01
Quelle geprüft
165Command ACohere2026-03-1522.85%
2026-09-01
Quelle geprüft
166EXAONE 4.5 33BOther2026-04-0921.35%
2026-09-01
Quelle geprüft
167Granite 4.2 8BOther2026-08-2518.35%
2026-09-01
Quelle geprüft
168HyperNova 60B 2605Multiverse2026-05-0618.35%
2026-09-01
Quelle geprüft
169JT-MINIOther2026-04-1518.18%
2026-09-01
Quelle geprüft
170Grok 4.20 0309 v2 (Non-reasoning)xAI2026-04-0716.67%
2026-09-01
Quelle geprüft
171DeepSeek R1DeepSeek2025-01-2015.91%
2026-09-01
Quelle geprüft
172Granite 4.2 3BOther2026-08-2513.86%
2026-09-01
Quelle geprüft
173OpenAI o1OpenAI2024-09-1212.88%
2026-09-01
Quelle geprüft
174DiffusionGemma 26B A4BGoogle2026-06-1012.36%
2026-09-01
Quelle geprüft
175Mistral Large 3Mistral2025-12-0211.99%
2026-09-01
Quelle geprüft
176Gemma 4 12B (Non-reasoning)Google2026-06-1011.36%
2026-09-01
Quelle geprüft
177Llama 4 MaverickMeta2026-04-057.87%
2026-09-01
Quelle geprüft
178Nemotron 3 Nano Omni 30B A3B ReasoningNVIDIA2026-04-296.74%
2026-09-01
Quelle geprüft
179G9v3-3BOther2026-07-235.99%
2026-09-01
Quelle geprüft
180LFM2.5-8B-A1BLiquid2026-06-084.55%
2026-09-01
Quelle geprüft
181Granite 4.1 30BOther2026-04-292.62%
2026-09-01
Quelle geprüft
182MiniCPM-V 4.6 1.3BOpenBMB2026-05-110%
2026-09-01
Quelle geprüft
183MiniCPM5-1B (Non-reasoning)OpenBMB2026-05-250%
2026-09-01
Quelle geprüft
184MiniCPM5-1B (Reasoning)OpenBMB2026-06-040%
2026-09-01
Quelle geprüft
Methode

Was er abdeckt

Dieser Benchmark gehört zur Familie agentisch. Sein Format: Containerisierte Aufgaben mit Terminal-Umgebung; Agenten arbeiten über Befehle und werden durch aufgabenspezifische Checks bewertet. Der Score sollte immer mit Aufgabenformat, Bewertungsmethode, Quelldatum und Benchmark-Version gelesen werden.

Score-Obergrenze

Wo er an Grenzen stößt

Noch ist keine Obergrenze erfasst. Wenn sich Scores oben bündeln, kann der Benchmark Frontier-Modelle möglicherweise nicht mehr trennen.

Tools, die ihn ausweisen

Belege

Quellen und weiterführende Lektüre

Fragen zu diesem Benchmark

Jede Antwort unten stammt aus den datierten Feldern dieser Seite. Nichts davon ist zusätzlich für Suchmaschinen geschrieben.

Was misst Terminal-Bench?

Ob ein Agent realistische, containerisierte Terminal-Aufgaben (Terminal-Bench 2.1) erledigen kann: Code debuggen, Dateien bearbeiten, Befehle ausführen und das Artefakt liefern, das der versteckte Checker erwartet. 16 % Gewicht im AA Intelligence Index v4.1.

Was beweist ein hoher Terminal-Bench-Wert nicht?

Ein starkes Terminal-Bench-Ergebnis sagt nichts aus über:

  • Nicht nur das Modell — Harness, Tools, Retries, Zeitlimits und Container-Setup können Werte stark verschieben.
  • Code-Wartbarkeit — eine bestandene Aufgabe kann trotzdem spröde Skripte oder kaum reviewbare Patches erzeugen.
  • Nicht jeden Entwickler-Workflow — Terminal-Aufgaben liegen näher an agentischem Operieren als an Produktdesign, Frontend-Polish oder langfristiger Repo-Pflege.

Wie wird Terminal-Bench bewertet?

Lösungs-/Passrate über auditierte Aufgaben. Agent-Harness und Modell-Paarung immer mitlesen. Aufgabenformat: Containerisierte Aufgaben mit Terminal-Umgebung; Agenten arbeiten über Befehle und werden durch aufgabenspezifische Checks bewertet.

Ist Terminal-Bench gesättigt?

Terminal-Bench ist im Atlas derzeit als Aktiv markiert.

Können Terminal-Bench-Ergebnisse durch Trainingsdaten verunreinigt sein?

Das Kontaminationsrisiko für Terminal-Bench ist als Kontamination niedrig eingestuft. Behandle jede Zeile auf dieser Seite als öffentliche Angabe mit Quelle und Datum, nicht als kontrolliertes Experiment.

The Pack · Redaktionsnewsletter

Neue Tools in dein Postfach. Kostenlos.

Eine kurze E-Mail, wenn ein Tool erscheint oder den Status wechselt. Kein Tracking, keine Drittanbieter-Analytics. Abmeldung mit einem Klick.