Benchmarks / Agentic

Terminal-Bench

Terminal-Bench 2.1

Whether an agent can complete realistic, containerized terminal tasks (Terminal-Bench 2.1): debugging code, handling files, running commands, and producing the artifact the hidden checker expects. 16% weight in AA Intelligence Index v4.1.

What this does not measure
  • The model alone — harness, tools, retries, time limits, and container setup can move scores dramatically.
  • Code maintainability — a passed task can still produce brittle scripts or unreviewable patches.
  • Every developer workflow — terminal tasks are closer to agentic operations than product design, frontend polish, or long-running repository stewardship.
Analysis

Why this benchmark is useful

When you need realistic containerized terminal work — debug, files, commands, artifacts — as an agentic ops signal weighted in AA Index v4.1.

Scope

Coverage map

Task family
Agentic
Format
Containerized tasks with a terminal environment; agents operate through commands and are graded by task-specific checks.
Scoring
Resolution/pass rate across audited tasks. Always read the agent harness and model pairing.
Maintainer
Laude Institute / Terminal-Bench
Reading guide

How to read the scores

Resolution/pass rate on audited Terminal-Bench 2.1 tasks. Always pair the model with its harness, tools, retries, and time limits — scaffolding moves scores as much as the model. The official site shipped 4.0 on 28 Aug 2026; AA and Vals still publish 2.1, so this page stays on 2.1 until those boards move.

Blind spots

What it does not cover

  • The model alone — harness, tools, retries, time limits, and container setup can move scores dramatically.
  • Code maintainability — a passed task can still produce brittle scripts or unreviewable patches.
  • Every developer workflow — terminal tasks are closer to agentic operations than product design, frontend polish, or long-running repository stewardship.
Scores

Evidence ledger

184 rows
184184 rows
89.14%best score
183source-checked
3sources
2026-09-01to 2026-05-20
167

api · api

Terminal-Bench16

official-page · manual

Vendor claims1

manual-snapshot · manual

Distribution

Where the rows land

0255075100

Normalized to this benchmark's axis (0–100). Open the table for raw units.

Timeline

Newest receipts

  1. Claude Opus 5 (Adaptive Reasoning, Max Effort)89.14% ·
  2. Grok 4.688.39% ·
  3. Claude Opus 5 (Adaptive Reasoning, Xhigh Effort)88.01% ·
  4. GPT-5.6 Sol88.01% ·
  5. GPT-5.6 Terra88.01% ·

Scores use this benchmark's own unit and axis, not a universal quality score.

#ModelRelease dateScoreProvenanceTrust
1Claude Opus 5 (Adaptive Reasoning, Max Effort)Anthropic2026-07-2489.14%
2026-09-01
Source-checked
2Grok 4.6xAI2026-08-1288.39%
2026-09-01
Source-checked
3Claude Opus 5 (Adaptive Reasoning, Xhigh Effort)Anthropic2026-07-2488.01%
2026-09-01
Source-checked
4GPT-5.6 SolOpenAI2026-07-0988.01%
2026-09-01
Source-checked
5GPT-5.6 TerraOpenAI2026-07-0988.01%
2026-09-01
Source-checked
6Claude Opus 5 (Adaptive Reasoning, High Effort)Anthropic2026-07-2487.64%
2026-09-01
Source-checked
7Claude Opus 5 (Adaptive Reasoning, Medium Effort)Anthropic2026-07-2486.14%
2026-09-01
Source-checked
8Qwen3.8-Flash-NextAlibaba2026-08-2686.14%
2026-09-01
Source-checked
9Gemini 3.7 FlashGoogle2026-08-1385.77%
2026-09-01
Source-checked
10Kimi K3Moonshot2026-07-1685.02%
2026-09-01
Source-checked
11Claude Fable 5Anthropic2026-06-0984.64%
2026-09-01
Source-checked
12GLM-5.3-FlashZhipu2026-08-2684.27%
2026-09-01
Source-checked
1Claude Mythos PreviewAnthropic2026-06-0184.1%
Terminal-Bench 2.0 leaderboard2026-06-02
Source-checked
14GLM-5.3Zhipu2026-08-1483.9%
2026-09-01
Source-checked
15Kimi K3 (low)Moonshot2026-07-1682.4%
2026-09-01
Source-checked
16Qwen3.8 2.4T A95BAlibaba2026-08-1282.02%
2026-09-01
Source-checked
2GPT 5.5 (Codex CLI)OpenAI2026-04-2382%
Terminal-Bench 2.0 leaderboard2026-05-20
Source-checked
3GPT 5.4 (ForgeCode)OpenAI2026-03-0581.8%
Terminal-Bench 2.0 leaderboard2026-05-20
Source-checked
19Grok 4.5xAI2026-07-0881.65%
2026-09-01
Source-checked
20Qwen3.8 MaxAlibaba2026-08-0381.27%
2026-09-01
Source-checked
21GPT-5.6 LunaOpenAI2026-07-0980.9%
2026-09-01
Source-checked
22Claude Sonnet 5Anthropic2026-06-3080.52%
2026-09-01
Source-checked
23GPT-5.5 (medium)OpenAI2026-04-2380.52%
2026-09-01
Source-checked
24Muse Spark 1.2Meta2026-08-0580.15%
2026-09-01
Source-checked
4Claude Opus 4.6 (ForgeCode)Anthropic2026-02-0179.8%
Terminal-Bench 2.0 leaderboard2026-05-20
Source-checked
26Qwen3.8 27BAlibaba2026-08-1479.78%
2026-09-01
Source-checked
27GPT-5.5 (high)OpenAI2026-04-2379.4%
2026-09-01
Source-checked
28DeepSeek V4 Flash 0731 (Reasoning, Max Effort)DeepSeek2026-07-3178.65%
2026-09-01
Source-checked
29DeepSeek V4 Pro 0813 (Reasoning, Max Effort)DeepSeek2026-08-1378.65%
2026-09-01
Source-checked
30GLM-5.2Zhipu2026-06-1377.9%
2026-09-01
Source-checked
31Muse Spark 1.1Meta2026-07-0977.9%
2026-09-01
Source-checked
32Gemini 3.6 Flash (high)Google2026-07-2177.53%
2026-09-01
Source-checked
33Claude Opus 5 (Adaptive Reasoning, Low Effort)Anthropic2026-07-2476.4%
2026-09-01
Source-checked
4Gemini 3.5 FlashGoogle2026-05-1976.2%
Terminal-Bench 2.0 leaderboard2026-05-20
Source-checked
35Motif 3Other2026-08-1274.91%
2026-09-01
Source-checked
5Claude Opus 4.8Anthropic2026-05-2874.6%
Terminal-Bench 2.0 leaderboard2026-05-20
Source-checked
37Qwen3.7 MaxAlibaba2026-05-1974.53%
2026-09-01
Source-checked
38DeepSeek V4 Flash Vision (Reasoning, Max Effort)DeepSeek2026-08-2174.16%
2026-09-01
Source-checked
39Gemini 3.1 Pro PreviewGoogle2026-02-1973.78%
2026-09-01
Source-checked
40Claude Sonnet 4.6 (Adaptive Reasoning, Max Effort)Anthropic2026-02-1771.16%
2026-09-01
Source-checked
41LongCat-2.0MeituanVendor-reported LongCat-2.0 score; keep separate from audited Terminal-Bench leaderboard rows until an independent run lands.2026-06-2970.8%
Meituan LongCat-2.0 release materials2026-06-29
Needs audit
42Motif 3 (Beta)Other2026-07-2170.79%
2026-09-01
Source-checked
43KAT Coder Pro V2Other2026-03-2770.04%
2026-09-01
Source-checked
6Qwen 3.7 MaxAlibaba2026-05-2069.7%
Terminal-Bench 2.0 leaderboard2026-05-20
Source-checked
45Agnes 2.5 Pro BetaOther2026-08-2669.66%
2026-09-01
Source-checked
46Apodex 1.1Other2026-08-3069.66%
2026-09-01
Source-checked
7Claude Opus 4.7 (Adaptive)Anthropic2026-04-1669.4%
Terminal-Bench 2.0 leaderboard2026-05-20
Source-checked
48Claude Sonnet 4.6Anthropic2026-02-1768.4%
Terminal-Bench 2.0 leaderboard2026-06-09
Source-checked
8DeepSeek V4 Pro MaxDeepSeek2026-04-2467.9%
Terminal-Bench 2.0 leaderboard2026-05-20
Source-checked
50Nex-N2-ProOther2026-06-0267.79%
2026-09-01
Source-checked
51Kimi K2.7 CodeMoonshot2026-06-1267.42%
2026-09-01
Source-checked
52Agnes 2.5 Pro AlphaOther2026-07-2467.04%
2026-09-01
Source-checked
9Kimi K2.6Moonshot2026-04-2066.7%
Terminal-Bench 2.0 leaderboard2026-05-20
Source-checked
10MiniMax M3MiniMax2026-05-3166%
Terminal-Bench 2.0 leaderboard2026-05-20
Source-checked
55GPT-5.5 (low)OpenAI2026-04-2365.54%
2026-09-01
Source-checked
11Gemini 3.1 ProGoogle2026-02-1965.4%
Terminal-Bench 2.0 leaderboard2026-05-20
Source-checked
57MiMo-V2.5-ProXiaomi2026-04-2265.17%
2026-09-01
Source-checked
58DeepSeek V4 Pro (Reasoning, High Effort)DeepSeek2026-04-2464.79%
2026-09-01
Source-checked
59Hy3Other2026-07-0664.42%
2026-09-01
Source-checked
60Grok 4.3xAI2026-04-3063.8%
Terminal-Bench 2.0 leaderboard2026-06-09
Source-checked
61MiMo-V2.5Xiaomi2026-04-2263.67%
2026-09-01
Source-checked
62Muse SparkOther2026-01-0162.17%
2026-09-01
Source-checked
63GLM-5.1Zhipu2026-04-0761.8%
2026-09-01
Source-checked
64Qwen3.6 PlusAlibaba2026-04-0261.42%
2026-09-01
Source-checked
65Claude Haiku 4.5Anthropic2025-10-0161.4%
Terminal-Bench 2.0 leaderboard2026-06-09
Source-checked
66GPT-5.5 (Non-reasoning)OpenAI2026-04-2361.05%
2026-09-01
Source-checked
67Qwen 3.7 PlusAlibaba2026-06-0261.05%
2026-09-01
Source-checked
68GPT-5.4 NanoOpenAI2026-03-1760.67%
2026-09-01
Source-checked
69Qwen3.6 27B (Reasoning)Alibaba2026-04-2260.67%
2026-09-01
Source-checked
70JT-4.1 Flash 236B A21BOther2026-07-0959.55%
2026-09-01
Source-checked
71GPT-5.4 MiniOpenAI2026-03-1759.18%
2026-09-01
Source-checked
72Llama 4 ScoutMeta2026-04-0558.6%
Terminal-Bench 2.0 leaderboard2026-06-09
Source-checked
73Solar Pro 4Other2026-08-0657.3%
2026-09-01
Source-checked
74DeepSeek V4 Flash (Reasoning, High Effort)DeepSeek2026-04-2456.93%
2026-09-01
Source-checked
75Claude 4.5 Sonnet (Reasoning)Anthropic2025-09-2955.81%
2026-09-01
Source-checked
76Ling 3.0 FlashOther2026-08-0455.43%
2026-09-01
Source-checked
77MiniMax M2.7MiniMax2026-04-1555.43%
2026-09-01
Source-checked
78Inkling (xhigh)Other2026-07-1555.06%
2026-09-01
Source-checked
79Inkling SmallOther2026-07-3055.06%
2026-09-01
Source-checked
80Claude Opus 4.7 (Non-reasoning, High Effort)Anthropic2026-04-1654.55%
2026-09-01
Source-checked
81Nemotron 3 Ultra 550B A55B (Reasoning)NVIDIA2026-06-0453.93%
2026-09-01
Source-checked
82Gemini 3.5 Flash-LiteGoogle2026-07-2153.56%
2026-09-01
Source-checked
83GPT-5.3 Codex (xhigh)OpenAI2026-02-0553.03%
2026-09-01
Source-checked
84GPT-5.1OpenAI2025-11-1352.43%
2026-09-01
Source-checked
85Grok Build 0.1 0616xAI2026-06-1652.06%
2026-09-01
Source-checked
86GLM-5.2 (Non-reasoning)Zhipu2026-06-1651.69%
2026-09-01
Source-checked
87Muse GlimmerMeta2026-08-1051.69%
2026-09-01
Source-checked
88Qwen3.5 397B A17B (Reasoning)Alibaba2026-02-1651.31%
2026-09-01
Source-checked
89Qwen3.6 27B (Non-reasoning)Alibaba2026-04-2251.31%
2026-09-01
Source-checked
90Mistral Medium 3.5Mistral2026-04-2950.56%
2026-09-01
Source-checked
91Qwen3.5 122B A10B (Reasoning)Alibaba2026-02-2447.57%
2026-09-01
Source-checked
92Claude Opus 4.5 (Reasoning)Anthropic2025-11-2446.97%
2026-09-01
Source-checked
93GPT-5.2OpenAI2025-12-1146.97%
2026-09-01
Source-checked
94DeepSeek V3.2 (Reasoning)DeepSeek2025-12-0146.82%
2026-09-01
Source-checked
95Claude Opus 4.6 (Adaptive Reasoning, Max Effort)Anthropic2026-02-0546.21%
2026-09-01
Source-checked
96Gemini 3.5 Flash (minimal)Google2026-05-1946.21%
2026-09-01
Source-checked
97Kimi K2.5Moonshot2026-01-2745.69%
2026-09-01
Source-checked
98GLM-4.7 (Reasoning)Zhipu2025-12-2245.32%
2026-09-01
Source-checked
99Qwen3.6 35B A3B (Reasoning)Alibaba2026-04-1644.94%
2026-09-01
Source-checked
100Solar Open2 250BOther2026-08-1244.19%
2026-09-01
Source-checked
101Qwen3.6 Max PreviewAlibaba2026-04-2043.94%
2026-09-01
Source-checked
102Gemma 4 31B ITGoogle2026-03-0143.45%
2026-09-01
Source-checked
103GLM-5 (Reasoning)Zhipu2026-02-1143.18%
2026-09-01
Source-checked
104GPT-5.2 (medium)OpenAI2025-12-1143.18%
2026-09-01
Source-checked
105GPT-5.4 (low)OpenAI2026-03-0543.18%
2026-09-01
Source-checked
106Ring-2.6-1TOther2026-05-0843.07%
2026-09-01
Source-checked
107Claude Sonnet 4.6 (Non-reasoning, Low Effort)Anthropic2026-02-1742.42%
2026-09-01
Source-checked
108GPT-5.5 Instant (May 2026)OpenAI2026-05-0542.42%
2026-09-01
Source-checked
109Gemini 3 ProGoogle2025-11-1841.67%
2026-09-01
Source-checked
110Qwen3.6 35B A3B (Non-reasoning)Alibaba2026-04-1641.57%
2026-09-01
Source-checked
111Claude Opus 4.5Anthropic2025-11-2440.91%
2026-09-01
Source-checked
112Grok 4.20 0309 (Reasoning)xAI2026-03-1040.91%
2026-09-01
Source-checked
113MiMo-V2-ProXiaomi2026-03-1840.91%
2026-09-01
Source-checked
114K-EXAONE 2.0 0803Other2026-08-1240.45%
2026-09-01
Source-checked
115Gemini 3.5 Flash (medium)Google2026-05-1939.39%
2026-09-01
Source-checked
116GLM-5 (Non-reasoning)Zhipu2026-02-1139.39%
2026-09-01
Source-checked
117Step 3.7 FlashStepFun2026-06-0139.33%
2026-09-01
Source-checked
118A.X-K2Other2026-08-1238.95%
2026-09-01
Source-checked
119Gemini 3 Flash Preview (Reasoning)Google2025-12-1738.64%
2026-09-01
Source-checked
120GPT-5 (medium)OpenAI2025-08-0737.88%
2026-09-01
Source-checked
121GPT-5 Codex (high)OpenAI2025-09-2337.88%
2026-09-01
Source-checked
122Grok 4xAI2025-07-1037.88%
2026-09-01
Source-checked
123Grok 4.20 ReasoningxAI2026-03-0537.88%
2026-09-01
Source-checked
124Kimi K2.6 (Non-reasoning)Other2026-04-2037.88%
2026-09-01
Source-checked
125GPT-5.2 Codex (xhigh)OpenAI2025-12-1137.12%
2026-09-01
Source-checked
126OpenAI o3OpenAI2025-04-1637.12%
2026-09-01
Source-checked
127DeepSeek V4 Pro (Non-reasoning)DeepSeek2026-04-2436.36%
2026-09-01
Source-checked
128MiMo-V2-Omni-0327Xiaomi2026-03-2735.61%
2026-09-01
Source-checked
129MiMo-V2.5-Pro (Non-reasoning)Xiaomi2026-04-2235.61%
2026-09-01
Source-checked
130Qwen3.5 397B A17B (Non-reasoning)Alibaba2026-02-1635.61%
2026-09-01
Source-checked
131North Mini CodeCohere2026-06-0935.58%
2026-09-01
Source-checked
132GPT-5 (high)OpenAI2025-08-0735.21%
2026-09-01
Source-checked
133GPT-5.1 Codex (high)OpenAI2025-11-1334.85%
2026-09-01
Source-checked
134MiMo-V2-OmniXiaomi2026-03-1934.85%
2026-09-01
Source-checked
135MiniMax M2.5MiniMax2026-04-0134.85%
2026-09-01
Source-checked
136GPT-5.5 Instant (June 2026)OpenAI2026-06-2534.83%
2026-09-01
Source-checked
137Claude 4.1 Opus (Reasoning)Anthropic2025-08-0534.34%
2026-09-01
Source-checked
138DeepSeek V4 Flash (Non-reasoning)DeepSeek2026-04-2434.09%
2026-09-01
Source-checked
139Gemini 3 Pro Preview (low)Google2025-11-1834.09%
2026-09-01
Source-checked
140Hy3-preview (Reasoning)Other2026-04-2334.09%
2026-09-01
Source-checked
141Grok 4.3 (Non-reasoning)xAI2026-04-3034.08%
2026-09-01
Source-checked
142GLM-5-TurboZhipu2026-03-1533.33%
2026-09-01
Source-checked
143G9v3-39A5BOther2026-08-0332.58%
2026-09-01
Source-checked
144GLM 5V Turbo (Reasoning)Zhipu2026-04-0132.58%
2026-09-01
Source-checked
145Qwen3.5 27B (Reasoning)Alibaba2026-02-2432.58%
2026-09-01
Source-checked
146Gemini 3 Flash PreviewGoogle2025-12-1731.82%
2026-09-01
Source-checked
147Hy3-preview (Non-reasoning)Other2026-04-2331.82%
2026-09-01
Source-checked
148Gemini 3.1 Flash LiteGoogle2026-05-0731.09%
2026-09-01
Source-checked
149Claude 4 Opus (Reasoning)Anthropic2025-05-2231.06%
2026-09-01
Source-checked
150Kimi K2 ThinkingMoonshot2025-11-0631.06%
2026-09-01
Source-checked
151Ling-2.6-1TOther2026-04-2331.06%
2026-09-01
Source-checked
152MiMo-V2-Flash (Feb 2026)Xiaomi2025-12-1631.06%
2026-09-01
Source-checked
153Grok 4.3 (medium)xAI2026-04-3030.3%
2026-09-01
Source-checked
154JT-35B-FlashOther2026-05-1428.79%
2026-09-01
Source-checked
155MiniMax-M2.1MiniMax2025-12-2328.79%
2026-09-01
Source-checked
156MiMo-V2-Flash (Reasoning)Xiaomi2025-12-1628.03%
2026-09-01
Source-checked
157Ling 3.0 TinyOther2026-08-0627.72%
2026-09-01
Source-checked
158Gemma 4 12B (Reasoning)Google2026-06-0727.34%
2026-09-01
Source-checked
159Granite 4.2 30BOther2026-08-2526.59%
2026-09-01
Source-checked
160GPT-5 (low)OpenAI2025-08-0726.52%
2026-09-01
Source-checked
161Grok 4.3 (low)xAI2026-04-3026.52%
2026-09-01
Source-checked
162Ling 2.6 FlashOther2026-04-2124.34%
2026-09-01
Source-checked
163Nemotron 3.5 LightningNVIDIA2026-08-1124.34%
2026-09-01
Source-checked
164Qwen3 Max ThinkingAlibaba2026-01-2624.24%
2026-09-01
Source-checked
165Command ACohere2026-03-1522.85%
2026-09-01
Source-checked
166EXAONE 4.5 33BOther2026-04-0921.35%
2026-09-01
Source-checked
167Granite 4.2 8BOther2026-08-2518.35%
2026-09-01
Source-checked
168HyperNova 60B 2605Multiverse2026-05-0618.35%
2026-09-01
Source-checked
169JT-MINIOther2026-04-1518.18%
2026-09-01
Source-checked
170Grok 4.20 0309 v2 (Non-reasoning)xAI2026-04-0716.67%
2026-09-01
Source-checked
171DeepSeek R1DeepSeek2025-01-2015.91%
2026-09-01
Source-checked
172Granite 4.2 3BOther2026-08-2513.86%
2026-09-01
Source-checked
173OpenAI o1OpenAI2024-09-1212.88%
2026-09-01
Source-checked
174DiffusionGemma 26B A4BGoogle2026-06-1012.36%
2026-09-01
Source-checked
175Mistral Large 3Mistral2025-12-0211.99%
2026-09-01
Source-checked
176Gemma 4 12B (Non-reasoning)Google2026-06-1011.36%
2026-09-01
Source-checked
177Llama 4 MaverickMeta2026-04-057.87%
2026-09-01
Source-checked
178Nemotron 3 Nano Omni 30B A3B ReasoningNVIDIA2026-04-296.74%
2026-09-01
Source-checked
179G9v3-3BOther2026-07-235.99%
2026-09-01
Source-checked
180LFM2.5-8B-A1BLiquid2026-06-084.55%
2026-09-01
Source-checked
181Granite 4.1 30BOther2026-04-292.62%
2026-09-01
Source-checked
182MiniCPM-V 4.6 1.3BOpenBMB2026-05-110%
2026-09-01
Source-checked
183MiniCPM5-1B (Non-reasoning)OpenBMB2026-05-250%
2026-09-01
Source-checked
184MiniCPM5-1B (Reasoning)OpenBMB2026-06-040%
2026-09-01
Source-checked
Method

What it covers

This benchmark sits in the agentic family. It uses Containerized tasks with a terminal environment; agents operate through commands and are graded by task-specific checks. The score should travel with its task format, scoring method, source date, and benchmark version.

Score ceiling

Where it breaks down

No ceiling note is recorded yet. Treat clustering near the top as a warning that the benchmark may no longer separate frontier models.

Tools that report it

Receipts

Sources and further reading

Questions about this benchmark

Every answer below is assembled from the dated fields on this page. Nothing is written separately for search.

What does Terminal-Bench measure?

Whether an agent can complete realistic, containerized terminal tasks (Terminal-Bench 2.1): debugging code, handling files, running commands, and producing the artifact the hidden checker expects. 16% weight in AA Intelligence Index v4.1.

What does a high Terminal-Bench score not prove?

A strong Terminal-Bench result says nothing about:

  • The model alone — harness, tools, retries, time limits, and container setup can move scores dramatically.
  • Code maintainability — a passed task can still produce brittle scripts or unreviewable patches.
  • Every developer workflow — terminal tasks are closer to agentic operations than product design, frontend polish, or long-running repository stewardship.

How is Terminal-Bench scored?

Resolution/pass rate across audited tasks. Always read the agent harness and model pairing. Task format: Containerized tasks with a terminal environment; agents operate through commands and are graded by task-specific checks.

Is Terminal-Bench saturated?

Terminal-Bench is currently marked Active in the atlas.

Can Terminal-Bench results be contaminated by training data?

Contamination risk for Terminal-Bench is graded Low contamination. Treat every row on this page as a public claim with a source and a date, not as a controlled experiment.

The Pack · Editorial newsletter

New tools in your inbox. Free.

One short email when a tool ships or changes status. No tracking, no third-party analytics. Unsubscribe in one click.