Benchmarks / Agentic

Terminal-Bench

Terminal-Bench 2.1

Whether an agent can complete realistic, containerized terminal tasks (Terminal-Bench 2.1): debugging code, handling files, running commands, and producing the artifact the hidden checker expects. 16% weight in AA Intelligence Index v4.1.

AgenticSolidActiveLow contamination riskSince 2025
What this does not measure
  • The model alone — harness, tools, retries, time limits, and container setup can move scores dramatically.
  • Code maintainability — a passed task can still produce brittle scripts or unreviewable patches.
  • Every developer workflow — terminal tasks are closer to agentic operations than product design, frontend polish, or long-running repository stewardship.
Analysis

Why this benchmark is useful

Editorial brief pendingWe publish the methodology and ledger first; benchmark-specific analysis ships after desk review.

Scope

Coverage map

Task family
Agentic
Format
Containerized tasks with a terminal environment; agents operate through commands and are graded by task-specific checks.
Scoring
Resolution/pass rate across audited tasks. Always read the agent harness and model pairing.
Maintainer
Laude Institute / Terminal-Bench
Reading guide

How to read the scores

Reading guide pending. Use task format, scoring method, and source dates in the ledger until the desk brief ships.

Blind spots

What it does not cover

  • The model alone — harness, tools, retries, time limits, and container setup can move scores dramatically.
  • Code maintainability — a passed task can still produce brittle scripts or unreviewable patches.
  • Every developer workflow — terminal tasks are closer to agentic operations than product design, frontend polish, or long-running repository stewardship.
Scores

Evidence ledger

69 rows
6969 rows
88.01%best score
68source-checked
3sources
2026-07-21to 2026-05-20
52

api · api

Terminal-Bench16

official-page · manual

Vendor claims1

manual-snapshot · manual

Distribution

Where the rows land

0255075100

Normalized to this benchmark's axis (0–100). Open the table for raw units.

Timeline

Newest receipts

  1. GPT-5.6 Sol88.01% ·
  2. GPT-5.6 Terra88.01% ·
  3. Kimi K385.02% ·
  4. Claude Fable 584.64% ·
  5. Grok 4.581.65% ·

Scores use this benchmark's own unit and axis, not a universal quality score.

#ModelRelease dateScoreProvenanceTrust
1GPT-5.6 SolOpenAI2026-07-0988.01%
2026-07-21
Source-checked
2GPT-5.6 TerraOpenAI2026-07-0988.01%
2026-07-21
Source-checked
3Kimi K3Moonshot2026-07-1685.02%
2026-07-21
Source-checked
4Claude Fable 5Anthropic2026-06-0984.64%
2026-07-21
Source-checked
1Claude Mythos PreviewAnthropic2026-06-0184.1%
Terminal-Bench 2.0 leaderboard2026-06-02
Source-checked
2GPT 5.5 (Codex CLI)OpenAI2026-04-2382%
Terminal-Bench 2.0 leaderboard2026-05-20
Source-checked
3GPT 5.4 (ForgeCode)OpenAI2026-03-0581.8%
Terminal-Bench 2.0 leaderboard2026-05-20
Source-checked
8Grok 4.5xAI2026-07-0881.65%
2026-07-21
Source-checked
9GPT-5.6 LunaOpenAI2026-07-0980.9%
2026-07-21
Source-checked
10Claude Sonnet 5Anthropic2026-06-3080.52%
2026-07-21
Source-checked
11GPT-5.5 (medium)OpenAI2026-04-2380.52%
2026-07-21
Source-checked
4Claude Opus 4.6 (ForgeCode)Anthropic2026-02-0179.8%
Terminal-Bench 2.0 leaderboard2026-05-20
Source-checked
13GPT-5.5 (high)OpenAI2026-04-2379.4%
2026-07-21
Source-checked
14GLM-5.2Zhipu2026-06-1377.9%
2026-07-21
Source-checked
15Muse Spark 1.1Meta2026-07-0977.9%
2026-07-21
Source-checked
4Gemini 3.5 FlashGoogle2026-05-1976.2%
Terminal-Bench 2.0 leaderboard2026-05-20
Source-checked
5Claude Opus 4.8Anthropic2026-05-2874.6%
Terminal-Bench 2.0 leaderboard2026-05-20
Source-checked
18Qwen3.7 MaxAlibaba2026-05-1974.53%
2026-07-21
Source-checked
19Gemini 3.1 Pro PreviewGoogle2026-02-1973.78%
2026-07-21
Source-checked
20Claude Sonnet 4.6 (Adaptive Reasoning, Max Effort)Anthropic2026-02-1771.16%
2026-07-21
Source-checked
21LongCat-2.0MeituanVendor-reported LongCat-2.0 score; keep separate from audited Terminal-Bench leaderboard rows until an independent run lands.2026-06-2970.8%
Meituan LongCat-2.0 release materials2026-06-29
Needs audit
6Qwen 3.7 MaxAlibaba2026-05-2069.7%
Terminal-Bench 2.0 leaderboard2026-05-20
Source-checked
7Claude Opus 4.7 (Adaptive)Anthropic2026-04-1669.4%
Terminal-Bench 2.0 leaderboard2026-05-20
Source-checked
24Claude Sonnet 4.6Anthropic2026-02-1768.4%
Terminal-Bench 2.0 leaderboard2026-06-09
Source-checked
8DeepSeek V4 Pro MaxDeepSeek2026-04-2467.9%
Terminal-Bench 2.0 leaderboard2026-05-20
Source-checked
26Kimi K2.7 CodeMoonshot2026-06-1267.42%
2026-07-21
Source-checked
9Kimi K2.6Moonshot2026-04-2066.7%
Terminal-Bench 2.0 leaderboard2026-05-20
Source-checked
10MiniMax M3MiniMax2026-05-3166%
Terminal-Bench 2.0 leaderboard2026-05-20
Source-checked
29GPT-5.5 (low)OpenAI2026-04-2365.54%
2026-07-21
Source-checked
11Gemini 3.1 ProGoogle2026-02-1965.4%
Terminal-Bench 2.0 leaderboard2026-05-20
Source-checked
31MiMo-V2.5-ProXiaomi2026-04-2265.17%
2026-07-21
Source-checked
32DeepSeek V4 Pro (Reasoning, Max Effort)DeepSeek2026-04-2464.04%
2026-07-21
Source-checked
33Grok 4.3xAI2026-04-3063.8%
Terminal-Bench 2.0 leaderboard2026-06-09
Source-checked
34Muse SparkOther2026-01-0162.17%
2026-07-21
Source-checked
35GLM-5.1Zhipu2026-04-0761.8%
2026-07-21
Source-checked
36Claude Haiku 4.5Anthropic2025-10-0161.4%
Terminal-Bench 2.0 leaderboard2026-06-09
Source-checked
37Qwen 3.7 PlusAlibaba2026-06-0261.05%
2026-07-21
Source-checked
38GPT-5.4 NanoOpenAI2026-03-1760.67%
2026-07-21
Source-checked
39GPT-5.4 MiniOpenAI2026-03-1759.18%
2026-07-21
Source-checked
40Llama 4 ScoutMeta2026-04-0558.6%
Terminal-Bench 2.0 leaderboard2026-06-09
Source-checked
41MiniMax M2.7MiniMax2026-04-1555.43%
2026-07-21
Source-checked
42Claude Opus 4.7 (Non-reasoning, High Effort)Anthropic2026-04-1654.55%
2026-07-21
Source-checked
43Nemotron 3 Ultra 550B A55B (Reasoning)NVIDIA2026-06-0453.93%
2026-07-21
Source-checked
44GPT-5.3 Codex (xhigh)OpenAI2026-02-0553.03%
2026-07-21
Source-checked
45GPT-5.1OpenAI2025-11-1352.43%
2026-07-21
Source-checked
46GPT-5.2OpenAI2025-12-1146.97%
2026-07-21
Source-checked
47Claude Opus 4.6 (Adaptive Reasoning, Max Effort)Anthropic2026-02-0546.21%
2026-07-21
Source-checked
48Kimi K2.5Moonshot2026-01-2745.69%
2026-07-21
Source-checked
49Gemma 4 31B ITGoogle2026-03-0143.45%
2026-07-21
Source-checked
50Gemini 3 ProGoogle2025-11-1841.67%
2026-07-21
Source-checked
51Claude Opus 4.5Anthropic2025-11-2440.91%
2026-07-21
Source-checked
52Gemini 3.5 Flash (medium)Google2026-05-1939.39%
2026-07-21
Source-checked
53Step 3.7 FlashStepFun2026-06-0139.33%
2026-07-21
Source-checked
54Grok 4.20 ReasoningxAI2026-03-0537.88%
2026-07-21
Source-checked
55OpenAI o3OpenAI2025-04-1637.12%
2026-07-21
Source-checked
56North Mini CodeCohere2026-06-0935.58%
2026-07-21
Source-checked
57MiniMax M2.5MiniMax2026-04-0134.85%
2026-07-21
Source-checked
58Gemini 3 Flash PreviewGoogle2025-12-1731.82%
2026-07-21
Source-checked
59Gemini 3.1 Flash LiteGoogle2026-05-0731.09%
2026-07-21
Source-checked
60HyperNova 60B 2605Multiverse2026-05-0618.35%
2026-07-21
Source-checked
61Gemma 4 12B (Reasoning)Google2026-06-0718.18%
2026-07-21
Source-checked
62DeepSeek R1DeepSeek2025-01-2015.91%
2026-07-21
Source-checked
63OpenAI o1OpenAI2024-09-1212.88%
2026-07-21
Source-checked
64Mistral Large 3Mistral2025-12-0211.99%
2026-07-21
Source-checked
65Gemma 4 12B (Non-reasoning)Google2026-06-1011.36%
2026-07-21
Source-checked
66Llama 4 MaverickMeta2026-04-057.87%
2026-07-21
Source-checked
67LFM2.5-8B-A1BLiquid2026-06-084.55%
2026-07-21
Source-checked
68Command ACohere2026-03-150.76%
2026-07-21
Source-checked
69MiniCPM5-1B (Reasoning)OpenBMB2026-06-040%
2026-07-21
Source-checked
Method

What it covers

Data-quality note pending. Every ledger row still carries source URL, source date, and ingest timestamp.

Score ceiling

Where it breaks down

No ceiling note is recorded yet. Treat clustering near the top as a warning that the benchmark may no longer separate frontier models.

Tools that report it

Receipts

Sources and further reading

The Pack · Editorial newsletter

New cards in your inbox. Free.

One short email when a card ships or changes status. No tracking, no third-party analytics. Unsubscribe in one click.