Why this benchmark is useful
Editorial brief pendingWe publish the methodology and ledger first; benchmark-specific analysis ships after desk review.
Benchmarks / Agentic
Terminal-Bench 2.1
Whether an agent can complete realistic, containerized terminal tasks (Terminal-Bench 2.1): debugging code, handling files, running commands, and producing the artifact the hidden checker expects. 16% weight in AA Intelligence Index v4.1.
Editorial brief pendingWe publish the methodology and ledger first; benchmark-specific analysis ships after desk review.
Reading guide pending. Use task format, scoring method, and source dates in the ledger until the desk brief ships.
Normalized to this benchmark's axis (0–100). Open the table for raw units.
Scores use this benchmark's own unit and axis, not a universal quality score.
| # | Model | Release date | Score | Provenance | Trust |
|---|---|---|---|---|---|
| 1 | GPT-5.6 SolOpenAI | 2026-07-09 | 88.01% | 2026-07-21 | Source-checked |
| 2 | GPT-5.6 TerraOpenAI | 2026-07-09 | 88.01% | 2026-07-21 | Source-checked |
| 3 | Kimi K3Moonshot | 2026-07-16 | 85.02% | 2026-07-21 | Source-checked |
| 4 | Claude Fable 5Anthropic | 2026-06-09 | 84.64% | 2026-07-21 | Source-checked |
| 1 | Claude Mythos PreviewAnthropic | 2026-06-01 | 84.1% | Terminal-Bench 2.0 leaderboard2026-06-02 | Source-checked |
| 2 | GPT 5.5 (Codex CLI)OpenAI | 2026-04-23 | 82% | Terminal-Bench 2.0 leaderboard2026-05-20 | Source-checked |
| 3 | GPT 5.4 (ForgeCode)OpenAI | 2026-03-05 | 81.8% | Terminal-Bench 2.0 leaderboard2026-05-20 | Source-checked |
| 8 | Grok 4.5xAI | 2026-07-08 | 81.65% | 2026-07-21 | Source-checked |
| 9 | GPT-5.6 LunaOpenAI | 2026-07-09 | 80.9% | 2026-07-21 | Source-checked |
| 10 | Claude Sonnet 5Anthropic | 2026-06-30 | 80.52% | 2026-07-21 | Source-checked |
| 11 | GPT-5.5 (medium)OpenAI | 2026-04-23 | 80.52% | 2026-07-21 | Source-checked |
| 4 | Claude Opus 4.6 (ForgeCode)Anthropic | 2026-02-01 | 79.8% | Terminal-Bench 2.0 leaderboard2026-05-20 | Source-checked |
| 13 | GPT-5.5 (high)OpenAI | 2026-04-23 | 79.4% | 2026-07-21 | Source-checked |
| 14 | GLM-5.2Zhipu | 2026-06-13 | 77.9% | 2026-07-21 | Source-checked |
| 15 | Muse Spark 1.1Meta | 2026-07-09 | 77.9% | 2026-07-21 | Source-checked |
| 4 | Gemini 3.5 FlashGoogle | 2026-05-19 | 76.2% | Terminal-Bench 2.0 leaderboard2026-05-20 | Source-checked |
| 5 | Claude Opus 4.8Anthropic | 2026-05-28 | 74.6% | Terminal-Bench 2.0 leaderboard2026-05-20 | Source-checked |
| 18 | Qwen3.7 MaxAlibaba | 2026-05-19 | 74.53% | 2026-07-21 | Source-checked |
| 19 | Gemini 3.1 Pro PreviewGoogle | 2026-02-19 | 73.78% | 2026-07-21 | Source-checked |
| 20 | Claude Sonnet 4.6 (Adaptive Reasoning, Max Effort)Anthropic | 2026-02-17 | 71.16% | 2026-07-21 | Source-checked |
| 21 | LongCat-2.0MeituanVendor-reported LongCat-2.0 score; keep separate from audited Terminal-Bench leaderboard rows until an independent run lands. | 2026-06-29 | 70.8% | Meituan LongCat-2.0 release materials2026-06-29 | Needs audit |
| 6 | Qwen 3.7 MaxAlibaba | 2026-05-20 | 69.7% | Terminal-Bench 2.0 leaderboard2026-05-20 | Source-checked |
| 7 | Claude Opus 4.7 (Adaptive)Anthropic | 2026-04-16 | 69.4% | Terminal-Bench 2.0 leaderboard2026-05-20 | Source-checked |
| 24 | Claude Sonnet 4.6Anthropic | 2026-02-17 | 68.4% | Terminal-Bench 2.0 leaderboard2026-06-09 | Source-checked |
| 8 | DeepSeek V4 Pro MaxDeepSeek | 2026-04-24 | 67.9% | Terminal-Bench 2.0 leaderboard2026-05-20 | Source-checked |
| 26 | Kimi K2.7 CodeMoonshot | 2026-06-12 | 67.42% | 2026-07-21 | Source-checked |
| 9 | Kimi K2.6Moonshot | 2026-04-20 | 66.7% | Terminal-Bench 2.0 leaderboard2026-05-20 | Source-checked |
| 10 | MiniMax M3MiniMax | 2026-05-31 | 66% | Terminal-Bench 2.0 leaderboard2026-05-20 | Source-checked |
| 29 | GPT-5.5 (low)OpenAI | 2026-04-23 | 65.54% | 2026-07-21 | Source-checked |
| 11 | Gemini 3.1 ProGoogle | 2026-02-19 | 65.4% | Terminal-Bench 2.0 leaderboard2026-05-20 | Source-checked |
| 31 | MiMo-V2.5-ProXiaomi | 2026-04-22 | 65.17% | 2026-07-21 | Source-checked |
| 32 | DeepSeek V4 Pro (Reasoning, Max Effort)DeepSeek | 2026-04-24 | 64.04% | 2026-07-21 | Source-checked |
| 33 | Grok 4.3xAI | 2026-04-30 | 63.8% | Terminal-Bench 2.0 leaderboard2026-06-09 | Source-checked |
| 34 | Muse SparkOther | 2026-01-01 | 62.17% | 2026-07-21 | Source-checked |
| 35 | GLM-5.1Zhipu | 2026-04-07 | 61.8% | 2026-07-21 | Source-checked |
| 36 | Claude Haiku 4.5Anthropic | 2025-10-01 | 61.4% | Terminal-Bench 2.0 leaderboard2026-06-09 | Source-checked |
| 37 | Qwen 3.7 PlusAlibaba | 2026-06-02 | 61.05% | 2026-07-21 | Source-checked |
| 38 | GPT-5.4 NanoOpenAI | 2026-03-17 | 60.67% | 2026-07-21 | Source-checked |
| 39 | GPT-5.4 MiniOpenAI | 2026-03-17 | 59.18% | 2026-07-21 | Source-checked |
| 40 | Llama 4 ScoutMeta | 2026-04-05 | 58.6% | Terminal-Bench 2.0 leaderboard2026-06-09 | Source-checked |
| 41 | MiniMax M2.7MiniMax | 2026-04-15 | 55.43% | 2026-07-21 | Source-checked |
| 42 | Claude Opus 4.7 (Non-reasoning, High Effort)Anthropic | 2026-04-16 | 54.55% | 2026-07-21 | Source-checked |
| 43 | Nemotron 3 Ultra 550B A55B (Reasoning)NVIDIA | 2026-06-04 | 53.93% | 2026-07-21 | Source-checked |
| 44 | GPT-5.3 Codex (xhigh)OpenAI | 2026-02-05 | 53.03% | 2026-07-21 | Source-checked |
| 45 | GPT-5.1OpenAI | 2025-11-13 | 52.43% | 2026-07-21 | Source-checked |
| 46 | GPT-5.2OpenAI | 2025-12-11 | 46.97% | 2026-07-21 | Source-checked |
| 47 | Claude Opus 4.6 (Adaptive Reasoning, Max Effort)Anthropic | 2026-02-05 | 46.21% | 2026-07-21 | Source-checked |
| 48 | Kimi K2.5Moonshot | 2026-01-27 | 45.69% | 2026-07-21 | Source-checked |
| 49 | Gemma 4 31B ITGoogle | 2026-03-01 | 43.45% | 2026-07-21 | Source-checked |
| 50 | Gemini 3 ProGoogle | 2025-11-18 | 41.67% | 2026-07-21 | Source-checked |
| 51 | Claude Opus 4.5Anthropic | 2025-11-24 | 40.91% | 2026-07-21 | Source-checked |
| 52 | Gemini 3.5 Flash (medium)Google | 2026-05-19 | 39.39% | 2026-07-21 | Source-checked |
| 53 | Step 3.7 FlashStepFun | 2026-06-01 | 39.33% | 2026-07-21 | Source-checked |
| 54 | Grok 4.20 ReasoningxAI | 2026-03-05 | 37.88% | 2026-07-21 | Source-checked |
| 55 | OpenAI o3OpenAI | 2025-04-16 | 37.12% | 2026-07-21 | Source-checked |
| 56 | North Mini CodeCohere | 2026-06-09 | 35.58% | 2026-07-21 | Source-checked |
| 57 | MiniMax M2.5MiniMax | 2026-04-01 | 34.85% | 2026-07-21 | Source-checked |
| 58 | Gemini 3 Flash PreviewGoogle | 2025-12-17 | 31.82% | 2026-07-21 | Source-checked |
| 59 | Gemini 3.1 Flash LiteGoogle | 2026-05-07 | 31.09% | 2026-07-21 | Source-checked |
| 60 | HyperNova 60B 2605Multiverse | 2026-05-06 | 18.35% | 2026-07-21 | Source-checked |
| 61 | Gemma 4 12B (Reasoning)Google | 2026-06-07 | 18.18% | 2026-07-21 | Source-checked |
| 62 | DeepSeek R1DeepSeek | 2025-01-20 | 15.91% | 2026-07-21 | Source-checked |
| 63 | OpenAI o1OpenAI | 2024-09-12 | 12.88% | 2026-07-21 | Source-checked |
| 64 | Mistral Large 3Mistral | 2025-12-02 | 11.99% | 2026-07-21 | Source-checked |
| 65 | Gemma 4 12B (Non-reasoning)Google | 2026-06-10 | 11.36% | 2026-07-21 | Source-checked |
| 66 | Llama 4 MaverickMeta | 2026-04-05 | 7.87% | 2026-07-21 | Source-checked |
| 67 | LFM2.5-8B-A1BLiquid | 2026-06-08 | 4.55% | 2026-07-21 | Source-checked |
| 68 | Command ACohere | 2026-03-15 | 0.76% | 2026-07-21 | Source-checked |
| 69 | MiniCPM5-1B (Reasoning)OpenBMB | 2026-06-04 | 0% | 2026-07-21 | Source-checked |
Data-quality note pending. Every ledger row still carries source URL, source date, and ingest timestamp.
No ceiling note is recorded yet. Treat clustering near the top as a warning that the benchmark may no longer separate frontier models.
The Pack · Editorial newsletter
One short email when a card ships or changes status. No tracking, no third-party analytics. Unsubscribe in one click.