Why this benchmark is useful
When you need realistic containerized terminal work — debug, files, commands, artifacts — as an agentic ops signal weighted in AA Index v4.1.
Terminal-Bench 2.1
Whether an agent can complete realistic, containerized terminal tasks (Terminal-Bench 2.1): debugging code, handling files, running commands, and producing the artifact the hidden checker expects. 16% weight in AA Intelligence Index v4.1.
When you need realistic containerized terminal work — debug, files, commands, artifacts — as an agentic ops signal weighted in AA Index v4.1.
Resolution/pass rate on audited Terminal-Bench 2.1 tasks. Always pair the model with its harness, tools, retries, and time limits — scaffolding moves scores as much as the model. The official site shipped 4.0 on 28 Aug 2026; AA and Vals still publish 2.1, so this page stays on 2.1 until those boards move.
Normalized to this benchmark's axis (0–100). Open the table for raw units.
Scores use this benchmark's own unit and axis, not a universal quality score.
| # | Model | Release date | Score | Provenance | Trust |
|---|---|---|---|---|---|
| 1 | Claude Opus 5 (Adaptive Reasoning, Max Effort)Anthropic | 2026-07-24 | 89.14% | 2026-09-01 | Source-checked |
| 2 | Grok 4.6xAI | 2026-08-12 | 88.39% | 2026-09-01 | Source-checked |
| 3 | Claude Opus 5 (Adaptive Reasoning, Xhigh Effort)Anthropic | 2026-07-24 | 88.01% | 2026-09-01 | Source-checked |
| 4 | GPT-5.6 SolOpenAI | 2026-07-09 | 88.01% | 2026-09-01 | Source-checked |
| 5 | GPT-5.6 TerraOpenAI | 2026-07-09 | 88.01% | 2026-09-01 | Source-checked |
| 6 | Claude Opus 5 (Adaptive Reasoning, High Effort)Anthropic | 2026-07-24 | 87.64% | 2026-09-01 | Source-checked |
| 7 | Claude Opus 5 (Adaptive Reasoning, Medium Effort)Anthropic | 2026-07-24 | 86.14% | 2026-09-01 | Source-checked |
| 8 | Qwen3.8-Flash-NextAlibaba | 2026-08-26 | 86.14% | 2026-09-01 | Source-checked |
| 9 | Gemini 3.7 FlashGoogle | 2026-08-13 | 85.77% | 2026-09-01 | Source-checked |
| 10 | Kimi K3Moonshot | 2026-07-16 | 85.02% | 2026-09-01 | Source-checked |
| 11 | Claude Fable 5Anthropic | 2026-06-09 | 84.64% | 2026-09-01 | Source-checked |
| 12 | GLM-5.3-FlashZhipu | 2026-08-26 | 84.27% | 2026-09-01 | Source-checked |
| 1 | Claude Mythos PreviewAnthropic | 2026-06-01 | 84.1% | Terminal-Bench 2.0 leaderboard2026-06-02 | Source-checked |
| 14 | GLM-5.3Zhipu | 2026-08-14 | 83.9% | 2026-09-01 | Source-checked |
| 15 | Kimi K3 (low)Moonshot | 2026-07-16 | 82.4% | 2026-09-01 | Source-checked |
| 16 | Qwen3.8 2.4T A95BAlibaba | 2026-08-12 | 82.02% | 2026-09-01 | Source-checked |
| 2 | GPT 5.5 (Codex CLI)OpenAI | 2026-04-23 | 82% | Terminal-Bench 2.0 leaderboard2026-05-20 | Source-checked |
| 3 | GPT 5.4 (ForgeCode)OpenAI | 2026-03-05 | 81.8% | Terminal-Bench 2.0 leaderboard2026-05-20 | Source-checked |
| 19 | Grok 4.5xAI | 2026-07-08 | 81.65% | 2026-09-01 | Source-checked |
| 20 | Qwen3.8 MaxAlibaba | 2026-08-03 | 81.27% | 2026-09-01 | Source-checked |
| 21 | GPT-5.6 LunaOpenAI | 2026-07-09 | 80.9% | 2026-09-01 | Source-checked |
| 22 | Claude Sonnet 5Anthropic | 2026-06-30 | 80.52% | 2026-09-01 | Source-checked |
| 23 | GPT-5.5 (medium)OpenAI | 2026-04-23 | 80.52% | 2026-09-01 | Source-checked |
| 24 | Muse Spark 1.2Meta | 2026-08-05 | 80.15% | 2026-09-01 | Source-checked |
| 4 | Claude Opus 4.6 (ForgeCode)Anthropic | 2026-02-01 | 79.8% | Terminal-Bench 2.0 leaderboard2026-05-20 | Source-checked |
| 26 | Qwen3.8 27BAlibaba | 2026-08-14 | 79.78% | 2026-09-01 | Source-checked |
| 27 | GPT-5.5 (high)OpenAI | 2026-04-23 | 79.4% | 2026-09-01 | Source-checked |
| 28 | DeepSeek V4 Flash 0731 (Reasoning, Max Effort)DeepSeek | 2026-07-31 | 78.65% | 2026-09-01 | Source-checked |
| 29 | DeepSeek V4 Pro 0813 (Reasoning, Max Effort)DeepSeek | 2026-08-13 | 78.65% | 2026-09-01 | Source-checked |
| 30 | GLM-5.2Zhipu | 2026-06-13 | 77.9% | 2026-09-01 | Source-checked |
| 31 | Muse Spark 1.1Meta | 2026-07-09 | 77.9% | 2026-09-01 | Source-checked |
| 32 | Gemini 3.6 Flash (high)Google | 2026-07-21 | 77.53% | 2026-09-01 | Source-checked |
| 33 | Claude Opus 5 (Adaptive Reasoning, Low Effort)Anthropic | 2026-07-24 | 76.4% | 2026-09-01 | Source-checked |
| 4 | Gemini 3.5 FlashGoogle | 2026-05-19 | 76.2% | Terminal-Bench 2.0 leaderboard2026-05-20 | Source-checked |
| 35 | Motif 3Other | 2026-08-12 | 74.91% | 2026-09-01 | Source-checked |
| 5 | Claude Opus 4.8Anthropic | 2026-05-28 | 74.6% | Terminal-Bench 2.0 leaderboard2026-05-20 | Source-checked |
| 37 | Qwen3.7 MaxAlibaba | 2026-05-19 | 74.53% | 2026-09-01 | Source-checked |
| 38 | DeepSeek V4 Flash Vision (Reasoning, Max Effort)DeepSeek | 2026-08-21 | 74.16% | 2026-09-01 | Source-checked |
| 39 | Gemini 3.1 Pro PreviewGoogle | 2026-02-19 | 73.78% | 2026-09-01 | Source-checked |
| 40 | Claude Sonnet 4.6 (Adaptive Reasoning, Max Effort)Anthropic | 2026-02-17 | 71.16% | 2026-09-01 | Source-checked |
| 41 | LongCat-2.0MeituanVendor-reported LongCat-2.0 score; keep separate from audited Terminal-Bench leaderboard rows until an independent run lands. | 2026-06-29 | 70.8% | Meituan LongCat-2.0 release materials2026-06-29 | Needs audit |
| 42 | Motif 3 (Beta)Other | 2026-07-21 | 70.79% | 2026-09-01 | Source-checked |
| 43 | KAT Coder Pro V2Other | 2026-03-27 | 70.04% | 2026-09-01 | Source-checked |
| 6 | Qwen 3.7 MaxAlibaba | 2026-05-20 | 69.7% | Terminal-Bench 2.0 leaderboard2026-05-20 | Source-checked |
| 45 | Agnes 2.5 Pro BetaOther | 2026-08-26 | 69.66% | 2026-09-01 | Source-checked |
| 46 | Apodex 1.1Other | 2026-08-30 | 69.66% | 2026-09-01 | Source-checked |
| 7 | Claude Opus 4.7 (Adaptive)Anthropic | 2026-04-16 | 69.4% | Terminal-Bench 2.0 leaderboard2026-05-20 | Source-checked |
| 48 | Claude Sonnet 4.6Anthropic | 2026-02-17 | 68.4% | Terminal-Bench 2.0 leaderboard2026-06-09 | Source-checked |
| 8 | DeepSeek V4 Pro MaxDeepSeek | 2026-04-24 | 67.9% | Terminal-Bench 2.0 leaderboard2026-05-20 | Source-checked |
| 50 | Nex-N2-ProOther | 2026-06-02 | 67.79% | 2026-09-01 | Source-checked |
| 51 | Kimi K2.7 CodeMoonshot | 2026-06-12 | 67.42% | 2026-09-01 | Source-checked |
| 52 | Agnes 2.5 Pro AlphaOther | 2026-07-24 | 67.04% | 2026-09-01 | Source-checked |
| 9 | Kimi K2.6Moonshot | 2026-04-20 | 66.7% | Terminal-Bench 2.0 leaderboard2026-05-20 | Source-checked |
| 10 | MiniMax M3MiniMax | 2026-05-31 | 66% | Terminal-Bench 2.0 leaderboard2026-05-20 | Source-checked |
| 55 | GPT-5.5 (low)OpenAI | 2026-04-23 | 65.54% | 2026-09-01 | Source-checked |
| 11 | Gemini 3.1 ProGoogle | 2026-02-19 | 65.4% | Terminal-Bench 2.0 leaderboard2026-05-20 | Source-checked |
| 57 | MiMo-V2.5-ProXiaomi | 2026-04-22 | 65.17% | 2026-09-01 | Source-checked |
| 58 | DeepSeek V4 Pro (Reasoning, High Effort)DeepSeek | 2026-04-24 | 64.79% | 2026-09-01 | Source-checked |
| 59 | Hy3Other | 2026-07-06 | 64.42% | 2026-09-01 | Source-checked |
| 60 | Grok 4.3xAI | 2026-04-30 | 63.8% | Terminal-Bench 2.0 leaderboard2026-06-09 | Source-checked |
| 61 | MiMo-V2.5Xiaomi | 2026-04-22 | 63.67% | 2026-09-01 | Source-checked |
| 62 | Muse SparkOther | 2026-01-01 | 62.17% | 2026-09-01 | Source-checked |
| 63 | GLM-5.1Zhipu | 2026-04-07 | 61.8% | 2026-09-01 | Source-checked |
| 64 | Qwen3.6 PlusAlibaba | 2026-04-02 | 61.42% | 2026-09-01 | Source-checked |
| 65 | Claude Haiku 4.5Anthropic | 2025-10-01 | 61.4% | Terminal-Bench 2.0 leaderboard2026-06-09 | Source-checked |
| 66 | GPT-5.5 (Non-reasoning)OpenAI | 2026-04-23 | 61.05% | 2026-09-01 | Source-checked |
| 67 | Qwen 3.7 PlusAlibaba | 2026-06-02 | 61.05% | 2026-09-01 | Source-checked |
| 68 | GPT-5.4 NanoOpenAI | 2026-03-17 | 60.67% | 2026-09-01 | Source-checked |
| 69 | Qwen3.6 27B (Reasoning)Alibaba | 2026-04-22 | 60.67% | 2026-09-01 | Source-checked |
| 70 | JT-4.1 Flash 236B A21BOther | 2026-07-09 | 59.55% | 2026-09-01 | Source-checked |
| 71 | GPT-5.4 MiniOpenAI | 2026-03-17 | 59.18% | 2026-09-01 | Source-checked |
| 72 | Llama 4 ScoutMeta | 2026-04-05 | 58.6% | Terminal-Bench 2.0 leaderboard2026-06-09 | Source-checked |
| 73 | Solar Pro 4Other | 2026-08-06 | 57.3% | 2026-09-01 | Source-checked |
| 74 | DeepSeek V4 Flash (Reasoning, High Effort)DeepSeek | 2026-04-24 | 56.93% | 2026-09-01 | Source-checked |
| 75 | Claude 4.5 Sonnet (Reasoning)Anthropic | 2025-09-29 | 55.81% | 2026-09-01 | Source-checked |
| 76 | Ling 3.0 FlashOther | 2026-08-04 | 55.43% | 2026-09-01 | Source-checked |
| 77 | MiniMax M2.7MiniMax | 2026-04-15 | 55.43% | 2026-09-01 | Source-checked |
| 78 | Inkling (xhigh)Other | 2026-07-15 | 55.06% | 2026-09-01 | Source-checked |
| 79 | Inkling SmallOther | 2026-07-30 | 55.06% | 2026-09-01 | Source-checked |
| 80 | Claude Opus 4.7 (Non-reasoning, High Effort)Anthropic | 2026-04-16 | 54.55% | 2026-09-01 | Source-checked |
| 81 | Nemotron 3 Ultra 550B A55B (Reasoning)NVIDIA | 2026-06-04 | 53.93% | 2026-09-01 | Source-checked |
| 82 | Gemini 3.5 Flash-LiteGoogle | 2026-07-21 | 53.56% | 2026-09-01 | Source-checked |
| 83 | GPT-5.3 Codex (xhigh)OpenAI | 2026-02-05 | 53.03% | 2026-09-01 | Source-checked |
| 84 | GPT-5.1OpenAI | 2025-11-13 | 52.43% | 2026-09-01 | Source-checked |
| 85 | Grok Build 0.1 0616xAI | 2026-06-16 | 52.06% | 2026-09-01 | Source-checked |
| 86 | GLM-5.2 (Non-reasoning)Zhipu | 2026-06-16 | 51.69% | 2026-09-01 | Source-checked |
| 87 | Muse GlimmerMeta | 2026-08-10 | 51.69% | 2026-09-01 | Source-checked |
| 88 | Qwen3.5 397B A17B (Reasoning)Alibaba | 2026-02-16 | 51.31% | 2026-09-01 | Source-checked |
| 89 | Qwen3.6 27B (Non-reasoning)Alibaba | 2026-04-22 | 51.31% | 2026-09-01 | Source-checked |
| 90 | Mistral Medium 3.5Mistral | 2026-04-29 | 50.56% | 2026-09-01 | Source-checked |
| 91 | Qwen3.5 122B A10B (Reasoning)Alibaba | 2026-02-24 | 47.57% | 2026-09-01 | Source-checked |
| 92 | Claude Opus 4.5 (Reasoning)Anthropic | 2025-11-24 | 46.97% | 2026-09-01 | Source-checked |
| 93 | GPT-5.2OpenAI | 2025-12-11 | 46.97% | 2026-09-01 | Source-checked |
| 94 | DeepSeek V3.2 (Reasoning)DeepSeek | 2025-12-01 | 46.82% | 2026-09-01 | Source-checked |
| 95 | Claude Opus 4.6 (Adaptive Reasoning, Max Effort)Anthropic | 2026-02-05 | 46.21% | 2026-09-01 | Source-checked |
| 96 | Gemini 3.5 Flash (minimal)Google | 2026-05-19 | 46.21% | 2026-09-01 | Source-checked |
| 97 | Kimi K2.5Moonshot | 2026-01-27 | 45.69% | 2026-09-01 | Source-checked |
| 98 | GLM-4.7 (Reasoning)Zhipu | 2025-12-22 | 45.32% | 2026-09-01 | Source-checked |
| 99 | Qwen3.6 35B A3B (Reasoning)Alibaba | 2026-04-16 | 44.94% | 2026-09-01 | Source-checked |
| 100 | Solar Open2 250BOther | 2026-08-12 | 44.19% | 2026-09-01 | Source-checked |
| 101 | Qwen3.6 Max PreviewAlibaba | 2026-04-20 | 43.94% | 2026-09-01 | Source-checked |
| 102 | Gemma 4 31B ITGoogle | 2026-03-01 | 43.45% | 2026-09-01 | Source-checked |
| 103 | GLM-5 (Reasoning)Zhipu | 2026-02-11 | 43.18% | 2026-09-01 | Source-checked |
| 104 | GPT-5.2 (medium)OpenAI | 2025-12-11 | 43.18% | 2026-09-01 | Source-checked |
| 105 | GPT-5.4 (low)OpenAI | 2026-03-05 | 43.18% | 2026-09-01 | Source-checked |
| 106 | Ring-2.6-1TOther | 2026-05-08 | 43.07% | 2026-09-01 | Source-checked |
| 107 | Claude Sonnet 4.6 (Non-reasoning, Low Effort)Anthropic | 2026-02-17 | 42.42% | 2026-09-01 | Source-checked |
| 108 | GPT-5.5 Instant (May 2026)OpenAI | 2026-05-05 | 42.42% | 2026-09-01 | Source-checked |
| 109 | Gemini 3 ProGoogle | 2025-11-18 | 41.67% | 2026-09-01 | Source-checked |
| 110 | Qwen3.6 35B A3B (Non-reasoning)Alibaba | 2026-04-16 | 41.57% | 2026-09-01 | Source-checked |
| 111 | Claude Opus 4.5Anthropic | 2025-11-24 | 40.91% | 2026-09-01 | Source-checked |
| 112 | Grok 4.20 0309 (Reasoning)xAI | 2026-03-10 | 40.91% | 2026-09-01 | Source-checked |
| 113 | MiMo-V2-ProXiaomi | 2026-03-18 | 40.91% | 2026-09-01 | Source-checked |
| 114 | K-EXAONE 2.0 0803Other | 2026-08-12 | 40.45% | 2026-09-01 | Source-checked |
| 115 | Gemini 3.5 Flash (medium)Google | 2026-05-19 | 39.39% | 2026-09-01 | Source-checked |
| 116 | GLM-5 (Non-reasoning)Zhipu | 2026-02-11 | 39.39% | 2026-09-01 | Source-checked |
| 117 | Step 3.7 FlashStepFun | 2026-06-01 | 39.33% | 2026-09-01 | Source-checked |
| 118 | A.X-K2Other | 2026-08-12 | 38.95% | 2026-09-01 | Source-checked |
| 119 | Gemini 3 Flash Preview (Reasoning)Google | 2025-12-17 | 38.64% | 2026-09-01 | Source-checked |
| 120 | GPT-5 (medium)OpenAI | 2025-08-07 | 37.88% | 2026-09-01 | Source-checked |
| 121 | GPT-5 Codex (high)OpenAI | 2025-09-23 | 37.88% | 2026-09-01 | Source-checked |
| 122 | Grok 4xAI | 2025-07-10 | 37.88% | 2026-09-01 | Source-checked |
| 123 | Grok 4.20 ReasoningxAI | 2026-03-05 | 37.88% | 2026-09-01 | Source-checked |
| 124 | Kimi K2.6 (Non-reasoning)Other | 2026-04-20 | 37.88% | 2026-09-01 | Source-checked |
| 125 | GPT-5.2 Codex (xhigh)OpenAI | 2025-12-11 | 37.12% | 2026-09-01 | Source-checked |
| 126 | OpenAI o3OpenAI | 2025-04-16 | 37.12% | 2026-09-01 | Source-checked |
| 127 | DeepSeek V4 Pro (Non-reasoning)DeepSeek | 2026-04-24 | 36.36% | 2026-09-01 | Source-checked |
| 128 | MiMo-V2-Omni-0327Xiaomi | 2026-03-27 | 35.61% | 2026-09-01 | Source-checked |
| 129 | MiMo-V2.5-Pro (Non-reasoning)Xiaomi | 2026-04-22 | 35.61% | 2026-09-01 | Source-checked |
| 130 | Qwen3.5 397B A17B (Non-reasoning)Alibaba | 2026-02-16 | 35.61% | 2026-09-01 | Source-checked |
| 131 | North Mini CodeCohere | 2026-06-09 | 35.58% | 2026-09-01 | Source-checked |
| 132 | GPT-5 (high)OpenAI | 2025-08-07 | 35.21% | 2026-09-01 | Source-checked |
| 133 | GPT-5.1 Codex (high)OpenAI | 2025-11-13 | 34.85% | 2026-09-01 | Source-checked |
| 134 | MiMo-V2-OmniXiaomi | 2026-03-19 | 34.85% | 2026-09-01 | Source-checked |
| 135 | MiniMax M2.5MiniMax | 2026-04-01 | 34.85% | 2026-09-01 | Source-checked |
| 136 | GPT-5.5 Instant (June 2026)OpenAI | 2026-06-25 | 34.83% | 2026-09-01 | Source-checked |
| 137 | Claude 4.1 Opus (Reasoning)Anthropic | 2025-08-05 | 34.34% | 2026-09-01 | Source-checked |
| 138 | DeepSeek V4 Flash (Non-reasoning)DeepSeek | 2026-04-24 | 34.09% | 2026-09-01 | Source-checked |
| 139 | Gemini 3 Pro Preview (low)Google | 2025-11-18 | 34.09% | 2026-09-01 | Source-checked |
| 140 | Hy3-preview (Reasoning)Other | 2026-04-23 | 34.09% | 2026-09-01 | Source-checked |
| 141 | Grok 4.3 (Non-reasoning)xAI | 2026-04-30 | 34.08% | 2026-09-01 | Source-checked |
| 142 | GLM-5-TurboZhipu | 2026-03-15 | 33.33% | 2026-09-01 | Source-checked |
| 143 | G9v3-39A5BOther | 2026-08-03 | 32.58% | 2026-09-01 | Source-checked |
| 144 | GLM 5V Turbo (Reasoning)Zhipu | 2026-04-01 | 32.58% | 2026-09-01 | Source-checked |
| 145 | Qwen3.5 27B (Reasoning)Alibaba | 2026-02-24 | 32.58% | 2026-09-01 | Source-checked |
| 146 | Gemini 3 Flash PreviewGoogle | 2025-12-17 | 31.82% | 2026-09-01 | Source-checked |
| 147 | Hy3-preview (Non-reasoning)Other | 2026-04-23 | 31.82% | 2026-09-01 | Source-checked |
| 148 | Gemini 3.1 Flash LiteGoogle | 2026-05-07 | 31.09% | 2026-09-01 | Source-checked |
| 149 | Claude 4 Opus (Reasoning)Anthropic | 2025-05-22 | 31.06% | 2026-09-01 | Source-checked |
| 150 | Kimi K2 ThinkingMoonshot | 2025-11-06 | 31.06% | 2026-09-01 | Source-checked |
| 151 | Ling-2.6-1TOther | 2026-04-23 | 31.06% | 2026-09-01 | Source-checked |
| 152 | MiMo-V2-Flash (Feb 2026)Xiaomi | 2025-12-16 | 31.06% | 2026-09-01 | Source-checked |
| 153 | Grok 4.3 (medium)xAI | 2026-04-30 | 30.3% | 2026-09-01 | Source-checked |
| 154 | JT-35B-FlashOther | 2026-05-14 | 28.79% | 2026-09-01 | Source-checked |
| 155 | MiniMax-M2.1MiniMax | 2025-12-23 | 28.79% | 2026-09-01 | Source-checked |
| 156 | MiMo-V2-Flash (Reasoning)Xiaomi | 2025-12-16 | 28.03% | 2026-09-01 | Source-checked |
| 157 | Ling 3.0 TinyOther | 2026-08-06 | 27.72% | 2026-09-01 | Source-checked |
| 158 | Gemma 4 12B (Reasoning)Google | 2026-06-07 | 27.34% | 2026-09-01 | Source-checked |
| 159 | Granite 4.2 30BOther | 2026-08-25 | 26.59% | 2026-09-01 | Source-checked |
| 160 | GPT-5 (low)OpenAI | 2025-08-07 | 26.52% | 2026-09-01 | Source-checked |
| 161 | Grok 4.3 (low)xAI | 2026-04-30 | 26.52% | 2026-09-01 | Source-checked |
| 162 | Ling 2.6 FlashOther | 2026-04-21 | 24.34% | 2026-09-01 | Source-checked |
| 163 | Nemotron 3.5 LightningNVIDIA | 2026-08-11 | 24.34% | 2026-09-01 | Source-checked |
| 164 | Qwen3 Max ThinkingAlibaba | 2026-01-26 | 24.24% | 2026-09-01 | Source-checked |
| 165 | Command ACohere | 2026-03-15 | 22.85% | 2026-09-01 | Source-checked |
| 166 | EXAONE 4.5 33BOther | 2026-04-09 | 21.35% | 2026-09-01 | Source-checked |
| 167 | Granite 4.2 8BOther | 2026-08-25 | 18.35% | 2026-09-01 | Source-checked |
| 168 | HyperNova 60B 2605Multiverse | 2026-05-06 | 18.35% | 2026-09-01 | Source-checked |
| 169 | JT-MINIOther | 2026-04-15 | 18.18% | 2026-09-01 | Source-checked |
| 170 | Grok 4.20 0309 v2 (Non-reasoning)xAI | 2026-04-07 | 16.67% | 2026-09-01 | Source-checked |
| 171 | DeepSeek R1DeepSeek | 2025-01-20 | 15.91% | 2026-09-01 | Source-checked |
| 172 | Granite 4.2 3BOther | 2026-08-25 | 13.86% | 2026-09-01 | Source-checked |
| 173 | OpenAI o1OpenAI | 2024-09-12 | 12.88% | 2026-09-01 | Source-checked |
| 174 | DiffusionGemma 26B A4BGoogle | 2026-06-10 | 12.36% | 2026-09-01 | Source-checked |
| 175 | Mistral Large 3Mistral | 2025-12-02 | 11.99% | 2026-09-01 | Source-checked |
| 176 | Gemma 4 12B (Non-reasoning)Google | 2026-06-10 | 11.36% | 2026-09-01 | Source-checked |
| 177 | Llama 4 MaverickMeta | 2026-04-05 | 7.87% | 2026-09-01 | Source-checked |
| 178 | Nemotron 3 Nano Omni 30B A3B ReasoningNVIDIA | 2026-04-29 | 6.74% | 2026-09-01 | Source-checked |
| 179 | G9v3-3BOther | 2026-07-23 | 5.99% | 2026-09-01 | Source-checked |
| 180 | LFM2.5-8B-A1BLiquid | 2026-06-08 | 4.55% | 2026-09-01 | Source-checked |
| 181 | Granite 4.1 30BOther | 2026-04-29 | 2.62% | 2026-09-01 | Source-checked |
| 182 | MiniCPM-V 4.6 1.3BOpenBMB | 2026-05-11 | 0% | 2026-09-01 | Source-checked |
| 183 | MiniCPM5-1B (Non-reasoning)OpenBMB | 2026-05-25 | 0% | 2026-09-01 | Source-checked |
| 184 | MiniCPM5-1B (Reasoning)OpenBMB | 2026-06-04 | 0% | 2026-09-01 | Source-checked |
This benchmark sits in the agentic family. It uses Containerized tasks with a terminal environment; agents operate through commands and are graded by task-specific checks. The score should travel with its task format, scoring method, source date, and benchmark version.
No ceiling note is recorded yet. Treat clustering near the top as a warning that the benchmark may no longer separate frontier models.
Every answer below is assembled from the dated fields on this page. Nothing is written separately for search.
Whether an agent can complete realistic, containerized terminal tasks (Terminal-Bench 2.1): debugging code, handling files, running commands, and producing the artifact the hidden checker expects. 16% weight in AA Intelligence Index v4.1.
A strong Terminal-Bench result says nothing about:
Resolution/pass rate across audited tasks. Always read the agent harness and model pairing. Task format: Containerized tasks with a terminal environment; agents operate through commands and are graded by task-specific checks.
Terminal-Bench is currently marked Active in the atlas.
Contamination risk for Terminal-Bench is graded Low contamination. Treat every row on this page as a public claim with a source and a date, not as a controlled experiment.
The Pack · Editorial newsletter
One short email when a tool ships or changes status. No tracking, no third-party analytics. Unsubscribe in one click.