Warum dieser Benchmark nützlich ist
Wenn du realistische containerisierte Terminal-Arbeit brauchst — Debug, Dateien, Befehle, Artefakte — als agentisches Ops-Signal mit Gewicht im AA Index v4.1.
Terminal-Bench 2.1
Ob ein Agent realistische, containerisierte Terminal-Aufgaben (Terminal-Bench 2.1) erledigen kann: Code debuggen, Dateien bearbeiten, Befehle ausführen und das Artefakt liefern, das der versteckte Checker erwartet. 16 % Gewicht im AA Intelligence Index v4.1.
Wenn du realistische containerisierte Terminal-Arbeit brauchst — Debug, Dateien, Befehle, Artefakte — als agentisches Ops-Signal mit Gewicht im AA Index v4.1.
Lösungs-/Passrate auf auditierten Terminal-Bench-2.1-Aufgaben. Modell immer mit Harness, Tools, Retries und Zeitlimits lesen — Scaffolding verschiebt Werte so stark wie das Modell. Die offizielle Seite hat am 28. Aug. 2026 4.0 ausgeliefert; AA und Vals publizieren weiter 2.1, also bleibt diese Seite auf 2.1, bis diese Boards wechseln.
Auf die Skala dieses Benchmarks normalisiert (0–100). Die Tabelle zeigt die Rohwerte.
Scores nutzen die eigene Einheit und Skala dieses Benchmarks, keinen universellen Qualitätswert.
| # | Modell | Veröffentlichung | Score | Herkunft | Beleglage |
|---|---|---|---|---|---|
| 1 | Claude Opus 5 (Adaptive Reasoning, Max Effort)Anthropic | 2026-07-24 | 89.14% | 2026-09-01 | Quelle geprüft |
| 2 | Grok 4.6xAI | 2026-08-12 | 88.39% | 2026-09-01 | Quelle geprüft |
| 3 | Claude Opus 5 (Adaptive Reasoning, Xhigh Effort)Anthropic | 2026-07-24 | 88.01% | 2026-09-01 | Quelle geprüft |
| 4 | GPT-5.6 SolOpenAI | 2026-07-09 | 88.01% | 2026-09-01 | Quelle geprüft |
| 5 | GPT-5.6 TerraOpenAI | 2026-07-09 | 88.01% | 2026-09-01 | Quelle geprüft |
| 6 | Claude Opus 5 (Adaptive Reasoning, High Effort)Anthropic | 2026-07-24 | 87.64% | 2026-09-01 | Quelle geprüft |
| 7 | Claude Opus 5 (Adaptive Reasoning, Medium Effort)Anthropic | 2026-07-24 | 86.14% | 2026-09-01 | Quelle geprüft |
| 8 | Qwen3.8-Flash-NextAlibaba | 2026-08-26 | 86.14% | 2026-09-01 | Quelle geprüft |
| 9 | Gemini 3.7 FlashGoogle | 2026-08-13 | 85.77% | 2026-09-01 | Quelle geprüft |
| 10 | Kimi K3Moonshot | 2026-07-16 | 85.02% | 2026-09-01 | Quelle geprüft |
| 11 | Claude Fable 5Anthropic | 2026-06-09 | 84.64% | 2026-09-01 | Quelle geprüft |
| 12 | GLM-5.3-FlashZhipu | 2026-08-26 | 84.27% | 2026-09-01 | Quelle geprüft |
| 1 | Claude Mythos PreviewAnthropic | 2026-06-01 | 84.1% | Terminal-Bench 2.0 leaderboard2026-06-02 | Quelle geprüft |
| 14 | GLM-5.3Zhipu | 2026-08-14 | 83.9% | 2026-09-01 | Quelle geprüft |
| 15 | Kimi K3 (low)Moonshot | 2026-07-16 | 82.4% | 2026-09-01 | Quelle geprüft |
| 16 | Qwen3.8 2.4T A95BAlibaba | 2026-08-12 | 82.02% | 2026-09-01 | Quelle geprüft |
| 2 | GPT 5.5 (Codex CLI)OpenAI | 2026-04-23 | 82% | Terminal-Bench 2.0 leaderboard2026-05-20 | Quelle geprüft |
| 3 | GPT 5.4 (ForgeCode)OpenAI | 2026-03-05 | 81.8% | Terminal-Bench 2.0 leaderboard2026-05-20 | Quelle geprüft |
| 19 | Grok 4.5xAI | 2026-07-08 | 81.65% | 2026-09-01 | Quelle geprüft |
| 20 | Qwen3.8 MaxAlibaba | 2026-08-03 | 81.27% | 2026-09-01 | Quelle geprüft |
| 21 | GPT-5.6 LunaOpenAI | 2026-07-09 | 80.9% | 2026-09-01 | Quelle geprüft |
| 22 | Claude Sonnet 5Anthropic | 2026-06-30 | 80.52% | 2026-09-01 | Quelle geprüft |
| 23 | GPT-5.5 (medium)OpenAI | 2026-04-23 | 80.52% | 2026-09-01 | Quelle geprüft |
| 24 | Muse Spark 1.2Meta | 2026-08-05 | 80.15% | 2026-09-01 | Quelle geprüft |
| 4 | Claude Opus 4.6 (ForgeCode)Anthropic | 2026-02-01 | 79.8% | Terminal-Bench 2.0 leaderboard2026-05-20 | Quelle geprüft |
| 26 | Qwen3.8 27BAlibaba | 2026-08-14 | 79.78% | 2026-09-01 | Quelle geprüft |
| 27 | GPT-5.5 (high)OpenAI | 2026-04-23 | 79.4% | 2026-09-01 | Quelle geprüft |
| 28 | DeepSeek V4 Flash 0731 (Reasoning, Max Effort)DeepSeek | 2026-07-31 | 78.65% | 2026-09-01 | Quelle geprüft |
| 29 | DeepSeek V4 Pro 0813 (Reasoning, Max Effort)DeepSeek | 2026-08-13 | 78.65% | 2026-09-01 | Quelle geprüft |
| 30 | GLM-5.2Zhipu | 2026-06-13 | 77.9% | 2026-09-01 | Quelle geprüft |
| 31 | Muse Spark 1.1Meta | 2026-07-09 | 77.9% | 2026-09-01 | Quelle geprüft |
| 32 | Gemini 3.6 Flash (high)Google | 2026-07-21 | 77.53% | 2026-09-01 | Quelle geprüft |
| 33 | Claude Opus 5 (Adaptive Reasoning, Low Effort)Anthropic | 2026-07-24 | 76.4% | 2026-09-01 | Quelle geprüft |
| 4 | Gemini 3.5 FlashGoogle | 2026-05-19 | 76.2% | Terminal-Bench 2.0 leaderboard2026-05-20 | Quelle geprüft |
| 35 | Motif 3Other | 2026-08-12 | 74.91% | 2026-09-01 | Quelle geprüft |
| 5 | Claude Opus 4.8Anthropic | 2026-05-28 | 74.6% | Terminal-Bench 2.0 leaderboard2026-05-20 | Quelle geprüft |
| 37 | Qwen3.7 MaxAlibaba | 2026-05-19 | 74.53% | 2026-09-01 | Quelle geprüft |
| 38 | DeepSeek V4 Flash Vision (Reasoning, Max Effort)DeepSeek | 2026-08-21 | 74.16% | 2026-09-01 | Quelle geprüft |
| 39 | Gemini 3.1 Pro PreviewGoogle | 2026-02-19 | 73.78% | 2026-09-01 | Quelle geprüft |
| 40 | Claude Sonnet 4.6 (Adaptive Reasoning, Max Effort)Anthropic | 2026-02-17 | 71.16% | 2026-09-01 | Quelle geprüft |
| 41 | LongCat-2.0MeituanVendor-gemeldeter LongCat-2.0-Wert; getrennt von auditierten Terminal-Bench-Leaderboard-Zeilen halten, bis ein unabhängiger Lauf vorliegt. | 2026-06-29 | 70.8% | Meituan LongCat-2.0 release materials2026-06-29 | Prüfung nötig |
| 42 | Motif 3 (Beta)Other | 2026-07-21 | 70.79% | 2026-09-01 | Quelle geprüft |
| 43 | KAT Coder Pro V2Other | 2026-03-27 | 70.04% | 2026-09-01 | Quelle geprüft |
| 6 | Qwen 3.7 MaxAlibaba | 2026-05-20 | 69.7% | Terminal-Bench 2.0 leaderboard2026-05-20 | Quelle geprüft |
| 45 | Agnes 2.5 Pro BetaOther | 2026-08-26 | 69.66% | 2026-09-01 | Quelle geprüft |
| 46 | Apodex 1.1Other | 2026-08-30 | 69.66% | 2026-09-01 | Quelle geprüft |
| 7 | Claude Opus 4.7 (Adaptive)Anthropic | 2026-04-16 | 69.4% | Terminal-Bench 2.0 leaderboard2026-05-20 | Quelle geprüft |
| 48 | Claude Sonnet 4.6Anthropic | 2026-02-17 | 68.4% | Terminal-Bench 2.0 leaderboard2026-06-09 | Quelle geprüft |
| 8 | DeepSeek V4 Pro MaxDeepSeek | 2026-04-24 | 67.9% | Terminal-Bench 2.0 leaderboard2026-05-20 | Quelle geprüft |
| 50 | Nex-N2-ProOther | 2026-06-02 | 67.79% | 2026-09-01 | Quelle geprüft |
| 51 | Kimi K2.7 CodeMoonshot | 2026-06-12 | 67.42% | 2026-09-01 | Quelle geprüft |
| 52 | Agnes 2.5 Pro AlphaOther | 2026-07-24 | 67.04% | 2026-09-01 | Quelle geprüft |
| 9 | Kimi K2.6Moonshot | 2026-04-20 | 66.7% | Terminal-Bench 2.0 leaderboard2026-05-20 | Quelle geprüft |
| 10 | MiniMax M3MiniMax | 2026-05-31 | 66% | Terminal-Bench 2.0 leaderboard2026-05-20 | Quelle geprüft |
| 55 | GPT-5.5 (low)OpenAI | 2026-04-23 | 65.54% | 2026-09-01 | Quelle geprüft |
| 11 | Gemini 3.1 ProGoogle | 2026-02-19 | 65.4% | Terminal-Bench 2.0 leaderboard2026-05-20 | Quelle geprüft |
| 57 | MiMo-V2.5-ProXiaomi | 2026-04-22 | 65.17% | 2026-09-01 | Quelle geprüft |
| 58 | DeepSeek V4 Pro (Reasoning, High Effort)DeepSeek | 2026-04-24 | 64.79% | 2026-09-01 | Quelle geprüft |
| 59 | Hy3Other | 2026-07-06 | 64.42% | 2026-09-01 | Quelle geprüft |
| 60 | Grok 4.3xAI | 2026-04-30 | 63.8% | Terminal-Bench 2.0 leaderboard2026-06-09 | Quelle geprüft |
| 61 | MiMo-V2.5Xiaomi | 2026-04-22 | 63.67% | 2026-09-01 | Quelle geprüft |
| 62 | Muse SparkOther | 2026-01-01 | 62.17% | 2026-09-01 | Quelle geprüft |
| 63 | GLM-5.1Zhipu | 2026-04-07 | 61.8% | 2026-09-01 | Quelle geprüft |
| 64 | Qwen3.6 PlusAlibaba | 2026-04-02 | 61.42% | 2026-09-01 | Quelle geprüft |
| 65 | Claude Haiku 4.5Anthropic | 2025-10-01 | 61.4% | Terminal-Bench 2.0 leaderboard2026-06-09 | Quelle geprüft |
| 66 | GPT-5.5 (Non-reasoning)OpenAI | 2026-04-23 | 61.05% | 2026-09-01 | Quelle geprüft |
| 67 | Qwen 3.7 PlusAlibaba | 2026-06-02 | 61.05% | 2026-09-01 | Quelle geprüft |
| 68 | GPT-5.4 NanoOpenAI | 2026-03-17 | 60.67% | 2026-09-01 | Quelle geprüft |
| 69 | Qwen3.6 27B (Reasoning)Alibaba | 2026-04-22 | 60.67% | 2026-09-01 | Quelle geprüft |
| 70 | JT-4.1 Flash 236B A21BOther | 2026-07-09 | 59.55% | 2026-09-01 | Quelle geprüft |
| 71 | GPT-5.4 MiniOpenAI | 2026-03-17 | 59.18% | 2026-09-01 | Quelle geprüft |
| 72 | Llama 4 ScoutMeta | 2026-04-05 | 58.6% | Terminal-Bench 2.0 leaderboard2026-06-09 | Quelle geprüft |
| 73 | Solar Pro 4Other | 2026-08-06 | 57.3% | 2026-09-01 | Quelle geprüft |
| 74 | DeepSeek V4 Flash (Reasoning, High Effort)DeepSeek | 2026-04-24 | 56.93% | 2026-09-01 | Quelle geprüft |
| 75 | Claude 4.5 Sonnet (Reasoning)Anthropic | 2025-09-29 | 55.81% | 2026-09-01 | Quelle geprüft |
| 76 | Ling 3.0 FlashOther | 2026-08-04 | 55.43% | 2026-09-01 | Quelle geprüft |
| 77 | MiniMax M2.7MiniMax | 2026-04-15 | 55.43% | 2026-09-01 | Quelle geprüft |
| 78 | Inkling (xhigh)Other | 2026-07-15 | 55.06% | 2026-09-01 | Quelle geprüft |
| 79 | Inkling SmallOther | 2026-07-30 | 55.06% | 2026-09-01 | Quelle geprüft |
| 80 | Claude Opus 4.7 (Non-reasoning, High Effort)Anthropic | 2026-04-16 | 54.55% | 2026-09-01 | Quelle geprüft |
| 81 | Nemotron 3 Ultra 550B A55B (Reasoning)NVIDIA | 2026-06-04 | 53.93% | 2026-09-01 | Quelle geprüft |
| 82 | Gemini 3.5 Flash-LiteGoogle | 2026-07-21 | 53.56% | 2026-09-01 | Quelle geprüft |
| 83 | GPT-5.3 Codex (xhigh)OpenAI | 2026-02-05 | 53.03% | 2026-09-01 | Quelle geprüft |
| 84 | GPT-5.1OpenAI | 2025-11-13 | 52.43% | 2026-09-01 | Quelle geprüft |
| 85 | Grok Build 0.1 0616xAI | 2026-06-16 | 52.06% | 2026-09-01 | Quelle geprüft |
| 86 | GLM-5.2 (Non-reasoning)Zhipu | 2026-06-16 | 51.69% | 2026-09-01 | Quelle geprüft |
| 87 | Muse GlimmerMeta | 2026-08-10 | 51.69% | 2026-09-01 | Quelle geprüft |
| 88 | Qwen3.5 397B A17B (Reasoning)Alibaba | 2026-02-16 | 51.31% | 2026-09-01 | Quelle geprüft |
| 89 | Qwen3.6 27B (Non-reasoning)Alibaba | 2026-04-22 | 51.31% | 2026-09-01 | Quelle geprüft |
| 90 | Mistral Medium 3.5Mistral | 2026-04-29 | 50.56% | 2026-09-01 | Quelle geprüft |
| 91 | Qwen3.5 122B A10B (Reasoning)Alibaba | 2026-02-24 | 47.57% | 2026-09-01 | Quelle geprüft |
| 92 | Claude Opus 4.5 (Reasoning)Anthropic | 2025-11-24 | 46.97% | 2026-09-01 | Quelle geprüft |
| 93 | GPT-5.2OpenAI | 2025-12-11 | 46.97% | 2026-09-01 | Quelle geprüft |
| 94 | DeepSeek V3.2 (Reasoning)DeepSeek | 2025-12-01 | 46.82% | 2026-09-01 | Quelle geprüft |
| 95 | Claude Opus 4.6 (Adaptive Reasoning, Max Effort)Anthropic | 2026-02-05 | 46.21% | 2026-09-01 | Quelle geprüft |
| 96 | Gemini 3.5 Flash (minimal)Google | 2026-05-19 | 46.21% | 2026-09-01 | Quelle geprüft |
| 97 | Kimi K2.5Moonshot | 2026-01-27 | 45.69% | 2026-09-01 | Quelle geprüft |
| 98 | GLM-4.7 (Reasoning)Zhipu | 2025-12-22 | 45.32% | 2026-09-01 | Quelle geprüft |
| 99 | Qwen3.6 35B A3B (Reasoning)Alibaba | 2026-04-16 | 44.94% | 2026-09-01 | Quelle geprüft |
| 100 | Solar Open2 250BOther | 2026-08-12 | 44.19% | 2026-09-01 | Quelle geprüft |
| 101 | Qwen3.6 Max PreviewAlibaba | 2026-04-20 | 43.94% | 2026-09-01 | Quelle geprüft |
| 102 | Gemma 4 31B ITGoogle | 2026-03-01 | 43.45% | 2026-09-01 | Quelle geprüft |
| 103 | GLM-5 (Reasoning)Zhipu | 2026-02-11 | 43.18% | 2026-09-01 | Quelle geprüft |
| 104 | GPT-5.2 (medium)OpenAI | 2025-12-11 | 43.18% | 2026-09-01 | Quelle geprüft |
| 105 | GPT-5.4 (low)OpenAI | 2026-03-05 | 43.18% | 2026-09-01 | Quelle geprüft |
| 106 | Ring-2.6-1TOther | 2026-05-08 | 43.07% | 2026-09-01 | Quelle geprüft |
| 107 | Claude Sonnet 4.6 (Non-reasoning, Low Effort)Anthropic | 2026-02-17 | 42.42% | 2026-09-01 | Quelle geprüft |
| 108 | GPT-5.5 Instant (May 2026)OpenAI | 2026-05-05 | 42.42% | 2026-09-01 | Quelle geprüft |
| 109 | Gemini 3 ProGoogle | 2025-11-18 | 41.67% | 2026-09-01 | Quelle geprüft |
| 110 | Qwen3.6 35B A3B (Non-reasoning)Alibaba | 2026-04-16 | 41.57% | 2026-09-01 | Quelle geprüft |
| 111 | Claude Opus 4.5Anthropic | 2025-11-24 | 40.91% | 2026-09-01 | Quelle geprüft |
| 112 | Grok 4.20 0309 (Reasoning)xAI | 2026-03-10 | 40.91% | 2026-09-01 | Quelle geprüft |
| 113 | MiMo-V2-ProXiaomi | 2026-03-18 | 40.91% | 2026-09-01 | Quelle geprüft |
| 114 | K-EXAONE 2.0 0803Other | 2026-08-12 | 40.45% | 2026-09-01 | Quelle geprüft |
| 115 | Gemini 3.5 Flash (medium)Google | 2026-05-19 | 39.39% | 2026-09-01 | Quelle geprüft |
| 116 | GLM-5 (Non-reasoning)Zhipu | 2026-02-11 | 39.39% | 2026-09-01 | Quelle geprüft |
| 117 | Step 3.7 FlashStepFun | 2026-06-01 | 39.33% | 2026-09-01 | Quelle geprüft |
| 118 | A.X-K2Other | 2026-08-12 | 38.95% | 2026-09-01 | Quelle geprüft |
| 119 | Gemini 3 Flash Preview (Reasoning)Google | 2025-12-17 | 38.64% | 2026-09-01 | Quelle geprüft |
| 120 | GPT-5 (medium)OpenAI | 2025-08-07 | 37.88% | 2026-09-01 | Quelle geprüft |
| 121 | GPT-5 Codex (high)OpenAI | 2025-09-23 | 37.88% | 2026-09-01 | Quelle geprüft |
| 122 | Grok 4xAI | 2025-07-10 | 37.88% | 2026-09-01 | Quelle geprüft |
| 123 | Grok 4.20 ReasoningxAI | 2026-03-05 | 37.88% | 2026-09-01 | Quelle geprüft |
| 124 | Kimi K2.6 (Non-reasoning)Other | 2026-04-20 | 37.88% | 2026-09-01 | Quelle geprüft |
| 125 | GPT-5.2 Codex (xhigh)OpenAI | 2025-12-11 | 37.12% | 2026-09-01 | Quelle geprüft |
| 126 | OpenAI o3OpenAI | 2025-04-16 | 37.12% | 2026-09-01 | Quelle geprüft |
| 127 | DeepSeek V4 Pro (Non-reasoning)DeepSeek | 2026-04-24 | 36.36% | 2026-09-01 | Quelle geprüft |
| 128 | MiMo-V2-Omni-0327Xiaomi | 2026-03-27 | 35.61% | 2026-09-01 | Quelle geprüft |
| 129 | MiMo-V2.5-Pro (Non-reasoning)Xiaomi | 2026-04-22 | 35.61% | 2026-09-01 | Quelle geprüft |
| 130 | Qwen3.5 397B A17B (Non-reasoning)Alibaba | 2026-02-16 | 35.61% | 2026-09-01 | Quelle geprüft |
| 131 | North Mini CodeCohere | 2026-06-09 | 35.58% | 2026-09-01 | Quelle geprüft |
| 132 | GPT-5 (high)OpenAI | 2025-08-07 | 35.21% | 2026-09-01 | Quelle geprüft |
| 133 | GPT-5.1 Codex (high)OpenAI | 2025-11-13 | 34.85% | 2026-09-01 | Quelle geprüft |
| 134 | MiMo-V2-OmniXiaomi | 2026-03-19 | 34.85% | 2026-09-01 | Quelle geprüft |
| 135 | MiniMax M2.5MiniMax | 2026-04-01 | 34.85% | 2026-09-01 | Quelle geprüft |
| 136 | GPT-5.5 Instant (June 2026)OpenAI | 2026-06-25 | 34.83% | 2026-09-01 | Quelle geprüft |
| 137 | Claude 4.1 Opus (Reasoning)Anthropic | 2025-08-05 | 34.34% | 2026-09-01 | Quelle geprüft |
| 138 | DeepSeek V4 Flash (Non-reasoning)DeepSeek | 2026-04-24 | 34.09% | 2026-09-01 | Quelle geprüft |
| 139 | Gemini 3 Pro Preview (low)Google | 2025-11-18 | 34.09% | 2026-09-01 | Quelle geprüft |
| 140 | Hy3-preview (Reasoning)Other | 2026-04-23 | 34.09% | 2026-09-01 | Quelle geprüft |
| 141 | Grok 4.3 (Non-reasoning)xAI | 2026-04-30 | 34.08% | 2026-09-01 | Quelle geprüft |
| 142 | GLM-5-TurboZhipu | 2026-03-15 | 33.33% | 2026-09-01 | Quelle geprüft |
| 143 | G9v3-39A5BOther | 2026-08-03 | 32.58% | 2026-09-01 | Quelle geprüft |
| 144 | GLM 5V Turbo (Reasoning)Zhipu | 2026-04-01 | 32.58% | 2026-09-01 | Quelle geprüft |
| 145 | Qwen3.5 27B (Reasoning)Alibaba | 2026-02-24 | 32.58% | 2026-09-01 | Quelle geprüft |
| 146 | Gemini 3 Flash PreviewGoogle | 2025-12-17 | 31.82% | 2026-09-01 | Quelle geprüft |
| 147 | Hy3-preview (Non-reasoning)Other | 2026-04-23 | 31.82% | 2026-09-01 | Quelle geprüft |
| 148 | Gemini 3.1 Flash LiteGoogle | 2026-05-07 | 31.09% | 2026-09-01 | Quelle geprüft |
| 149 | Claude 4 Opus (Reasoning)Anthropic | 2025-05-22 | 31.06% | 2026-09-01 | Quelle geprüft |
| 150 | Kimi K2 ThinkingMoonshot | 2025-11-06 | 31.06% | 2026-09-01 | Quelle geprüft |
| 151 | Ling-2.6-1TOther | 2026-04-23 | 31.06% | 2026-09-01 | Quelle geprüft |
| 152 | MiMo-V2-Flash (Feb 2026)Xiaomi | 2025-12-16 | 31.06% | 2026-09-01 | Quelle geprüft |
| 153 | Grok 4.3 (medium)xAI | 2026-04-30 | 30.3% | 2026-09-01 | Quelle geprüft |
| 154 | JT-35B-FlashOther | 2026-05-14 | 28.79% | 2026-09-01 | Quelle geprüft |
| 155 | MiniMax-M2.1MiniMax | 2025-12-23 | 28.79% | 2026-09-01 | Quelle geprüft |
| 156 | MiMo-V2-Flash (Reasoning)Xiaomi | 2025-12-16 | 28.03% | 2026-09-01 | Quelle geprüft |
| 157 | Ling 3.0 TinyOther | 2026-08-06 | 27.72% | 2026-09-01 | Quelle geprüft |
| 158 | Gemma 4 12B (Reasoning)Google | 2026-06-07 | 27.34% | 2026-09-01 | Quelle geprüft |
| 159 | Granite 4.2 30BOther | 2026-08-25 | 26.59% | 2026-09-01 | Quelle geprüft |
| 160 | GPT-5 (low)OpenAI | 2025-08-07 | 26.52% | 2026-09-01 | Quelle geprüft |
| 161 | Grok 4.3 (low)xAI | 2026-04-30 | 26.52% | 2026-09-01 | Quelle geprüft |
| 162 | Ling 2.6 FlashOther | 2026-04-21 | 24.34% | 2026-09-01 | Quelle geprüft |
| 163 | Nemotron 3.5 LightningNVIDIA | 2026-08-11 | 24.34% | 2026-09-01 | Quelle geprüft |
| 164 | Qwen3 Max ThinkingAlibaba | 2026-01-26 | 24.24% | 2026-09-01 | Quelle geprüft |
| 165 | Command ACohere | 2026-03-15 | 22.85% | 2026-09-01 | Quelle geprüft |
| 166 | EXAONE 4.5 33BOther | 2026-04-09 | 21.35% | 2026-09-01 | Quelle geprüft |
| 167 | Granite 4.2 8BOther | 2026-08-25 | 18.35% | 2026-09-01 | Quelle geprüft |
| 168 | HyperNova 60B 2605Multiverse | 2026-05-06 | 18.35% | 2026-09-01 | Quelle geprüft |
| 169 | JT-MINIOther | 2026-04-15 | 18.18% | 2026-09-01 | Quelle geprüft |
| 170 | Grok 4.20 0309 v2 (Non-reasoning)xAI | 2026-04-07 | 16.67% | 2026-09-01 | Quelle geprüft |
| 171 | DeepSeek R1DeepSeek | 2025-01-20 | 15.91% | 2026-09-01 | Quelle geprüft |
| 172 | Granite 4.2 3BOther | 2026-08-25 | 13.86% | 2026-09-01 | Quelle geprüft |
| 173 | OpenAI o1OpenAI | 2024-09-12 | 12.88% | 2026-09-01 | Quelle geprüft |
| 174 | DiffusionGemma 26B A4BGoogle | 2026-06-10 | 12.36% | 2026-09-01 | Quelle geprüft |
| 175 | Mistral Large 3Mistral | 2025-12-02 | 11.99% | 2026-09-01 | Quelle geprüft |
| 176 | Gemma 4 12B (Non-reasoning)Google | 2026-06-10 | 11.36% | 2026-09-01 | Quelle geprüft |
| 177 | Llama 4 MaverickMeta | 2026-04-05 | 7.87% | 2026-09-01 | Quelle geprüft |
| 178 | Nemotron 3 Nano Omni 30B A3B ReasoningNVIDIA | 2026-04-29 | 6.74% | 2026-09-01 | Quelle geprüft |
| 179 | G9v3-3BOther | 2026-07-23 | 5.99% | 2026-09-01 | Quelle geprüft |
| 180 | LFM2.5-8B-A1BLiquid | 2026-06-08 | 4.55% | 2026-09-01 | Quelle geprüft |
| 181 | Granite 4.1 30BOther | 2026-04-29 | 2.62% | 2026-09-01 | Quelle geprüft |
| 182 | MiniCPM-V 4.6 1.3BOpenBMB | 2026-05-11 | 0% | 2026-09-01 | Quelle geprüft |
| 183 | MiniCPM5-1B (Non-reasoning)OpenBMB | 2026-05-25 | 0% | 2026-09-01 | Quelle geprüft |
| 184 | MiniCPM5-1B (Reasoning)OpenBMB | 2026-06-04 | 0% | 2026-09-01 | Quelle geprüft |
Dieser Benchmark gehört zur Familie agentisch. Sein Format: Containerisierte Aufgaben mit Terminal-Umgebung; Agenten arbeiten über Befehle und werden durch aufgabenspezifische Checks bewertet. Der Score sollte immer mit Aufgabenformat, Bewertungsmethode, Quelldatum und Benchmark-Version gelesen werden.
Noch ist keine Obergrenze erfasst. Wenn sich Scores oben bündeln, kann der Benchmark Frontier-Modelle möglicherweise nicht mehr trennen.
Jede Antwort unten stammt aus den datierten Feldern dieser Seite. Nichts davon ist zusätzlich für Suchmaschinen geschrieben.
Ob ein Agent realistische, containerisierte Terminal-Aufgaben (Terminal-Bench 2.1) erledigen kann: Code debuggen, Dateien bearbeiten, Befehle ausführen und das Artefakt liefern, das der versteckte Checker erwartet. 16 % Gewicht im AA Intelligence Index v4.1.
Ein starkes Terminal-Bench-Ergebnis sagt nichts aus über:
Lösungs-/Passrate über auditierte Aufgaben. Agent-Harness und Modell-Paarung immer mitlesen. Aufgabenformat: Containerisierte Aufgaben mit Terminal-Umgebung; Agenten arbeiten über Befehle und werden durch aufgabenspezifische Checks bewertet.
Terminal-Bench ist im Atlas derzeit als Aktiv markiert.
Das Kontaminationsrisiko für Terminal-Bench ist als Kontamination niedrig eingestuft. Behandle jede Zeile auf dieser Seite als öffentliche Angabe mit Quelle und Datum, nicht als kontrolliertes Experiment.
The Pack · Redaktionsnewsletter
Eine kurze E-Mail, wenn ein Tool erscheint oder den Status wechselt. Kein Tracking, keine Drittanbieter-Analytics. Abmeldung mit einem Klick.