Warum dieser Benchmark nützlich ist
Redaktionelle Einordnung ausstehendWir veröffentlichen zuerst Methodik und Ledger. Die benchmark-spezifische Analyse folgt nach der Desk-Prüfung.
Benchmarks / Agentisch
Terminal-Bench 2.1
Ob ein Agent realistische, containerisierte Terminal-Aufgaben (Terminal-Bench 2.1) erledigen kann: Code debuggen, Dateien bearbeiten, Befehle ausführen und das Artefakt liefern, das der versteckte Checker erwartet. 16 % Gewicht im AA Intelligence Index v4.1.
Redaktionelle Einordnung ausstehendWir veröffentlichen zuerst Methodik und Ledger. Die benchmark-spezifische Analyse folgt nach der Desk-Prüfung.
Die Lesehilfe steht noch aus. Nutze bis zur Desk-Einordnung Aufgabenformat, Bewertungsmethode und Quelldaten im Ledger.
Auf die Skala dieses Benchmarks normalisiert (0–100). Die Tabelle zeigt die Rohwerte.
Scores nutzen die eigene Einheit und Skala dieses Benchmarks, keinen universellen Qualitätswert.
| # | Modell | Veröffentlichung | Score | Herkunft | Beleglage |
|---|---|---|---|---|---|
| 1 | GPT-5.6 SolOpenAI | 2026-07-09 | 88.01% | 2026-07-21 | Quelle geprüft |
| 2 | GPT-5.6 TerraOpenAI | 2026-07-09 | 88.01% | 2026-07-21 | Quelle geprüft |
| 3 | Kimi K3Moonshot | 2026-07-16 | 85.02% | 2026-07-21 | Quelle geprüft |
| 4 | Claude Fable 5Anthropic | 2026-06-09 | 84.64% | 2026-07-21 | Quelle geprüft |
| 1 | Claude Mythos PreviewAnthropic | 2026-06-01 | 84.1% | Terminal-Bench 2.0 leaderboard2026-06-02 | Quelle geprüft |
| 2 | GPT 5.5 (Codex CLI)OpenAI | 2026-04-23 | 82% | Terminal-Bench 2.0 leaderboard2026-05-20 | Quelle geprüft |
| 3 | GPT 5.4 (ForgeCode)OpenAI | 2026-03-05 | 81.8% | Terminal-Bench 2.0 leaderboard2026-05-20 | Quelle geprüft |
| 8 | Grok 4.5xAI | 2026-07-08 | 81.65% | 2026-07-21 | Quelle geprüft |
| 9 | GPT-5.6 LunaOpenAI | 2026-07-09 | 80.9% | 2026-07-21 | Quelle geprüft |
| 10 | Claude Sonnet 5Anthropic | 2026-06-30 | 80.52% | 2026-07-21 | Quelle geprüft |
| 11 | GPT-5.5 (medium)OpenAI | 2026-04-23 | 80.52% | 2026-07-21 | Quelle geprüft |
| 4 | Claude Opus 4.6 (ForgeCode)Anthropic | 2026-02-01 | 79.8% | Terminal-Bench 2.0 leaderboard2026-05-20 | Quelle geprüft |
| 13 | GPT-5.5 (high)OpenAI | 2026-04-23 | 79.4% | 2026-07-21 | Quelle geprüft |
| 14 | GLM-5.2Zhipu | 2026-06-13 | 77.9% | 2026-07-21 | Quelle geprüft |
| 15 | Muse Spark 1.1Meta | 2026-07-09 | 77.9% | 2026-07-21 | Quelle geprüft |
| 4 | Gemini 3.5 FlashGoogle | 2026-05-19 | 76.2% | Terminal-Bench 2.0 leaderboard2026-05-20 | Quelle geprüft |
| 5 | Claude Opus 4.8Anthropic | 2026-05-28 | 74.6% | Terminal-Bench 2.0 leaderboard2026-05-20 | Quelle geprüft |
| 18 | Qwen3.7 MaxAlibaba | 2026-05-19 | 74.53% | 2026-07-21 | Quelle geprüft |
| 19 | Gemini 3.1 Pro PreviewGoogle | 2026-02-19 | 73.78% | 2026-07-21 | Quelle geprüft |
| 20 | Claude Sonnet 4.6 (Adaptive Reasoning, Max Effort)Anthropic | 2026-02-17 | 71.16% | 2026-07-21 | Quelle geprüft |
| 21 | LongCat-2.0MeituanVendor-gemeldeter LongCat-2.0-Wert; getrennt von auditierten Terminal-Bench-Leaderboard-Zeilen halten, bis ein unabhängiger Lauf vorliegt. | 2026-06-29 | 70.8% | Meituan LongCat-2.0 release materials2026-06-29 | Prüfung nötig |
| 6 | Qwen 3.7 MaxAlibaba | 2026-05-20 | 69.7% | Terminal-Bench 2.0 leaderboard2026-05-20 | Quelle geprüft |
| 7 | Claude Opus 4.7 (Adaptive)Anthropic | 2026-04-16 | 69.4% | Terminal-Bench 2.0 leaderboard2026-05-20 | Quelle geprüft |
| 24 | Claude Sonnet 4.6Anthropic | 2026-02-17 | 68.4% | Terminal-Bench 2.0 leaderboard2026-06-09 | Quelle geprüft |
| 8 | DeepSeek V4 Pro MaxDeepSeek | 2026-04-24 | 67.9% | Terminal-Bench 2.0 leaderboard2026-05-20 | Quelle geprüft |
| 26 | Kimi K2.7 CodeMoonshot | 2026-06-12 | 67.42% | 2026-07-21 | Quelle geprüft |
| 9 | Kimi K2.6Moonshot | 2026-04-20 | 66.7% | Terminal-Bench 2.0 leaderboard2026-05-20 | Quelle geprüft |
| 10 | MiniMax M3MiniMax | 2026-05-31 | 66% | Terminal-Bench 2.0 leaderboard2026-05-20 | Quelle geprüft |
| 29 | GPT-5.5 (low)OpenAI | 2026-04-23 | 65.54% | 2026-07-21 | Quelle geprüft |
| 11 | Gemini 3.1 ProGoogle | 2026-02-19 | 65.4% | Terminal-Bench 2.0 leaderboard2026-05-20 | Quelle geprüft |
| 31 | MiMo-V2.5-ProXiaomi | 2026-04-22 | 65.17% | 2026-07-21 | Quelle geprüft |
| 32 | DeepSeek V4 Pro (Reasoning, Max Effort)DeepSeek | 2026-04-24 | 64.04% | 2026-07-21 | Quelle geprüft |
| 33 | Grok 4.3xAI | 2026-04-30 | 63.8% | Terminal-Bench 2.0 leaderboard2026-06-09 | Quelle geprüft |
| 34 | Muse SparkOther | 2026-01-01 | 62.17% | 2026-07-21 | Quelle geprüft |
| 35 | GLM-5.1Zhipu | 2026-04-07 | 61.8% | 2026-07-21 | Quelle geprüft |
| 36 | Claude Haiku 4.5Anthropic | 2025-10-01 | 61.4% | Terminal-Bench 2.0 leaderboard2026-06-09 | Quelle geprüft |
| 37 | Qwen 3.7 PlusAlibaba | 2026-06-02 | 61.05% | 2026-07-21 | Quelle geprüft |
| 38 | GPT-5.4 NanoOpenAI | 2026-03-17 | 60.67% | 2026-07-21 | Quelle geprüft |
| 39 | GPT-5.4 MiniOpenAI | 2026-03-17 | 59.18% | 2026-07-21 | Quelle geprüft |
| 40 | Llama 4 ScoutMeta | 2026-04-05 | 58.6% | Terminal-Bench 2.0 leaderboard2026-06-09 | Quelle geprüft |
| 41 | MiniMax M2.7MiniMax | 2026-04-15 | 55.43% | 2026-07-21 | Quelle geprüft |
| 42 | Claude Opus 4.7 (Non-reasoning, High Effort)Anthropic | 2026-04-16 | 54.55% | 2026-07-21 | Quelle geprüft |
| 43 | Nemotron 3 Ultra 550B A55B (Reasoning)NVIDIA | 2026-06-04 | 53.93% | 2026-07-21 | Quelle geprüft |
| 44 | GPT-5.3 Codex (xhigh)OpenAI | 2026-02-05 | 53.03% | 2026-07-21 | Quelle geprüft |
| 45 | GPT-5.1OpenAI | 2025-11-13 | 52.43% | 2026-07-21 | Quelle geprüft |
| 46 | GPT-5.2OpenAI | 2025-12-11 | 46.97% | 2026-07-21 | Quelle geprüft |
| 47 | Claude Opus 4.6 (Adaptive Reasoning, Max Effort)Anthropic | 2026-02-05 | 46.21% | 2026-07-21 | Quelle geprüft |
| 48 | Kimi K2.5Moonshot | 2026-01-27 | 45.69% | 2026-07-21 | Quelle geprüft |
| 49 | Gemma 4 31B ITGoogle | 2026-03-01 | 43.45% | 2026-07-21 | Quelle geprüft |
| 50 | Gemini 3 ProGoogle | 2025-11-18 | 41.67% | 2026-07-21 | Quelle geprüft |
| 51 | Claude Opus 4.5Anthropic | 2025-11-24 | 40.91% | 2026-07-21 | Quelle geprüft |
| 52 | Gemini 3.5 Flash (medium)Google | 2026-05-19 | 39.39% | 2026-07-21 | Quelle geprüft |
| 53 | Step 3.7 FlashStepFun | 2026-06-01 | 39.33% | 2026-07-21 | Quelle geprüft |
| 54 | Grok 4.20 ReasoningxAI | 2026-03-05 | 37.88% | 2026-07-21 | Quelle geprüft |
| 55 | OpenAI o3OpenAI | 2025-04-16 | 37.12% | 2026-07-21 | Quelle geprüft |
| 56 | North Mini CodeCohere | 2026-06-09 | 35.58% | 2026-07-21 | Quelle geprüft |
| 57 | MiniMax M2.5MiniMax | 2026-04-01 | 34.85% | 2026-07-21 | Quelle geprüft |
| 58 | Gemini 3 Flash PreviewGoogle | 2025-12-17 | 31.82% | 2026-07-21 | Quelle geprüft |
| 59 | Gemini 3.1 Flash LiteGoogle | 2026-05-07 | 31.09% | 2026-07-21 | Quelle geprüft |
| 60 | HyperNova 60B 2605Multiverse | 2026-05-06 | 18.35% | 2026-07-21 | Quelle geprüft |
| 61 | Gemma 4 12B (Reasoning)Google | 2026-06-07 | 18.18% | 2026-07-21 | Quelle geprüft |
| 62 | DeepSeek R1DeepSeek | 2025-01-20 | 15.91% | 2026-07-21 | Quelle geprüft |
| 63 | OpenAI o1OpenAI | 2024-09-12 | 12.88% | 2026-07-21 | Quelle geprüft |
| 64 | Mistral Large 3Mistral | 2025-12-02 | 11.99% | 2026-07-21 | Quelle geprüft |
| 65 | Gemma 4 12B (Non-reasoning)Google | 2026-06-10 | 11.36% | 2026-07-21 | Quelle geprüft |
| 66 | Llama 4 MaverickMeta | 2026-04-05 | 7.87% | 2026-07-21 | Quelle geprüft |
| 67 | LFM2.5-8B-A1BLiquid | 2026-06-08 | 4.55% | 2026-07-21 | Quelle geprüft |
| 68 | Command ACohere | 2026-03-15 | 0.76% | 2026-07-21 | Quelle geprüft |
| 69 | MiniCPM5-1B (Reasoning)OpenBMB | 2026-06-04 | 0% | 2026-07-21 | Quelle geprüft |
Die Notiz zur Datenqualität steht aus. Jede Ledger-Zeile trägt weiterhin Quellen-URL, Quelldatum und Zeitpunkt des Einlesens.
Noch ist keine Obergrenze erfasst. Wenn sich Scores oben bündeln, kann der Benchmark Frontier-Modelle möglicherweise nicht mehr trennen.
The Pack · Redaktionsnewsletter
Eine kurze E-Mail, wenn eine Karte erscheint oder den Status wechselt. Kein Tracking, keine Drittanbieter-Analytics. Abmeldung mit einem Klick.