Warum dieser Benchmark nützlich ist
Historischer Instruction-Following-Stresstest für neue Format-Constraints. Gesättigt und aus AA Intelligence Index v4.1 entfernt — Glossar-Ehrlichkeit, keine aktuelle Frontier-Rangordnung.
Instruction-Following Benchmark
Präzises Instruction-Following bei neuen Constraints — testet, ob Modelle komplexe, ungesehene Formatregeln ohne Abdriften befolgen.
Historischer Instruction-Following-Stresstest für neue Format-Constraints. Gesättigt und aus AA Intelligence Index v4.1 entfernt — Glossar-Ehrlichkeit, keine aktuelle Frontier-Rangordnung.
Nur Constraint-Satisfaction-Genauigkeit — eine perfekt formatierte falsche Antwort scored trotzdem. Nicht zur Trennung heutiger Frontier nutzen; AA veröffentlicht Läufe weiter, gewichtet die Suite aber nicht mehr.
Auf die Skala dieses Benchmarks normalisiert (0–100). Die Tabelle zeigt die Rohwerte.
Scores nutzen die eigene Einheit und Skala dieses Benchmarks, keinen universellen Qualitätswert.
| # | Modell | Veröffentlichung | Score | Herkunft | Beleglage |
|---|---|---|---|---|---|
| 1 | Grok 4.3 (medium)xAI | 2026-04-30 | 83.33% | 2026-09-01 | Quelle geprüft |
| 2 | Grok 4.20 0309 (Reasoning)xAI | 2026-03-10 | 82.93% | 2026-09-01 | Quelle geprüft |
| 3 | MiniMax M3MiniMax | 2026-05-31 | 82.86% | 2026-09-01 | Quelle geprüft |
| 4 | Nemotron 3 Ultra 550B A55B (Reasoning)NVIDIA | 2026-06-04 | 81.36% | 2026-09-01 | Quelle geprüft |
| 5 | Grok 4.3xAI | 2026-04-30 | 81.29% | 2026-09-01 | Quelle geprüft |
| 6 | Grok 4.20 ReasoningxAI | 2026-03-05 | 81.22% | 2026-09-01 | Quelle geprüft |
| 7 | Grok 4.3 (low)xAI | 2026-04-30 | 80.95% | 2026-09-01 | Quelle geprüft |
| 8 | Qwen3.7 MaxAlibaba | 2026-05-19 | 80.54% | 2026-09-01 | Quelle geprüft |
| 9 | MiMo-V2.5-ProXiaomi | 2026-04-22 | 79.86% | 2026-09-01 | Quelle geprüft |
| 10 | Qwen3.5 397B A17B (Reasoning)Alibaba | 2026-02-16 | 78.78% | 2026-09-01 | Quelle geprüft |
| 11 | Gemini 3 Flash Preview (Reasoning)Google | 2025-12-17 | 77.96% | 2026-09-01 | Quelle geprüft |
| 12 | Qwen 3.7 PlusAlibaba | 2026-06-02 | 77.96% | 2026-09-01 | Quelle geprüft |
| 13 | GPT-5.2 Codex (xhigh)OpenAI | 2025-12-11 | 77.62% | 2026-09-01 | Quelle geprüft |
| 14 | Gemini 3.1 Flash LiteGoogle | 2026-05-07 | 77.21% | 2026-09-01 | Quelle geprüft |
| 15 | Gemini 3.1 Pro PreviewGoogle | 2026-02-19 | 77.14% | 2026-09-01 | Quelle geprüft |
| 16 | Qwen3.6 Max PreviewAlibaba | 2026-04-20 | 76.6% | 2026-09-01 | Quelle geprüft |
| 17 | Gemini 3.5 FlashGoogle | 2026-05-19 | 76.33% | 2026-09-01 | Quelle geprüft |
| 18 | GLM-5.1Zhipu | 2026-04-07 | 76.26% | 2026-09-01 | Quelle geprüft |
| 19 | Kimi K2.6Moonshot | 2026-04-20 | 75.99% | 2026-09-01 | Quelle geprüft |
| 20 | GPT-5.4 NanoOpenAI | 2026-03-17 | 75.92% | 2026-09-01 | Quelle geprüft |
| 21 | Muse SparkOther | 2026-01-01 | 75.92% | 2026-09-01 | Quelle geprüft |
| 22 | GPT 5.5OpenAI | 2026-04-23 | 75.85% | 2026-09-01 | Quelle geprüft |
| 23 | MiniMax M2.7MiniMax | 2026-04-15 | 75.71% | 2026-09-01 | Quelle geprüft |
| 24 | Qwen3.5 122B A10B (Reasoning)Alibaba | 2026-02-24 | 75.71% | 2026-09-01 | Quelle geprüft |
| 25 | Gemma 4 31B ITGoogle | 2026-03-01 | 75.58% | 2026-09-01 | Quelle geprüft |
| 26 | Qwen3.5 27B (Reasoning)Alibaba | 2026-02-24 | 75.58% | 2026-09-01 | Quelle geprüft |
| 27 | GPT-5.2OpenAI | 2025-12-11 | 75.44% | 2026-09-01 | Quelle geprüft |
| 28 | GPT-5.3 Codex (xhigh)OpenAI | 2026-02-05 | 75.37% | 2026-09-01 | Quelle geprüft |
| 29 | Qwen3.6 PlusAlibaba | 2026-04-02 | 75.17% | 2026-09-01 | Quelle geprüft |
| 30 | Gemini 3.5 Flash (medium)Google | 2026-05-19 | 74.56% | 2026-09-01 | Quelle geprüft |
| 31 | GPT-5 Codex (high)OpenAI | 2025-09-23 | 74.15% | 2026-09-01 | Quelle geprüft |
| 32 | GPT 5.4OpenAI | 2026-03-05 | 73.95% | 2026-09-01 | Quelle geprüft |
| 33 | Gemma 4 12B (Reasoning)Google | 2026-06-07 | 73.54% | 2026-09-01 | Quelle geprüft |
| 34 | DeepSeek V4 Flash (Reasoning, High Effort)DeepSeek | 2026-04-24 | 73.47% | 2026-09-01 | Quelle geprüft |
| 35 | GLM-5.2Zhipu | 2026-06-13 | 73.33% | 2026-09-01 | Quelle geprüft |
| 36 | GPT-5.4 MiniOpenAI | 2026-03-17 | 73.27% | 2026-09-01 | Quelle geprüft |
| 37 | GLM-5-TurboZhipu | 2026-03-15 | 73.2% | 2026-09-01 | Quelle geprüft |
| 38 | GPT-5 (high)OpenAI | 2025-08-07 | 73.06% | 2026-09-01 | Quelle geprüft |
| 39 | GPT-5.1OpenAI | 2025-11-13 | 72.86% | 2026-09-01 | Quelle geprüft |
| 40 | GPT-5.6 SolOpenAI | 2026-07-09 | 72.65% | 2026-09-01 | Quelle geprüft |
| 41 | GLM-5 (Reasoning)Zhipu | 2026-02-11 | 72.31% | 2026-09-01 | Quelle geprüft |
| 42 | MiMo-V2-Flash (Feb 2026)Xiaomi | 2025-12-16 | 71.84% | 2026-09-01 | Quelle geprüft |
| 43 | GPT-5.5 (high)OpenAI | 2026-04-23 | 71.63% | 2026-09-01 | Quelle geprüft |
| 44 | MiniMax M2.5MiniMax | 2026-04-01 | 71.63% | 2026-09-01 | Quelle geprüft |
| 45 | GPT-5.5 Instant (May 2026)OpenAI | 2026-05-05 | 71.5% | 2026-09-01 | Quelle geprüft |
| 46 | OpenAI o3OpenAI | 2025-04-16 | 71.43% | 2026-09-01 | Quelle geprüft |
| 47 | DeepSeek V4 Pro (Reasoning, High Effort)DeepSeek | 2026-04-24 | 71.29% | 2026-09-01 | Quelle geprüft |
| 48 | GPT-5.6 TerraOpenAI | 2026-07-09 | 71.22% | 2026-09-01 | Quelle geprüft |
| 49 | GPT-5.5 (medium)OpenAI | 2026-04-23 | 70.95% | 2026-09-01 | Quelle geprüft |
| 50 | Qwen3 Max ThinkingAlibaba | 2026-01-26 | 70.75% | 2026-09-01 | Quelle geprüft |
| 51 | GPT-5 (medium)OpenAI | 2025-08-07 | 70.61% | 2026-09-01 | Quelle geprüft |
| 52 | Gemini 3 ProGoogle | 2025-11-18 | 70.41% | 2026-09-01 | Quelle geprüft |
| 53 | OpenAI o1OpenAI | 2024-09-12 | 70.34% | 2026-09-01 | Quelle geprüft |
| 54 | Kimi K2.5Moonshot | 2026-01-27 | 70.2% | 2026-09-01 | Quelle geprüft |
| 55 | GPT-5.1 Codex (high)OpenAI | 2025-11-13 | 70% | 2026-09-01 | Quelle geprüft |
| 56 | MiniMax-M2.1MiniMax | 2025-12-23 | 69.86% | 2026-09-01 | Quelle geprüft |
| 57 | MiMo-V2-ProXiaomi | 2026-03-18 | 68.84% | 2026-09-01 | Quelle geprüft |
| 58 | Mistral Medium 3.5Mistral | 2026-04-29 | 68.78% | 2026-09-01 | Quelle geprüft |
| 59 | Kimi K2 ThinkingMoonshot | 2025-11-06 | 68.1% | 2026-09-01 | Quelle geprüft |
| 60 | GLM-4.7 (Reasoning)Zhipu | 2025-12-22 | 67.89% | 2026-09-01 | Quelle geprüft |
| 61 | Qwen3.6 27B (Reasoning)Alibaba | 2026-04-22 | 67.55% | 2026-09-01 | Quelle geprüft |
| 62 | MiMo-V2-Omni-0327Xiaomi | 2026-03-27 | 67.35% | 2026-09-01 | Quelle geprüft |
| 63 | Step 3.7 FlashStepFun | 2026-06-01 | 67.28% | 2026-09-01 | Quelle geprüft |
| 64 | MiMo-V2.5Xiaomi | 2026-04-22 | 67.14% | 2026-09-01 | Quelle geprüft |
| 65 | KAT Coder Pro V2Other | 2026-03-27 | 66.67% | 2026-09-01 | Quelle geprüft |
| 66 | GPT-5 (low)OpenAI | 2025-08-07 | 66.6% | 2026-09-01 | Quelle geprüft |
| 67 | HyperNova 60B 2605Multiverse | 2026-05-06 | 66.46% | 2026-09-01 | Quelle geprüft |
| 68 | Nex-N2-ProOther | 2026-06-02 | 66.19% | 2026-09-01 | Quelle geprüft |
| 69 | GPT-5.4 (low)OpenAI | 2026-03-05 | 65.92% | 2026-09-01 | Quelle geprüft |
| 70 | GPT-5.2 (medium)OpenAI | 2025-12-11 | 65.24% | 2026-09-01 | Quelle geprüft |
| 71 | GPT-5.5 (low)OpenAI | 2026-04-23 | 64.35% | 2026-09-01 | Quelle geprüft |
| 72 | Qwen3.6 35B A3B (Reasoning)Alibaba | 2026-04-16 | 64.35% | 2026-09-01 | Quelle geprüft |
| 73 | MiMo-V2-Flash (Reasoning)Xiaomi | 2025-12-16 | 64.22% | 2026-09-01 | Quelle geprüft |
| 74 | Claude Fable 5Anthropic | 2026-06-09 | 63.47% | 2026-09-01 | Quelle geprüft |
| 75 | Nemotron 3 Nano Omni 30B A3B ReasoningNVIDIA | 2026-04-29 | 63.2% | 2026-09-01 | Quelle geprüft |
| 76 | Hy3-preview (Reasoning)Other | 2026-04-23 | 63.13% | 2026-09-01 | Quelle geprüft |
| 77 | Kimi K2.7 CodeMoonshot | 2026-06-12 | 63.13% | 2026-09-01 | Quelle geprüft |
| 78 | Claude Opus 4.8Anthropic | 2026-05-28 | 62.24% | 2026-09-01 | Quelle geprüft |
| 79 | GLM 5V Turbo (Reasoning)Zhipu | 2026-04-01 | 61.09% | 2026-09-01 | Quelle geprüft |
| 80 | DeepSeek V3.2 (Reasoning)DeepSeek | 2025-12-01 | 60.68% | 2026-09-01 | Quelle geprüft |
| 81 | DiffusionGemma 26B A4BGoogle | 2026-06-10 | 59.46% | 2026-09-01 | Quelle geprüft |
| 82 | Claude Opus 4.7Anthropic | 2026-04-16 | 58.64% | 2026-09-01 | Quelle geprüft |
| 83 | Claude Opus 4.5 (Reasoning)Anthropic | 2025-11-24 | 57.96% | 2026-09-01 | Quelle geprüft |
| 84 | EXAONE 4.5 33BOther | 2026-04-09 | 57.96% | 2026-09-01 | Quelle geprüft |
| 85 | North Mini CodeCohere | 2026-06-09 | 57.55% | 2026-09-01 | Quelle geprüft |
| 86 | Ling 2.6 FlashOther | 2026-04-21 | 57.41% | 2026-09-01 | Quelle geprüft |
| 87 | Claude 4.5 Sonnet (Reasoning)Anthropic | 2025-09-29 | 57.28% | 2026-09-01 | Quelle geprüft |
| 88 | Ling-2.6-1TOther | 2026-04-23 | 56.87% | 2026-09-01 | Quelle geprüft |
| 89 | Claude Sonnet 4.6 (Adaptive Reasoning, Max Effort)Anthropic | 2026-02-17 | 56.6% | 2026-09-01 | Quelle geprüft |
| 90 | LFM2.5-8B-A1BLiquid | 2026-06-08 | 55.65% | 2026-09-01 | Quelle geprüft |
| 91 | Claude 4.1 Opus (Reasoning)Anthropic | 2025-08-05 | 55.44% | 2026-09-01 | Quelle geprüft |
| 92 | GLM-5 (Non-reasoning)Zhipu | 2026-02-11 | 55.17% | 2026-09-01 | Quelle geprüft |
| 93 | Gemini 3 Flash PreviewGoogle | 2025-12-17 | 55.1% | 2026-09-01 | Quelle geprüft |
| 94 | Claude 4 Opus (Reasoning)Anthropic | 2025-05-22 | 53.74% | 2026-09-01 | Quelle geprüft |
| 95 | Grok 4xAI | 2025-07-10 | 53.67% | 2026-09-01 | Quelle geprüft |
| 96 | MiMo-V2-OmniXiaomi | 2026-03-19 | 53.54% | 2026-09-01 | Quelle geprüft |
| 97 | Claude Opus 4.6 (Adaptive Reasoning, Max Effort)Anthropic | 2026-02-05 | 53.13% | 2026-09-01 | Quelle geprüft |
| 98 | Qwen3.5 397B A17B (Non-reasoning)Alibaba | 2026-02-16 | 51.63% | 2026-09-01 | Quelle geprüft |
| 99 | Gemini 3 Pro Preview (low)Google | 2025-11-18 | 49.66% | 2026-09-01 | Quelle geprüft |
| 100 | Grok 4.20 0309 v2 (Non-reasoning)xAI | 2026-04-07 | 49.32% | 2026-09-01 | Quelle geprüft |
| 101 | MiniCPM5-1B (Reasoning)OpenBMB | 2026-06-04 | 49.32% | 2026-09-01 | Quelle geprüft |
| 102 | Hy3-preview (Non-reasoning)Other | 2026-04-23 | 47.96% | 2026-09-01 | Quelle geprüft |
| 103 | Grok 4.3 (Non-reasoning)xAI | 2026-04-30 | 47.62% | 2026-09-01 | Quelle geprüft |
| 104 | Gemini 3.5 Flash (minimal)Google | 2026-05-19 | 47.28% | 2026-09-01 | Quelle geprüft |
| 105 | DeepSeek V4 Flash (Non-reasoning)DeepSeek | 2026-04-24 | 47.21% | 2026-09-01 | Quelle geprüft |
| 106 | GPT-5.5 (Non-reasoning)OpenAI | 2026-04-23 | 46.12% | 2026-09-01 | Quelle geprüft |
| 107 | DeepSeek V4 Pro (Non-reasoning)DeepSeek | 2026-04-24 | 45.78% | 2026-09-01 | Quelle geprüft |
| 108 | Qwen3.6 27B (Non-reasoning)Alibaba | 2026-04-22 | 45.71% | 2026-09-01 | Quelle geprüft |
| 109 | Gemma 4 12B (Non-reasoning)Google | 2026-06-10 | 45.17% | 2026-09-01 | Quelle geprüft |
| 110 | Claude Opus 4.6Anthropic | 2026-02-05 | 44.63% | 2026-09-01 | Quelle geprüft |
| 111 | Ring-2.6-1TOther | 2026-05-08 | 44.56% | 2026-09-01 | Quelle geprüft |
| 112 | Granite 4.1 30BOther | 2026-04-29 | 44.35% | 2026-09-01 | Quelle geprüft |
| 113 | Kimi K2.6 (Non-reasoning)Other | 2026-04-20 | 44.29% | 2026-09-01 | Quelle geprüft |
| 114 | Claude Opus 4.7 (Non-reasoning, High Effort)Anthropic | 2026-04-16 | 43.61% | 2026-09-01 | Quelle geprüft |
| 115 | Claude Opus 4.5Anthropic | 2025-11-24 | 42.99% | 2026-09-01 | Quelle geprüft |
| 116 | Llama 4 MaverickMeta | 2026-04-05 | 42.99% | 2026-09-01 | Quelle geprüft |
| 117 | MiMo-V2.5-Pro (Non-reasoning)Xiaomi | 2026-04-22 | 42.72% | 2026-09-01 | Quelle geprüft |
| 118 | Claude Sonnet 4.6 (Non-reasoning, Low Effort)Anthropic | 2026-02-17 | 42.38% | 2026-09-01 | Quelle geprüft |
| 119 | JT-35B-FlashOther | 2026-05-14 | 42.04% | 2026-09-01 | Quelle geprüft |
| 120 | Claude Sonnet 4.6Anthropic | 2026-02-17 | 41.16% | 2026-09-01 | Quelle geprüft |
| 121 | DeepSeek R1DeepSeek | 2025-01-20 | 39.59% | 2026-09-01 | Quelle geprüft |
| 122 | Llama 4 ScoutMeta | 2026-04-05 | 39.52% | 2026-09-01 | Quelle geprüft |
| 123 | JT-MINIOther | 2026-04-15 | 36.67% | 2026-09-01 | Quelle geprüft |
| 124 | Mistral Large 3Mistral | 2025-12-02 | 36.19% | 2026-09-01 | Quelle geprüft |
| 125 | Qwen3.6 35B A3B (Non-reasoning)Alibaba | 2026-04-16 | 36.19% | 2026-09-01 | Quelle geprüft |
| 126 | MiniCPM5-1B (Non-reasoning)OpenBMB | 2026-05-25 | 35.17% | 2026-09-01 | Quelle geprüft |
| 127 | MiniCPM-V 4.6 1.3BOpenBMB | 2026-05-11 | 26.73% | 2026-09-01 | Quelle geprüft |
Archiviert — aus AA Intelligence Index v4.1 wegen Sättigung entfernt. AA führt es weiter; VerdictPal behält den Glossar-Eintrag als Ehrlichkeits-Beleg.
Noch ist keine Obergrenze erfasst. Wenn sich Scores oben bündeln, kann der Benchmark Frontier-Modelle möglicherweise nicht mehr trennen.
Jede Antwort unten stammt aus den datierten Feldern dieser Seite. Nichts davon ist zusätzlich für Suchmaschinen geschrieben.
Präzises Instruction-Following bei neuen Constraints — testet, ob Modelle komplexe, ungesehene Formatregeln ohne Abdriften befolgen.
Ein starkes IFBench-Ergebnis sagt nichts aus über:
Constraint-Satisfaction-Genauigkeit. AA veröffentlicht weiterhin Ergebnisse, gewichtet IFBench aber nicht mehr im Composite-Index. Aufgabenformat: Neue Instruction-Following-Aufgaben mit strikten Output-Constraints; Genauigkeit auf ungesehenen Regelsets.
IFBench ist im Atlas derzeit als Gesättigt markiert.
Das Kontaminationsrisiko für IFBench ist als Kontamination mittel eingestuft. Behandle jede Zeile auf dieser Seite als öffentliche Angabe mit Quelle und Datum, nicht als kontrolliertes Experiment.
The Pack · Redaktionsnewsletter
Eine kurze E-Mail, wenn ein Tool erscheint oder den Status wechselt. Kein Tracking, keine Drittanbieter-Analytics. Abmeldung mit einem Klick.