Benchmarks / Reasoning

IFBench

Instruction-Following Benchmark

Präzises Instruction-Following bei neuen Constraints — testet, ob Modelle komplexe, ungesehene Formatregeln ohne Abdriften befolgen.

Was dieser Benchmark nicht misst
  • Frontier-Trennung heute — Artificial Analysis entfernte IFBench aus dem Intelligence Index v4.1, weil Frontier-Modelle ihn sättigten.
  • Faktische Genauigkeit — eine perfekt formatierte falsche Antwort scored trotzdem.
  • Echte Nutzeraufgaben — synthetische Constraint-Tests, keine Produktions-Workflows.
Analyse

Warum dieser Benchmark nützlich ist

Historischer Instruction-Following-Stresstest für neue Format-Constraints. Gesättigt und aus AA Intelligence Index v4.1 entfernt — Glossar-Ehrlichkeit, keine aktuelle Frontier-Rangordnung.

Umfang

Abdeckung

Aufgabenfamilie
Reasoning
Format
Neue Instruction-Following-Aufgaben mit strikten Output-Constraints; Genauigkeit auf ungesehenen Regelsets.
Bewertung
Constraint-Satisfaction-Genauigkeit. AA veröffentlicht weiterhin Ergebnisse, gewichtet IFBench aber nicht mehr im Composite-Index.
Verantwortliche Stelle
Artificial Analysis
Lesehilfe

So liest du die Scores

Nur Constraint-Satisfaction-Genauigkeit — eine perfekt formatierte falsche Antwort scored trotzdem. Nicht zur Trennung heutiger Frontier nutzen; AA veröffentlicht Läufe weiter, gewichtet die Suite aber nicht mehr.

Blinde Flecken

Was er nicht abdeckt

  • Frontier-Trennung heute — Artificial Analysis entfernte IFBench aus dem Intelligence Index v4.1, weil Frontier-Modelle ihn sättigten.
  • Faktische Genauigkeit — eine perfekt formatierte falsche Antwort scored trotzdem.
  • Echte Nutzeraufgaben — synthetische Constraint-Tests, keine Produktions-Workflows.
Scores

Evidenz-Ledger

127 Zeilen
127127 Zeilen
83.33%bester Score
127quellgeprüft
1Quellen
2026-09-10Quelldatum
127

api · api

Verteilung

Wo die Zeilen liegen

0255075100

Auf die Skala dieses Benchmarks normalisiert (0–100). Die Tabelle zeigt die Rohwerte.

Zeitverlauf

Neueste Belege

  1. Grok 4.3 (medium)83.33% ·
  2. Grok 4.20 0309 (Reasoning)82.93% ·
  3. MiniMax M382.86% ·
  4. Nemotron 3 Ultra 550B A55B (Reasoning)81.36% ·
  5. Grok 4.381.29% ·

Scores nutzen die eigene Einheit und Skala dieses Benchmarks, keinen universellen Qualitätswert.

#ModellVeröffentlichungScoreHerkunftBeleglage
1Grok 4.3 (medium)xAI2026-04-3083.33%
2026-09-10
Quelle geprüft
2Grok 4.20 0309 (Reasoning)xAI2026-03-1082.93%
2026-09-10
Quelle geprüft
3MiniMax M3MiniMax2026-05-3182.86%
2026-09-10
Quelle geprüft
4Nemotron 3 Ultra 550B A55B (Reasoning)NVIDIA2026-06-0481.36%
2026-09-10
Quelle geprüft
5Grok 4.3xAI2026-04-3081.29%
2026-09-10
Quelle geprüft
6Grok 4.20 ReasoningxAI2026-03-0581.22%
2026-09-10
Quelle geprüft
7Grok 4.3 (low)xAI2026-04-3080.95%
2026-09-10
Quelle geprüft
8Qwen3.7 MaxAlibaba2026-05-1980.54%
2026-09-10
Quelle geprüft
9MiMo-V2.5-ProXiaomi2026-04-2279.86%
2026-09-10
Quelle geprüft
10Qwen3.5 397B A17B (Reasoning)Alibaba2026-02-1678.78%
2026-09-10
Quelle geprüft
11Gemini 3 Flash Preview (Reasoning)Google2025-12-1777.96%
2026-09-10
Quelle geprüft
12Qwen 3.7 PlusAlibaba2026-06-0277.96%
2026-09-10
Quelle geprüft
13GPT-5.2 Codex (xhigh)OpenAI2025-12-1177.62%
2026-09-10
Quelle geprüft
14Gemini 3.1 Flash LiteGoogle2026-05-0777.21%
2026-09-10
Quelle geprüft
15Gemini 3.1 Pro PreviewGoogle2026-02-1977.14%
2026-09-10
Quelle geprüft
16Qwen3.6 Max PreviewAlibaba2026-04-2076.6%
2026-09-10
Quelle geprüft
17Gemini 3.5 FlashGoogle2026-05-1976.33%
2026-09-10
Quelle geprüft
18GLM-5.1Zhipu2026-04-0776.26%
2026-09-10
Quelle geprüft
19Kimi K2.6Moonshot2026-04-2075.99%
2026-09-10
Quelle geprüft
20GPT-5.4 NanoOpenAI2026-03-1775.92%
2026-09-10
Quelle geprüft
21Muse SparkOther2026-01-0175.92%
2026-09-10
Quelle geprüft
22GPT 5.5OpenAI2026-04-2375.85%
2026-09-10
Quelle geprüft
23MiniMax M2.7MiniMax2026-04-1575.71%
2026-09-10
Quelle geprüft
24Qwen3.5 122B A10B (Reasoning)Alibaba2026-02-2475.71%
2026-09-10
Quelle geprüft
25Gemma 4 31B ITGoogle2026-03-0175.58%
2026-09-10
Quelle geprüft
26Qwen3.5 27B (Reasoning)Alibaba2026-02-2475.58%
2026-09-10
Quelle geprüft
27GPT-5.2OpenAI2025-12-1175.44%
2026-09-10
Quelle geprüft
28GPT-5.3 Codex (xhigh)OpenAI2026-02-0575.37%
2026-09-10
Quelle geprüft
29Qwen3.6 PlusAlibaba2026-04-0275.17%
2026-09-10
Quelle geprüft
30Gemini 3.5 Flash (medium)Google2026-05-1974.56%
2026-09-10
Quelle geprüft
31GPT-5 Codex (high)OpenAI2025-09-2374.15%
2026-09-10
Quelle geprüft
32GPT 5.4OpenAI2026-03-0573.95%
2026-09-10
Quelle geprüft
33Gemma 4 12B (Reasoning)Google2026-06-0773.54%
2026-09-10
Quelle geprüft
34DeepSeek V4 Flash (Reasoning, High Effort)DeepSeek2026-04-2473.47%
2026-09-10
Quelle geprüft
35GLM-5.2Zhipu2026-06-1373.33%
2026-09-10
Quelle geprüft
36GPT-5.4 MiniOpenAI2026-03-1773.27%
2026-09-10
Quelle geprüft
37GLM-5-TurboZhipu2026-03-1573.2%
2026-09-10
Quelle geprüft
38GPT-5 (high)OpenAI2025-08-0773.06%
2026-09-10
Quelle geprüft
39GPT-5.1OpenAI2025-11-1372.86%
2026-09-10
Quelle geprüft
40GPT-5.6 SolOpenAI2026-07-0972.65%
2026-09-10
Quelle geprüft
41GLM-5 (Reasoning)Zhipu2026-02-1172.31%
2026-09-10
Quelle geprüft
42MiMo-V2-Flash (Feb 2026)Xiaomi2025-12-1671.84%
2026-09-10
Quelle geprüft
43GPT-5.5 (high)OpenAI2026-04-2371.63%
2026-09-10
Quelle geprüft
44MiniMax M2.5MiniMax2026-04-0171.63%
2026-09-10
Quelle geprüft
45GPT-5.5 Instant (May 2026)OpenAI2026-05-0571.5%
2026-09-10
Quelle geprüft
46OpenAI o3OpenAI2025-04-1671.43%
2026-09-10
Quelle geprüft
47DeepSeek V4 Pro (Reasoning, High Effort)DeepSeek2026-04-2471.29%
2026-09-10
Quelle geprüft
48GPT-5.6 TerraOpenAI2026-07-0971.22%
2026-09-10
Quelle geprüft
49GPT-5.5 (medium)OpenAI2026-04-2370.95%
2026-09-10
Quelle geprüft
50Qwen3 Max ThinkingAlibaba2026-01-2670.75%
2026-09-10
Quelle geprüft
51GPT-5 (medium)OpenAI2025-08-0770.61%
2026-09-10
Quelle geprüft
52Gemini 3 ProGoogle2025-11-1870.41%
2026-09-10
Quelle geprüft
53OpenAI o1OpenAI2024-09-1270.34%
2026-09-10
Quelle geprüft
54Kimi K2.5Moonshot2026-01-2770.2%
2026-09-10
Quelle geprüft
55GPT-5.1 Codex (high)OpenAI2025-11-1370%
2026-09-10
Quelle geprüft
56MiniMax-M2.1MiniMax2025-12-2369.86%
2026-09-10
Quelle geprüft
57MiMo-V2-ProXiaomi2026-03-1868.84%
2026-09-10
Quelle geprüft
58Mistral Medium 3.5Mistral2026-04-2968.78%
2026-09-10
Quelle geprüft
59Kimi K2 ThinkingMoonshot2025-11-0668.1%
2026-09-10
Quelle geprüft
60GLM-4.7 (Reasoning)Zhipu2025-12-2267.89%
2026-09-10
Quelle geprüft
61Qwen3.6 27B (Reasoning)Alibaba2026-04-2267.55%
2026-09-10
Quelle geprüft
62MiMo-V2-Omni-0327Xiaomi2026-03-2767.35%
2026-09-10
Quelle geprüft
63Step 3.7 FlashStepFun2026-06-0167.28%
2026-09-10
Quelle geprüft
64MiMo-V2.5Xiaomi2026-04-2267.14%
2026-09-10
Quelle geprüft
65KAT Coder Pro V2Other2026-03-2766.67%
2026-09-10
Quelle geprüft
66GPT-5 (low)OpenAI2025-08-0766.6%
2026-09-10
Quelle geprüft
67Nex-N2-ProOther2026-06-0266.19%
2026-09-10
Quelle geprüft
68GPT-5.4 (low)OpenAI2026-03-0565.92%
2026-09-10
Quelle geprüft
69GPT-5.2 (medium)OpenAI2025-12-1165.24%
2026-09-10
Quelle geprüft
70GPT-5.5 (low)OpenAI2026-04-2364.35%
2026-09-10
Quelle geprüft
71Qwen3.6 35B A3B (Reasoning)Alibaba2026-04-1664.35%
2026-09-10
Quelle geprüft
72MiMo-V2-Flash (Reasoning)Xiaomi2025-12-1664.22%
2026-09-10
Quelle geprüft
73Claude Fable 5Anthropic2026-06-0963.47%
2026-09-10
Quelle geprüft
74Nemotron 3 Nano Omni 30B A3B ReasoningNVIDIA2026-04-2963.2%
2026-09-10
Quelle geprüft
75Hy3-preview (Reasoning)Other2026-04-2363.13%
2026-09-10
Quelle geprüft
76Kimi K2.7 CodeMoonshot2026-06-1263.13%
2026-09-10
Quelle geprüft
77Claude Opus 4.8Anthropic2026-05-2862.24%
2026-09-10
Quelle geprüft
78GLM 5V Turbo (Reasoning)Zhipu2026-04-0161.09%
2026-09-10
Quelle geprüft
79DeepSeek V3.2 (Reasoning)DeepSeek2025-12-0160.68%
2026-09-10
Quelle geprüft
80DiffusionGemma 26B A4BGoogle2026-06-1059.46%
2026-09-10
Quelle geprüft
81Claude Opus 4.7Anthropic2026-04-1658.64%
2026-09-10
Quelle geprüft
82Claude Opus 4.5 (Reasoning)Anthropic2025-11-2457.96%
2026-09-10
Quelle geprüft
83EXAONE 4.5 33BOther2026-04-0957.96%
2026-09-10
Quelle geprüft
84North Mini CodeCohere2026-06-0957.55%
2026-09-10
Quelle geprüft
85Ling 2.6 FlashOther2026-04-2157.41%
2026-09-10
Quelle geprüft
86Claude 4.5 Sonnet (Reasoning)Anthropic2025-09-2957.28%
2026-09-10
Quelle geprüft
87Ling-2.6-1TOther2026-04-2356.87%
2026-09-10
Quelle geprüft
88Claude Sonnet 4.6 (Adaptive Reasoning, Max Effort)Anthropic2026-02-1756.6%
2026-09-10
Quelle geprüft
89LFM2.5-8B-A1BLiquid2026-06-0855.65%
2026-09-10
Quelle geprüft
90Claude 4.1 Opus (Reasoning)Anthropic2025-08-0555.44%
2026-09-10
Quelle geprüft
91GLM-5 (Non-reasoning)Zhipu2026-02-1155.17%
2026-09-10
Quelle geprüft
92Gemini 3 Flash PreviewGoogle2025-12-1755.1%
2026-09-10
Quelle geprüft
93Claude 4 Opus (Reasoning)Anthropic2025-05-2253.74%
2026-09-10
Quelle geprüft
94Grok 4xAI2025-07-1053.67%
2026-09-10
Quelle geprüft
95MiMo-V2-OmniXiaomi2026-03-1953.54%
2026-09-10
Quelle geprüft
96Claude Opus 4.6 (Adaptive Reasoning, Max Effort)Anthropic2026-02-0553.13%
2026-09-10
Quelle geprüft
97Qwen3.5 397B A17B (Non-reasoning)Alibaba2026-02-1651.63%
2026-09-10
Quelle geprüft
98Gemini 3 Pro Preview (low)Google2025-11-1849.66%
2026-09-10
Quelle geprüft
99Grok 4.20 0309 v2 (Non-reasoning)xAI2026-04-0749.32%
2026-09-10
Quelle geprüft
100MiniCPM5-1B (Reasoning)OpenBMB2026-06-0449.32%
2026-09-10
Quelle geprüft
101Hy3-preview (Non-reasoning)Other2026-04-2347.96%
2026-09-10
Quelle geprüft
102Grok 4.3 (Non-reasoning)xAI2026-04-3047.62%
2026-09-10
Quelle geprüft
103Gemini 3.5 Flash (minimal)Google2026-05-1947.28%
2026-09-10
Quelle geprüft
104DeepSeek V4 Flash (Non-reasoning)DeepSeek2026-04-2447.21%
2026-09-10
Quelle geprüft
105GPT-5.5 (Non-reasoning)OpenAI2026-04-2346.12%
2026-09-10
Quelle geprüft
106DeepSeek V4 Pro (Non-reasoning)DeepSeek2026-04-2445.78%
2026-09-10
Quelle geprüft
107Qwen3.6 27B (Non-reasoning)Alibaba2026-04-2245.71%
2026-09-10
Quelle geprüft
108Gemma 4 12B (Non-reasoning)Google2026-06-1045.17%
2026-09-10
Quelle geprüft
109Claude Opus 4.6Anthropic2026-02-0544.63%
2026-09-10
Quelle geprüft
110Ring-2.6-1TOther2026-05-0844.56%
2026-09-10
Quelle geprüft
111Granite 4.1 30BOther2026-04-2944.35%
2026-09-10
Quelle geprüft
112Kimi K2.6 (Non-reasoning)Other2026-04-2044.29%
2026-09-10
Quelle geprüft
113Claude Opus 4.7 (Non-reasoning, High Effort)Anthropic2026-04-1643.61%
2026-09-10
Quelle geprüft
114Claude Opus 4.5Anthropic2025-11-2442.99%
2026-09-10
Quelle geprüft
115Llama 4 MaverickMeta2026-04-0542.99%
2026-09-10
Quelle geprüft
116MiMo-V2.5-Pro (Non-reasoning)Xiaomi2026-04-2242.72%
2026-09-10
Quelle geprüft
117Claude Sonnet 4.6 (Non-reasoning, Low Effort)Anthropic2026-02-1742.38%
2026-09-10
Quelle geprüft
118JT-35B-FlashOther2026-05-1442.04%
2026-09-10
Quelle geprüft
119Claude Sonnet 4.6Anthropic2026-02-1741.16%
2026-09-10
Quelle geprüft
120DeepSeek R1DeepSeek2025-01-2039.59%
2026-09-10
Quelle geprüft
121Llama 4 ScoutMeta2026-04-0539.52%
2026-09-10
Quelle geprüft
122JT-MINIOther2026-04-1536.67%
2026-09-10
Quelle geprüft
123Command ACohere2026-03-1536.46%
2026-09-10
Quelle geprüft
124Mistral Large 3Mistral2025-12-0236.19%
2026-09-10
Quelle geprüft
125Qwen3.6 35B A3B (Non-reasoning)Alibaba2026-04-1636.19%
2026-09-10
Quelle geprüft
126MiniCPM5-1B (Non-reasoning)OpenBMB2026-05-2535.17%
2026-09-10
Quelle geprüft
127MiniCPM-V 4.6 1.3BOpenBMB2026-05-1126.73%
2026-09-10
Quelle geprüft
Methode

Was er abdeckt

Archiviert — aus AA Intelligence Index v4.1 wegen Sättigung entfernt. AA führt es weiter; VerdictPal behält den Glossar-Eintrag als Ehrlichkeits-Beleg.

Score-Obergrenze

Wo er an Grenzen stößt

Noch ist keine Obergrenze erfasst. Wenn sich Scores oben bündeln, kann der Benchmark Frontier-Modelle möglicherweise nicht mehr trennen.

Belege

Quellen und weiterführende Lektüre

Fragen zu diesem Benchmark

Jede Antwort unten stammt aus den datierten Feldern dieser Seite. Nichts davon ist zusätzlich für Suchmaschinen geschrieben.

Was misst IFBench?

Präzises Instruction-Following bei neuen Constraints — testet, ob Modelle komplexe, ungesehene Formatregeln ohne Abdriften befolgen.

Was beweist ein hoher IFBench-Wert nicht?

Ein starkes IFBench-Ergebnis sagt nichts aus über:

  • Frontier-Trennung heute — Artificial Analysis entfernte IFBench aus dem Intelligence Index v4.1, weil Frontier-Modelle ihn sättigten.
  • Faktische Genauigkeit — eine perfekt formatierte falsche Antwort scored trotzdem.
  • Echte Nutzeraufgaben — synthetische Constraint-Tests, keine Produktions-Workflows.

Wie wird IFBench bewertet?

Constraint-Satisfaction-Genauigkeit. AA veröffentlicht weiterhin Ergebnisse, gewichtet IFBench aber nicht mehr im Composite-Index. Aufgabenformat: Neue Instruction-Following-Aufgaben mit strikten Output-Constraints; Genauigkeit auf ungesehenen Regelsets.

Ist IFBench gesättigt?

IFBench ist im Atlas derzeit als Gesättigt markiert.

Können IFBench-Ergebnisse durch Trainingsdaten verunreinigt sein?

Das Kontaminationsrisiko für IFBench ist als Kontamination mittel eingestuft. Behandle jede Zeile auf dieser Seite als öffentliche Angabe mit Quelle und Datum, nicht als kontrolliertes Experiment.

The Pack · Redaktionsnewsletter

Neue Tools in dein Postfach. Kostenlos.

Eine kurze E-Mail, wenn ein Tool erscheint oder den Status wechselt. Kein Tracking, keine Drittanbieter-Analytics. Abmeldung mit einem Klick.