Benchmarks / Reasoning

IFBench

Instruction-Following Benchmark

Präzises Instruction-Following bei neuen Constraints — testet, ob Modelle komplexe, ungesehene Formatregeln ohne Abdriften befolgen.

Artificial AnalysisReasoningSolidAusgedientMittleres KontaminationsrisikoSeit 2024
Was dieser Benchmark nicht misst
  • Frontier-Trennung heute — Artificial Analysis entfernte IFBench aus dem Intelligence Index v4.1, weil Frontier-Modelle ihn sättigten.
  • Faktische Genauigkeit — eine perfekt formatierte falsche Antwort scored trotzdem.
  • Echte Nutzeraufgaben — synthetische Constraint-Tests, keine Produktions-Workflows.
Analyse

Warum dieser Benchmark nützlich ist

Er fordert Abstraktion und mehrstufiges Schlussfolgern. So erkennst du Modelle, die ein Problem zusammenhalten, auch wenn der Prompt nicht wie eine bekannte Prüfungsfrage aussieht.

Umfang

Abdeckung

Aufgabenfamilie
Reasoning
Format
Neue Instruction-Following-Aufgaben mit strikten Output-Constraints; Genauigkeit auf ungesehenen Regelsets.
Bewertung
Constraint-Satisfaction-Genauigkeit. AA veröffentlicht weiterhin Ergebnisse, gewichtet IFBench aber nicht mehr im Composite-Index.
Verantwortliche Stelle
Artificial Analysis
Lesehilfe

So liest du die Scores

Lies IFBench als ausgedient Signal mit mittleres kontaminationsrisiko. Vergleiche Modelle nur, wenn Quelle, Testumgebung, Prompting, Sampling und Score-Einheit übereinstimmen.

Blinde Flecken

Was er nicht abdeckt

  • Frontier-Trennung heute — Artificial Analysis entfernte IFBench aus dem Intelligence Index v4.1, weil Frontier-Modelle ihn sättigten.
  • Faktische Genauigkeit — eine perfekt formatierte falsche Antwort scored trotzdem.
  • Echte Nutzeraufgaben — synthetische Constraint-Tests, keine Produktions-Workflows.
Scores

Evidenz-Ledger

57 Zeilen
5757 Zeilen
82.86%bester Score
57quellgeprüft
1Quellen
2026-07-21Quelldatum
57

api · api

Verteilung

Wo die Zeilen liegen

0255075100

Auf die Skala dieses Benchmarks normalisiert (0–100). Die Tabelle zeigt die Rohwerte.

Zeitverlauf

Neueste Belege

  1. MiniMax M382.86% ·
  2. Nemotron 3 Ultra 550B A55B (Reasoning)81.36% ·
  3. Grok 4.381.29% ·
  4. Grok 4.20 Reasoning81.22% ·
  5. Qwen3.7 Max80.54% ·

Scores nutzen die eigene Einheit und Skala dieses Benchmarks, keinen universellen Qualitätswert.

#ModellVeröffentlichungScoreHerkunftBeleglage
1MiniMax M3MiniMax2026-05-3182.86%
2026-07-21
Quelle geprüft
2Nemotron 3 Ultra 550B A55B (Reasoning)NVIDIA2026-06-0481.36%
2026-07-21
Quelle geprüft
3Grok 4.3xAI2026-04-3081.29%
2026-07-21
Quelle geprüft
4Grok 4.20 ReasoningxAI2026-03-0581.22%
2026-07-21
Quelle geprüft
5Qwen3.7 MaxAlibaba2026-05-1980.54%
2026-07-21
Quelle geprüft
6MiMo-V2.5-ProXiaomi2026-04-2279.86%
2026-07-21
Quelle geprüft
7Qwen 3.7 PlusAlibaba2026-06-0277.96%
2026-07-21
Quelle geprüft
8Gemini 3.1 Flash LiteGoogle2026-05-0777.21%
2026-07-21
Quelle geprüft
9Gemini 3.1 Pro PreviewGoogle2026-02-1977.14%
2026-07-21
Quelle geprüft
10DeepSeek V4 Pro (Reasoning, Max Effort)DeepSeek2026-04-2476.46%
2026-07-21
Quelle geprüft
11Gemini 3.5 FlashGoogle2026-05-1976.33%
2026-07-21
Quelle geprüft
12GLM-5.1Zhipu2026-04-0776.26%
2026-07-21
Quelle geprüft
13Kimi K2.6Moonshot2026-04-2075.99%
2026-07-21
Quelle geprüft
14GPT-5.4 NanoOpenAI2026-03-1775.92%
2026-07-21
Quelle geprüft
15Muse SparkOther2026-01-0175.92%
2026-07-21
Quelle geprüft
16GPT 5.5OpenAI2026-04-2375.85%
2026-07-21
Quelle geprüft
17MiniMax M2.7MiniMax2026-04-1575.71%
2026-07-21
Quelle geprüft
18Gemma 4 31B ITGoogle2026-03-0175.58%
2026-07-21
Quelle geprüft
19GPT-5.2OpenAI2025-12-1175.44%
2026-07-21
Quelle geprüft
20GPT-5.3 Codex (xhigh)OpenAI2026-02-0575.37%
2026-07-21
Quelle geprüft
21Gemini 3.5 Flash (medium)Google2026-05-1974.56%
2026-07-21
Quelle geprüft
22GPT 5.4OpenAI2026-03-0573.95%
2026-07-21
Quelle geprüft
23Gemma 4 12B (Reasoning)Google2026-06-0773.54%
2026-07-21
Quelle geprüft
24GLM-5.2Zhipu2026-06-1373.33%
2026-07-21
Quelle geprüft
25GPT-5.4 MiniOpenAI2026-03-1773.27%
2026-07-21
Quelle geprüft
26GPT-5.1OpenAI2025-11-1372.86%
2026-07-21
Quelle geprüft
27GPT-5.6 SolOpenAI2026-07-0972.65%
2026-07-21
Quelle geprüft
28GPT-5.5 (high)OpenAI2026-04-2371.63%
2026-07-21
Quelle geprüft
29MiniMax M2.5MiniMax2026-04-0171.63%
2026-07-21
Quelle geprüft
30OpenAI o3OpenAI2025-04-1671.43%
2026-07-21
Quelle geprüft
31GPT-5.6 TerraOpenAI2026-07-0971.22%
2026-07-21
Quelle geprüft
32GPT-5.5 (medium)OpenAI2026-04-2370.95%
2026-07-21
Quelle geprüft
33Gemini 3 ProGoogle2025-11-1870.41%
2026-07-21
Quelle geprüft
34OpenAI o1OpenAI2024-09-1270.34%
2026-07-21
Quelle geprüft
35Kimi K2.5Moonshot2026-01-2770.2%
2026-07-21
Quelle geprüft
36Step 3.7 FlashStepFun2026-06-0167.28%
2026-07-21
Quelle geprüft
37HyperNova 60B 2605Multiverse2026-05-0666.46%
2026-07-21
Quelle geprüft
38GPT-5.5 (low)OpenAI2026-04-2364.35%
2026-07-21
Quelle geprüft
39Claude Fable 5Anthropic2026-06-0963.47%
2026-07-21
Quelle geprüft
40Kimi K2.7 CodeMoonshot2026-06-1263.13%
2026-07-21
Quelle geprüft
41Claude Opus 4.8Anthropic2026-05-2862.24%
2026-07-21
Quelle geprüft
42Claude Opus 4.7Anthropic2026-04-1658.64%
2026-07-21
Quelle geprüft
43North Mini CodeCohere2026-06-0957.55%
2026-07-21
Quelle geprüft
44Claude Sonnet 4.6 (Adaptive Reasoning, Max Effort)Anthropic2026-02-1756.6%
2026-07-21
Quelle geprüft
45LFM2.5-8B-A1BLiquid2026-06-0855.65%
2026-07-21
Quelle geprüft
46Gemini 3 Flash PreviewGoogle2025-12-1755.1%
2026-07-21
Quelle geprüft
47Claude Opus 4.6 (Adaptive Reasoning, Max Effort)Anthropic2026-02-0553.13%
2026-07-21
Quelle geprüft
48MiniCPM5-1B (Reasoning)OpenBMB2026-06-0449.32%
2026-07-21
Quelle geprüft
49Gemma 4 12B (Non-reasoning)Google2026-06-1045.17%
2026-07-21
Quelle geprüft
50Claude Opus 4.6Anthropic2026-02-0544.63%
2026-07-21
Quelle geprüft
51Claude Opus 4.7 (Non-reasoning, High Effort)Anthropic2026-04-1643.61%
2026-07-21
Quelle geprüft
52Claude Opus 4.5Anthropic2025-11-2442.99%
2026-07-21
Quelle geprüft
53Llama 4 MaverickMeta2026-04-0542.99%
2026-07-21
Quelle geprüft
54Claude Sonnet 4.6Anthropic2026-02-1741.16%
2026-07-21
Quelle geprüft
55DeepSeek R1DeepSeek2025-01-2039.59%
2026-07-21
Quelle geprüft
56Llama 4 ScoutMeta2026-04-0539.52%
2026-07-21
Quelle geprüft
57Mistral Large 3Mistral2025-12-0236.19%
2026-07-21
Quelle geprüft
Methode

Was er abdeckt

Archiviert — aus AA Intelligence Index v4.1 wegen Sättigung entfernt. AA führt es weiter; VerdictPal behält den Glossar-Eintrag als Ehrlichkeits-Beleg.

Score-Obergrenze

Wo er an Grenzen stößt

Noch ist keine Obergrenze erfasst. Wenn sich Scores oben bündeln, kann der Benchmark Frontier-Modelle möglicherweise nicht mehr trennen.

Belege

Quellen und weiterführende Lektüre

The Pack · Redaktionsnewsletter

Neue Karten in dein Postfach. Kostenlos.

Eine kurze E-Mail, wenn eine Karte erscheint oder den Status wechselt. Kein Tracking, keine Drittanbieter-Analytics. Abmeldung mit einem Klick.