Benchmarks / Reasoning

Artificial Analysis Intelligence Index

AA Intelligence Index

AA Intelligence Index v4.1 — gewichteter Composite mit Fokus auf agentische Workloads: GDPval-AA v2 (20 %), Terminal-Bench 2.1 (16 %), τ³-Bench Banking (14 %), Humanity's Last Exam (12 %), AA-Omniscience (12 %), SciCode (8 %), GPQA Diamond (6 %), AA-LCR (6 %), CritPt (6 %). IFBench wegen Sättigung entfernt.

Artificial AnalysisReasoningFlagshipAktivMittleres KontaminationsrisikoSeit 2026
Was dieser Benchmark nicht misst
  • Latenz, Kosten-pro-Token und Durchsatz — der Index ist reine Intelligenz. Für $/1M-Token die AA-API parallel nutzen.
  • Multilinguale oder multimodale Fähigkeit — AA testet Bild, Sprache und Mehrsprachigkeit in separaten Indizes.
  • Keinen einzelnen Sub-Test isoliert — ein hoher Composite kann schwache Agentic- oder Coding-Anteile verdecken.
Analyse

Warum dieser Benchmark nützlich ist

Single-Number-Modell-Rankings verstecken Trade-offs. Der AA Intelligence Index ist ein gewichteter Composite aus zehn öffentlichen Sub-Evals — nützlich als datierter Frontier-Snapshot, wenn man die Slices liest, nicht als universeller Qualitätswert.

Umfang

Abdeckung

Aufgabenfamilie
Reasoning
Format
Composite aus zehn versionierten Sub-Evaluationen mit öffentlichen Gewichten; die Methodik-Seite listet Fragenzahlen und Scoring pro Eval.
Bewertung
Gewichteter Prozentsatz über vier gleichgewichtete Kategorien. AA schätzt ±1 % CI auf dem Composite bei ausreichenden Wiederholungen.
Verantwortliche Stelle
Artificial Analysis
Lesehilfe

So liest du die Scores

Öffne die Methodik-Seite für v4.1-Gewichte, dann jede Sub-Eval-Karte. Ein hoher Composite kann schwache Agentic-, Coding- oder Long-Context-Anteile verdecken.

Blinde Flecken

Was er nicht abdeckt

  • Latenz, Kosten-pro-Token und Durchsatz — der Index ist reine Intelligenz. Für $/1M-Token die AA-API parallel nutzen.
  • Multilinguale oder multimodale Fähigkeit — AA testet Bild, Sprache und Mehrsprachigkeit in separaten Indizes.
  • Keinen einzelnen Sub-Test isoliert — ein hoher Composite kann schwache Agentic- oder Coding-Anteile verdecken.
Scores

Evidenz-Ledger

67 Zeilen
6767 Zeilen
59.9%bester Score
67quellgeprüft
1Quellen
2026-07-21Quelldatum
67

api · api

Verteilung

Wo die Zeilen liegen

0255075100

Auf die Skala dieses Benchmarks normalisiert (0–100). Die Tabelle zeigt die Rohwerte.

Zeitverlauf

Neueste Belege

  1. Claude Fable 559.9% ·
  2. GPT-5.6 Sol58.9% ·
  3. Kimi K357.1% ·
  4. Claude Opus 4.855.7% ·
  5. GPT-5.6 Terra55% ·

Scores nutzen die eigene Einheit und Skala dieses Benchmarks, keinen universellen Qualitätswert.

#ModellVeröffentlichungScoreHerkunftBeleglage
1Claude Fable 5Anthropic2026-06-0959.9%
2026-07-21
Quelle geprüft
2GPT-5.6 SolOpenAI2026-07-0958.9%
2026-07-21
Quelle geprüft
3Kimi K3Moonshot2026-07-1657.1%
2026-07-21
Quelle geprüft
4Claude Opus 4.8Anthropic2026-05-2855.7%
2026-07-21
Quelle geprüft
5GPT-5.6 TerraOpenAI2026-07-0955%
2026-07-21
Quelle geprüft
6GPT 5.5OpenAI2026-04-2354.8%
2026-07-21
Quelle geprüft
7Grok 4.5xAI2026-07-0853.8%
2026-07-21
Quelle geprüft
8Claude Opus 4.7Anthropic2026-04-1653.5%
2026-07-21
Quelle geprüft
9Claude Sonnet 5Anthropic2026-06-3053.4%
2026-07-21
Quelle geprüft
10GPT-5.5 (high)OpenAI2026-04-2353.1%
2026-07-21
Quelle geprüft
11GPT 5.4OpenAI2026-03-0551.4%
2026-07-21
Quelle geprüft
12GPT-5.6 LunaOpenAI2026-07-0951.2%
2026-07-21
Quelle geprüft
13GLM-5.2Zhipu2026-06-1351.1%
2026-07-21
Quelle geprüft
14Muse Spark 1.1Meta2026-07-0950.6%
2026-07-21
Quelle geprüft
15GPT-5.5 (medium)OpenAI2026-04-2350.4%
2026-07-21
Quelle geprüft
16Gemini 3.5 FlashGoogle2026-05-1950.2%
2026-07-21
Quelle geprüft
17Claude Sonnet 4.6 (Adaptive Reasoning, Max Effort)Anthropic2026-02-1747.2%
2026-07-21
Quelle geprüft
18Gemini 3.1 Pro PreviewGoogle2026-02-1946.5%
2026-07-21
Quelle geprüft
19Qwen3.7 MaxAlibaba2026-05-1946%
2026-07-21
Quelle geprüft
20Gemini 3.5 Flash (medium)Google2026-05-1945.4%
2026-07-21
Quelle geprüft
21MiniMax M3MiniMax2026-05-3144.4%
2026-07-21
Quelle geprüft
22DeepSeek V4 Pro (Reasoning, Max Effort)DeepSeek2026-04-2444.3%
2026-07-21
Quelle geprüft
23GPT-5.3 Codex (xhigh)OpenAI2026-02-0544.3%
2026-07-21
Quelle geprüft
24Kimi K2.6Moonshot2026-04-2044.2%
2026-07-21
Quelle geprüft
25Claude Opus 4.6 (Adaptive Reasoning, Max Effort)Anthropic2026-02-0543.7%
2026-07-21
Quelle geprüft
26GPT-5.5 (low)OpenAI2026-04-2343.5%
2026-07-21
Quelle geprüft
27Muse SparkOther2026-01-0143.1%
2026-07-21
Quelle geprüft
28Claude Opus 4.7 (Non-reasoning, High Effort)Anthropic2026-04-1642.7%
2026-07-21
Quelle geprüft
29GPT-5.2OpenAI2025-12-1142.2%
2026-07-21
Quelle geprüft
30MiMo-V2.5-ProXiaomi2026-04-2242.2%
2026-07-21
Quelle geprüft
31Kimi K2.7 CodeMoonshot2026-06-1241.9%
2026-07-21
Quelle geprüft
32GLM-5.1Zhipu2026-04-0740.2%
2026-07-21
Quelle geprüft
33GPT-5.4 MiniOpenAI2026-03-1740%
2026-07-21
Quelle geprüft
34Gemini 3 ProGoogle2025-11-1839.6%
2026-07-21
Quelle geprüft
35Qwen 3.7 PlusAlibaba2026-06-0239%
2026-07-21
Quelle geprüft
36GPT-5.4 NanoOpenAI2026-03-1738.2%
2026-07-21
Quelle geprüft
37MiniMax M2.7MiniMax2026-04-1538.1%
2026-07-21
Quelle geprüft
38Claude Opus 4.6Anthropic2026-02-0537.8%
2026-07-21
Quelle geprüft
39Nemotron 3 Ultra 550B A55B (Reasoning)NVIDIA2026-06-0437.8%
2026-07-21
Quelle geprüft
40Grok 4.3xAI2026-04-3037.6%
2026-07-21
Quelle geprüft
41Grok 4.20 ReasoningxAI2026-03-0537%
2026-07-21
Quelle geprüft
42GPT-5.1OpenAI2025-11-1336.9%
2026-07-21
Quelle geprüft
43Claude Sonnet 4.6Anthropic2026-02-1735.9%
2026-07-21
Quelle geprüft
44Kimi K2.5Moonshot2026-01-2735.4%
2026-07-21
Quelle geprüft
45Claude Opus 4.5Anthropic2025-11-2434.7%
2026-07-21
Quelle geprüft
46MiniMax M2.5MiniMax2026-04-0133.7%
2026-07-21
Quelle geprüft
47LongCat-2.0Meituan2026-06-2933.5%
2026-07-21
Quelle geprüft
48OpenAI o3OpenAI2025-04-1630.4%
2026-07-21
Quelle geprüft
49Step 3.7 FlashStepFun2026-06-0130.3%
2026-07-21
Quelle geprüft
50Gemma 4 31B ITGoogle2026-03-0129.4%
2026-07-21
Quelle geprüft
51Gemini 3 Flash PreviewGoogle2025-12-1727.4%
2026-07-21
Quelle geprüft
52Gemini 3.1 Flash LiteGoogle2026-05-0725%
2026-07-21
Quelle geprüft
53OpenAI o1OpenAI2024-09-1223.4%
2026-07-21
Quelle geprüft
54Gemma 4 12B (Reasoning)Google2026-06-0722%
2026-07-21
Quelle geprüft
55DeepSeek R1DeepSeek2025-01-2020.1%
2026-07-21
Quelle geprüft
56North Mini CodeCohere2026-06-0919.8%
2026-07-21
Quelle geprüft
57HyperNova 60B 2605Multiverse2026-05-0617.8%
2026-07-21
Quelle geprüft
58Mistral Large 3Mistral2025-12-0215.9%
2026-07-21
Quelle geprüft
59Llama 4 MaverickMeta2026-04-0514.3%
2026-07-21
Quelle geprüft
60Gemma 4 12B (Non-reasoning)Google2026-06-1013.2%
2026-07-21
Quelle geprüft
61MiniCPM5-1B (Reasoning)OpenBMB2026-06-0412%
2026-07-21
Quelle geprüft
62Claude 3 OpusAnthropic2024-03-0411.8%
2026-07-21
Quelle geprüft
63Llama 4 ScoutMeta2026-04-0510%
2026-07-21
Quelle geprüft
64LFM2.5-8B-A1BLiquid2026-06-088.3%
2026-07-21
Quelle geprüft
65Command ACohere2026-03-157.7%
2026-07-21
Quelle geprüft
66DeepSeek Coder V2DeepSeek2024-05-155.1%
2026-07-21
Quelle geprüft
67Gemini 1.0 UltraGoogle2024-02-084.6%
2026-07-21
Quelle geprüft
Methode

Was er abdeckt

Ledger-Scores sind von artificialanalysis.ai/models gesnapshottet; Quelldatum und Ingest-Zeitstempel stehen pro Zeile.

Score-Obergrenze

Wo er an Grenzen stößt

v4.1 upgraded GDPval, Terminal-Bench und τ-bench; entfernte IFBench wegen Sättigung. v4.1-Headlines nicht mit AA-Index-Versionen vor 2026 vergleichen.

Tools, die ihn ausweisen

Belege

Quellen und weiterführende Lektüre

The Pack · Redaktionsnewsletter

Neue Karten in dein Postfach. Kostenlos.

Eine kurze E-Mail, wenn eine Karte erscheint oder den Status wechselt. Kein Tracking, keine Drittanbieter-Analytics. Abmeldung mit einem Klick.