Benchmarks / Reasoning

Artificial Analysis Intelligence Index

AA Intelligence Index

AA Intelligence Index v4.2 — gewichteter Composite über vier Kategorien: Agents 30 % (AA-Briefcase 15 %, GDPval-AA v2 10 %, τ³-Banking 5 %), Coding 20 % (Terminal-Bench 2.1 10 %, SciCode 10 %), Scientific Reasoning 20 % (HLE 10 %, CritPt 10 %), General 30 % (AA-Omniscience-Accuracy 10 % + Non-Hallucination 5 %, GDP.pdf 10 %, AA-LCR v1.1 5 %).

Was dieser Benchmark nicht misst
  • Latenz, Kosten-pro-Token und Durchsatz — der Index ist reine Intelligenz. Für $/1M-Token die AA-API parallel nutzen.
  • Multilinguale oder multimodale Fähigkeit — AA testet Bild, Sprache und Mehrsprachigkeit in separaten Indizes.
  • Keinen einzelnen Sub-Test isoliert — ein hoher Composite kann schwache Agentic- oder Coding-Anteile verdecken.
Analyse

Warum dieser Benchmark nützlich ist

Single-Number-Modell-Rankings verstecken Trade-offs. Der AA Intelligence Index ist ein gewichteter Composite aus öffentlichen Sub-Evals — nützlich als datierter Frontier-Snapshot, wenn man die Slices liest, nicht als universeller Qualitätswert.

Umfang

Abdeckung

Aufgabenfamilie
Reasoning
Format
Composite aus zehn versionierten Sub-Evaluationen mit öffentlichen Kategorie-Gewichten. Die Methodik-Seite listet Fragenzahlen, Repeats und Scoring pro Eval. AA-Briefcase und GDP.pdf sind neu in v4.2.
Bewertung
Gewichteter Prozentsatz über vier Kategorien (Agents 30 %, Coding 20 %, Scientific Reasoning 20 %, General 30 %). AA schätzt ein 95-%-CI unter ±1 % auf dem Composite bei genug Repeats.
Verantwortliche Stelle
Artificial Analysis
Lesehilfe

So liest du die Scores

Öffne die Methodik-Seite für v4.2-Gewichte, dann jede Sub-Eval. Am 5. Sep. 2026 steht das Live-Board bei Fable 5.1 mit 57, GPT-6 Astra mit 55, Opus 5 mit 54, Muse Spark 1.3 mit 53, dann Grok 4.6 und GPT-5.6 Sol mit 51.

Blinde Flecken

Was er nicht abdeckt

  • Latenz, Kosten-pro-Token und Durchsatz — der Index ist reine Intelligenz. Für $/1M-Token die AA-API parallel nutzen.
  • Multilinguale oder multimodale Fähigkeit — AA testet Bild, Sprache und Mehrsprachigkeit in separaten Indizes.
  • Keinen einzelnen Sub-Test isoliert — ein hoher Composite kann schwache Agentic- oder Coding-Anteile verdecken.
  • v4.1-Headlines — GPQA Diamond hat den Index in v4.2 verlassen; AA-Briefcase und GDP.pdf sind dazugekommen. Ein Rückgang gegenüber einem September-v4.1-Score ist meist Neuzusammensetzung, kein schwächeres Modell.
Scores

Evidenz-Ledger

187 Zeilen
187187 Zeilen
62.5%bester Score
187quellgeprüft
1Quellen
2026-09-05bis 2026-09-01
187

api · api

Verteilung

Wo die Zeilen liegen

0255075100

Auf die Skala dieses Benchmarks normalisiert (0–100). Die Tabelle zeigt die Rohwerte.

Zeitverlauf

Neueste Belege

  1. Claude Fable 5.157% ·
  2. GPT-6 Astra55% ·
  3. Claude Opus 5 (Adaptive Reasoning, Max Effort)54% ·
  4. Muse Spark 1.353% ·
  5. GPT-5.6 Sol51% ·

Scores nutzen die eigene Einheit und Skala dieses Benchmarks, keinen universellen Qualitätswert.

#ModellVeröffentlichungScoreHerkunftBeleglage
1Claude Opus 5 (Adaptive Reasoning, Xhigh Effort)Anthropic2026-07-2462.5%
2026-09-01
Quelle geprüft
2Claude Fable 5Anthropic2026-06-0962.1%
2026-09-01
Quelle geprüft
3Claude Opus 5 (Adaptive Reasoning, High Effort)Anthropic2026-07-2461.5%
2026-09-01
Quelle geprüft
4Kimi K3Moonshot2026-07-1659.7%
2026-09-01
Quelle geprüft
5GLM-5.3Zhipu2026-08-1459.5%
2026-09-01
Quelle geprüft
6Claude Opus 5 (Adaptive Reasoning, Medium Effort)Anthropic2026-07-2458.6%
2026-09-01
Quelle geprüft
7Qwen3.8 MaxAlibaba2026-08-0358.1%
2026-09-01
Quelle geprüft
8Qwen3.8 2.4T A95BAlibaba2026-08-1257.7%
2026-09-01
Quelle geprüft
9GLM-5.3-FlashZhipu2026-08-2657.5%
2026-09-01
Quelle geprüft
10Claude Opus 4.8Anthropic2026-05-2857.3%
2026-09-01
Quelle geprüft
1Claude Fable 5.1AnthropicÖffentliche AA-Modellseite, 5. Sep. 2026, Intelligence Index v4.2. Max + Default-Fallback. Die v4.1-Headline vom 1. Sep. war 66 — der Rückgang ist Index-Neuzusammensetzung, keine Modell-Regression.2026-09-0157%
2026-09-05
Quelle geprüft
12Muse Spark 1.2Meta2026-08-0556.8%
2026-09-01
Quelle geprüft
13GPT-5.6 TerraOpenAI2026-07-0956.6%
2026-09-01
Quelle geprüft
14GPT 5.5OpenAI2026-04-2356.3%
2026-09-01
Quelle geprüft
15Grok 4.5xAI2026-07-0855.8%
2026-09-01
Quelle geprüft
16Qwen3.8-Flash-NextAlibaba2026-08-2655.8%
2026-09-01
Quelle geprüft
17Claude Sonnet 5Anthropic2026-06-3055.3%
2026-09-01
Quelle geprüft
2GPT-6 AstraOpenAIÖffentliche AA-Modellseite, 5. Sep. 2026, Max Effort, Intelligence Index v4.2.2026-09-0355%
2026-09-05
Quelle geprüft
19Claude Opus 4.7Anthropic2026-04-1655%
2026-09-01
Quelle geprüft
20GPT-5.5 (high)OpenAI2026-04-2354.7%
2026-09-01
Quelle geprüft
4Claude Opus 5 (Adaptive Reasoning, Max Effort)AnthropicÖffentliche AA-Modellseite, 5. Sep. 2026, Max Effort, Intelligence Index v4.2. Ersetzt die v4.1-Snapshot-Zeile 63,1 vom 1. Sep.2026-07-2454%
2026-09-05
Quelle geprüft
22DeepSeek V4 Pro 0813 (Reasoning, Max Effort)DeepSeek2026-08-1353.2%
2026-09-01
Quelle geprüft
23Muse Spark 1.1Meta2026-07-0953.2%
2026-09-01
Quelle geprüft
24GPT 5.4OpenAI2026-03-0553.1%
2026-09-01
Quelle geprüft
9Muse Spark 1.3MetaÖffentliche AA-Modellseite, 5. Sep. 2026, Max Effort, Intelligence Index v4.2. Rang #9 / 202 in dieser Preisklasse.2026-09-0253%
2026-09-05
Quelle geprüft
26GLM-5.2Zhipu2026-06-1352.6%
2026-09-01
Quelle geprüft
27Claude Opus 5 (Adaptive Reasoning, Low Effort)Anthropic2026-07-2452.5%
2026-09-01
Quelle geprüft
28GPT-5.6 LunaOpenAI2026-07-0952.3%
2026-09-01
Quelle geprüft
29Gemini 3.5 FlashGoogle2026-05-1952%
2026-09-01
Quelle geprüft
30Qwen3.8 27BAlibaba2026-08-1452%
2026-09-01
Quelle geprüft
31DeepSeek V4 Flash 0731 (Reasoning, Max Effort)DeepSeek2026-07-3151.8%
2026-09-01
Quelle geprüft
32Gemini 3.6 Flash (high)Google2026-07-2151.6%
2026-09-01
Quelle geprüft
33DeepSeek V4 Flash Vision (Reasoning, Max Effort)DeepSeek2026-08-2151.5%
2026-09-01
Quelle geprüft
34GPT-5.5 (medium)OpenAI2026-04-2351.4%
2026-09-01
Quelle geprüft
14GPT-5.6 SolOpenAIÖffentliche AA-Modellseite, 5. Sep. 2026, Max Effort, Intelligence Index v4.2. Ersetzt die v4.1-Snapshot-Zeile 60,9 vom 1. Sep.2026-07-0951%
2026-09-05
Quelle geprüft
15Grok 4.6xAIÖffentliche AA-Modellseite, 5. Sep. 2026, High Effort, Intelligence Index v4.2. Ersetzt die v4.1-Snapshot-Zeile 60,9 vom 1. Sep.2026-08-1251%
2026-09-05
Quelle geprüft
37Agnes 2.5 Pro BetaOther2026-08-2649.1%
2026-09-01
Quelle geprüft
38Claude Sonnet 4.6 (Adaptive Reasoning, Max Effort)Anthropic2026-02-1748.4%
2026-09-01
Quelle geprüft
39Kimi K3 (low)Moonshot2026-07-1648.3%
2026-09-01
Quelle geprüft
40Gemini 3.1 Pro PreviewGoogle2026-02-1947.7%
2026-09-01
Quelle geprüft
41Motif 3Other2026-08-1247.4%
2026-09-01
Quelle geprüft
27Gemini 3.8 FlashGoogleÖffentliche AA-Modellseite, 5. Sep. 2026, High Effort, Intelligence Index v4.2.2026-09-0247%
2026-09-05
Quelle geprüft
43Gemini 3.5 Flash (medium)Google2026-05-1946.7%
2026-09-01
Quelle geprüft
44Qwen3.7 MaxAlibaba2026-05-1946.7%
2026-09-01
Quelle geprüft
45GPT-5.3 Codex (xhigh)OpenAI2026-02-0545.5%
2026-09-01
Quelle geprüft
46MiniMax M3MiniMax2026-05-3145.4%
2026-09-01
Quelle geprüft
47Motif 3 (Beta)Other2026-07-2145.3%
2026-09-01
Quelle geprüft
48Kimi K2.6Moonshot2026-04-2045.1%
2026-09-01
Quelle geprüft
37Gemini 3.7 FlashGoogleÖffentliche AA-Modellseite, 5. Sep. 2026, High Effort, Intelligence Index v4.2. Ersetzt die v4.1-Snapshot-Zeile 56 vom 1. Sep.2026-08-1345%
2026-09-05
Quelle geprüft
50Claude Opus 4.6 (Adaptive Reasoning, Max Effort)Anthropic2026-02-0544.9%
2026-09-01
Quelle geprüft
51GPT-5.5 (low)OpenAI2026-04-2344.5%
2026-09-01
Quelle geprüft
52Muse SparkOther2026-01-0144.3%
2026-09-01
Quelle geprüft
53Apodex 1.1Other2026-08-3044%
2026-09-01
Quelle geprüft
54Claude Opus 4.7 (Non-reasoning, High Effort)Anthropic2026-04-1643.9%
2026-09-01
Quelle geprüft
55DeepSeek V4 Pro (Reasoning, High Effort)DeepSeek2026-04-2443.7%
2026-09-01
Quelle geprüft
56GPT-5.2OpenAI2025-12-1143.3%
2026-09-01
Quelle geprüft
57Kimi K2.7 CodeMoonshot2026-06-1243%
2026-09-01
Quelle geprüft
58MiMo-V2.5-ProXiaomi2026-04-2242.9%
2026-09-01
Quelle geprüft
59Inkling (xhigh)Other2026-07-1542.3%
2026-09-01
Quelle geprüft
60Hy3Other2026-07-0642.2%
2026-09-01
Quelle geprüft
61Claude Opus 4.5 (Reasoning)Anthropic2025-11-2441.9%
2026-09-01
Quelle geprüft
62Nex-N2-ProOther2026-06-0241.7%
2026-09-01
Quelle geprüft
63Solar Pro 4Other2026-08-0641.6%
2026-09-01
Quelle geprüft
64MiMo-V2-ProXiaomi2026-03-1841.4%
2026-09-01
Quelle geprüft
65GPT-5.2 Codex (xhigh)OpenAI2025-12-1141.2%
2026-09-01
Quelle geprüft
66Inkling SmallOther2026-07-3041.2%
2026-09-01
Quelle geprüft
67Qwen3.6 Max PreviewAlibaba2026-04-2041.1%
2026-09-01
Quelle geprüft
68GLM-5.1Zhipu2026-04-0741%
2026-09-01
Quelle geprüft
69GPT-5.4 MiniOpenAI2026-03-1740.9%
2026-09-01
Quelle geprüft
70Grok Build 0.1 0616xAI2026-06-1640.7%
2026-09-01
Quelle geprüft
71Gemini 3 ProGoogle2025-11-1840.6%
2026-09-01
Quelle geprüft
72GLM-5 (Reasoning)Zhipu2026-02-1140.6%
2026-09-01
Quelle geprüft
73Qwen3.6 PlusAlibaba2026-04-0240.5%
2026-09-01
Quelle geprüft
74GPT-5.4 (low)OpenAI2026-03-0540.2%
2026-09-01
Quelle geprüft
75JT-4.1 Flash 236B A21BOther2026-07-0939.9%
2026-09-01
Quelle geprüft
76Agnes 2.5 Pro AlphaOther2026-07-2439.7%
2026-09-01
Quelle geprüft
77GPT-5.4 NanoOpenAI2026-03-1739.7%
2026-09-01
Quelle geprüft
78Qwen 3.7 PlusAlibaba2026-06-0239.4%
2026-09-01
Quelle geprüft
79GLM-5-TurboZhipu2026-03-1539.1%
2026-09-01
Quelle geprüft
80DeepSeek V4 Flash (Reasoning, High Effort)DeepSeek2026-04-2439%
2026-09-01
Quelle geprüft
81GPT-5.2 (medium)OpenAI2025-12-1138.9%
2026-09-01
Quelle geprüft
82MiniMax M2.7MiniMax2026-04-1538.9%
2026-09-01
Quelle geprüft
83Claude Opus 4.6Anthropic2026-02-0538.8%
2026-09-01
Quelle geprüft
84Gemini 3 Flash Preview (Reasoning)Google2025-12-1738.7%
2026-09-01
Quelle geprüft
85Nemotron 3 Ultra 550B A55B (Reasoning)NVIDIA2026-06-0438.3%
2026-09-01
Quelle geprüft
86Grok 4.20 ReasoningxAI2026-03-0538%
2026-09-01
Quelle geprüft
87MiMo-V2.5Xiaomi2026-04-2238%
2026-09-01
Quelle geprüft
88Grok 4.3xAI2026-04-3037.9%
2026-09-01
Quelle geprüft
89Ling 3.0 FlashOther2026-08-0437.8%
2026-09-01
Quelle geprüft
90Qwen3.6 27B (Reasoning)Alibaba2026-04-2237.7%
2026-09-01
Quelle geprüft
91GPT-5.1OpenAI2025-11-1337.5%
2026-09-01
Quelle geprüft
92Claude 4.5 Sonnet (Reasoning)Anthropic2025-09-2937.4%
2026-09-01
Quelle geprüft
93Gemini 3.5 Flash-LiteGoogle2026-07-2137.4%
2026-09-01
Quelle geprüft
94Grok 4.20 0309 (Reasoning)xAI2026-03-1037.4%
2026-09-01
Quelle geprüft
95Solar Open2 250BOther2026-08-1237.4%
2026-09-01
Quelle geprüft
96MiMo-V2-Omni-0327Xiaomi2026-03-2737.3%
2026-09-01
Quelle geprüft
97GPT-5 Codex (high)OpenAI2025-09-2337%
2026-09-01
Quelle geprüft
98Grok 4.3 (medium)xAI2026-04-3036.9%
2026-09-01
Quelle geprüft
99Claude Sonnet 4.6Anthropic2026-02-1736.8%
2026-09-01
Quelle geprüft
100Grok 4.3 (low)xAI2026-04-3036.3%
2026-09-01
Quelle geprüft
101Kimi K2.5Moonshot2026-01-2736%
2026-09-01
Quelle geprüft
102MiMo-V2-OmniXiaomi2026-03-1935.9%
2026-09-01
Quelle geprüft
103Gemini 3.5 Flash (minimal)Google2026-05-1935.8%
2026-09-01
Quelle geprüft
104GPT-5.5 (Non-reasoning)OpenAI2026-04-2335.8%
2026-09-01
Quelle geprüft
105Claude Opus 4.5Anthropic2025-11-2435.6%
2026-09-01
Quelle geprüft
106GPT-5.1 Codex (high)OpenAI2025-11-1335.6%
2026-09-01
Quelle geprüft
107Kimi K2.6 (Non-reasoning)Other2026-04-2035.4%
2026-09-01
Quelle geprüft
108GLM 5V Turbo (Reasoning)Zhipu2026-04-0135.3%
2026-09-01
Quelle geprüft
109GPT-5 (high)OpenAI2025-08-0735.3%
2026-09-01
Quelle geprüft
110Claude Sonnet 4.6 (Non-reasoning, Low Effort)Anthropic2026-02-1735.1%
2026-09-01
Quelle geprüft
111Muse GlimmerMeta2026-08-1035.1%
2026-09-01
Quelle geprüft
112A.X-K2Other2026-08-1235%
2026-09-01
Quelle geprüft
113GLM-5.2 (Non-reasoning)Zhipu2026-06-1634.8%
2026-09-01
Quelle geprüft
114GPT-5 (medium)OpenAI2025-08-0734.6%
2026-09-01
Quelle geprüft
115Qwen3.5 27B (Reasoning)Alibaba2026-02-2434.6%
2026-09-01
Quelle geprüft
116Claude 4.1 Opus (Reasoning)Anthropic2025-08-0534.5%
2026-09-01
Quelle geprüft
117GLM-4.7 (Reasoning)Zhipu2025-12-2234.5%
2026-09-01
Quelle geprüft
118MiniMax M2.5MiniMax2026-04-0134.5%
2026-09-01
Quelle geprüft
119Hy3-preview (Reasoning)Other2026-04-2334.4%
2026-09-01
Quelle geprüft
120GPT-5.5 Instant (May 2026)OpenAI2026-05-0534.3%
2026-09-01
Quelle geprüft
121Qwen3.5 397B A17B (Reasoning)Alibaba2026-02-1634.3%
2026-09-01
Quelle geprüft
122Grok 4xAI2025-07-1034.1%
2026-09-01
Quelle geprüft
123G9v3-39A5BOther2026-08-0334%
2026-09-01
Quelle geprüft
124LongCat-2.0Meituan2026-06-2934%
2026-09-01
Quelle geprüft
125MiMo-V2-Flash (Feb 2026)Xiaomi2025-12-1634%
2026-09-01
Quelle geprüft
126Gemini 3 Pro Preview (low)Google2025-11-1833.9%
2026-09-01
Quelle geprüft
127KAT Coder Pro V2Other2026-03-2733.7%
2026-09-01
Quelle geprüft
128Kimi K2 ThinkingMoonshot2025-11-0633.5%
2026-09-01
Quelle geprüft
129o3-proOpenAI2025-06-1033.3%
2026-09-01
Quelle geprüft
130GLM-5 (Non-reasoning)Zhipu2026-02-1133.2%
2026-09-01
Quelle geprüft
131DeepSeek V3.2 (Reasoning)DeepSeek2025-12-0132.8%
2026-09-01
Quelle geprüft
132Qwen3.5 122B A10B (Reasoning)Alibaba2026-02-2432.8%
2026-09-01
Quelle geprüft
133Qwen3.5 397B A17B (Non-reasoning)Alibaba2026-02-1632.7%
2026-09-01
Quelle geprüft
134Qwen3 Max ThinkingAlibaba2026-01-2632.5%
2026-09-01
Quelle geprüft
135MiniMax-M2.1MiniMax2025-12-2332.1%
2026-09-01
Quelle geprüft
136Qwen3.6 35B A3B (Reasoning)Alibaba2026-04-1632.1%
2026-09-01
Quelle geprüft
137DeepSeek V4 Pro (Non-reasoning)DeepSeek2026-04-2431.9%
2026-09-01
Quelle geprüft
138GPT-5 (low)OpenAI2025-08-0731.9%
2026-09-01
Quelle geprüft
139MiMo-V2-Flash (Reasoning)Xiaomi2025-12-1631.9%
2026-09-01
Quelle geprüft
140Claude 4 Opus (Reasoning)Anthropic2025-05-2231.7%
2026-09-01
Quelle geprüft
141Ring-2.6-1TOther2026-05-0831.7%
2026-09-01
Quelle geprüft
142Qwen3.6 27B (Non-reasoning)Alibaba2026-04-2231.3%
2026-09-01
Quelle geprüft
143OpenAI o3OpenAI2025-04-1631.1%
2026-09-01
Quelle geprüft
144K-EXAONE 2.0 0803Other2026-08-1231%
2026-09-01
Quelle geprüft
145Step 3.7 FlashStepFun2026-06-0130.9%
2026-09-01
Quelle geprüft
146Mistral Medium 3.5Mistral2026-04-2930.4%
2026-09-01
Quelle geprüft
147Gemma 4 31B ITGoogle2026-03-0129.7%
2026-09-01
Quelle geprüft
148DeepSeek V4 Flash (Non-reasoning)DeepSeek2026-04-2429.3%
2026-09-01
Quelle geprüft
149GPT-5.5 Instant (June 2026)OpenAI2026-06-2529.2%
2026-09-01
Quelle geprüft
150JT-35B-FlashOther2026-05-1429%
2026-09-01
Quelle geprüft
151MiMo-V2.5-Pro (Non-reasoning)Xiaomi2026-04-2228.4%
2026-09-01
Quelle geprüft
152Gemini 3 Flash PreviewGoogle2025-12-1727.9%
2026-09-01
Quelle geprüft
153Hy3-preview (Non-reasoning)Other2026-04-2326.6%
2026-09-01
Quelle geprüft
154Ling-2.6-1TOther2026-04-2326.6%
2026-09-01
Quelle geprüft
155Gemini 3.1 Flash LiteGoogle2026-05-0725.6%
2026-09-01
Quelle geprüft
156Grok 4.3 (Non-reasoning)xAI2026-04-3025%
2026-09-01
Quelle geprüft
157Qwen3.6 35B A3B (Non-reasoning)Alibaba2026-04-1624.6%
2026-09-01
Quelle geprüft
158Ling 3.0 TinyOther2026-08-0624.5%
2026-09-01
Quelle geprüft
159OpenAI o1OpenAI2024-09-1223.9%
2026-09-01
Quelle geprüft
160Granite 4.2 30BOther2026-08-2523.7%
2026-09-01
Quelle geprüft
161Nemotron 3.5 LightningNVIDIA2026-08-1123.6%
2026-09-01
Quelle geprüft
162Command ACohere2026-03-1522.8%
2026-09-01
Quelle geprüft
163Gemma 4 12B (Reasoning)Google2026-06-0722.2%
2026-09-01
Quelle geprüft
164Grok 4.20 0309 v2 (Non-reasoning)xAI2026-04-0722.2%
2026-09-01
Quelle geprüft
165EXAONE 4.5 33BOther2026-04-0920.5%
2026-09-01
Quelle geprüft
166DeepSeek R1DeepSeek2025-01-2020.4%
2026-09-01
Quelle geprüft
167North Mini CodeCohere2026-06-0920.2%
2026-09-01
Quelle geprüft
168Granite 4.2 8BOther2026-08-2519.6%
2026-09-01
Quelle geprüft
169JT-MINIOther2026-04-1518.8%
2026-09-01
Quelle geprüft
170HyperNova 60B 2605Multiverse2026-05-0618.3%
2026-09-01
Quelle geprüft
171G9v3-3BOther2026-07-2316.2%
2026-09-01
Quelle geprüft
172Mistral Large 3Mistral2025-12-0215.9%
2026-09-01
Quelle geprüft
173Nemotron 3 Nano Omni 30B A3B ReasoningNVIDIA2026-04-2915%
2026-09-01
Quelle geprüft
174Llama 4 MaverickMeta2026-04-0514.5%
2026-09-01
Quelle geprüft
175Granite 4.2 3BOther2026-08-2514.3%
2026-09-01
Quelle geprüft
176Ling 2.6 FlashOther2026-04-2114.2%
2026-09-01
Quelle geprüft
177DiffusionGemma 26B A4BGoogle2026-06-1013.5%
2026-09-01
Quelle geprüft
178Gemma 4 12B (Non-reasoning)Google2026-06-1013.2%
2026-09-01
Quelle geprüft
179MiniCPM5-1B (Reasoning)OpenBMB2026-06-0411.9%
2026-09-01
Quelle geprüft
180Claude 3 OpusAnthropic2024-03-0411.8%
2026-09-01
Quelle geprüft
181MiniCPM5-1B (Non-reasoning)OpenBMB2026-05-2511.7%
2026-09-01
Quelle geprüft
182Llama 4 ScoutMeta2026-04-0510.3%
2026-09-01
Quelle geprüft
183Granite 4.1 30BOther2026-04-298.7%
2026-09-01
Quelle geprüft
184LFM2.5-8B-A1BLiquid2026-06-088.1%
2026-09-01
Quelle geprüft
185DeepSeek Coder V2DeepSeek2024-05-154.7%
2026-09-01
Quelle geprüft
186Gemini 1.0 UltraGoogle2024-02-084.3%
2026-09-01
Quelle geprüft
187MiniCPM-V 4.6 1.3BOpenBMB2026-05-113.8%
2026-09-01
Quelle geprüft
Methode

Was er abdeckt

Frontier-Zeilen vom 2026-09-05 stammen von öffentlichen AA-Modellseiten auf Intelligence Index v4.2. Der committete API-Snapshot ist weiter 2026-09-01 (v4.1). AA-Briefcase und GDP.pdf haben noch keine eigenen VerdictPal-Erklärseiten — es fehlen fünf unabhängig extrahierte Modellzeilen.

Score-Obergrenze

Wo er an Grenzen stößt

v4.2 hat AA-Briefcase (15 %) und GDP.pdf (10 %) ergänzt und GPQA Diamond entfernt. v4.2-Headlines nicht mit v4.1 oder AA-Index-Versionen vor 2026 vergleichen. API-Snapshot-Zeilen vom 1. Sep. im Ledger sind v4.1; per Hand aktualisierte Frontier-Zeilen vom 5. Sep. 2026 sind v4.2.

Tools, die ihn ausweisen

Belege

Quellen und weiterführende Lektüre

Fragen zu diesem Benchmark

Jede Antwort unten stammt aus den datierten Feldern dieser Seite. Nichts davon ist zusätzlich für Suchmaschinen geschrieben.

Was misst Artificial Analysis Intelligence Index?

AA Intelligence Index v4.2 — gewichteter Composite über vier Kategorien: Agents 30 % (AA-Briefcase 15 %, GDPval-AA v2 10 %, τ³-Banking 5 %), Coding 20 % (Terminal-Bench 2.1 10 %, SciCode 10 %), Scientific Reasoning 20 % (HLE 10 %, CritPt 10 %), General 30 % (AA-Omniscience-Accuracy 10 % + Non-Hallucination 5 %, GDP.pdf 10 %, AA-LCR v1.1 5 %).

Was beweist ein hoher Artificial Analysis Intelligence Index-Wert nicht?

Ein starkes Artificial Analysis Intelligence Index-Ergebnis sagt nichts aus über:

  • Latenz, Kosten-pro-Token und Durchsatz — der Index ist reine Intelligenz. Für $/1M-Token die AA-API parallel nutzen.
  • Multilinguale oder multimodale Fähigkeit — AA testet Bild, Sprache und Mehrsprachigkeit in separaten Indizes.
  • Keinen einzelnen Sub-Test isoliert — ein hoher Composite kann schwache Agentic- oder Coding-Anteile verdecken.
  • v4.1-Headlines — GPQA Diamond hat den Index in v4.2 verlassen; AA-Briefcase und GDP.pdf sind dazugekommen. Ein Rückgang gegenüber einem September-v4.1-Score ist meist Neuzusammensetzung, kein schwächeres Modell.

Wie wird Artificial Analysis Intelligence Index bewertet?

Gewichteter Prozentsatz über vier Kategorien (Agents 30 %, Coding 20 %, Scientific Reasoning 20 %, General 30 %). AA schätzt ein 95-%-CI unter ±1 % auf dem Composite bei genug Repeats. Aufgabenformat: Composite aus zehn versionierten Sub-Evaluationen mit öffentlichen Kategorie-Gewichten. Die Methodik-Seite listet Fragenzahlen, Repeats und Scoring pro Eval. AA-Briefcase und GDP.pdf sind neu in v4.2.

Ist Artificial Analysis Intelligence Index gesättigt?

Artificial Analysis Intelligence Index ist im Atlas derzeit als Aktiv markiert.

Können Artificial Analysis Intelligence Index-Ergebnisse durch Trainingsdaten verunreinigt sein?

Das Kontaminationsrisiko für Artificial Analysis Intelligence Index ist als Kontamination mittel eingestuft. Behandle jede Zeile auf dieser Seite als öffentliche Angabe mit Quelle und Datum, nicht als kontrolliertes Experiment.

The Pack · Redaktionsnewsletter

Neue Tools in dein Postfach. Kostenlos.

Eine kurze E-Mail, wenn ein Tool erscheint oder den Status wechselt. Kein Tracking, keine Drittanbieter-Analytics. Abmeldung mit einem Klick.