Benchmarks / Reasoning

Artificial Analysis Intelligence Index

AA Intelligence Index

AA Intelligence Index v4.3 — gewichteter Composite über vier Kategorien: Agents 30 % (AA-Briefcase 15 %, GDPval-AA v2 10 %, AutomationBench-AA 5 %), Coding 20 % (Terminal-Bench v4.0 10 %, SciCode 10 %), Scientific Reasoning 20 % (HLE 10 %, CritPt 10 %), General 30 % (AA-Omniscience-Accuracy 10 % + Non-Hallucination 5 %, GDP.pdf 10 %, AA-LCR v1.1 5 %).

Was dieser Benchmark nicht misst
  • Latenz, Kosten-pro-Token und Durchsatz — der Index ist reine Intelligenz. Für $/1M-Token die AA-API parallel nutzen.
  • Multilinguale oder multimodale Fähigkeit — AA testet Bild, Sprache und Mehrsprachigkeit in separaten Indizes.
  • Keinen einzelnen Sub-Test isoliert — ein hoher Composite kann schwache Agentic- oder Coding-Anteile verdecken.
Analyse

Warum dieser Benchmark nützlich ist

Single-Number-Modell-Rankings verstecken Trade-offs. Der AA Intelligence Index ist ein gewichteter Composite aus öffentlichen Sub-Evals — nützlich als datierter Frontier-Snapshot, wenn man die Slices liest, nicht als universeller Qualitätswert.

Umfang

Abdeckung

Aufgabenfamilie
Reasoning
Format
Composite aus zehn versionierten Sub-Evaluationen mit öffentlichen Kategorie-Gewichten. Die Methodik-Seite listet Fragenzahlen, Repeats und Scoring pro Eval. v4.3 behält die v4.2-Kategoriegewichte; der Anteil privater Aufgaben steigt von 40 % auf 45 %. AutomationBench-AA und Terminal-Bench v4.0 sind neu im Composite.
Bewertung
Gewichteter Prozentsatz über vier Kategorien (Agents 30 %, Coding 20 %, Scientific Reasoning 20 %, General 30 %). AA schätzt ein 95-%-CI unter ±1 % auf dem Composite bei genug Repeats.
Verantwortliche Stelle
Artificial Analysis
Lesehilfe

So liest du die Scores

Öffne die Methodik-Seite für v4.3-Gewichte, dann jede Sub-Eval. Im API-Snapshot vom 10. Sep. 2026 steht das kanonische Max-Effort-Board bei Fable 5.1 mit 53,4, GPT-6 Astra mit 52,8, Opus 5 mit 50,7, Fable 5 mit 49,7, Muse Spark 1.3 mit 48,2, dann GPT-5.6 Sol mit 47,1. Grok 4.6 High ist 44,4; Gemini 3.8 Flash kanonisch 41,2.

Blinde Flecken

Was er nicht abdeckt

  • Latenz, Kosten-pro-Token und Durchsatz — der Index ist reine Intelligenz. Für $/1M-Token die AA-API parallel nutzen.
  • Multilinguale oder multimodale Fähigkeit — AA testet Bild, Sprache und Mehrsprachigkeit in separaten Indizes.
  • Keinen einzelnen Sub-Test isoliert — ein hoher Composite kann schwache Agentic- oder Coding-Anteile verdecken.
  • Ältere Index-Headlines — v4.2 hat GPQA Diamond entfernt und AA-Briefcase plus GDP.pdf ergänzt; v4.3 hat τ³-Banking durch AutomationBench-AA ersetzt und Terminal-Bench auf v4.0 gehoben. Ein Rückgang gegenüber einem v4.1- oder v4.2-Score ist meist Neuzusammensetzung, kein schwächeres Modell.
Scores

Evidenz-Ledger

188 Zeilen
188188 Zeilen
53.4%bester Score
188quellgeprüft
1Quellen
2026-09-10Quelldatum
188

api · api

Verteilung

Wo die Zeilen liegen

0255075100

Auf die Skala dieses Benchmarks normalisiert (0–100). Die Tabelle zeigt die Rohwerte.

Zeitverlauf

Neueste Belege

  1. Claude Fable 5.153.4% ·
  2. GPT-6 Astra52.8% ·
  3. Claude Opus 5 (Adaptive Reasoning, Max Effort)50.7% ·
  4. Claude Fable 549.7% ·
  5. Claude Opus 5 (Adaptive Reasoning, Xhigh Effort)49.7% ·

Scores nutzen die eigene Einheit und Skala dieses Benchmarks, keinen universellen Qualitätswert.

#ModellVeröffentlichungScoreHerkunftBeleglage
1Claude Fable 5.1Anthropic2026-09-0153.4%
2026-09-10
Quelle geprüft
2GPT-6 AstraOpenAI2026-09-0352.8%
2026-09-10
Quelle geprüft
3Claude Opus 5 (Adaptive Reasoning, Max Effort)Anthropic2026-07-2450.7%
2026-09-10
Quelle geprüft
4Claude Fable 5Anthropic2026-06-0949.7%
2026-09-10
Quelle geprüft
5Claude Opus 5 (Adaptive Reasoning, Xhigh Effort)Anthropic2026-07-2449.7%
2026-09-10
Quelle geprüft
6Claude Opus 5 (Adaptive Reasoning, High Effort)Anthropic2026-07-2448.2%
2026-09-10
Quelle geprüft
7Muse Spark 1.3Meta2026-09-0248.2%
2026-09-10
Quelle geprüft
8GPT-5.6 SolOpenAI2026-07-0947.1%
2026-09-10
Quelle geprüft
9Claude Opus 5 (Adaptive Reasoning, Medium Effort)Anthropic2026-07-2445.1%
2026-09-10
Quelle geprüft
10GLM-5.3Zhipu2026-08-1444.9%
2026-09-10
Quelle geprüft
11Grok 4.6xAI2026-08-1244.4%
2026-09-10
Quelle geprüft
12Kimi K3Moonshot2026-07-1643.8%
2026-09-10
Quelle geprüft
13GPT-5.6 TerraOpenAI2026-07-0942.3%
2026-09-10
Quelle geprüft
14Qwen3.8-Flash-NextAlibaba2026-08-2642.2%
2026-09-10
Quelle geprüft
15Claude Opus 4.8Anthropic2026-05-2842%
2026-09-10
Quelle geprüft
16GLM-5.3-FlashZhipu2026-08-2641.9%
2026-09-10
Quelle geprüft
17Gemini 3.8 FlashGoogle2026-09-0241.2%
2026-09-10
Quelle geprüft
18Claude Opus 4.7Anthropic2026-04-1640.7%
2026-09-10
Quelle geprüft
19Qwen3.8 MaxAlibaba2026-08-0340.3%
2026-09-10
Quelle geprüft
20Qwen3.8 2.4T A95BAlibaba2026-08-1240%
2026-09-10
Quelle geprüft
21Claude Opus 5 (Adaptive Reasoning, Low Effort)Anthropic2026-07-2439.8%
2026-09-10
Quelle geprüft
22Muse Spark 1.2Meta2026-08-0539.8%
2026-09-10
Quelle geprüft
23Gemini 3.7 FlashGoogle2026-08-1339.4%
2026-09-10
Quelle geprüft
24Grok 4.5xAI2026-07-0839.1%
2026-09-10
Quelle geprüft
25GPT 5.4OpenAI2026-03-0539%
2026-09-10
Quelle geprüft
26GLM-5.2Zhipu2026-06-1338.6%
2026-09-10
Quelle geprüft
27GPT 5.5OpenAI2026-04-2338.6%
2026-09-10
Quelle geprüft
28Claude Sonnet 5Anthropic2026-06-3038.4%
2026-09-10
Quelle geprüft
29GPT-5.6 LunaOpenAI2026-07-0937.5%
2026-09-10
Quelle geprüft
30GPT-5.5 (high)OpenAI2026-04-2337.3%
2026-09-10
Quelle geprüft
31DeepSeek V4 Pro 0813 (Reasoning, Max Effort)DeepSeek2026-08-1336.3%
2026-09-10
Quelle geprüft
32Agnes 2.5 Pro BetaOther2026-08-2635.2%
2026-09-10
Quelle geprüft
33DeepSeek V4 Flash Vision (Reasoning, Max Effort)DeepSeek2026-08-2135%
2026-09-10
Quelle geprüft
34DeepSeek V4 Flash 0731 (Reasoning, Max Effort)DeepSeek2026-07-3134.5%
2026-09-10
Quelle geprüft
35Kimi K3 (low)Moonshot2026-07-1634.5%
2026-09-10
Quelle geprüft
36Gemini 3.6 Flash (high)Google2026-07-2134.3%
2026-09-10
Quelle geprüft
37Muse Spark 1.1Meta2026-07-0934.3%
2026-09-10
Quelle geprüft
38GPT-5.5 (medium)OpenAI2026-04-2334.2%
2026-09-10
Quelle geprüft
39K2 Horizon 375B A23BOther2026-09-0333.9%
2026-09-10
Quelle geprüft
40Qwen3.8 27BAlibaba2026-08-1433.9%
2026-09-10
Quelle geprüft
41Gemini 3.5 Flash (medium)Google2026-05-1933.6%
2026-09-10
Quelle geprüft
42Motif 3Other2026-08-1233.6%
2026-09-10
Quelle geprüft
43Gemini 3.5 FlashGoogle2026-05-1933%
2026-09-10
Quelle geprüft
44GPT-5.3 Codex (xhigh)OpenAI2026-02-0532.5%
2026-09-10
Quelle geprüft
45Motif 3 (Beta)Other2026-07-2132.3%
2026-09-10
Quelle geprüft
46Claude Opus 4.6 (Adaptive Reasoning, Max Effort)Anthropic2026-02-0531.9%
2026-09-10
Quelle geprüft
47Kimi K2.6Moonshot2026-04-2031.3%
2026-09-10
Quelle geprüft
48Muse SparkOther2026-01-0131.3%
2026-09-10
Quelle geprüft
49Claude Opus 4.7 (Non-reasoning, High Effort)Anthropic2026-04-1630.9%
2026-09-10
Quelle geprüft
50GPT-5.5 (low)OpenAI2026-04-2330.7%
2026-09-10
Quelle geprüft
51Claude Sonnet 4.6 (Adaptive Reasoning, Max Effort)Anthropic2026-02-1730.5%
2026-09-10
Quelle geprüft
52Apodex 1.1Other2026-08-3030.4%
2026-09-10
Quelle geprüft
53Gemini 3.1 Pro PreviewGoogle2026-02-1930.4%
2026-09-10
Quelle geprüft
54GPT-5.2OpenAI2025-12-1130.4%
2026-09-10
Quelle geprüft
55DeepSeek V4 Pro (Reasoning, High Effort)DeepSeek2026-04-2430.1%
2026-09-10
Quelle geprüft
56Qwen3.7 MaxAlibaba2026-05-1929.9%
2026-09-10
Quelle geprüft
57MiniMax M3MiniMax2026-05-3129.6%
2026-09-10
Quelle geprüft
58Claude Opus 4.5 (Reasoning)Anthropic2025-11-2429.1%
2026-09-10
Quelle geprüft
59MiMo-V2-ProXiaomi2026-03-1828.6%
2026-09-10
Quelle geprüft
60GPT-5.2 Codex (xhigh)OpenAI2025-12-1128.5%
2026-09-10
Quelle geprüft
61Qwen3.6 Max PreviewAlibaba2026-04-2028.4%
2026-09-10
Quelle geprüft
62Nex-N2-ProOther2026-06-0228.2%
2026-09-10
Quelle geprüft
63Solar Pro 4Other2026-08-0628.2%
2026-09-10
Quelle geprüft
64Gemini 3 ProGoogle2025-11-1828%
2026-09-10
Quelle geprüft
65GLM-5 (Reasoning)Zhipu2026-02-1127.9%
2026-09-10
Quelle geprüft
66GPT-5.4 (low)OpenAI2026-03-0527.6%
2026-09-10
Quelle geprüft
67GLM-5.1Zhipu2026-04-0727.4%
2026-09-10
Quelle geprüft
68JT-4.1 Flash 236B A21BOther2026-07-0927.3%
2026-09-10
Quelle geprüft
69Grok Build 0.1 0616xAI2026-06-1627.2%
2026-09-10
Quelle geprüft
70Qwen3.6 PlusAlibaba2026-04-0227%
2026-09-10
Quelle geprüft
71Agnes 2.5 Pro AlphaOther2026-07-2426.8%
2026-09-10
Quelle geprüft
72GPT-5.5 Instant (June 2026)OpenAI2026-06-2526.8%
2026-09-10
Quelle geprüft
73GLM-5-TurboZhipu2026-03-1526.6%
2026-09-10
Quelle geprüft
74GPT-5.2 (medium)OpenAI2025-12-1126.5%
2026-09-10
Quelle geprüft
75Claude Opus 4.6Anthropic2026-02-0526.4%
2026-09-10
Quelle geprüft
76MiMo-V2.5-ProXiaomi2026-04-2226.4%
2026-09-10
Quelle geprüft
77Gemini 3 Flash Preview (Reasoning)Google2025-12-1726.3%
2026-09-10
Quelle geprüft
78Kimi K2.7 CodeMoonshot2026-06-1226.3%
2026-09-10
Quelle geprüft
79Inkling SmallOther2026-07-3026.1%
2026-09-10
Quelle geprüft
80Hy3Other2026-07-0625.8%
2026-09-10
Quelle geprüft
81Qwen 3.7 PlusAlibaba2026-06-0225.8%
2026-09-10
Quelle geprüft
82Grok 4.20 ReasoningxAI2026-03-0525.7%
2026-09-10
Quelle geprüft
83Inkling (xhigh)Other2026-07-1525.5%
2026-09-10
Quelle geprüft
84Grok 4.3xAI2026-04-3025.4%
2026-09-10
Quelle geprüft
85Grok 4.20 0309 (Reasoning)xAI2026-03-1025.2%
2026-09-10
Quelle geprüft
86MiMo-V2-Omni-0327Xiaomi2026-03-2725.1%
2026-09-10
Quelle geprüft
87GPT-5 Codex (high)OpenAI2025-09-2324.9%
2026-09-10
Quelle geprüft
88Ling 3.0 FlashOther2026-08-0424.9%
2026-09-10
Quelle geprüft
89DeepSeek V4 Flash (Reasoning, High Effort)DeepSeek2026-04-2424.8%
2026-09-10
Quelle geprüft
90Grok 4.3 (medium)xAI2026-04-3024.8%
2026-09-10
Quelle geprüft
91Claude Sonnet 4.6Anthropic2026-02-1724.7%
2026-09-10
Quelle geprüft
92GPT-5.1OpenAI2025-11-1324.7%
2026-09-10
Quelle geprüft
93Solar Open2 250BOther2026-08-1224.7%
2026-09-10
Quelle geprüft
94GPT-5.4 MiniOpenAI2026-03-1724.6%
2026-09-10
Quelle geprüft
95Grok 4.3 (low)xAI2026-04-3024.3%
2026-09-10
Quelle geprüft
96MiMo-V2-OmniXiaomi2026-03-1923.9%
2026-09-10
Quelle geprüft
97Gemini 3.5 Flash (minimal)Google2026-05-1923.8%
2026-09-10
Quelle geprüft
98Claude Opus 4.5Anthropic2025-11-2423.7%
2026-09-10
Quelle geprüft
99GPT-5.1 Codex (high)OpenAI2025-11-1323.7%
2026-09-10
Quelle geprüft
100Kimi K2.6 (Non-reasoning)Other2026-04-2023.6%
2026-09-10
Quelle geprüft
101GLM 5V Turbo (Reasoning)Zhipu2026-04-0123.5%
2026-09-10
Quelle geprüft
102Kimi K2.5Moonshot2026-01-2723.5%
2026-09-10
Quelle geprüft
103Nemotron 3 Ultra 550B A55B (Reasoning)NVIDIA2026-06-0423.4%
2026-09-10
Quelle geprüft
104Claude Sonnet 4.6 (Non-reasoning, Low Effort)Anthropic2026-02-1723.3%
2026-09-10
Quelle geprüft
105GPT-5.5 (Non-reasoning)OpenAI2026-04-2323.2%
2026-09-10
Quelle geprüft
106MiniMax M2.7MiniMax2026-04-1523.2%
2026-09-10
Quelle geprüft
107GPT-5 (high)OpenAI2025-08-0723%
2026-09-10
Quelle geprüft
108GPT-5 (medium)OpenAI2025-08-0722.9%
2026-09-10
Quelle geprüft
109Qwen3.5 27B (Reasoning)Alibaba2026-02-2422.9%
2026-09-10
Quelle geprüft
110Claude 4.1 Opus (Reasoning)Anthropic2025-08-0522.8%
2026-09-10
Quelle geprüft
111MiniMax M2.5MiniMax2026-04-0122.8%
2026-09-10
Quelle geprüft
112A.X-K2Other2026-08-1222.7%
2026-09-10
Quelle geprüft
113Gemini 3.5 Flash-LiteGoogle2026-07-2122.7%
2026-09-10
Quelle geprüft
114GPT-5.5 Instant (May 2026)OpenAI2026-05-0522.7%
2026-09-10
Quelle geprüft
115Hy3-preview (Reasoning)Other2026-04-2322.7%
2026-09-10
Quelle geprüft
116Grok 4xAI2025-07-1022.5%
2026-09-10
Quelle geprüft
117GLM-5.2 (Non-reasoning)Zhipu2026-06-1622.4%
2026-09-10
Quelle geprüft
118MiMo-V2-Flash (Feb 2026)Xiaomi2025-12-1622.4%
2026-09-10
Quelle geprüft
119Gemini 3 Pro Preview (low)Google2025-11-1822.3%
2026-09-10
Quelle geprüft
120MiMo-V2.5Xiaomi2026-04-2222.3%
2026-09-10
Quelle geprüft
121Qwen3.6 35B A3B (Reasoning)Alibaba2026-04-1622.3%
2026-09-10
Quelle geprüft
122GLM-4.7 (Reasoning)Zhipu2025-12-2222.2%
2026-09-10
Quelle geprüft
123Kimi K2 ThinkingMoonshot2025-11-0622%
2026-09-10
Quelle geprüft
124o3-proOpenAI2025-06-1021.9%
2026-09-10
Quelle geprüft
125Qwen3.6 27B (Reasoning)Alibaba2026-04-2221.9%
2026-09-10
Quelle geprüft
126G9v3-39A5BOther2026-08-0321.8%
2026-09-10
Quelle geprüft
127GLM-5 (Non-reasoning)Zhipu2026-02-1121.8%
2026-09-10
Quelle geprüft
128KAT Coder Pro V2Other2026-03-2721.7%
2026-09-10
Quelle geprüft
129DeepSeek V3.2 (Reasoning)DeepSeek2025-12-0121.5%
2026-09-10
Quelle geprüft
130Qwen3.5 397B A17B (Non-reasoning)Alibaba2026-02-1621.4%
2026-09-10
Quelle geprüft
131Qwen3 Max ThinkingAlibaba2026-01-2621.3%
2026-09-10
Quelle geprüft
132Claude 4.5 Sonnet (Reasoning)Anthropic2025-09-2921.2%
2026-09-10
Quelle geprüft
133GPT-5.4 NanoOpenAI2026-03-1721.2%
2026-09-10
Quelle geprüft
134MiniMax-M2.1MiniMax2025-12-2320.9%
2026-09-10
Quelle geprüft
135DeepSeek V4 Pro (Non-reasoning)DeepSeek2026-04-2420.8%
2026-09-10
Quelle geprüft
136GPT-5 (low)OpenAI2025-08-0720.8%
2026-09-10
Quelle geprüft
137MiMo-V2-Flash (Reasoning)Xiaomi2025-12-1620.8%
2026-09-10
Quelle geprüft
138Claude 4 Opus (Reasoning)Anthropic2025-05-2220.6%
2026-09-10
Quelle geprüft
139OpenAI o3OpenAI2025-04-1620.2%
2026-09-10
Quelle geprüft
140Qwen3.6 27B (Non-reasoning)Alibaba2026-04-2219.8%
2026-09-10
Quelle geprüft
141K-EXAONE 2.0 0803Other2026-08-1219.7%
2026-09-10
Quelle geprüft
142LongCat-2.0Meituan2026-06-2919.7%
2026-09-10
Quelle geprüft
143Step 3.7 FlashStepFun2026-06-0119.5%
2026-09-10
Quelle geprüft
144Qwen3.5 397B A17B (Reasoning)Alibaba2026-02-1619.1%
2026-09-10
Quelle geprüft
145DeepSeek V4 Flash (Non-reasoning)DeepSeek2026-04-2418.9%
2026-09-10
Quelle geprüft
146JT-35B-FlashOther2026-05-1418.7%
2026-09-10
Quelle geprüft
147MiMo-V2.5-Pro (Non-reasoning)Xiaomi2026-04-2218.3%
2026-09-10
Quelle geprüft
148Muse GlimmerMeta2026-08-1018.1%
2026-09-10
Quelle geprüft
149Gemini 3 Flash PreviewGoogle2025-12-1717.9%
2026-09-10
Quelle geprüft
150Ring-2.6-1TOther2026-05-0817.3%
2026-09-10
Quelle geprüft
151Hy3-preview (Non-reasoning)Other2026-04-2317%
2026-09-10
Quelle geprüft
152Ling-2.6-1TOther2026-04-2317%
2026-09-10
Quelle geprüft
153Qwen3.5 122B A10B (Reasoning)Alibaba2026-02-2416.2%
2026-09-10
Quelle geprüft
154Gemini 3.1 Flash LiteGoogle2026-05-0716%
2026-09-10
Quelle geprüft
155Gemma 4 31B ITGoogle2026-03-0115.4%
2026-09-10
Quelle geprüft
156OpenAI o1OpenAI2024-09-1215.2%
2026-09-10
Quelle geprüft
157Qwen3.6 35B A3B (Non-reasoning)Alibaba2026-04-1615.2%
2026-09-10
Quelle geprüft
158Mistral Medium 3.5Mistral2026-04-2914.9%
2026-09-10
Quelle geprüft
159Granite 4.2 30BOther2026-08-2514.8%
2026-09-10
Quelle geprüft
160Grok 4.3 (Non-reasoning)xAI2026-04-3014.5%
2026-09-10
Quelle geprüft
161MiniCPM5-2BOpenBMB2026-09-0714.3%
2026-09-10
Quelle geprüft
162Gemma 4 12B (Reasoning)Google2026-06-0714.2%
2026-09-10
Quelle geprüft
163Grok 4.20 0309 v2 (Non-reasoning)xAI2026-04-0714.2%
2026-09-10
Quelle geprüft
164Nemotron 3.5 LightningNVIDIA2026-08-1113.6%
2026-09-10
Quelle geprüft
165EXAONE 4.5 33BOther2026-04-0913.2%
2026-09-10
Quelle geprüft
166DeepSeek R1DeepSeek2025-01-2013.1%
2026-09-10
Quelle geprüft
167North Mini CodeCohere2026-06-0912.8%
2026-09-10
Quelle geprüft
168Granite 4.2 8BOther2026-08-2512.4%
2026-09-10
Quelle geprüft
169JT-MINIOther2026-04-1512.2%
2026-09-10
Quelle geprüft
170Ling 3.0 TinyOther2026-08-0611.9%
2026-09-10
Quelle geprüft
171G9v3-3BOther2026-07-2310.8%
2026-09-10
Quelle geprüft
172Nemotron 3 Nano Omni 30B A3B ReasoningNVIDIA2026-04-2910.3%
2026-09-10
Quelle geprüft
173Ling 2.6 FlashOther2026-04-219.7%
2026-09-10
Quelle geprüft
174Mistral Large 3Mistral2025-12-029.7%
2026-09-10
Quelle geprüft
175DiffusionGemma 26B A4BGoogle2026-06-109.5%
2026-09-10
Quelle geprüft
176Gemma 4 12B (Non-reasoning)Google2026-06-109.4%
2026-09-10
Quelle geprüft
177Llama 4 MaverickMeta2026-04-059.3%
2026-09-10
Quelle geprüft
178Granite 4.2 3BOther2026-08-259.1%
2026-09-10
Quelle geprüft
179MiniCPM5-1B (Reasoning)OpenBMB2026-06-048.8%
2026-09-10
Quelle geprüft
180Claude 3 OpusAnthropic2024-03-048.7%
2026-09-10
Quelle geprüft
181MiniCPM5-1B (Non-reasoning)OpenBMB2026-05-258.7%
2026-09-10
Quelle geprüft
182Granite 4.1 30BOther2026-04-297.4%
2026-09-10
Quelle geprüft
183LFM2.5-8B-A1BLiquid2026-06-087.2%
2026-09-10
Quelle geprüft
184Command ACohere2026-03-157%
2026-09-10
Quelle geprüft
185Llama 4 ScoutMeta2026-04-056.5%
2026-09-10
Quelle geprüft
186DeepSeek Coder V2DeepSeek2024-05-156%
2026-09-10
Quelle geprüft
187Gemini 1.0 UltraGoogle2024-02-085.8%
2026-09-10
Quelle geprüft
188MiniCPM-V 4.6 1.3BOpenBMB2026-05-115.7%
2026-09-10
Quelle geprüft
Methode

Was er abdeckt

Composite-Scores aus der Artificial-Analysis-API vom 10. Sep. 2026. Index v4.3 erschien am 7. Sep. 2026. Die API publiziert τ³-Banking und Terminal-Bench 2.1 weiter als eigene Schlüssel; diese Seiten sind nicht die v4.3-Coding/Agents-Slices. AA-Briefcase, GDP.pdf und AutomationBench-AA bleiben API-opak.

Score-Obergrenze

Wo er an Grenzen stößt

v4.3-Headlines nicht mit v4.2, v4.1 oder AA-Index-Versionen vor 2026 vergleichen. Ledger-Zeilen vom 10. Sep. 2026 sind v4.3-API-Composites. AA-Briefcase, GDP.pdf und AutomationBench-AA haben noch keine eigenen VerdictPal-Erklärseiten — die öffentliche API legt diese Evaluationsschlüssel noch nicht offen.

Tools, die ihn ausweisen

Belege

Quellen und weiterführende Lektüre

Fragen zu diesem Benchmark

Jede Antwort unten stammt aus den datierten Feldern dieser Seite. Nichts davon ist zusätzlich für Suchmaschinen geschrieben.

Was misst Artificial Analysis Intelligence Index?

AA Intelligence Index v4.3 — gewichteter Composite über vier Kategorien: Agents 30 % (AA-Briefcase 15 %, GDPval-AA v2 10 %, AutomationBench-AA 5 %), Coding 20 % (Terminal-Bench v4.0 10 %, SciCode 10 %), Scientific Reasoning 20 % (HLE 10 %, CritPt 10 %), General 30 % (AA-Omniscience-Accuracy 10 % + Non-Hallucination 5 %, GDP.pdf 10 %, AA-LCR v1.1 5 %).

Was beweist ein hoher Artificial Analysis Intelligence Index-Wert nicht?

Ein starkes Artificial Analysis Intelligence Index-Ergebnis sagt nichts aus über:

  • Latenz, Kosten-pro-Token und Durchsatz — der Index ist reine Intelligenz. Für $/1M-Token die AA-API parallel nutzen.
  • Multilinguale oder multimodale Fähigkeit — AA testet Bild, Sprache und Mehrsprachigkeit in separaten Indizes.
  • Keinen einzelnen Sub-Test isoliert — ein hoher Composite kann schwache Agentic- oder Coding-Anteile verdecken.
  • Ältere Index-Headlines — v4.2 hat GPQA Diamond entfernt und AA-Briefcase plus GDP.pdf ergänzt; v4.3 hat τ³-Banking durch AutomationBench-AA ersetzt und Terminal-Bench auf v4.0 gehoben. Ein Rückgang gegenüber einem v4.1- oder v4.2-Score ist meist Neuzusammensetzung, kein schwächeres Modell.

Wie wird Artificial Analysis Intelligence Index bewertet?

Gewichteter Prozentsatz über vier Kategorien (Agents 30 %, Coding 20 %, Scientific Reasoning 20 %, General 30 %). AA schätzt ein 95-%-CI unter ±1 % auf dem Composite bei genug Repeats. Aufgabenformat: Composite aus zehn versionierten Sub-Evaluationen mit öffentlichen Kategorie-Gewichten. Die Methodik-Seite listet Fragenzahlen, Repeats und Scoring pro Eval. v4.3 behält die v4.2-Kategoriegewichte; der Anteil privater Aufgaben steigt von 40 % auf 45 %. AutomationBench-AA und Terminal-Bench v4.0 sind neu im Composite.

Ist Artificial Analysis Intelligence Index gesättigt?

Artificial Analysis Intelligence Index ist im Atlas derzeit als Aktiv markiert.

Können Artificial Analysis Intelligence Index-Ergebnisse durch Trainingsdaten verunreinigt sein?

Das Kontaminationsrisiko für Artificial Analysis Intelligence Index ist als Kontamination mittel eingestuft. Behandle jede Zeile auf dieser Seite als öffentliche Angabe mit Quelle und Datum, nicht als kontrolliertes Experiment.

The Pack · Redaktionsnewsletter

Neue Tools in dein Postfach. Kostenlos.

Eine kurze E-Mail, wenn ein Tool erscheint oder den Status wechselt. Kein Tracking, keine Drittanbieter-Analytics. Abmeldung mit einem Klick.