Benchmarks / Reasoning
Artificial Analysis Intelligence Index
AA Intelligence Index
AA Intelligence Index v4.1 — gewichteter Composite mit Fokus auf agentische Workloads: GDPval-AA v2 (20 %), Terminal-Bench 2.1 (16 %), τ³-Bench Banking (14 %), Humanity's Last Exam (12 %), AA-Omniscience (12 %), SciCode (8 %), GPQA Diamond (6 %), AA-LCR (6 %), CritPt (6 %). IFBench wegen Sättigung entfernt.
Was dieser Benchmark nicht misst- Latenz, Kosten-pro-Token und Durchsatz — der Index ist reine Intelligenz. Für $/1M-Token die AA-API parallel nutzen.
- Multilinguale oder multimodale Fähigkeit — AA testet Bild, Sprache und Mehrsprachigkeit in separaten Indizes.
- Keinen einzelnen Sub-Test isoliert — ein hoher Composite kann schwache Agentic- oder Coding-Anteile verdecken.