90.8%
MMLU
Modelle / OpenAI
GPT 5 · Release 2026-04-23
OpenAIs Flaggschiff April 2026. Vals-Index 67,62 % (#2), AA-Index 60,2 (#2), Terminal-Bench 2.0 82,0 %, ARC-AGI-2 85 % (Spitze). LMArena-Elo 1473 seit April 2026. 512K-Kontext, $12,50 / $50 pro 1M Tokens.
Bester Generalist für Coding-Agents, Research-Workflows und tool-lastige Automatisierung. Das Modell, zu dem der Desk greift, wenn Coding-Agents ein Issue in einem Durchlauf schließen sollen.
87average across 10 tested families
Wo GPT 5.5 auf jeder öffentlichen Benchmark-Quelle mit Zeile steht. Rang zählt jedes Modell mit neuester Zeile im selben Test — kein universeller Qualitätsscore.
Die drei höchstscorierenden kartierten Modelle pro Capability-Family. Wo GPT 5.5 auftaucht, ist es hervorgehoben.
Benchmark-Zeilen im öffentlichen Ledger für GPT 5.5 in den letzten 120 Tagen. Ältere Zeilen stehen in der vollen Tabelle unten.
Ein hoher Composite, der eine schwache Family versteckt, ist eine Falle. Diese Balken zeigen Families ohne öffentlichen Test — und wo das Modell führt.
Hover or tab any dot for name, score, and input price.
Jeder Katalog-Benchmark für GPT 5.5. Scores verlinken zur Originalquelle; Lücken heißen: noch keine öffentliche Zeile.
28 of 32 catalog benchmarks have a sourced row for GPT 5.5.
85%
ARC-AGI-2 semi-private
54.8%
AA Intelligence Index v4.1
81.2%
GPQA Diamond accuracy (CoT)
44.3%
HLE (AA run)
75.85%
IFBench (AA run)
69.8%
LiveBench
67%
DeepSWE pass@1 (xhigh effort)
96.2% pass@1
HumanEval
56.1%
SciCode (AA run)
82.5%
SWE-bench Verified
1531
GDPval-AA v2
82%
Terminal-Bench 2.0 (audited harness)
68%
Vals Index
7523.84
Final bank balance (USD)
54.8%
τ³-Bench Banking pass@1
71.8%
MMMU
52.1%
AA-LCR pass@1
56.1%
LongBench v2
90 t/s
Median output tokens/s (1k prompt, default provider)
31.38s
Median time to first token (1k prompt, default provider)
90.6%
HELM Safety
1473
LMArena Elo (Style Controlled)