OpenAIs Flaggschiff April 2026. Vals-Index 67,62 % (#2), AA-Index 60,2 (#2), Terminal-Bench 2.0 82,0 %, ARC-AGI-2 85 % (Spitze). LMArena-Elo 1473 seit April 2026. 512K-Kontext, $12,50 / $50 pro 1M Tokens.
Bester Generalist für Coding-Agents, Research-Workflows und tool-lastige Automatisierung. Das Modell, zu dem der Desk greift, wenn Coding-Agents ein Issue in einem Durchlauf schließen sollen.
#6 von 24 im Vals Index · aktueller Snapshot
68 Vals Index · 31 Benchmark-Zeilen · 14 QuellenPosition ist benchmark-spezifisch — kein Cross-Family- oder Cross-Source-Ranking.
Bester veröffentlichter Score je abgedeckter Benchmark-Familie.
87/100 Ø
050100
Wissen
91
Reasoning
85
Mathe
92
Coding
96
Agentisch
100
Multimodal
72
Langer Kontext
56
Tool-Nutzung
87
Sicherheit
91
Menschliche Präferenz
95
10 getestete Benchmark-Familien
Redaktionsnotiz
GPT 5.5 ist das Modell, zu dem der Desk greift, wenn Coding-Agents ein Issue in einem Durchlauf schließen sollen. Terminal-Bench 2.0 (82,0 %) und SWE-bench Verified (82,5 %) sind reproduzierbare Zahlen, keine Vendor-Slides. Die LMArena-Elo-Führung ist die meistzitierte Zahl auf dem öffentlichen Markt.
Benchmark-Platzierungen
Positionen pro Benchmark
Wo GPT 5.5 auf jeder öffentlichen Benchmark-Quelle mit Zeile steht. Rang zählt jedes Modell mit neuester Zeile im selben Test — kein universeller Qualitätsscore.
Ein hoher Composite, der eine schwache Family versteckt, ist eine Falle. Diese Balken zeigen Families ohne öffentlichen Test — und wo das Modell führt.
Wissen91
Reasoning85
Mathe92
Coding96
Agentisch100
Multimodal72
Langer Kontext56
Tool-Nutzung87
Sicherheit91
Menschliche Präferenz95
Preis vs. Performance
Wo GPT 5.5 im Scatter liegt
Hover auf einen Punkt zeigt Name, Score und Input-Preis. Per Tastatur: die zwölf besten mit Tab durchgehen oder die Rangliste unten nutzen.