Modelle / OpenAI

GPT 5.5

GPT 5 · Release 2026-04-23

OpenAIs Flaggschiff April 2026. Vals-Index 67,62 % (#2), AA-Index 60,2 (#2), Terminal-Bench 2.0 82,0 %, ARC-AGI-2 85 % (Spitze). LMArena-Elo 1473 seit April 2026. 512K-Kontext, $12,50 / $50 pro 1M Tokens.

Bester Generalist für Coding-Agents, Research-Workflows und tool-lastige Automatisierung. Das Modell, zu dem der Desk greift, wenn Coding-Agents ein Issue in einem Durchlauf schließen sollen.

#6 von 24 im Vals Index · aktueller Snapshot
68 Vals Index · 31 Benchmark-Zeilen · 14 QuellenPosition ist benchmark-spezifisch — kein Cross-Family- oder Cross-Source-Ranking.
Composite71
Kontext512K
Input / 1M$13
Output / 1M$50
Wissensstichtag2026-03-15
Statusflagship

Familienprofil

Bester veröffentlichter Score je abgedeckter Benchmark-Familie.

87/100 Ø
Wissen
91
Reasoning
85
Mathe
92
Coding
96
Agentisch
100
Multimodal
72
Langer Kontext
56
Tool-Nutzung
87
Sicherheit
91
Menschliche Präferenz
95

10 getestete Benchmark-Familien

Redaktionsnotiz
GPT 5.5 ist das Modell, zu dem der Desk greift, wenn Coding-Agents ein Issue in einem Durchlauf schließen sollen. Terminal-Bench 2.0 (82,0 %) und SWE-bench Verified (82,5 %) sind reproduzierbare Zahlen, keine Vendor-Slides. Die LMArena-Elo-Führung ist die meistzitierte Zahl auf dem öffentlichen Markt.
Benchmark-Platzierungen

Wo GPT 5.5 auf jeder öffentlichen Benchmark-Quelle mit Zeile steht. Rang zählt jedes Modell mit neuester Zeile im selben Test — kein universeller Qualitätsscore.

BenchmarkFamilyRangScoreQuelleDatum
LMArena (Chatbot Arena)Human preference#1/ 1395LMArena leaderboard2026-05-25
ARC-AGIReasoning#2/ 1485ARC Prize leaderboard2026-05-15
BFCLTool use#2/ 2087Berkeley Function Calling Leaderboard V42026-04-15
FrontierMathMath#2/ 1552Epoch AI FrontierMath Tiers 1-3 (v2) CSV2026-08-15
HumanEvalCoding#2/ 1596CodeSOTA HumanEval leaderboard2026-04-23
MMMUMultimodal#2/ 872MMMU leaderboard2026-04-23
GDPvalAgentic#3/ 6100Artificial Analysis — GDPval-AA v22026-06-17
HELM SafetySafety#3/ 991Stanford HELM leaderboard2026-04-23
LiveBenchReasoning#3/ 2170LiveBench leaderboard2026-04-15
LongBench v2Long context#3/ 1956LongBench v2 leaderboard2026-04-01
MCP AtlasTool use#3/ 1078MCP Atlas leaderboard2026-06-09
MMLUKnowledge#3/ 2291OpenAI model release notes2025-12-01
DeepSWECoding#4/ 867DeepSWE leaderboard v1.12026-06-20
SWE-bench VerifiedCoding#4/ 2383SWE-bench Verified leaderboard2026-06-01
AA-OmniscienceKnowledge#5/ 1257Artificial Analysis — AA-Omniscience2026-09-01
Vals IndexAgentic#6/ 2368Vals AI — Vals Index2026-06-04
Vending-Bench 2Agentic#6/ 10Andon Labs Vending-Bench 22026-08-04
CritPtReasoning#7/ 1227Artificial Analysis — CritPt2026-09-01
MATHMath#9/ 2590OpenAI model release notes2026-04-23
SciCodeCoding#10/ 18056Artificial Analysis2026-09-01
Humanity's Last ExamReasoning#12/ 18046Artificial Analysis2026-09-01
Artificial Analysis Intelligence IndexReasoning#14/ 18756Artificial Analysis2026-09-01
AIMEMath#15/ 3792OpenAI model release notes2026-04-23
Terminal-BenchAgentic#17/ 18482Terminal-Bench 2.0 leaderboard2026-05-20
τ³-Bench BankingAgentic#20/ 10639Artificial Analysis2026-09-01
IFBenchReasoning#22/ 12776Artificial Analysis2026-09-01
MMLU-ProKnowledge#28/ 3982MMLU-Pro HuggingFace leaderboard2026-04-23
AA time to first tokenPerformance#124/ 186Artificial Analysis2026-09-01
AA output speedPerformance#125/ 187Artificial Analysis2026-09-01
GPQA DiamondReasoning#131/ 18581GPQA Diamond paper leaderboard2026-05-15
AA-LCRLong context#148/ 17952Artificial Analysis — AA-LCR2026-06-17
Family-Kontext

Die drei höchstscorierenden kartierten Modelle pro Capability-Family. Wo GPT 5.5 auftaucht, ist es hervorgehoben.

KnowledgeGPT 5.5 · 91
  1. 1
    91
  2. 2
    91
  3. 3
    91
ReasoningGPT 5.5 · 85
  1. 1
    95
  2. 2
    95
  3. 3
    95
MathGPT 5.5 · 92
  1. 1
    99
  2. 2
    99
  3. 3
    99
CodingGPT 5.5 · 96
  1. 1
    96
  2. 2
    96
  3. 3
    96
AgenticGPT 5.5 · 100
  1. 1
    100
  2. 2
    100
  3. 3
    100
Long contextGPT 5.5 · 56
  1. 1
    83
  2. 2
    83
  3. 3
    81
Tool useGPT 5.5 · 87
  1. 1
    89
  2. 2
    87
  3. 3
    87
Human preferenceGPT 5.5 · 95
  1. 1
    95
  2. 2
    92
  3. 3
    91
Neueste Belege

Benchmark-Zeilen im öffentlichen Ledger für GPT 5.5 in den letzten 120 Tagen. Ältere Zeilen stehen in der vollen Tabelle unten.

21 neu
Family-Abdeckung

Ein hoher Composite, der eine schwache Family versteckt, ist eine Falle. Diese Balken zeigen Families ohne öffentlichen Test — und wo das Modell führt.

Wissen91
Reasoning85
Mathe92
Coding96
Agentisch100
Multimodal72
Langer Kontext56
Tool-Nutzung87
Sicherheit91
Menschliche Präferenz95
Preis vs. Performance
0255075100$0.10$0.30$1$3$10$30Input-USD / 1M Tokens · log-Skala →← Intelligenz

Hover auf einen Punkt zeigt Name, Score und Input-Preis. Per Tastatur: die zwölf besten mit Tab durchgehen oder die Rangliste unten nutzen.

AnthropicOpenAIMistralAlibabaDeepSeekGoogleMoonshotMetaMiniMaxxAIZhipuXiaomiOtherMeituanCohereNVIDIA

Volles Benchmark-Ledger

Jeder Katalog-Benchmark für GPT 5.5. Scores verlinken zur Originalquelle; Lücken heißen: noch keine öffentliche Zeile.

31 Quell-Zeilen

31 von 37 Katalog-Benchmarks haben eine belegte Zeile für GPT 5.5.

Knowledge

Reasoning

Math

Coding

Agentic

Multimodal

Long context

Tool use

Performance

Safety

Human preference

Changelog
  1. GPT 5.5 mit nativem Audio, Bild und 512K-Kontext veröffentlicht.
  2. GPT 5.4 für allgemeine Verfügbarkeit ausgemustert.
Quellen