Modelle / OpenAI

GPT 5.5

GPT 5 · Release 2026-04-23

OpenAIs Flaggschiff April 2026. Vals-Index 67,62 % (#2), AA-Index 60,2 (#2), Terminal-Bench 2.0 82,0 %, ARC-AGI-2 85 % (Spitze). LMArena-Elo 1473 seit April 2026. 512K-Kontext, $12,50 / $50 pro 1M Tokens.

Bester Generalist für Coding-Agents, Research-Workflows und tool-lastige Automatisierung. Das Modell, zu dem der Desk greift, wenn Coding-Agents ein Issue in einem Durchlauf schließen sollen.

#6 von 21 im Vals Index · aktueller Snapshot
68 Vals Index · 28 Benchmark-Zeilen · 14 QuellenPosition ist benchmark-spezifisch — kein Cross-Family- oder Cross-Source-Ranking.
Composite75
Kontext512K
Input / 1M$13
Output / 1M$50
Wissensstichtag2026-03-15
Output-Speed90 t/s
TTFT (Default-API)31.38s
Statusflagship
KnowledgeReasoningMathCodingAgenticMultimodalLong contextTool useSafetyHuman preference
Knowledge
91
Reasoning
85
Math
92
Coding
96
Agentic
100
Multimodal
72
Long context
56
Tool use
87
Safety
91
Human preference
95

87average across 10 tested families

Redaktionsnotiz
GPT 5.5 ist das Modell, zu dem der Desk greift, wenn Coding-Agents ein Issue in einem Durchlauf schließen sollen. Terminal-Bench 2.0 (82,0 %) und SWE-bench Verified (82,5 %) sind reproduzierbare Zahlen, keine Vendor-Slides. Die LMArena-Elo-Führung ist die meistzitierte Zahl auf dem öffentlichen Markt.
Benchmark-Platzierungen

Wo GPT 5.5 auf jeder öffentlichen Benchmark-Quelle mit Zeile steht. Rang zählt jedes Modell mit neuester Zeile im selben Test — kein universeller Qualitätsscore.

BenchmarkFamilyRangScoreQuelleDatum
LMArena (Chatbot Arena)Human preference#1/ 1395LMArena leaderboard2026-05-25
ARC-AGIReasoning#2/ 1485ARC Prize leaderboard2026-05-15
BFCLTool use#2/ 2087Berkeley Function Calling Leaderboard V42026-04-15
DeepSWECoding#2/ 667DeepSWE leaderboard v1.12026-06-20
HumanEvalCoding#2/ 1596CodeSOTA HumanEval leaderboard2026-04-23
MMMUMultimodal#2/ 872MMMU leaderboard2026-04-23
GDPvalAgentic#3/ 6100Artificial Analysis — GDPval-AA v22026-06-17
HELM SafetySafety#3/ 991Stanford HELM leaderboard2026-04-23
LiveBenchReasoning#3/ 2170LiveBench leaderboard2026-04-15
LongBench v2Long context#3/ 1956LongBench v2 leaderboard2026-04-01
MCP AtlasTool use#3/ 1078MCP Atlas leaderboard2026-06-09
MMLUKnowledge#3/ 2291OpenAI model release notes2025-12-01
MATHMath#4/ 2090OpenAI model release notes2026-04-23
SWE-bench VerifiedCoding#4/ 2383SWE-bench Verified leaderboard2026-06-01
Vending-Bench 2Agentic#4/ 5Andon Labs Vending-Bench 22026-06-01
AIMEMath#5/ 1992OpenAI model release notes2026-04-23
Artificial Analysis Intelligence IndexReasoning#6/ 6755Artificial Analysis2026-07-21
Humanity's Last ExamReasoning#6/ 6544Artificial Analysis2026-07-21
Terminal-BenchAgentic#6/ 6982Terminal-Bench 2.0 leaderboard2026-05-20
Vals IndexAgentic#6/ 2068Vals AI — Vals Index2026-06-04
SciCodeCoding#7/ 6556Artificial Analysis2026-07-21
MMLU-ProKnowledge#10/ 2182MMLU-Pro HuggingFace leaderboard2026-04-23
AA time to first tokenPerformance#11/ 69Artificial Analysis2026-07-21
IFBenchReasoning#16/ 5776Artificial Analysis2026-07-21
τ³-Bench BankingAgentic#16/ 6455Artificial Analysis — τ³-Bench Banking2026-06-17
AA output speedPerformance#28/ 69Artificial Analysis2026-07-21
GPQA DiamondReasoning#47/ 6981GPQA Diamond paper leaderboard2026-05-15
AA-LCRLong context#54/ 6452Artificial Analysis — AA-LCR2026-06-17
Family-Kontext

Die drei höchstscorierenden kartierten Modelle pro Capability-Family. Wo GPT 5.5 auftaucht, ist es hervorgehoben.

KnowledgeGPT 5.5 · 91
  1. 1
    91
  2. 2
    91
  3. 3
    91
ReasoningGPT 5.5 · 85
  1. 1
    95
  2. 2
    94
  3. 3
    94
MathGPT 5.5 · 92
  1. 1
    99
  2. 2
    97
  3. 3
    96
CodingGPT 5.5 · 96
  1. 1
    96
  2. 2
    96
  3. 3
    96
AgenticGPT 5.5 · 100
  1. 1
    100
  2. 2
    100
  3. 3
    100
MultimodalGPT 5.5 · 72
  1. 1
    72
  2. 2
    72
  3. 3
    71
Long contextGPT 5.5 · 56
  1. 1
    75
  2. 2
    75
  3. 3
    74
Tool useGPT 5.5 · 87
  1. 1
    89
  2. 2
    87
  3. 3
    87
Human preferenceGPT 5.5 · 95
  1. 1
    95
  2. 2
    92
  3. 3
    91
Neueste Belege

Benchmark-Zeilen im öffentlichen Ledger für GPT 5.5 in den letzten 120 Tagen. Ältere Zeilen stehen in der vollen Tabelle unten.

27 neu
Family-Abdeckung

Ein hoher Composite, der eine schwache Family versteckt, ist eine Falle. Diese Balken zeigen Families ohne öffentlichen Test — und wo das Modell führt.

Knowledge91
Reasoning85
Math92
Coding96
Agentic100
Multimodal72
Long context56
Tool use87
Safety91
Human preference95
Preis vs. Performance
0255075100$0.10$0.30$1$3$10$30input USD / 1M tokens · log scale →← intelligence

Hover or tab any dot for name, score, and input price.

AnthropicOpenAIMistralAlibabaDeepSeekGoogleMoonshotMiniMaxxAIMetaZhipuXiaomiMeituanCohere

Volles Benchmark-Ledger

Jeder Katalog-Benchmark für GPT 5.5. Scores verlinken zur Originalquelle; Lücken heißen: noch keine öffentliche Zeile.

28 Quell-Zeilen

28 of 32 catalog benchmarks have a sourced row for GPT 5.5.

Knowledge

Reasoning

Math

Coding

Agentic

Multimodal

Long context

Tool use

Performance

Safety

Human preference

Changelog
  1. GPT 5.5 mit nativem Audio, Bild und 512K-Kontext veröffentlicht.
  2. GPT 5.4 für allgemeine Verfügbarkeit ausgemustert.
Quellen