Modelle / OpenAI

GPT-4 (2023)

GPT-4 · Release 2023-03-14

Original-GPT-4-Technical-Report-Baseline. MMLU 86,4 %, HumanEval 67,0 % pass@1. Anker für Frontier-Vergleiche vor 2024.

Nur historischer Anker — nicht auf aktuellen OpenAI-Routen deploybar.

Composite67
Kontext8K
Input / 1M$30
Output / 1M$60
Wissensstichtag2021-09-01
Statuslightweight

Familienprofil

Bester veröffentlichter Score je abgedeckter Benchmark-Familie.

69/100 Ø
Wissen
86
Mathe
53
Coding
67

3 getestete Benchmark-Familien

Benchmark-Platzierungen

Wo GPT-4 (2023) auf jeder öffentlichen Benchmark-Quelle mit Zeile steht. Rang zählt jedes Modell mit neuester Zeile im selben Test — kein universeller Qualitätsscore.

BenchmarkFamilyRangScoreQuelleDatum
HumanEvalCoding#15/ 1567GPT-4 Technical Report2023-03-15
MMLUKnowledge#17/ 2286GPT-4 Technical Report2023-03-15
MATHMath#25/ 2553GPT-4 Technical Report2023-03-15
Family-Kontext

Die drei höchstscorierenden kartierten Modelle pro Capability-Family. Wo GPT-4 (2023) auftaucht, ist es hervorgehoben.

Family-Abdeckung

Ein hoher Composite, der eine schwache Family versteckt, ist eine Falle. Diese Balken zeigen Families ohne öffentlichen Test — und wo das Modell führt.

Wissen86
Mathe53
Coding67
Preis vs. Performance
0255075100$0.10$0.30$1$3$10$30Input-USD / 1M Tokens · log-Skala →← Intelligenz

Hover auf einen Punkt zeigt Name, Score und Input-Preis. Per Tastatur: die zwölf besten mit Tab durchgehen oder die Rangliste unten nutzen.

AnthropicOpenAIMistralAlibabaDeepSeekGoogleMoonshotMetaMiniMaxxAIZhipuXiaomiOtherMeituanCohereNVIDIA

Volles Benchmark-Ledger

Jeder Katalog-Benchmark für GPT-4 (2023). Scores verlinken zur Originalquelle; Lücken heißen: noch keine öffentliche Zeile.

3 Quell-Zeilen

3 von 37 Katalog-Benchmarks haben eine belegte Zeile für GPT-4 (2023).

Knowledge

Math

Coding

Quellen