Modelle / OpenAI

GPT-4 (2023)

GPT-4 · Release 2023-03-14

Original-GPT-4-Technical-Report-Baseline. MMLU 86,4 %, HumanEval 67,0 % pass@1. Anker für Frontier-Vergleiche vor 2024.

Nur historischer Anker — nicht auf aktuellen OpenAI-Routen deploybar.

Composite67
Kontext8K
Input / 1M$30
Output / 1M$60
Wissensstichtag2021-09-01
Statuslightweight
KnowledgeMathCoding
Knowledge
86
Math
53
Coding
67

69average across 3 tested families

Benchmark-Platzierungen

Wo GPT-4 (2023) auf jeder öffentlichen Benchmark-Quelle mit Zeile steht. Rang zählt jedes Modell mit neuester Zeile im selben Test — kein universeller Qualitätsscore.

BenchmarkFamilyRangScoreQuelleDatum
HumanEvalCoding#15/ 1567GPT-4 Technical Report2023-03-15
MMLUKnowledge#17/ 2286GPT-4 Technical Report2023-03-15
MATHMath#20/ 2053GPT-4 Technical Report2023-03-15
Family-Kontext

Die drei höchstscorierenden kartierten Modelle pro Capability-Family. Wo GPT-4 (2023) auftaucht, ist es hervorgehoben.

Family-Abdeckung

Ein hoher Composite, der eine schwache Family versteckt, ist eine Falle. Diese Balken zeigen Families ohne öffentlichen Test — und wo das Modell führt.

Knowledge86
Math53
Coding67
Preis vs. Performance
0255075100$0.10$0.30$1$3$10$30input USD / 1M tokens · log scale →← intelligence

Hover or tab any dot for name, score, and input price.

AnthropicOpenAIMistralAlibabaDeepSeekGoogleMoonshotMiniMaxxAIMetaZhipuXiaomiMeituanCohere

Volles Benchmark-Ledger

Jeder Katalog-Benchmark für GPT-4 (2023). Scores verlinken zur Originalquelle; Lücken heißen: noch keine öffentliche Zeile.

3 Quell-Zeilen

3 of 32 catalog benchmarks have a sourced row for GPT-4 (2023).

Knowledge

Math

Coding

Quellen