86.4%
MMLU
Modelle / OpenAI
GPT-4 · Release 2023-03-14
Original-GPT-4-Technical-Report-Baseline. MMLU 86,4 %, HumanEval 67,0 % pass@1. Anker für Frontier-Vergleiche vor 2024.
Nur historischer Anker — nicht auf aktuellen OpenAI-Routen deploybar.
69average across 3 tested families
Wo GPT-4 (2023) auf jeder öffentlichen Benchmark-Quelle mit Zeile steht. Rang zählt jedes Modell mit neuester Zeile im selben Test — kein universeller Qualitätsscore.
| Benchmark | Family | Rang | Score | Quelle | Datum |
|---|---|---|---|---|---|
| HumanEval | Coding | #15/ 15 | 67 | GPT-4 Technical Report | 2023-03-15 |
| MMLU | Knowledge | #17/ 22 | 86 | GPT-4 Technical Report | 2023-03-15 |
| MATH | Math | #20/ 20 | 53 | GPT-4 Technical Report | 2023-03-15 |
Die drei höchstscorierenden kartierten Modelle pro Capability-Family. Wo GPT-4 (2023) auftaucht, ist es hervorgehoben.
Ein hoher Composite, der eine schwache Family versteckt, ist eine Falle. Diese Balken zeigen Families ohne öffentlichen Test — und wo das Modell führt.
Hover or tab any dot for name, score, and input price.
Jeder Katalog-Benchmark für GPT-4 (2023). Scores verlinken zur Originalquelle; Lücken heißen: noch keine öffentliche Zeile.