86.8%
MMLU
Modelle / Anthropic
Claude Opus · Release 2024-03-04
Anthropics Opus März 2024. MMLU 86,8 %, MMLU-Pro 68,4 %, HumanEval-Baseline im öffentlichen Ledger.
Historische Baseline vor Opus 4 — keine aktuelle Wahl.
57average across 4 tested families
Wo Claude 3 Opus auf jeder öffentlichen Benchmark-Quelle mit Zeile steht. Rang zählt jedes Modell mit neuester Zeile im selben Test — kein universeller Qualitätsscore.
| Benchmark | Family | Rang | Score | Quelle | Datum |
|---|---|---|---|---|---|
| LiveCodeBench | Coding | #13/ 13 | 28 | Artificial Analysis | 2026-07-21 |
| MMLU | Knowledge | #16/ 22 | 87 | Anthropic Claude 3 model card | 2024-03-04 |
| AIME | Math | #19/ 19 | 3 | Artificial Analysis | 2026-07-21 |
| MATH | Math | #19/ 20 | 64 | Artificial Analysis | 2026-07-21 |
| MMLU-Pro | Knowledge | #21/ 21 | 68 | MMLU-Pro paper | 2024-06-03 |
| AA output speed | Performance | #59/ 69 | Artificial Analysis | 2026-07-21 | |
| AA time to first token | Performance | #59/ 69 | Artificial Analysis | 2026-07-21 | |
| Artificial Analysis Intelligence Index | Reasoning | #62/ 67 | 12 | Artificial Analysis | 2026-07-21 |
| SciCode | Coding | #62/ 65 | 23 | Artificial Analysis | 2026-07-21 |
| Humanity's Last Exam | Reasoning | #65/ 65 | 3 | Artificial Analysis | 2026-07-21 |
| GPQA Diamond | Reasoning | #68/ 69 | 49 | Artificial Analysis | 2026-07-21 |
Die drei höchstscorierenden kartierten Modelle pro Capability-Family. Wo Claude 3 Opus auftaucht, ist es hervorgehoben.
Benchmark-Zeilen im öffentlichen Ledger für Claude 3 Opus in den letzten 120 Tagen. Ältere Zeilen stehen in der vollen Tabelle unten.
| Benchmark | Family | Score | Quelle | Tage her |
|---|---|---|---|---|
| AA output speed | Performance | 0 t/s | Artificial Analysis | 2 |
| AA time to first token | Performance | 0.00s | Artificial Analysis | 2 |
| AIME | Math | 3.33% | Artificial Analysis | 2 |
| Artificial Analysis Intelligence Index | Reasoning | 11.8% | Artificial Analysis | 2 |
| GPQA Diamond | Reasoning | 48.9% | Artificial Analysis | 2 |
| Humanity's Last Exam | Reasoning | 3.1% | Artificial Analysis | 2 |
| LiveCodeBench | Coding | 27.9% | Artificial Analysis | 2 |
| MATH | Math | 64.07% | Artificial Analysis | 2 |
| SciCode | Coding | 23.3% | Artificial Analysis | 2 |
Ein hoher Composite, der eine schwache Family versteckt, ist eine Falle. Diese Balken zeigen Families ohne öffentlichen Test — und wo das Modell führt.
Hover or tab any dot for name, score, and input price.
Jeder Katalog-Benchmark für Claude 3 Opus. Scores verlinken zur Originalquelle; Lücken heißen: noch keine öffentliche Zeile.
11 of 32 catalog benchmarks have a sourced row for Claude 3 Opus.
11.8%
AA Intelligence Index v4.1
48.9%
GPQA Diamond (AA run)
3.1%
HLE (AA run)
27.9%
LiveCodeBench (AA run)
23.3%
SciCode (AA run)
0 t/s
Median output tokens/s (1k prompt, default provider)
0.00s
Median time to first token (1k prompt, default provider)