Modelle / Anthropic

Claude 3 Opus

Claude Opus · Release 2024-03-04

Anthropics Opus März 2024. MMLU 86,8 %, MMLU-Pro 68,4 %, HumanEval-Baseline im öffentlichen Ledger.

Historische Baseline vor Opus 4 — keine aktuelle Wahl.

#160 von 168 im AA Index · aktueller Snapshot
12 AA Index · 11 Benchmark-Zeilen · 3 QuellenPosition ist benchmark-spezifisch — kein Cross-Family- oder Cross-Source-Ranking.
Composite34
Kontext200K
Input / 1M$15
Output / 1M$75
Wissensstichtag2023-08-01
Statuslightweight

Familienprofil

Bester veröffentlichter Score je abgedeckter Benchmark-Familie.

57/100 Ø
Wissen
87
Reasoning
49
Mathe
64
Coding
28

4 getestete Benchmark-Familien

Benchmark-Platzierungen

Wo Claude 3 Opus auf jeder öffentlichen Benchmark-Quelle mit Zeile steht. Rang zählt jedes Modell mit neuester Zeile im selben Test — kein universeller Qualitätsscore.

BenchmarkFamilyRangScoreQuelleDatum
MMLUKnowledge#16/ 2287Anthropic Claude 3 model card2024-03-04
MATHMath#24/ 2564Artificial Analysis2026-09-01
LiveCodeBenchCoding#31/ 3128Artificial Analysis2026-09-01
AIMEMath#37/ 373Artificial Analysis2026-09-01
MMLU-ProKnowledge#39/ 3968MMLU-Pro paper2024-06-03
AA time to first tokenPerformance#88/ 186Artificial Analysis2026-09-01
AA output speedPerformance#89/ 187Artificial Analysis2026-09-01
SciCodeCoding#173/ 18023Artificial Analysis2026-09-01
GPQA DiamondReasoning#179/ 18549Artificial Analysis2026-09-01
Artificial Analysis Intelligence IndexReasoning#180/ 18712Artificial Analysis2026-09-01
Humanity's Last ExamReasoning#180/ 1803Artificial Analysis2026-09-01
Family-Kontext

Die drei höchstscorierenden kartierten Modelle pro Capability-Family. Wo Claude 3 Opus auftaucht, ist es hervorgehoben.

Neueste Belege

Benchmark-Zeilen im öffentlichen Ledger für Claude 3 Opus in den letzten 120 Tagen. Ältere Zeilen stehen in der vollen Tabelle unten.

9 neu
Family-Abdeckung

Ein hoher Composite, der eine schwache Family versteckt, ist eine Falle. Diese Balken zeigen Families ohne öffentlichen Test — und wo das Modell führt.

Wissen87
Reasoning49
Mathe64
Coding28
Preis vs. Performance
0255075100$0.10$0.30$1$3$10$30Input-USD / 1M Tokens · log-Skala →← Intelligenz

Hover auf einen Punkt zeigt Name, Score und Input-Preis. Per Tastatur: die zwölf besten mit Tab durchgehen oder die Rangliste unten nutzen.

AnthropicOpenAIMistralAlibabaDeepSeekGoogleMoonshotMetaMiniMaxxAIZhipuXiaomiOtherMeituanCohereNVIDIA

Volles Benchmark-Ledger

Jeder Katalog-Benchmark für Claude 3 Opus. Scores verlinken zur Originalquelle; Lücken heißen: noch keine öffentliche Zeile.

11 Quell-Zeilen

11 von 37 Katalog-Benchmarks haben eine belegte Zeile für Claude 3 Opus.

Knowledge

Reasoning

Math

Coding

Performance

Quellen