91.4%
MMLU
Modelle / Anthropic
Claude Opus · Release 2026-05-28
Anthropics Flaggschiff Mai 2026. Führt den Vals-Index (70,17 %) und den Artificial-Analysis-Intelligence-Index (61,4) an. SWE-bench Verified 88,6 %, Terminal-Bench 2.0 74,6 %, 1M-Token-Kontext, $15 / $75 pro 1M Tokens.
Eingangsmodell für hartes Reasoning, lange Dokumente, agentisches Coding und tool-lastige Recherche. Das Modell, zu dem wir zuerst greifen, wenn eine Aufgabe zu schwer für Sonnet, aber klein genug für einen Prompt ist.
86average across 10 tested families
Wo Claude Opus 4.8 auf jeder öffentlichen Benchmark-Quelle mit Zeile steht. Rang zählt jedes Modell mit neuester Zeile im selben Test — kein universeller Qualitätsscore.
Die drei höchstscorierenden kartierten Modelle pro Capability-Family. Wo Claude Opus 4.8 auftaucht, ist es hervorgehoben.
Benchmark-Zeilen im öffentlichen Ledger für Claude Opus 4.8 in den letzten 120 Tagen. Ältere Zeilen stehen in der vollen Tabelle unten.
Ein hoher Composite, der eine schwache Family versteckt, ist eine Falle. Diese Balken zeigen Families ohne öffentlichen Test — und wo das Modell führt.
Hover or tab any dot for name, score, and input price.
Jeder Katalog-Benchmark für Claude Opus 4.8. Scores verlinken zur Originalquelle; Lücken heißen: noch keine öffentliche Zeile.
26 of 32 catalog benchmarks have a sourced row for Claude Opus 4.8.
55.7%
AA Intelligence Index v4.1
79.8%
GPQA Diamond accuracy (CoT)
45.7%
HLE (AA run)
62.24%
IFBench (AA run)
70.8%
LiveBench
59%
DeepSWE pass@1 (max effort)
95.8% pass@1
HumanEval
53.5%
SciCode (AA run)
88.6%
SWE-bench Verified
1638
GDPval-AA v2
74.6%
Terminal-Bench 2.0 (audited harness)
70.4%
Vals Index
27.63%
τ³-Bench Banking (AA run)
70.6%
MMMU
58.3%
AA-LCR pass@1
58.4%
LongBench v2
63 t/s
Median output tokens/s (1k prompt, default provider)
30.13s
Median time to first token (1k prompt, default provider)
91.8%
HELM Safety
1462
LMArena Elo (Style Controlled)