Anthropics Flaggschiff Mai 2026. Führt den Vals-Index (70,17 %) und den Artificial-Analysis-Intelligence-Index (61,4) an. SWE-bench Verified 88,6 %, Terminal-Bench 2.0 74,6 %, 1M-Token-Kontext, $15 / $75 pro 1M Tokens.
Eingangsmodell für hartes Reasoning, lange Dokumente, agentisches Coding und tool-lastige Recherche. Das Modell, zu dem wir zuerst greifen, wenn eine Aufgabe zu schwer für Sonnet, aber klein genug für einen Prompt ist.
#4 von 24 im Vals Index · aktueller Snapshot
70 Vals Index · 30 Benchmark-Zeilen · 12 QuellenPosition ist benchmark-spezifisch — kein Cross-Family- oder Cross-Source-Ranking.
Bester veröffentlichter Score je abgedeckter Benchmark-Familie.
86/100 Ø
050100
Wissen
91
Reasoning
80
Mathe
94
Coding
96
Agentisch
100
Multimodal
71
Langer Kontext
58
Tool-Nutzung
87
Sicherheit
92
Menschliche Präferenz
92
10 getestete Benchmark-Familien
Redaktionsnotiz
Opus 4.8 ist das Modell, zu dem wir zuerst greifen, wenn eine Aufgabe schwer genug ist, um Sonnet halluzinieren zu lassen, aber klein genug für einen Prompt. Das 1M-Kontextfenster ist real, kein Marketing — Langdokument-Zitat-Treue und BFCL-Scores belegen das. Der Single-Number-Rang (Vals, AA) ist der höchste, den wir gemessen haben.
Benchmark-Platzierungen
Positionen pro Benchmark
Wo Claude Opus 4.8 auf jeder öffentlichen Benchmark-Quelle mit Zeile steht. Rang zählt jedes Modell mit neuester Zeile im selben Test — kein universeller Qualitätsscore.
Ein hoher Composite, der eine schwache Family versteckt, ist eine Falle. Diese Balken zeigen Families ohne öffentlichen Test — und wo das Modell führt.
Wissen91
Reasoning80
Mathe94
Coding96
Agentisch100
Multimodal71
Langer Kontext58
Tool-Nutzung87
Sicherheit92
Menschliche Präferenz92
Preis vs. Performance
Wo Claude Opus 4.8 im Scatter liegt
Hover auf einen Punkt zeigt Name, Score und Input-Preis. Per Tastatur: die zwölf besten mit Tab durchgehen oder die Rangliste unten nutzen.