Modelle / Anthropic

Claude Opus 4.8

Claude Opus · Release 2026-05-28

Anthropics Flaggschiff Mai 2026. Führt den Vals-Index (70,17 %) und den Artificial-Analysis-Intelligence-Index (61,4) an. SWE-bench Verified 88,6 %, Terminal-Bench 2.0 74,6 %, 1M-Token-Kontext, $15 / $75 pro 1M Tokens.

Eingangsmodell für hartes Reasoning, lange Dokumente, agentisches Coding und tool-lastige Recherche. Das Modell, zu dem wir zuerst greifen, wenn eine Aufgabe zu schwer für Sonnet, aber klein genug für einen Prompt ist.

#4 von 24 im Vals Index · aktueller Snapshot
70 Vals Index · 30 Benchmark-Zeilen · 12 QuellenPosition ist benchmark-spezifisch — kein Cross-Family- oder Cross-Source-Ranking.
Composite67
Kontext1M
Input / 1M$15
Output / 1M$75
Wissensstichtag2026-02-01
Statusflagship

Familienprofil

Bester veröffentlichter Score je abgedeckter Benchmark-Familie.

86/100 Ø
Wissen
91
Reasoning
80
Mathe
94
Coding
96
Agentisch
100
Multimodal
71
Langer Kontext
58
Tool-Nutzung
87
Sicherheit
92
Menschliche Präferenz
92

10 getestete Benchmark-Familien

Redaktionsnotiz
Opus 4.8 ist das Modell, zu dem wir zuerst greifen, wenn eine Aufgabe schwer genug ist, um Sonnet halluzinieren zu lassen, aber klein genug für einen Prompt. Das 1M-Kontextfenster ist real, kein Marketing — Langdokument-Zitat-Treue und BFCL-Scores belegen das. Der Single-Number-Rang (Vals, AA) ist der höchste, den wir gemessen haben.
Benchmark-Platzierungen

Wo Claude Opus 4.8 auf jeder öffentlichen Benchmark-Quelle mit Zeile steht. Rang zählt jedes Modell mit neuester Zeile im selben Test — kein universeller Qualitätsscore.

BenchmarkFamilyRangScoreQuelleDatum
LongBench v2Long context#1/ 1958LongBench v2 leaderboard2026-04-01
MMLUKnowledge#1/ 2291Anthropic Claude 4 family2026-05-28
LMArena (Chatbot Arena)Human preference#2/ 1392LMArena leaderboard2026-05-25
GDPvalAgentic#2/ 6100Artificial Analysis — GDPval-AA v22026-06-17
HELM SafetySafety#2/ 992Stanford HELM leaderboard2026-05-28
LiveBenchReasoning#2/ 2171LiveBench leaderboard2026-04-15
MCP AtlasTool use#2/ 1079MCP Atlas leaderboard2026-06-09
SWE-bench VerifiedCoding#2/ 2389SWE-bench official leaderboard2026-05-30
BFCLTool use#3/ 2087Berkeley Function Calling Leaderboard V42026-04-15
HumanEvalCoding#3/ 1596Anthropic Claude 4 family2026-05-28
MMMUMultimodal#3/ 871MMMU leaderboard2026-05-28
Terminal-Bench-ScienceAgentic#4/ 911Terminal-Bench-Science 0.1 announcement2026-08-27
Vals IndexAgentic#4/ 2370Vals AI — Vals Index2026-06-04
DeepSWECoding#5/ 859DeepSWE leaderboard v1.12026-06-20
FrontierMathMath#5/ 1547Epoch AI FrontierMath Tiers 1-3 (v2) CSV2026-08-15
Humanity's Last ExamReasoning#7/ 18049Artificial Analysis2026-09-01
AA-OmniscienceKnowledge#9/ 1249Artificial Analysis — AA-Omniscience2026-09-01
AIMEMath#10/ 3794Anthropic Claude 4 family2026-05-28
Artificial Analysis Intelligence IndexReasoning#10/ 18757Artificial Analysis2026-09-01
CritPtReasoning#10/ 1221Artificial Analysis — CritPt2026-09-01
MATHMath#11/ 2588Anthropic Claude 4 family2026-05-28
SciCodeCoding#22/ 18054Artificial Analysis2026-09-01
MMLU-ProKnowledge#27/ 3982MMLU-Pro HuggingFace leaderboard2026-05-28
τ³-Bench BankingAgentic#31/ 10634Artificial Analysis2026-09-01
Terminal-BenchAgentic#36/ 18475Terminal-Bench 2.0 leaderboard2026-05-20
IFBenchReasoning#78/ 12762Artificial Analysis2026-09-01
AA time to first tokenPerformance#98/ 186Artificial Analysis2026-09-01
AA output speedPerformance#99/ 187Artificial Analysis2026-09-01
GPQA DiamondReasoning#139/ 18580GPQA Diamond paper leaderboard2026-05-15
AA-LCRLong context#142/ 17958Artificial Analysis — AA-LCR2026-06-17
Family-Kontext

Die drei höchstscorierenden kartierten Modelle pro Capability-Family. Wo Claude Opus 4.8 auftaucht, ist es hervorgehoben.

KnowledgeClaude Opus 4.8 · 91
  1. 1
    91
  2. 2
    91
  3. 3
    91
ReasoningClaude Opus 4.8 · 80
  1. 1
    95
  2. 2
    95
  3. 3
    95
MathClaude Opus 4.8 · 94
  1. 1
    99
  2. 2
    99
  3. 3
    99
CodingClaude Opus 4.8 · 96
  1. 1
    96
  2. 2
    96
  3. 3
    96
AgenticClaude Opus 4.8 · 100
  1. 1
    100
  2. 2
    100
  3. 3
    100
Long contextClaude Opus 4.8 · 58
  1. 1
    83
  2. 2
    83
  3. 3
    81
Tool useClaude Opus 4.8 · 87
  1. 1
    89
  2. 2
    87
  3. 3
    87
SafetyClaude Opus 4.8 · 92
  1. 1
    92
  2. 2
    92
  3. 3
    91
Human preferenceClaude Opus 4.8 · 92
  1. 1
    95
  2. 2
    92
  3. 3
    91
Neueste Belege

Benchmark-Zeilen im öffentlichen Ledger für Claude Opus 4.8 in den letzten 120 Tagen. Ältere Zeilen stehen in der vollen Tabelle unten.

27 neu
Family-Abdeckung

Ein hoher Composite, der eine schwache Family versteckt, ist eine Falle. Diese Balken zeigen Families ohne öffentlichen Test — und wo das Modell führt.

Wissen91
Reasoning80
Mathe94
Coding96
Agentisch100
Multimodal71
Langer Kontext58
Tool-Nutzung87
Sicherheit92
Menschliche Präferenz92
Preis vs. Performance
0255075100$0.10$0.30$1$3$10$30Input-USD / 1M Tokens · log-Skala →← Intelligenz

Hover auf einen Punkt zeigt Name, Score und Input-Preis. Per Tastatur: die zwölf besten mit Tab durchgehen oder die Rangliste unten nutzen.

AnthropicOpenAIMistralAlibabaDeepSeekGoogleMoonshotMetaMiniMaxxAIZhipuXiaomiOtherMeituanCohereNVIDIA

Volles Benchmark-Ledger

Jeder Katalog-Benchmark für Claude Opus 4.8. Scores verlinken zur Originalquelle; Lücken heißen: noch keine öffentliche Zeile.

30 Quell-Zeilen

30 von 37 Katalog-Benchmarks haben eine belegte Zeile für Claude Opus 4.8.

Knowledge

Reasoning

Math

Coding

Agentic

Multimodal

Long context

Tool use

Performance

Safety

Human preference

Changelog
  1. Claude Opus 4.8 veröffentlicht — Spitze bei Vals (70,17 %) und AA (61,4).
  2. Claude Opus 4.7 für allgemeine Verfügbarkeit ausgemustert.
Quellen