Modelle / Anthropic

Claude Opus 4.8

Claude Opus · Release 2026-05-28

Anthropics Flaggschiff Mai 2026. Führt den Vals-Index (70,17 %) und den Artificial-Analysis-Intelligence-Index (61,4) an. SWE-bench Verified 88,6 %, Terminal-Bench 2.0 74,6 %, 1M-Token-Kontext, $15 / $75 pro 1M Tokens.

Eingangsmodell für hartes Reasoning, lange Dokumente, agentisches Coding und tool-lastige Recherche. Das Modell, zu dem wir zuerst greifen, wenn eine Aufgabe zu schwer für Sonnet, aber klein genug für einen Prompt ist.

#9 von 184 im AA Index · aktueller Snapshot
42 AA Index · 30 Benchmark-Zeilen · 12 QuellenPosition ist benchmark-spezifisch — kein Cross-Family- oder Cross-Source-Ranking.
Composite67
Kontext1M
Input / 1M$15
Output / 1M$75
Wissensstichtag2026-02-01
Statusflagship

Familienprofil

Bester veröffentlichter Score je abgedeckter Benchmark-Familie.

86/100 Ø
Wissen
91
Reasoning
80
Mathe
94
Coding
96
Agentisch
100
Multimodal
71
Langer Kontext
58
Tool-Nutzung
87
Sicherheit
92
Menschliche Präferenz
92

10 getestete Benchmark-Familien

Redaktionsnotiz
Opus 4.8 ist das Modell, zu dem wir zuerst greifen, wenn eine Aufgabe schwer genug ist, um Sonnet halluzinieren zu lassen, aber klein genug für einen Prompt. Das 1M-Kontextfenster ist real, kein Marketing — Langdokument-Zitat-Treue und BFCL-Scores belegen das. Der Single-Number-Rang (Vals, AA) ist der höchste, den wir gemessen haben.
Benchmark-Platzierungen

Wo Claude Opus 4.8 auf jeder öffentlichen Benchmark-Quelle mit Zeile steht. Rang zählt jedes Modell mit neuester Zeile im selben Test — kein universeller Qualitätsscore.

BenchmarkFamilyRangScoreQuelleDatum
LongBench v2Long context#1/ 1958LongBench v2 leaderboard2026-04-01
MMLUKnowledge#1/ 2291Anthropic Claude 4 family2026-05-28
LMArena (Chatbot Arena)Human preference#2/ 1392LMArena leaderboard2026-05-25
GDPvalAgentic#2/ 6100Artificial Analysis — GDPval-AA v22026-06-17
HELM SafetySafety#2/ 992Stanford HELM leaderboard2026-05-28
LiveBenchReasoning#2/ 2171LiveBench leaderboard2026-04-15
MCP AtlasTool use#2/ 1079MCP Atlas leaderboard2026-06-09
SWE-bench VerifiedCoding#2/ 2289SWE-bench official leaderboard2026-05-30
BFCLTool use#3/ 2087Berkeley Function Calling Leaderboard V42026-04-15
HumanEvalCoding#3/ 1596Anthropic Claude 4 family2026-05-28
MMMUMultimodal#3/ 871MMMU leaderboard2026-05-28
Terminal-Bench-ScienceAgentic#4/ 911Terminal-Bench-Science 0.1 announcement2026-08-27
Vals IndexAgentic#4/ 1970Vals AI — Vals Index2026-06-04
DeepSWECoding#5/ 859DeepSWE leaderboard v1.12026-06-20
FrontierMathMath#5/ 1547Epoch AI FrontierMath Tiers 1-3 (v2) CSV2026-08-15
AA-OmniscienceKnowledge#9/ 1249Artificial Analysis — AA-Omniscience2026-09-01
Humanity's Last ExamReasoning#9/ 18549Artificial Analysis2026-09-10
AIMEMath#10/ 3794Anthropic Claude 4 family2026-05-28
CritPtReasoning#10/ 1221Artificial Analysis — CritPt2026-09-01
MATHMath#11/ 2588Anthropic Claude 4 family2026-05-28
Artificial Analysis Intelligence IndexReasoning#15/ 18842Artificial Analysis2026-09-10
SciCodeCoding#22/ 9354Artificial Analysis2026-09-10
MMLU-ProKnowledge#27/ 3982MMLU-Pro HuggingFace leaderboard2026-05-28
τ³-Bench BankingAgentic#35/ 11034Artificial Analysis2026-09-10
Terminal-BenchAgentic#40/ 18975Terminal-Bench 2.0 leaderboard2026-05-20
IFBenchReasoning#77/ 12762Artificial Analysis2026-09-10
AA output speedPerformance#98/ 190Artificial Analysis2026-09-10
AA time to first tokenPerformance#98/ 190Artificial Analysis2026-09-10
GPQA DiamondReasoning#144/ 19080GPQA Diamond paper leaderboard2026-05-15
AA-LCRLong context#150/ 18258Artificial Analysis — AA-LCR2026-06-17
Family-Kontext

Die drei höchstscorierenden kartierten Modelle pro Capability-Family. Wo Claude Opus 4.8 auftaucht, ist es hervorgehoben.

KnowledgeClaude Opus 4.8 · 91
  1. 1
    91
  2. 2
    91
  3. 3
    91
ReasoningClaude Opus 4.8 · 80
  1. 1
    96
  2. 2
    95
  3. 3
    95
MathClaude Opus 4.8 · 94
  1. 1
    99
  2. 2
    99
  3. 3
    99
CodingClaude Opus 4.8 · 96
  1. 1
    96
  2. 2
    96
  3. 3
    96
AgenticClaude Opus 4.8 · 100
  1. 1
    100
  2. 2
    100
  3. 3
    100
Long contextClaude Opus 4.8 · 58
  1. 1
    89
  2. 2
    85
  3. 3
    84
Tool useClaude Opus 4.8 · 87
  1. 1
    89
  2. 2
    87
  3. 3
    87
SafetyClaude Opus 4.8 · 92
  1. 1
    92
  2. 2
    92
  3. 3
    91
Human preferenceClaude Opus 4.8 · 92
  1. 1
    95
  2. 2
    92
  3. 3
    91
Neueste Belege

Benchmark-Zeilen im öffentlichen Ledger für Claude Opus 4.8 in den letzten 120 Tagen. Ältere Zeilen stehen in der vollen Tabelle unten.

26 neu
Family-Abdeckung

Ein hoher Composite, der eine schwache Family versteckt, ist eine Falle. Diese Balken zeigen Families ohne öffentlichen Test — und wo das Modell führt.

Wissen91
Reasoning80
Mathe94
Coding96
Agentisch100
Multimodal71
Langer Kontext58
Tool-Nutzung87
Sicherheit92
Menschliche Präferenz92
Preis vs. Performance
0255075100$0.10$0.30$1$3$10$30Input-USD / 1M Tokens · log-Skala →← Intelligenz

Hover auf einen Punkt zeigt Name, Score und Input-Preis. Per Tastatur: die zwölf besten mit Tab durchgehen oder die Rangliste unten nutzen.

AnthropicOpenAIMistralAlibabaDeepSeekGoogleMoonshotMetaxAIMiniMaxZhipuXiaomiOtherMeituanCohereNVIDIA

Volles Benchmark-Ledger

Jeder Katalog-Benchmark für Claude Opus 4.8. Scores verlinken zur Originalquelle; Lücken heißen: noch keine öffentliche Zeile.

30 Quell-Zeilen

30 von 37 Katalog-Benchmarks haben eine belegte Zeile für Claude Opus 4.8.

Knowledge

Reasoning

Math

Coding

Agentic

Multimodal

Long context

Tool use

Performance

Safety

Human preference

Changelog
  1. Claude Opus 4.8 veröffentlicht — Spitze bei Vals (70,17 %) und AA (61,4).
  2. Claude Opus 4.7 für allgemeine Verfügbarkeit ausgemustert.
Quellen

The Pack · Redaktionsnewsletter

Neue Tools in dein Postfach. Kostenlos.

Eine kurze E-Mail, wenn ein Tool erscheint oder den Status wechselt. Kein Tracking, keine Drittanbieter-Analytics. Abmeldung mit einem Klick.