90.6%
MMLU
Modelle / Anthropic
Claude Sonnet · Release 2026-02-17
Anthropics Mittelklassemodell Februar 2026. Vals-Index 60,30 % (#3 auf dem öffentlichen Leaderboard — schlägt GPT 5.4 Mini und Gemini 3 Flash). SWE-bench Verified 79,6 %, ARC-AGI-2 58,3 %. 1M-Kontext, $3 / $15 pro 1M Tokens — 5× günstiger als Opus 4.8 beim Input.
Standard für Produktionsarbeit, die Anthropics Stimme und Tool-Use-Disziplin braucht, ohne den Opus-4.8-Preis. SWE-bench Verified 79,6 % machen es stark genug für die meisten Coding-Agents.
Familienprofil
Bester veröffentlichter Score je abgedeckter Benchmark-Familie.
10 getestete Benchmark-Familien
Wo Claude Sonnet 4.6 auf jeder öffentlichen Benchmark-Quelle mit Zeile steht. Rang zählt jedes Modell mit neuester Zeile im selben Test — kein universeller Qualitätsscore.
Die drei höchstscorierenden kartierten Modelle pro Capability-Family. Wo Claude Sonnet 4.6 auftaucht, ist es hervorgehoben.
Benchmark-Zeilen im öffentlichen Ledger für Claude Sonnet 4.6 in den letzten 120 Tagen. Ältere Zeilen stehen in der vollen Tabelle unten.
| Benchmark | Family | Score | Quelle | Tage her |
|---|---|---|---|---|
| AA-LCR | Long context | 62.33% | Artificial Analysis | 6 |
| AA output speed | Performance | 0 t/s | Artificial Analysis | 6 |
| AA time to first token | Performance | 0.00s | Artificial Analysis | 6 |
| Artificial Analysis Intelligence Index | Reasoning | 36.8% | Artificial Analysis | 6 |
| Humanity's Last Exam | Reasoning | 13.3% | Artificial Analysis | 6 |
| IFBench | Reasoning | 41.16% | Artificial Analysis | 6 |
| SciCode | Coding | 46.9% | Artificial Analysis | 6 |
| FrontierMath | Math | 32.4% | Epoch AI FrontierMath Tiers 1-3 (v2) CSV | 23 |
| Vending-Bench 2 | Agentic | 7204.14 | Andon Labs Vending-Bench 2 | 34 |
| Terminal-Bench | Agentic | 68.4% | Terminal-Bench 2.0 leaderboard | 90 |
| GPQA Diamond | Reasoning | 77.2% | Artificial Analysis GPQA Diamond evaluation | 90 |
| MCP Atlas | Tool use | 75.4% | MCP Atlas leaderboard | 90 |
| Vals Index | Agentic | 60.3% | Vals AI — Vals Index | 95 |
| SWE-bench Verified | Coding | 79.6% | SWE-bench official leaderboard | 100 |
| LMArena (Chatbot Arena) | Human preference | 1396 | LMArena leaderboard | 105 |
Ein hoher Composite, der eine schwache Family versteckt, ist eine Falle. Diese Balken zeigen Families ohne öffentlichen Test — und wo das Modell führt.
Hover auf einen Punkt zeigt Name, Score und Input-Preis. Per Tastatur: die zwölf besten mit Tab durchgehen oder die Rangliste unten nutzen.
Jeder Katalog-Benchmark für Claude Sonnet 4.6. Scores verlinken zur Originalquelle; Lücken heißen: noch keine öffentliche Zeile.
25 von 37 Katalog-Benchmarks haben eine belegte Zeile für Claude Sonnet 4.6.
58.3%
ARC-AGI-2 semi-private
36.8%
AA Intelligence Index v4.1
77.2%
GPQA Diamond
13.3%
HLE (AA run)
41.16%
IFBench (AA run)
67.2%
LiveBench
32.4%
FrontierMath Tiers 1-3 (v2) best Epoch run
84.2%
MATH
94.1% pass@1
HumanEval
46.9%
SciCode (AA run)
79.6%
SWE-bench Verified
68.4%
Terminal-Bench 2.0 (audited harness)
60.3%
Vals Index
7204.14
Final bank balance (USD)
66.2%
MMMU
62.33%
AA-LCR (AA run)
52.6%
LongBench v2
0 t/s
Median output tokens/s (1k prompt, default provider)
0.00s
Median time to first token (1k prompt, default provider)
89.2%
HELM Safety
1396
LMArena Elo (Style Controlled)