Modelle / Anthropic

Claude Sonnet 4.6

Claude Sonnet · Release 2026-02-17

Anthropics Mittelklassemodell Februar 2026. Vals-Index 60,30 % (#3 auf dem öffentlichen Leaderboard — schlägt GPT 5.4 Mini und Gemini 3 Flash). SWE-bench Verified 79,6 %, ARC-AGI-2 58,3 %. 1M-Kontext, $3 / $15 pro 1M Tokens — 5× günstiger als Opus 4.8 beim Input.

Standard für Produktionsarbeit, die Anthropics Stimme und Tool-Use-Disziplin braucht, ohne den Opus-4.8-Preis. SWE-bench Verified 79,6 % machen es stark genug für die meisten Coding-Agents.

#11 von 24 im Vals Index · aktueller Snapshot
60 Vals Index · 25 Benchmark-Zeilen · 12 QuellenPosition ist benchmark-spezifisch — kein Cross-Family- oder Cross-Source-Ranking.
Composite64
Kontext1M
Input / 1M$3.0
Output / 1M$15
Wissensstichtag2025-12-01
Statusflagship

Familienprofil

Bester veröffentlichter Score je abgedeckter Benchmark-Familie.

80/100 Ø
Wissen
91
Reasoning
77
Mathe
84
Coding
94
Agentisch
68
Multimodal
66
Langer Kontext
62
Tool-Nutzung
89
Sicherheit
89
Menschliche Präferenz
79

10 getestete Benchmark-Familien

Redaktionsnotiz
Sonnet 4.6 ist das Arbeitstier. Es führt Anthropics Mittelklasse an und liegt auf #3 bei Vals — zwischen Opus 4.8 und der GPT-5.4-Familie. Für Produktions-Agents, bei denen Opus 4.8 zu viel ist, ist dies die Anthropic-Wahl.
Benchmark-Platzierungen

Wo Claude Sonnet 4.6 auf jeder öffentlichen Benchmark-Quelle mit Zeile steht. Rang zählt jedes Modell mit neuester Zeile im selben Test — kein universeller Qualitätsscore.

BenchmarkFamilyRangScoreQuelleDatum
BFCLTool use#1/ 2089Berkeley Function Calling Leaderboard V42026-04-15
MCP AtlasTool use#4/ 1075MCP Atlas leaderboard2026-06-09
MMLUKnowledge#4/ 2291Anthropic Claude 3.7/4.6 model card2026-02-17
HELM SafetySafety#5/ 989Stanford HELM leaderboard2026-02-17
LiveBenchReasoning#5/ 2167LiveBench leaderboard2026-04-15
MMMUMultimodal#5/ 866MMMU leaderboard2026-02-17
HumanEvalCoding#7/ 1594Anthropic Claude 3.7/4.6 model card2026-01-01
ARC-AGIReasoning#8/ 1458ARC Prize semi-private evaluation2026-02-17
LongBench v2Long context#8/ 1953LongBench v2 leaderboard2026-04-01
Vending-Bench 2Agentic#8/ 10Andon Labs Vending-Bench 22026-08-04
LMArena (Chatbot Arena)Human preference#10/ 1379LMArena leaderboard2026-05-25
Vals IndexAgentic#11/ 2360Vals AI — Vals Index2026-06-04
SWE-bench VerifiedCoding#13/ 2380SWE-bench official leaderboard2026-05-30
FrontierMathMath#15/ 1532Epoch AI FrontierMath Tiers 1-3 (v2) CSV2026-08-15
MATHMath#16/ 2584Anthropic Claude 3.7/4.6 model card2026-02-17
MMLU-ProKnowledge#31/ 3978MMLU-Pro HuggingFace leaderboard2026-02-17
Terminal-BenchAgentic#48/ 18468Terminal-Bench 2.0 leaderboard2026-06-09
SciCodeCoding#64/ 18047Artificial Analysis2026-09-01
AA time to first tokenPerformance#99/ 186Artificial Analysis2026-09-01
Artificial Analysis Intelligence IndexReasoning#99/ 18737Artificial Analysis2026-09-01
AA output speedPerformance#100/ 187Artificial Analysis2026-09-01
IFBenchReasoning#120/ 12741Artificial Analysis2026-09-01
AA-LCRLong context#132/ 17962Artificial Analysis2026-09-01
Humanity's Last ExamReasoning#144/ 18013Artificial Analysis2026-09-01
GPQA DiamondReasoning#147/ 18577Artificial Analysis GPQA Diamond evaluation2026-06-09
Family-Kontext

Die drei höchstscorierenden kartierten Modelle pro Capability-Family. Wo Claude Sonnet 4.6 auftaucht, ist es hervorgehoben.

KnowledgeClaude Sonnet 4.6 · 91
  1. 1
    91
  2. 2
    91
  3. 3
    91
ReasoningClaude Sonnet 4.6 · 77
  1. 1
    95
  2. 2
    95
  3. 3
    95
MathClaude Sonnet 4.6 · 84
  1. 1
    99
  2. 2
    99
  3. 3
    99
CodingClaude Sonnet 4.6 · 94
  1. 1
    96
  2. 2
    96
  3. 3
    96
AgenticClaude Sonnet 4.6 · 68
  1. 1
    100
  2. 2
    100
  3. 3
    100
Long contextClaude Sonnet 4.6 · 62
  1. 1
    83
  2. 2
    83
  3. 3
    81
Tool useClaude Sonnet 4.6 · 89
  1. 1
    89
  2. 2
    87
  3. 3
    87
SafetyClaude Sonnet 4.6 · 89
  1. 1
    92
  2. 2
    92
  3. 3
    91
Human preferenceClaude Sonnet 4.6 · 79
  1. 1
    95
  2. 2
    92
  3. 3
    91
Neueste Belege

Benchmark-Zeilen im öffentlichen Ledger für Claude Sonnet 4.6 in den letzten 120 Tagen. Ältere Zeilen stehen in der vollen Tabelle unten.

15 neu
Family-Abdeckung

Ein hoher Composite, der eine schwache Family versteckt, ist eine Falle. Diese Balken zeigen Families ohne öffentlichen Test — und wo das Modell führt.

Wissen91
Reasoning77
Mathe84
Coding94
Agentisch68
Multimodal66
Langer Kontext62
Tool-Nutzung89
Sicherheit89
Menschliche Präferenz79
Preis vs. Performance
0255075100$0.10$0.30$1$3$10$30Input-USD / 1M Tokens · log-Skala →← Intelligenz

Hover auf einen Punkt zeigt Name, Score und Input-Preis. Per Tastatur: die zwölf besten mit Tab durchgehen oder die Rangliste unten nutzen.

AnthropicOpenAIMistralAlibabaDeepSeekGoogleMoonshotMetaMiniMaxxAIZhipuXiaomiOtherMeituanCohereNVIDIA

Volles Benchmark-Ledger

Jeder Katalog-Benchmark für Claude Sonnet 4.6. Scores verlinken zur Originalquelle; Lücken heißen: noch keine öffentliche Zeile.

25 Quell-Zeilen

25 von 37 Katalog-Benchmarks haben eine belegte Zeile für Claude Sonnet 4.6.

Knowledge

Reasoning

Math

Coding

Agentic

Multimodal

Long context

Tool use

Performance

Safety

Human preference

Changelog
  1. Claude Sonnet 4.6 veröffentlicht — Vals #3 bei 60,30 %, 1M-Kontext, $3 / $15.
Quellen