85.6%
MMLU
Modelle / Anthropic
Claude Haiku · Release 2025-10-01
Anthropics Speed-Stufe. 200K-Kontext, 64K-Output, $1/$5 pro 1M Tokens. Ideal für hochvolumige, latenzarme Aufgaben.
Schnelles, günstiges Claude für Routing, Klassifikation, Extraktion und hochvolumige Backend-Aufgaben.
66average across 6 tested families
Wo Claude Haiku 4.5 auf jeder öffentlichen Benchmark-Quelle mit Zeile steht. Rang zählt jedes Modell mit neuester Zeile im selben Test — kein universeller Qualitätsscore.
| Benchmark | Family | Rang | Score | Quelle | Datum |
|---|---|---|---|---|---|
| LMArena (Chatbot Arena) | Human preference | #13/ 13 | 74 | LMArena leaderboard | 2026-05-25 |
| Vals Index | Agentic | #18/ 20 | 40 | Vals AI — Vals Index | 2026-06-04 |
| BFCL | Tool use | #19/ 20 | 72 | Berkeley Function Calling Leaderboard V4 | 2026-04-15 |
| LongBench v2 | Long context | #19/ 19 | 45 | LongBench v2 leaderboard | 2026-04-01 |
| LiveBench | Reasoning | #20/ 21 | 58 | LiveBench leaderboard | 2026-04-15 |
| MMLU | Knowledge | #20/ 22 | 86 | Anthropic Claude Haiku 4.5 | 2025-10-01 |
| Terminal-Bench | Agentic | #36/ 69 | 61 | Terminal-Bench 2.0 leaderboard | 2026-06-09 |
Die drei höchstscorierenden kartierten Modelle pro Capability-Family. Wo Claude Haiku 4.5 auftaucht, ist es hervorgehoben.
Benchmark-Zeilen im öffentlichen Ledger für Claude Haiku 4.5 in den letzten 120 Tagen. Ältere Zeilen stehen in der vollen Tabelle unten.
| Benchmark | Family | Score | Quelle | Tage her |
|---|---|---|---|---|
| Terminal-Bench | Agentic | 61.4% | Terminal-Bench 2.0 leaderboard | 44 |
| Vals Index | Agentic | 40.33% | Vals AI — Vals Index | 49 |
| LMArena (Chatbot Arena) | Human preference | 1368 | LMArena leaderboard | 59 |
| BFCL | Tool use | 71.8% | Berkeley Function Calling Leaderboard V4 | 99 |
| LiveBench | Reasoning | 57.8% | LiveBench leaderboard | 99 |
| LongBench v2 | Long context | 44.8% | LongBench v2 leaderboard | 113 |
Ein hoher Composite, der eine schwache Family versteckt, ist eine Falle. Diese Balken zeigen Families ohne öffentlichen Test — und wo das Modell führt.
Hover or tab any dot for name, score, and input price.
Jeder Katalog-Benchmark für Claude Haiku 4.5. Scores verlinken zur Originalquelle; Lücken heißen: noch keine öffentliche Zeile.
7 of 32 catalog benchmarks have a sourced row for Claude Haiku 4.5.
85.6%
MMLU
57.8%
LiveBench
61.4%
Terminal-Bench 2.0 (audited harness)
40.33%
Vals Index
44.8%
LongBench v2
71.8%
BFCL
1368
LMArena Elo (Style Controlled)