85.6%
MATH
Modelle / Anthropic
Claude Opus · Release 2024-07-01
Claude-Opus-4-Checkpoint Juli 2024. HELM Safety 92,1 % im öffentlichen Ledger. Vorgänger von Opus 4.5+.
Früher Opus-4-API-Snapshot für Leaderboard-Kontinuität.
Wo Claude Opus 4 (2024-07) auf jeder öffentlichen Benchmark-Quelle mit Zeile steht. Rang zählt jedes Modell mit neuester Zeile im selben Test — kein universeller Qualitätsscore.
| Benchmark | Family | Rang | Score | Quelle | Datum |
|---|---|---|---|---|---|
| HELM Safety | Safety | #1/ 9 | 92 | Stanford HELM leaderboard | 2024-08-15 |
| MATH | Math | #9/ 20 | 86 | Anthropic model card | 2025-06-01 |
Die drei höchstscorierenden kartierten Modelle pro Capability-Family. Wo Claude Opus 4 (2024-07) auftaucht, ist es hervorgehoben.
Ein hoher Composite, der eine schwache Family versteckt, ist eine Falle. Diese Balken zeigen Families ohne öffentlichen Test — und wo das Modell führt.
Hover or tab any dot for name, score, and input price.
Jeder Katalog-Benchmark für Claude Opus 4 (2024-07). Scores verlinken zur Originalquelle; Lücken heißen: noch keine öffentliche Zeile.
2 of 32 catalog benchmarks have a sourced row for Claude Opus 4 (2024-07).
85.6%
MATH
92.1%
HELM Safety