24.1%
ARC-AGI-2 semi-private (low compute)
Modelle / Anthropic
Claude Opus · Release 2026-06-01
Anthropics Research-Preview Juni 2026. Spitze bei SWE-bench Verified (93,9 %, Best-of-3-Harness) und Vals-Index (73,42 %). Führt außerdem GPQA Diamond (94,6 %), HLE (64,7 %) und CharXiv (93,2 %) an. 2M-Kontext, $75 / $300 pro 1M Tokens.
Research-Preview für die härtesten Reasoning-, Coding- und Generalisierungsaufgaben. Noch nicht allgemein verfügbar — Zugang über das Claude-Research-Programm. Als Research-Artefakt behandeln, nicht als Deployment-Kandidat.
91average across 3 tested families
Wo Claude Mythos Preview auf jeder öffentlichen Benchmark-Quelle mit Zeile steht. Rang zählt jedes Modell mit neuester Zeile im selben Test — kein universeller Qualitätsscore.
| Benchmark | Family | Rang | Score | Quelle | Datum |
|---|---|---|---|---|---|
| GPQA Diamond | Reasoning | #1/ 69 | 95 | GPQA Diamond paper leaderboard | 2026-06-02 |
| SWE-bench Verified | Coding | #1/ 23 | 94 | SWE-bench official leaderboard | 2026-06-02 |
| Vals Index | Agentic | #3/ 20 | 73 | Vals AI — Vals Index | 2026-06-04 |
| Terminal-Bench | Agentic | #5/ 69 | 84 | Terminal-Bench 2.0 leaderboard | 2026-06-02 |
| ARC-AGI | Reasoning | #12/ 14 | 24 | ARC Prize leaderboard | 2026-06-02 |
Die drei höchstscorierenden kartierten Modelle pro Capability-Family. Wo Claude Mythos Preview auftaucht, ist es hervorgehoben.
Benchmark-Zeilen im öffentlichen Ledger für Claude Mythos Preview in den letzten 120 Tagen. Ältere Zeilen stehen in der vollen Tabelle unten.
| Benchmark | Family | Score | Quelle | Tage her |
|---|---|---|---|---|
| Vals Index | Agentic | 73.42% | Vals AI — Vals Index | 49 |
| SWE-bench Verified | Coding | 93.9% | SWE-bench official leaderboard | 51 |
| Terminal-Bench | Agentic | 84.1% | Terminal-Bench 2.0 leaderboard | 51 |
| ARC-AGI | Reasoning | 24.1% | ARC Prize leaderboard | 51 |
| GPQA Diamond | Reasoning | 94.6% | GPQA Diamond paper leaderboard | 51 |
Ein hoher Composite, der eine schwache Family versteckt, ist eine Falle. Diese Balken zeigen Families ohne öffentlichen Test — und wo das Modell führt.
Hover or tab any dot for name, score, and input price.
Jeder Katalog-Benchmark für Claude Mythos Preview. Scores verlinken zur Originalquelle; Lücken heißen: noch keine öffentliche Zeile.
5 of 32 catalog benchmarks have a sourced row for Claude Mythos Preview.
24.1%
ARC-AGI-2 semi-private (low compute)
94.6%
GPQA Diamond accuracy
93.9%
SWE-bench Verified (best-of-3 harness)
84.1%
Terminal-Bench 2.0 (audited harness)
73.42%
Vals Index