24.1%
ARC-AGI-2 semi-private (low compute)
Modelle / Anthropic
Claude Opus · Release 2026-06-01
Anthropics Research-Preview Juni 2026. Spitze bei SWE-bench Verified (93,9 %, Best-of-3-Harness) und Vals-Index (73,42 %). Führt außerdem GPQA Diamond (94,6 %), HLE (64,7 %) und CharXiv (93,2 %) an. 2M-Kontext, $75 / $300 pro 1M Tokens.
Research-Preview für die härtesten Reasoning-, Coding- und Generalisierungsaufgaben. Noch nicht allgemein verfügbar — Zugang über das Claude-Research-Programm. Als Research-Artefakt behandeln, nicht als Deployment-Kandidat.
Familienprofil
Bester veröffentlichter Score je abgedeckter Benchmark-Familie.
3 getestete Benchmark-Familien
Wo Claude Mythos Preview auf jeder öffentlichen Benchmark-Quelle mit Zeile steht. Rang zählt jedes Modell mit neuester Zeile im selben Test — kein universeller Qualitätsscore.
| Benchmark | Family | Rang | Score | Quelle | Datum |
|---|---|---|---|---|---|
| SWE-bench Verified | Coding | #1/ 22 | 94 | SWE-bench official leaderboard | 2026-06-02 |
| Vals Index | Agentic | #2/ 19 | 73 | Vals AI — Vals Index | 2026-06-04 |
| GPQA Diamond | Reasoning | #4/ 190 | 95 | GPQA Diamond paper leaderboard | 2026-06-02 |
| ARC-AGI | Reasoning | #9/ 9 | 24 | ARC Prize leaderboard | 2026-06-02 |
| Terminal-Bench | Agentic | #17/ 189 | 84 | Terminal-Bench 2.0 leaderboard | 2026-06-02 |
Die drei höchstscorierenden kartierten Modelle pro Capability-Family. Wo Claude Mythos Preview auftaucht, ist es hervorgehoben.
Benchmark-Zeilen im öffentlichen Ledger für Claude Mythos Preview in den letzten 120 Tagen. Ältere Zeilen stehen in der vollen Tabelle unten.
| Benchmark | Family | Score | Quelle | Tage her |
|---|---|---|---|---|
| Vals Index | Agentic | 73.42% | Vals AI — Vals Index | 102 |
| SWE-bench Verified | Coding | 93.9% | SWE-bench official leaderboard | 104 |
| Terminal-Bench | Agentic | 84.1% | Terminal-Bench 2.0 leaderboard | 104 |
| ARC-AGI | Reasoning | 24.1% | ARC Prize leaderboard | 104 |
| GPQA Diamond | Reasoning | 94.6% | GPQA Diamond paper leaderboard | 104 |
Ein hoher Composite, der eine schwache Family versteckt, ist eine Falle. Diese Balken zeigen Families ohne öffentlichen Test — und wo das Modell führt.
Hover auf einen Punkt zeigt Name, Score und Input-Preis. Per Tastatur: die zwölf besten mit Tab durchgehen oder die Rangliste unten nutzen.
Jeder Katalog-Benchmark für Claude Mythos Preview. Scores verlinken zur Originalquelle; Lücken heißen: noch keine öffentliche Zeile.
5 von 37 Katalog-Benchmarks haben eine belegte Zeile für Claude Mythos Preview.
24.1%
ARC-AGI-2 semi-private (low compute)
94.6%
GPQA Diamond accuracy
93.9%
SWE-bench Verified (best-of-3 harness)
84.1%
Terminal-Bench 2.0 (audited harness)
73.42%
Vals Index
The Pack · Redaktionsnewsletter
Eine kurze E-Mail, wenn ein Tool erscheint oder den Status wechselt. Kein Tracking, keine Drittanbieter-Analytics. Abmeldung mit einem Klick.