Warum dieser Benchmark nützlich ist
Historische Wettbewerbs-Mathe-Suite — einst Standard-Reasoning-Maßstab. Jetzt gesättigt; für Kontext behalten, für Frontier-Trennung härtere Mathe-Evals bevorzugen.
Schritt-für-Schritt-Lösungen zu 12.500 Wettbewerbs-Mathematikaufgaben (AMC/AIME-Stil), bewertet an der finalen Antwort.
Historische Wettbewerbs-Mathe-Suite — einst Standard-Reasoning-Maßstab. Jetzt gesättigt; für Kontext behalten, für Frontier-Trennung härtere Mathe-Evals bevorzugen.
Nur Endantwort-Genauigkeit — falscher Weg mit richtigem Kasten scored trotzdem. MATH-500 und volles MATH clustern für Frontier nahe der Decke; nicht für aktuelle Rangordnung.
Auf die Skala dieses Benchmarks normalisiert (0–100). Die Tabelle zeigt die Rohwerte.
Scores nutzen die eigene Einheit und Skala dieses Benchmarks, keinen universellen Qualitätswert.
| # | Modell | Veröffentlichung | Score | Herkunft | Beleglage |
|---|---|---|---|---|---|
| 1 | GPT-5 (high)OpenAI | 2025-08-07 | 99.4% | 2026-09-01 | Quelle geprüft |
| 2 | OpenAI o3OpenAI | 2025-04-16 | 99.2% | 2026-09-01 | Quelle geprüft |
| 3 | GPT-5 (medium)OpenAI | 2025-08-07 | 99.13% | 2026-09-01 | Quelle geprüft |
| 4 | Grok 4xAI | 2025-07-10 | 99% | 2026-09-01 | Quelle geprüft |
| 5 | GPT-5 (low)OpenAI | 2025-08-07 | 98.73% | 2026-09-01 | Quelle geprüft |
| 6 | Claude 4 Opus (Reasoning)Anthropic | 2025-05-22 | 98.2% | 2026-09-01 | Quelle geprüft |
| 7 | OpenAI o1OpenAI | 2024-09-12 | 97% | 2026-09-01 | Quelle geprüft |
| 1 | o3 (high compute)OpenAIMATH (Hendrycks et al.). Extended thinking. | 2025-04-16 | 91.1% | OpenAI: Learning to Reason2025-01-20 | Quelle geprüft |
| 2 | GPT 5.5OpenAIMATH. Contamination warning applies. | 2026-04-23 | 89.6% | OpenAI model release notes2026-04-23 | Prüfung nötig |
| 10 | Llama 4 MaverickMeta | 2026-04-05 | 88.87% | 2026-09-01 | Quelle geprüft |
| 3 | Claude Opus 4.8AnthropicMATH (full set). Contamination warning applies. | 2026-05-28 | 88.4% | Anthropic Claude 4 family2026-05-28 | Prüfung nötig |
| 4 | GPT 5OpenAIMATH. Contamination warning applies. | 2025-12-11 | 87.2% | OpenAI model release notes2025-12-01 | Prüfung nötig |
| 5 | Gemini 3.1 ProGoogleMATH. Contamination warning applies. | 2026-02-19 | 86.7% | Google Gemini 3.1 Pro2026-02-19 | Prüfung nötig |
| 6 | Claude Opus 4AnthropicMATH (full 12,500 problems). High contamination risk — these numbers reflect trained performance, not raw reasoning. | 2024-07-01 | 85.6% | Anthropic model card2025-06-01 | Prüfung nötig |
| 15 | Llama 4 ScoutMeta | 2026-04-05 | 84.4% | 2026-09-01 | Quelle geprüft |
| 7 | Claude Sonnet 4.6AnthropicMATH. Contamination warning applies. | 2026-02-17 | 84.2% | Anthropic Claude 3.7/4.6 model card2026-02-17 | Prüfung nötig |
| 8 | DeepSeek V4 Pro MaxDeepSeekMATH. Contamination warning applies. | 2026-04-24 | 83.9% | DeepSeek V4 release2026-04-24 | Prüfung nötig |
| 9 | Kimi K2.6MoonshotMATH. Contamination warning applies. | 2026-04-20 | 82.5% | Moonshot Kimi K2.62026-04-20 | Prüfung nötig |
| 19 | Command ACohere | 2026-03-15 | 81.87% | 2026-09-01 | Quelle geprüft |
| 10 | Qwen 3.7 MaxAlibabaMATH. Contamination warning applies. | 2026-05-20 | 81.6% | Alibaba Qwen 3.7 Max2026-05-20 | Prüfung nötig |
| 11 | DeepSeek R1DeepSeekMATH. Contamination warning applies. | 2025-01-20 | 79.8% | DeepSeek R1 model card2025-01-20 | Prüfung nötig |
| 22 | DeepSeek Coder V2DeepSeek | 2024-05-15 | 74.27% | 2026-09-01 | Quelle geprüft |
| 12 | Claude 3.5 Sonnet (2024-06)Anthropic | 2024-06-20 | 71.1% | Anthropic Claude 3.5 Sonnet2024-06-20 | Quelle geprüft |
| 24 | Claude 3 OpusAnthropic | 2024-03-04 | 64.07% | 2026-09-01 | Quelle geprüft |
| 13 | GPT-4 (2023)OpenAI | 2023-03-14 | 52.9% | GPT-4 Technical Report2023-03-15 | Quelle geprüft |
Archiviert — MATH-500 (öffentlicher AA-Lauf) meldet jetzt 99 %+ für Frontier-Modelle. Volles MATH-Set clustert über 90 %. Für harte Mathe-Trennung /benchmarks/frontiermath bevorzugen.
Noch ist keine Obergrenze erfasst. Wenn sich Scores oben bündeln, kann der Benchmark Frontier-Modelle möglicherweise nicht mehr trennen.
Jede Antwort unten stammt aus den datierten Feldern dieser Seite. Nichts davon ist zusätzlich für Suchmaschinen geschrieben.
Schritt-für-Schritt-Lösungen zu 12.500 Wettbewerbs-Mathematikaufgaben (AMC/AIME-Stil), bewertet an der finalen Antwort.
Ein starkes MATH-Ergebnis sagt nichts aus über:
Genauigkeit der Endantwort. Aufgabenformat: 12.500 Aufgaben über 7 Fächer und 5 Schwierigkeitsstufen; Abgleich der normalisierten Endantwort.
MATH ist im Atlas derzeit als Ausgedient markiert.
Das Kontaminationsrisiko für MATH ist als Kontamination hoch eingestuft. Behandle jede Zeile auf dieser Seite als öffentliche Angabe mit Quelle und Datum, nicht als kontrolliertes Experiment.
The Pack · Redaktionsnewsletter
Eine kurze E-Mail, wenn ein Tool erscheint oder den Status wechselt. Kein Tracking, keine Drittanbieter-Analytics. Abmeldung mit einem Klick.