Warum dieser Benchmark nützlich ist
Er liefert ein klares Reasoning-Signal mit richtigen oder falschen Antworten. Vergleiche damit strukturiertes Problemlösen und achte auf Stichprobengröße sowie pass@k.
Benchmarks / Mathe
Schritt-für-Schritt-Lösungen zu 12.500 Wettbewerbs-Mathematikaufgaben (AMC/AIME-Stil), bewertet an der finalen Antwort.
Er liefert ein klares Reasoning-Signal mit richtigen oder falschen Antworten. Vergleiche damit strukturiertes Problemlösen und achte auf Stichprobengröße sowie pass@k.
Lies MATH als ausgedient Signal mit hohes kontaminationsrisiko. Vergleiche Modelle nur, wenn Quelle, Testumgebung, Prompting, Sampling und Score-Einheit übereinstimmen.
Auf die Skala dieses Benchmarks normalisiert (0–100). Die Tabelle zeigt die Rohwerte.
Scores nutzen die eigene Einheit und Skala dieses Benchmarks, keinen universellen Qualitätswert.
| # | Modell | Veröffentlichung | Score | Herkunft | Beleglage |
|---|---|---|---|---|---|
| 1 | OpenAI o3OpenAI | 2025-04-16 | 99.2% | 2026-07-21 | Quelle geprüft |
| 2 | OpenAI o1OpenAI | 2024-09-12 | 97% | 2026-07-21 | Quelle geprüft |
| 1 | o3 (high compute)OpenAIMATH (Hendrycks et al.). Extended thinking. | 2025-04-16 | 91.1% | OpenAI: Learning to Reason2025-01-20 | Quelle geprüft |
| 2 | GPT 5.5OpenAIMATH. Contamination warning applies. | 2026-04-23 | 89.6% | OpenAI model release notes2026-04-23 | Prüfung nötig |
| 5 | Llama 4 MaverickMeta | 2026-04-05 | 88.87% | 2026-07-21 | Quelle geprüft |
| 3 | Claude Opus 4.8AnthropicMATH (full set). Contamination warning applies. | 2026-05-28 | 88.4% | Anthropic Claude 4 family2026-05-28 | Prüfung nötig |
| 4 | GPT 5OpenAIMATH. Contamination warning applies. | 2025-12-11 | 87.2% | OpenAI model release notes2025-12-01 | Prüfung nötig |
| 5 | Gemini 3.1 ProGoogleMATH. Contamination warning applies. | 2026-02-19 | 86.7% | Google Gemini 3.1 Pro2026-02-19 | Prüfung nötig |
| 6 | Claude Opus 4AnthropicMATH (full 12,500 problems). High contamination risk — these numbers reflect trained performance, not raw reasoning. | 2024-07-01 | 85.6% | Anthropic model card2025-06-01 | Prüfung nötig |
| 10 | Llama 4 ScoutMeta | 2026-04-05 | 84.4% | 2026-07-21 | Quelle geprüft |
| 7 | Claude Sonnet 4.6AnthropicMATH. Contamination warning applies. | 2026-02-17 | 84.2% | Anthropic Claude 3.7/4.6 model card2026-02-17 | Prüfung nötig |
| 8 | DeepSeek V4 Pro MaxDeepSeekMATH. Contamination warning applies. | 2026-04-24 | 83.9% | DeepSeek V4 release2026-04-24 | Prüfung nötig |
| 9 | Kimi K2.6MoonshotMATH. Contamination warning applies. | 2026-04-20 | 82.5% | Moonshot Kimi K2.62026-04-20 | Prüfung nötig |
| 14 | Command ACohere | 2026-03-15 | 81.87% | 2026-07-21 | Quelle geprüft |
| 10 | Qwen 3.7 MaxAlibabaMATH. Contamination warning applies. | 2026-05-20 | 81.6% | Alibaba Qwen 3.7 Max2026-05-20 | Prüfung nötig |
| 11 | DeepSeek R1DeepSeekMATH. Contamination warning applies. | 2025-01-20 | 79.8% | DeepSeek R1 model card2025-01-20 | Prüfung nötig |
| 17 | DeepSeek Coder V2DeepSeek | 2024-05-15 | 74.27% | 2026-07-21 | Quelle geprüft |
| 12 | Claude 3.5 Sonnet (2024-06)Anthropic | 2024-06-20 | 71.1% | Anthropic Claude 3.5 Sonnet2024-06-20 | Quelle geprüft |
| 19 | Claude 3 OpusAnthropic | 2024-03-04 | 64.07% | 2026-07-21 | Quelle geprüft |
| 13 | GPT-4 (2023)OpenAI | 2023-03-14 | 52.9% | GPT-4 Technical Report2023-03-15 | Quelle geprüft |
Archiviert — MATH-500 (öffentlicher AA-Lauf) meldet jetzt 99 %+ für Frontier-Modelle. Volles MATH-Set clustert über 90 %. Für harte Mathe-Trennung FrontierMath bevorzugen.
Noch ist keine Obergrenze erfasst. Wenn sich Scores oben bündeln, kann der Benchmark Frontier-Modelle möglicherweise nicht mehr trennen.
The Pack · Redaktionsnewsletter
Eine kurze E-Mail, wenn eine Karte erscheint oder den Status wechselt. Kein Tracking, keine Drittanbieter-Analytics. Abmeldung mit einem Klick.