Benchmarks / Mathe

MATH

Schritt-für-Schritt-Lösungen zu 12.500 Wettbewerbs-Mathematikaufgaben (AMC/AIME-Stil), bewertet an der finalen Antwort.

MatheSolidAusgedientHohes KontaminationsrisikoSeit 2021
Was dieser Benchmark nicht misst
  • Ob die Herleitung korrekt ist — nur die Endantwort zählt, eine richtige Antwort aus falschem Weg wird gewertet.
  • Neue Mathematik — jede Aufgabe hat eine bekannte Lösung aus bestehenden Wettbewerben.
Analyse

Warum dieser Benchmark nützlich ist

Er liefert ein klares Reasoning-Signal mit richtigen oder falschen Antworten. Vergleiche damit strukturiertes Problemlösen und achte auf Stichprobengröße sowie pass@k.

Umfang

Abdeckung

Aufgabenfamilie
Mathe
Format
12.500 Aufgaben über 7 Fächer und 5 Schwierigkeitsstufen; Abgleich der normalisierten Endantwort.
Bewertung
Genauigkeit der Endantwort.
Verantwortliche Stelle
Hendrycks et al.
Lesehilfe

So liest du die Scores

Lies MATH als ausgedient Signal mit hohes kontaminationsrisiko. Vergleiche Modelle nur, wenn Quelle, Testumgebung, Prompting, Sampling und Score-Einheit übereinstimmen.

Blinde Flecken

Was er nicht abdeckt

  • Ob die Herleitung korrekt ist — nur die Endantwort zählt, eine richtige Antwort aus falschem Weg wird gewertet.
  • Neue Mathematik — jede Aufgabe hat eine bekannte Lösung aus bestehenden Wettbewerben.
Scores

Evidenz-Ledger

20 Zeilen
2020 Zeilen
99.2%bester Score
10quellgeprüft
3Quellen
2026-07-21bis 2023-03-15
7

api · api

Papers / model cards4

manual-snapshot · manual

Vendor claims9

manual-snapshot · manual

Verteilung

Wo die Zeilen liegen

0255075100

Auf die Skala dieses Benchmarks normalisiert (0–100). Die Tabelle zeigt die Rohwerte.

Zeitverlauf

Neueste Belege

  1. OpenAI o399.2% ·
  2. OpenAI o197% ·
  3. Llama 4 Maverick88.87% ·
  4. Llama 4 Scout84.4% ·
  5. Command A81.87% ·

Scores nutzen die eigene Einheit und Skala dieses Benchmarks, keinen universellen Qualitätswert.

#ModellVeröffentlichungScoreHerkunftBeleglage
1OpenAI o3OpenAI2025-04-1699.2%
2026-07-21
Quelle geprüft
2OpenAI o1OpenAI2024-09-1297%
2026-07-21
Quelle geprüft
1o3 (high compute)OpenAIMATH (Hendrycks et al.). Extended thinking.2025-04-1691.1%
OpenAI: Learning to Reason2025-01-20
Quelle geprüft
2GPT 5.5OpenAIMATH. Contamination warning applies.2026-04-2389.6%
OpenAI model release notes2026-04-23
Prüfung nötig
5Llama 4 MaverickMeta2026-04-0588.87%
2026-07-21
Quelle geprüft
3Claude Opus 4.8AnthropicMATH (full set). Contamination warning applies.2026-05-2888.4%
Anthropic Claude 4 family2026-05-28
Prüfung nötig
4GPT 5OpenAIMATH. Contamination warning applies.2025-12-1187.2%
OpenAI model release notes2025-12-01
Prüfung nötig
5Gemini 3.1 ProGoogleMATH. Contamination warning applies.2026-02-1986.7%
Google Gemini 3.1 Pro2026-02-19
Prüfung nötig
6Claude Opus 4AnthropicMATH (full 12,500 problems). High contamination risk — these numbers reflect trained performance, not raw reasoning.2024-07-0185.6%
Anthropic model card2025-06-01
Prüfung nötig
10Llama 4 ScoutMeta2026-04-0584.4%
2026-07-21
Quelle geprüft
7Claude Sonnet 4.6AnthropicMATH. Contamination warning applies.2026-02-1784.2%
Anthropic Claude 3.7/4.6 model card2026-02-17
Prüfung nötig
8DeepSeek V4 Pro MaxDeepSeekMATH. Contamination warning applies.2026-04-2483.9%
DeepSeek V4 release2026-04-24
Prüfung nötig
9Kimi K2.6MoonshotMATH. Contamination warning applies.2026-04-2082.5%
Moonshot Kimi K2.62026-04-20
Prüfung nötig
14Command ACohere2026-03-1581.87%
2026-07-21
Quelle geprüft
10Qwen 3.7 MaxAlibabaMATH. Contamination warning applies.2026-05-2081.6%
Alibaba Qwen 3.7 Max2026-05-20
Prüfung nötig
11DeepSeek R1DeepSeekMATH. Contamination warning applies.2025-01-2079.8%
DeepSeek R1 model card2025-01-20
Prüfung nötig
17DeepSeek Coder V2DeepSeek2024-05-1574.27%
2026-07-21
Quelle geprüft
12Claude 3.5 Sonnet (2024-06)Anthropic2024-06-2071.1%
Anthropic Claude 3.5 Sonnet2024-06-20
Quelle geprüft
19Claude 3 OpusAnthropic2024-03-0464.07%
2026-07-21
Quelle geprüft
13GPT-4 (2023)OpenAI2023-03-1452.9%
GPT-4 Technical Report2023-03-15
Quelle geprüft
Methode

Was er abdeckt

Archiviert — MATH-500 (öffentlicher AA-Lauf) meldet jetzt 99 %+ für Frontier-Modelle. Volles MATH-Set clustert über 90 %. Für harte Mathe-Trennung FrontierMath bevorzugen.

Score-Obergrenze

Wo er an Grenzen stößt

Noch ist keine Obergrenze erfasst. Wenn sich Scores oben bündeln, kann der Benchmark Frontier-Modelle möglicherweise nicht mehr trennen.

Tools, die ihn ausweisen

Belege

Quellen und weiterführende Lektüre

The Pack · Redaktionsnewsletter

Neue Karten in dein Postfach. Kostenlos.

Eine kurze E-Mail, wenn eine Karte erscheint oder den Status wechselt. Kein Tracking, keine Drittanbieter-Analytics. Abmeldung mit einem Klick.