Benchmarks / Mathe

MATH

Schritt-für-Schritt-Lösungen zu 12.500 Wettbewerbs-Mathematikaufgaben (AMC/AIME-Stil), bewertet an der finalen Antwort.

Was dieser Benchmark nicht misst
  • Ob die Herleitung korrekt ist — nur die Endantwort zählt, eine richtige Antwort aus falschem Weg wird gewertet.
  • Neue Mathematik — jede Aufgabe hat eine bekannte Lösung aus bestehenden Wettbewerben.
Analyse

Warum dieser Benchmark nützlich ist

Historische Wettbewerbs-Mathe-Suite — einst Standard-Reasoning-Maßstab. Jetzt gesättigt; für Kontext behalten, für Frontier-Trennung härtere Mathe-Evals bevorzugen.

Umfang

Abdeckung

Aufgabenfamilie
Mathe
Format
12.500 Aufgaben über 7 Fächer und 5 Schwierigkeitsstufen; Abgleich der normalisierten Endantwort.
Bewertung
Genauigkeit der Endantwort.
Verantwortliche Stelle
Hendrycks et al.
Lesehilfe

So liest du die Scores

Nur Endantwort-Genauigkeit — falscher Weg mit richtigem Kasten scored trotzdem. MATH-500 und volles MATH clustern für Frontier nahe der Decke; nicht für aktuelle Rangordnung.

Blinde Flecken

Was er nicht abdeckt

  • Ob die Herleitung korrekt ist — nur die Endantwort zählt, eine richtige Antwort aus falschem Weg wird gewertet.
  • Neue Mathematik — jede Aufgabe hat eine bekannte Lösung aus bestehenden Wettbewerben.
Scores

Evidenz-Ledger

25 Zeilen
2525 Zeilen
99.4%bester Score
15quellgeprüft
3Quellen
2026-09-01bis 2023-03-15
12

api · api

Papers / model cards4

manual-snapshot · manual

Vendor claims9

manual-snapshot · manual

Verteilung

Wo die Zeilen liegen

0255075100

Auf die Skala dieses Benchmarks normalisiert (0–100). Die Tabelle zeigt die Rohwerte.

Zeitverlauf

Neueste Belege

  1. GPT-5 (high)99.4% ·
  2. OpenAI o399.2% ·
  3. GPT-5 (medium)99.13% ·
  4. Grok 499% ·
  5. GPT-5 (low)98.73% ·

Scores nutzen die eigene Einheit und Skala dieses Benchmarks, keinen universellen Qualitätswert.

#ModellVeröffentlichungScoreHerkunftBeleglage
1GPT-5 (high)OpenAI2025-08-0799.4%
2026-09-01
Quelle geprüft
2OpenAI o3OpenAI2025-04-1699.2%
2026-09-01
Quelle geprüft
3GPT-5 (medium)OpenAI2025-08-0799.13%
2026-09-01
Quelle geprüft
4Grok 4xAI2025-07-1099%
2026-09-01
Quelle geprüft
5GPT-5 (low)OpenAI2025-08-0798.73%
2026-09-01
Quelle geprüft
6Claude 4 Opus (Reasoning)Anthropic2025-05-2298.2%
2026-09-01
Quelle geprüft
7OpenAI o1OpenAI2024-09-1297%
2026-09-01
Quelle geprüft
1o3 (high compute)OpenAIMATH (Hendrycks et al.). Extended thinking.2025-04-1691.1%
OpenAI: Learning to Reason2025-01-20
Quelle geprüft
2GPT 5.5OpenAIMATH. Contamination warning applies.2026-04-2389.6%
OpenAI model release notes2026-04-23
Prüfung nötig
10Llama 4 MaverickMeta2026-04-0588.87%
2026-09-01
Quelle geprüft
3Claude Opus 4.8AnthropicMATH (full set). Contamination warning applies.2026-05-2888.4%
Anthropic Claude 4 family2026-05-28
Prüfung nötig
4GPT 5OpenAIMATH. Contamination warning applies.2025-12-1187.2%
OpenAI model release notes2025-12-01
Prüfung nötig
5Gemini 3.1 ProGoogleMATH. Contamination warning applies.2026-02-1986.7%
Google Gemini 3.1 Pro2026-02-19
Prüfung nötig
6Claude Opus 4AnthropicMATH (full 12,500 problems). High contamination risk — these numbers reflect trained performance, not raw reasoning.2024-07-0185.6%
Anthropic model card2025-06-01
Prüfung nötig
15Llama 4 ScoutMeta2026-04-0584.4%
2026-09-01
Quelle geprüft
7Claude Sonnet 4.6AnthropicMATH. Contamination warning applies.2026-02-1784.2%
Anthropic Claude 3.7/4.6 model card2026-02-17
Prüfung nötig
8DeepSeek V4 Pro MaxDeepSeekMATH. Contamination warning applies.2026-04-2483.9%
DeepSeek V4 release2026-04-24
Prüfung nötig
9Kimi K2.6MoonshotMATH. Contamination warning applies.2026-04-2082.5%
Moonshot Kimi K2.62026-04-20
Prüfung nötig
19Command ACohere2026-03-1581.87%
2026-09-01
Quelle geprüft
10Qwen 3.7 MaxAlibabaMATH. Contamination warning applies.2026-05-2081.6%
Alibaba Qwen 3.7 Max2026-05-20
Prüfung nötig
11DeepSeek R1DeepSeekMATH. Contamination warning applies.2025-01-2079.8%
DeepSeek R1 model card2025-01-20
Prüfung nötig
22DeepSeek Coder V2DeepSeek2024-05-1574.27%
2026-09-01
Quelle geprüft
12Claude 3.5 Sonnet (2024-06)Anthropic2024-06-2071.1%
Anthropic Claude 3.5 Sonnet2024-06-20
Quelle geprüft
24Claude 3 OpusAnthropic2024-03-0464.07%
2026-09-01
Quelle geprüft
13GPT-4 (2023)OpenAI2023-03-1452.9%
GPT-4 Technical Report2023-03-15
Quelle geprüft
Methode

Was er abdeckt

Archiviert — MATH-500 (öffentlicher AA-Lauf) meldet jetzt 99 %+ für Frontier-Modelle. Volles MATH-Set clustert über 90 %. Für harte Mathe-Trennung /benchmarks/frontiermath bevorzugen.

Score-Obergrenze

Wo er an Grenzen stößt

Noch ist keine Obergrenze erfasst. Wenn sich Scores oben bündeln, kann der Benchmark Frontier-Modelle möglicherweise nicht mehr trennen.

Tools, die ihn ausweisen

Belege

Quellen und weiterführende Lektüre

Fragen zu diesem Benchmark

Jede Antwort unten stammt aus den datierten Feldern dieser Seite. Nichts davon ist zusätzlich für Suchmaschinen geschrieben.

Was misst MATH?

Schritt-für-Schritt-Lösungen zu 12.500 Wettbewerbs-Mathematikaufgaben (AMC/AIME-Stil), bewertet an der finalen Antwort.

Was beweist ein hoher MATH-Wert nicht?

Ein starkes MATH-Ergebnis sagt nichts aus über:

  • Ob die Herleitung korrekt ist — nur die Endantwort zählt, eine richtige Antwort aus falschem Weg wird gewertet.
  • Neue Mathematik — jede Aufgabe hat eine bekannte Lösung aus bestehenden Wettbewerben.

Wie wird MATH bewertet?

Genauigkeit der Endantwort. Aufgabenformat: 12.500 Aufgaben über 7 Fächer und 5 Schwierigkeitsstufen; Abgleich der normalisierten Endantwort.

Ist MATH gesättigt?

MATH ist im Atlas derzeit als Ausgedient markiert.

Können MATH-Ergebnisse durch Trainingsdaten verunreinigt sein?

Das Kontaminationsrisiko für MATH ist als Kontamination hoch eingestuft. Behandle jede Zeile auf dieser Seite als öffentliche Angabe mit Quelle und Datum, nicht als kontrolliertes Experiment.

The Pack · Redaktionsnewsletter

Neue Tools in dein Postfach. Kostenlos.

Eine kurze E-Mail, wenn ein Tool erscheint oder den Status wechselt. Kein Tracking, keine Drittanbieter-Analytics. Abmeldung mit einem Klick.