Benchmarks / Mathe

FrontierMath

FrontierMath Tiers 1-3

Harte unveröffentlichte Mathematik: 295 private Tiers-1-3-Aufgaben (v2), bei denen das Modell nach iterativem Reasoning und Code-Ausführung eine Python-answer()-Funktion abgibt.

Was dieser Benchmark nicht misst
  • Tier-4-Forschungsprobleme — die 43-Aufgaben-Erweiterung ist ein separates, härteres Set. Tiers-1-3-Headlines nicht mit Tier 4 mischen.
  • Contest-MATH- / AIME-Können — diese Suites sind gesättigt. FrontierMath sind originale Expertenaufgaben, keine recycelten Olympiad-Papers.
  • Ob die Herleitung lesbar ist — gewertet wird bestanden/nicht bestanden am abgegebenen Python-Objekt, keine Beweisnote.
Analyse

Warum dieser Benchmark nützlich ist

Wenn MATH und AIME die Frontier nicht mehr trennen, ist das der lebende Mathe-Trenner: originale Expertenaufgaben, Python-fähig, noch weit von der Decke.

Umfang

Abdeckung

Aufgabenfamilie
Mathe
Format
Privates Set aus 295 Tiers-1-3-Aufgaben (v2, Korrektur 12. Jun. 2026). Das Modell darf laut denken, ein zustandsloses Python-Tool aufrufen und muss eine answer()-Funktion abgeben. Token-Limit 1.000.000.
Bewertung
Pass-Rate auf dem privaten Tiers-1-3-v2-Set (1 wenn das abgegebene Objekt stimmt, sonst 0). VerdictPal-Zeilen nutzen Epochs besten internen Lauf pro Modell aus der öffentlichen CSV.
Verantwortliche Stelle
Epoch AI
Lesehilfe

So liest du die Scores

Lies die private Tiers-1-3-v2-Pass-Rate, keine Vendor-MATH-500-Headlines. Epoch-Finanzierung umfasst exklusiven OpenAI-Zugang zu einem Teilset — OpenAI-Zeilen mit diesem Konflikt lesen. GPT-5.6 Sol steht in der Epoch-CSV vom 2026-08-15 noch nicht.

Blinde Flecken

Was er nicht abdeckt

  • Tier-4-Forschungsprobleme — die 43-Aufgaben-Erweiterung ist ein separates, härteres Set. Tiers-1-3-Headlines nicht mit Tier 4 mischen.
  • Contest-MATH- / AIME-Können — diese Suites sind gesättigt. FrontierMath sind originale Expertenaufgaben, keine recycelten Olympiad-Papers.
  • Ob die Herleitung lesbar ist — gewertet wird bestanden/nicht bestanden am abgegebenen Python-Objekt, keine Beweisnote.
Scores

Evidenz-Ledger

295 private Aufgaben nach der Korrektur vom 12. Jun. 2026. Das ist die Hub-Primärspur.

15 Zeilen
1515 Zeilen
52.4%bester Score
15quellgeprüft
1Quellen
2026-08-15Quelldatum
Papers / model cards15

manual-snapshot · manual

Verteilung

Wo die Zeilen liegen

0255075100

Auf die Skala dieses Benchmarks normalisiert (0–100). Die Tabelle zeigt die Rohwerte.

Zeitverlauf

Neueste Belege

  1. GPT-5.5 Pro52.4% · Epoch AI FrontierMath Tiers 1-3 (v2) CSV
  2. GPT 5.551.7% · Epoch AI FrontierMath Tiers 1-3 (v2) CSV
  3. GPT-5.4 Pro50% · Epoch AI FrontierMath Tiers 1-3 (v2) CSV
  4. GPT 5.447.6% · Epoch AI FrontierMath Tiers 1-3 (v2) CSV
  5. Claude Opus 4.847.24% · Epoch AI FrontierMath Tiers 1-3 (v2) CSV

Scores nutzen die eigene Einheit und Skala dieses Benchmarks, keinen universellen Qualitätswert.

#ModellVeröffentlichungScoreHerkunftBeleglage
1GPT-5.5 ProOpenAIEpoch-CSV-Zeile `gpt-5.5-pro-pre-release_high`; bester interner Tiers-1-3-v2-Lauf (Start 2026-04-23). OpenAI hat FrontierMath finanziert. Epoch veröffentlicht einen Interessenkonflikt-Hinweis.2026-04-2352.4%
Epoch AI FrontierMath Tiers 1-3 (v2) CSV2026-08-15
Quelle geprüft
2GPT 5.5OpenAIEpoch-CSV-Zeile `gpt-5.5-pre-release_xhigh`; bester interner Tiers-1-3-v2-Lauf (Start 2026-04-23). OpenAI hat FrontierMath finanziert. Epoch veröffentlicht einen Interessenkonflikt-Hinweis.2026-04-2351.7%
Epoch AI FrontierMath Tiers 1-3 (v2) CSV2026-08-15
Quelle geprüft
3GPT-5.4 ProOpenAIEpoch-CSV-Zeile `gpt-5.4-pro-2026-03-05_xhigh`; bester interner Tiers-1-3-v2-Lauf (Start 2026-03-06). OpenAI hat FrontierMath finanziert. Epoch veröffentlicht einen Interessenkonflikt-Hinweis.2026-03-0550%
Epoch AI FrontierMath Tiers 1-3 (v2) CSV2026-08-15
Quelle geprüft
4GPT 5.4OpenAIEpoch-CSV-Zeile `gpt-5.4-2026-03-05_xhigh`; bester interner Tiers-1-3-v2-Lauf (Start 2026-03-06). OpenAI hat FrontierMath finanziert. Epoch veröffentlicht einen Interessenkonflikt-Hinweis.2026-03-0547.6%
Epoch AI FrontierMath Tiers 1-3 (v2) CSV2026-08-15
Quelle geprüft
5Claude Opus 4.8AnthropicEpoch-CSV-Zeile `claude-opus-4-8_max`; bester interner Tiers-1-3-v2-Lauf (Start 2026-06-08). OpenAI hat FrontierMath finanziert. Epoch veröffentlicht einen Interessenkonflikt-Hinweis.2026-05-2847.24%
Epoch AI FrontierMath Tiers 1-3 (v2) CSV2026-08-15
Quelle geprüft
6Claude Opus 4.7AnthropicEpoch-CSV-Zeile `claude-opus-4-7_xhigh`; bester interner Tiers-1-3-v2-Lauf (Start 2026-04-17). OpenAI hat FrontierMath finanziert. Epoch veröffentlicht einen Interessenkonflikt-Hinweis.2026-04-1643.79%
Epoch AI FrontierMath Tiers 1-3 (v2) CSV2026-08-15
Quelle geprüft
7Claude Opus 4.6AnthropicEpoch-CSV-Zeile `claude-opus-4-6_max`; bester interner Tiers-1-3-v2-Lauf (Start 2026-02-12). OpenAI hat FrontierMath finanziert. Epoch veröffentlicht einen Interessenkonflikt-Hinweis.2026-02-0540.7%
Epoch AI FrontierMath Tiers 1-3 (v2) CSV2026-08-15
Quelle geprüft
8GPT-5.2OpenAIEpoch-CSV-Zeile `gpt-5.2-2025-12-11_xhigh`; bester interner Tiers-1-3-v2-Lauf (Start 2025-12-13). OpenAI hat FrontierMath finanziert. Epoch veröffentlicht einen Interessenkonflikt-Hinweis.2025-12-1140.7%
Epoch AI FrontierMath Tiers 1-3 (v2) CSV2026-08-15
Quelle geprüft
9Muse SparkOtherEpoch-CSV-Zeile `muse-spark`; bester interner Tiers-1-3-v2-Lauf (Start 2026-04-08). OpenAI hat FrontierMath finanziert. Epoch veröffentlicht einen Interessenkonflikt-Hinweis.2026-01-0139%
Epoch AI FrontierMath Tiers 1-3 (v2) CSV2026-08-15
Quelle geprüft
10Gemini 3.5 FlashGoogleEpoch-CSV-Zeile `gemini-3.5-flash_high`; bester interner Tiers-1-3-v2-Lauf (Start 2026-05-22). OpenAI hat FrontierMath finanziert. Epoch veröffentlicht einen Interessenkonflikt-Hinweis.2026-05-1938.97%
Epoch AI FrontierMath Tiers 1-3 (v2) CSV2026-08-15
Quelle geprüft
11Kimi K2.6MoonshotEpoch-CSV-Zeile `kimi-k2.6`; bester interner Tiers-1-3-v2-Lauf (Start 2026-05-07). OpenAI hat FrontierMath finanziert. Epoch veröffentlicht einen Interessenkonflikt-Hinweis.2026-04-2038.97%
Epoch AI FrontierMath Tiers 1-3 (v2) CSV2026-08-15
Quelle geprüft
12Gemini 3 ProGoogleEpoch-CSV-Zeile `gemini-3-pro-preview`; bester interner Tiers-1-3-v2-Lauf (Start 2025-11-21). OpenAI hat FrontierMath finanziert. Epoch veröffentlicht einen Interessenkonflikt-Hinweis.2025-11-1837.6%
Epoch AI FrontierMath Tiers 1-3 (v2) CSV2026-08-15
Quelle geprüft
13Gemini 3.1 ProGoogleEpoch-CSV-Zeile `gemini-3.1-pro-preview`; bester interner Tiers-1-3-v2-Lauf (Start 2026-02-19). OpenAI hat FrontierMath finanziert. Epoch veröffentlicht einen Interessenkonflikt-Hinweis.2026-02-1936.9%
Epoch AI FrontierMath Tiers 1-3 (v2) CSV2026-08-15
Quelle geprüft
14GLM-5.1ZhipuEpoch-CSV-Zeile `glm-5.1`; bester interner Tiers-1-3-v2-Lauf (Start 2026-05-11). OpenAI hat FrontierMath finanziert. Epoch veröffentlicht einen Interessenkonflikt-Hinweis.2026-04-0733.45%
Epoch AI FrontierMath Tiers 1-3 (v2) CSV2026-08-15
Quelle geprüft
15Claude Sonnet 4.6AnthropicEpoch-CSV-Zeile `claude-sonnet-4-6_16K`; bester interner Tiers-1-3-v2-Lauf (Start 2026-02-20). OpenAI hat FrontierMath finanziert. Epoch veröffentlicht einen Interessenkonflikt-Hinweis.2026-02-1732.4%
Epoch AI FrontierMath Tiers 1-3 (v2) CSV2026-08-15
Quelle geprüft
Methode

Was er abdeckt

Scores aus Epochs öffentlicher CSV vom 2026-08-15 (interne Läufe). Eine Zeile pro Atlas-Modell, beste Effort-Variante. OpenAI hat FrontierMath finanziert; Epoch veröffentlicht einen Interessenkonflikt-Hinweis.

Score-Obergrenze

Wo er an Grenzen stößt

Menschliche Expertenzeit sind Stunden bis Tage pro Aufgabe. Frontier-Pass-Raten in der Epoch-CSV clustern auf Tiers 1-3 v2 deutlich unter 60 %.

Tools, die ihn ausweisen

Belege

Quellen und weiterführende Lektüre

Fragen zu diesem Benchmark

Jede Antwort unten stammt aus den datierten Feldern dieser Seite. Nichts davon ist zusätzlich für Suchmaschinen geschrieben.

Was misst FrontierMath?

Harte unveröffentlichte Mathematik: 295 private Tiers-1-3-Aufgaben (v2), bei denen das Modell nach iterativem Reasoning und Code-Ausführung eine Python-answer()-Funktion abgibt.

Was beweist ein hoher FrontierMath-Wert nicht?

Ein starkes FrontierMath-Ergebnis sagt nichts aus über:

  • Tier-4-Forschungsprobleme — die 43-Aufgaben-Erweiterung ist ein separates, härteres Set. Tiers-1-3-Headlines nicht mit Tier 4 mischen.
  • Contest-MATH- / AIME-Können — diese Suites sind gesättigt. FrontierMath sind originale Expertenaufgaben, keine recycelten Olympiad-Papers.
  • Ob die Herleitung lesbar ist — gewertet wird bestanden/nicht bestanden am abgegebenen Python-Objekt, keine Beweisnote.

Wie wird FrontierMath bewertet?

Pass-Rate auf dem privaten Tiers-1-3-v2-Set (1 wenn das abgegebene Objekt stimmt, sonst 0). VerdictPal-Zeilen nutzen Epochs besten internen Lauf pro Modell aus der öffentlichen CSV. Aufgabenformat: Privates Set aus 295 Tiers-1-3-Aufgaben (v2, Korrektur 12. Jun. 2026). Das Modell darf laut denken, ein zustandsloses Python-Tool aufrufen und muss eine answer()-Funktion abgeben. Token-Limit 1.000.000.

Ist FrontierMath gesättigt?

FrontierMath ist im Atlas derzeit als Aktiv markiert. Kontext zur Obergrenze: Menschliche Expertenzeit sind Stunden bis Tage pro Aufgabe. Frontier-Pass-Raten in der Epoch-CSV clustern auf Tiers 1-3 v2 deutlich unter 60 %.

Können FrontierMath-Ergebnisse durch Trainingsdaten verunreinigt sein?

Das Kontaminationsrisiko für FrontierMath ist als Kontamination niedrig eingestuft. Behandle jede Zeile auf dieser Seite als öffentliche Angabe mit Quelle und Datum, nicht als kontrolliertes Experiment.

The Pack · Redaktionsnewsletter

Neue Tools in dein Postfach. Kostenlos.

Eine kurze E-Mail, wenn ein Tool erscheint oder den Status wechselt. Kein Tracking, keine Drittanbieter-Analytics. Abmeldung mit einem Klick.