Warum dieser Benchmark nützlich ist
Wenn MATH und AIME die Frontier nicht mehr trennen, ist das der lebende Mathe-Trenner: originale Expertenaufgaben, Python-fähig, noch weit von der Decke.
FrontierMath Tiers 1-3
Harte unveröffentlichte Mathematik: 295 private Tiers-1-3-Aufgaben (v2), bei denen das Modell nach iterativem Reasoning und Code-Ausführung eine Python-answer()-Funktion abgibt.
Wenn MATH und AIME die Frontier nicht mehr trennen, ist das der lebende Mathe-Trenner: originale Expertenaufgaben, Python-fähig, noch weit von der Decke.
Lies die private Tiers-1-3-v2-Pass-Rate, keine Vendor-MATH-500-Headlines. Epoch-Finanzierung umfasst exklusiven OpenAI-Zugang zu einem Teilset — OpenAI-Zeilen mit diesem Konflikt lesen. GPT-5.6 Sol steht in der Epoch-CSV vom 2026-08-15 noch nicht.
295 private Aufgaben nach der Korrektur vom 12. Jun. 2026. Das ist die Hub-Primärspur.
Auf die Skala dieses Benchmarks normalisiert (0–100). Die Tabelle zeigt die Rohwerte.
Scores nutzen die eigene Einheit und Skala dieses Benchmarks, keinen universellen Qualitätswert.
| # | Modell | Veröffentlichung | Score | Herkunft | Beleglage |
|---|---|---|---|---|---|
| 1 | GPT-5.5 ProOpenAIEpoch-CSV-Zeile `gpt-5.5-pro-pre-release_high`; bester interner Tiers-1-3-v2-Lauf (Start 2026-04-23). OpenAI hat FrontierMath finanziert. Epoch veröffentlicht einen Interessenkonflikt-Hinweis. | 2026-04-23 | 52.4% | Epoch AI FrontierMath Tiers 1-3 (v2) CSV2026-08-15 | Quelle geprüft |
| 2 | GPT 5.5OpenAIEpoch-CSV-Zeile `gpt-5.5-pre-release_xhigh`; bester interner Tiers-1-3-v2-Lauf (Start 2026-04-23). OpenAI hat FrontierMath finanziert. Epoch veröffentlicht einen Interessenkonflikt-Hinweis. | 2026-04-23 | 51.7% | Epoch AI FrontierMath Tiers 1-3 (v2) CSV2026-08-15 | Quelle geprüft |
| 3 | GPT-5.4 ProOpenAIEpoch-CSV-Zeile `gpt-5.4-pro-2026-03-05_xhigh`; bester interner Tiers-1-3-v2-Lauf (Start 2026-03-06). OpenAI hat FrontierMath finanziert. Epoch veröffentlicht einen Interessenkonflikt-Hinweis. | 2026-03-05 | 50% | Epoch AI FrontierMath Tiers 1-3 (v2) CSV2026-08-15 | Quelle geprüft |
| 4 | GPT 5.4OpenAIEpoch-CSV-Zeile `gpt-5.4-2026-03-05_xhigh`; bester interner Tiers-1-3-v2-Lauf (Start 2026-03-06). OpenAI hat FrontierMath finanziert. Epoch veröffentlicht einen Interessenkonflikt-Hinweis. | 2026-03-05 | 47.6% | Epoch AI FrontierMath Tiers 1-3 (v2) CSV2026-08-15 | Quelle geprüft |
| 5 | Claude Opus 4.8AnthropicEpoch-CSV-Zeile `claude-opus-4-8_max`; bester interner Tiers-1-3-v2-Lauf (Start 2026-06-08). OpenAI hat FrontierMath finanziert. Epoch veröffentlicht einen Interessenkonflikt-Hinweis. | 2026-05-28 | 47.24% | Epoch AI FrontierMath Tiers 1-3 (v2) CSV2026-08-15 | Quelle geprüft |
| 6 | Claude Opus 4.7AnthropicEpoch-CSV-Zeile `claude-opus-4-7_xhigh`; bester interner Tiers-1-3-v2-Lauf (Start 2026-04-17). OpenAI hat FrontierMath finanziert. Epoch veröffentlicht einen Interessenkonflikt-Hinweis. | 2026-04-16 | 43.79% | Epoch AI FrontierMath Tiers 1-3 (v2) CSV2026-08-15 | Quelle geprüft |
| 7 | Claude Opus 4.6AnthropicEpoch-CSV-Zeile `claude-opus-4-6_max`; bester interner Tiers-1-3-v2-Lauf (Start 2026-02-12). OpenAI hat FrontierMath finanziert. Epoch veröffentlicht einen Interessenkonflikt-Hinweis. | 2026-02-05 | 40.7% | Epoch AI FrontierMath Tiers 1-3 (v2) CSV2026-08-15 | Quelle geprüft |
| 8 | GPT-5.2OpenAIEpoch-CSV-Zeile `gpt-5.2-2025-12-11_xhigh`; bester interner Tiers-1-3-v2-Lauf (Start 2025-12-13). OpenAI hat FrontierMath finanziert. Epoch veröffentlicht einen Interessenkonflikt-Hinweis. | 2025-12-11 | 40.7% | Epoch AI FrontierMath Tiers 1-3 (v2) CSV2026-08-15 | Quelle geprüft |
| 9 | Muse SparkOtherEpoch-CSV-Zeile `muse-spark`; bester interner Tiers-1-3-v2-Lauf (Start 2026-04-08). OpenAI hat FrontierMath finanziert. Epoch veröffentlicht einen Interessenkonflikt-Hinweis. | 2026-01-01 | 39% | Epoch AI FrontierMath Tiers 1-3 (v2) CSV2026-08-15 | Quelle geprüft |
| 10 | Gemini 3.5 FlashGoogleEpoch-CSV-Zeile `gemini-3.5-flash_high`; bester interner Tiers-1-3-v2-Lauf (Start 2026-05-22). OpenAI hat FrontierMath finanziert. Epoch veröffentlicht einen Interessenkonflikt-Hinweis. | 2026-05-19 | 38.97% | Epoch AI FrontierMath Tiers 1-3 (v2) CSV2026-08-15 | Quelle geprüft |
| 11 | Kimi K2.6MoonshotEpoch-CSV-Zeile `kimi-k2.6`; bester interner Tiers-1-3-v2-Lauf (Start 2026-05-07). OpenAI hat FrontierMath finanziert. Epoch veröffentlicht einen Interessenkonflikt-Hinweis. | 2026-04-20 | 38.97% | Epoch AI FrontierMath Tiers 1-3 (v2) CSV2026-08-15 | Quelle geprüft |
| 12 | Gemini 3 ProGoogleEpoch-CSV-Zeile `gemini-3-pro-preview`; bester interner Tiers-1-3-v2-Lauf (Start 2025-11-21). OpenAI hat FrontierMath finanziert. Epoch veröffentlicht einen Interessenkonflikt-Hinweis. | 2025-11-18 | 37.6% | Epoch AI FrontierMath Tiers 1-3 (v2) CSV2026-08-15 | Quelle geprüft |
| 13 | Gemini 3.1 ProGoogleEpoch-CSV-Zeile `gemini-3.1-pro-preview`; bester interner Tiers-1-3-v2-Lauf (Start 2026-02-19). OpenAI hat FrontierMath finanziert. Epoch veröffentlicht einen Interessenkonflikt-Hinweis. | 2026-02-19 | 36.9% | Epoch AI FrontierMath Tiers 1-3 (v2) CSV2026-08-15 | Quelle geprüft |
| 14 | GLM-5.1ZhipuEpoch-CSV-Zeile `glm-5.1`; bester interner Tiers-1-3-v2-Lauf (Start 2026-05-11). OpenAI hat FrontierMath finanziert. Epoch veröffentlicht einen Interessenkonflikt-Hinweis. | 2026-04-07 | 33.45% | Epoch AI FrontierMath Tiers 1-3 (v2) CSV2026-08-15 | Quelle geprüft |
| 15 | Claude Sonnet 4.6AnthropicEpoch-CSV-Zeile `claude-sonnet-4-6_16K`; bester interner Tiers-1-3-v2-Lauf (Start 2026-02-20). OpenAI hat FrontierMath finanziert. Epoch veröffentlicht einen Interessenkonflikt-Hinweis. | 2026-02-17 | 32.4% | Epoch AI FrontierMath Tiers 1-3 (v2) CSV2026-08-15 | Quelle geprüft |
Scores aus Epochs öffentlicher CSV vom 2026-08-15 (interne Läufe). Eine Zeile pro Atlas-Modell, beste Effort-Variante. OpenAI hat FrontierMath finanziert; Epoch veröffentlicht einen Interessenkonflikt-Hinweis.
Menschliche Expertenzeit sind Stunden bis Tage pro Aufgabe. Frontier-Pass-Raten in der Epoch-CSV clustern auf Tiers 1-3 v2 deutlich unter 60 %.
Jede Antwort unten stammt aus den datierten Feldern dieser Seite. Nichts davon ist zusätzlich für Suchmaschinen geschrieben.
Harte unveröffentlichte Mathematik: 295 private Tiers-1-3-Aufgaben (v2), bei denen das Modell nach iterativem Reasoning und Code-Ausführung eine Python-answer()-Funktion abgibt.
Ein starkes FrontierMath-Ergebnis sagt nichts aus über:
Pass-Rate auf dem privaten Tiers-1-3-v2-Set (1 wenn das abgegebene Objekt stimmt, sonst 0). VerdictPal-Zeilen nutzen Epochs besten internen Lauf pro Modell aus der öffentlichen CSV. Aufgabenformat: Privates Set aus 295 Tiers-1-3-Aufgaben (v2, Korrektur 12. Jun. 2026). Das Modell darf laut denken, ein zustandsloses Python-Tool aufrufen und muss eine answer()-Funktion abgeben. Token-Limit 1.000.000.
FrontierMath ist im Atlas derzeit als Aktiv markiert. Kontext zur Obergrenze: Menschliche Expertenzeit sind Stunden bis Tage pro Aufgabe. Frontier-Pass-Raten in der Epoch-CSV clustern auf Tiers 1-3 v2 deutlich unter 60 %.
Das Kontaminationsrisiko für FrontierMath ist als Kontamination niedrig eingestuft. Behandle jede Zeile auf dieser Seite als öffentliche Angabe mit Quelle und Datum, nicht als kontrolliertes Experiment.
The Pack · Redaktionsnewsletter
Eine kurze E-Mail, wenn ein Tool erscheint oder den Status wechselt. Kein Tracking, keine Drittanbieter-Analytics. Abmeldung mit einem Klick.