Warum dieser Benchmark nützlich ist
Historisches Wettbewerbs-Mathe-Signal — einst nützlich für hartes Ganzzahl-Reasoning. Für Frontier-Modelle mit Extended Thinking gelöst; für Kontext behalten, nicht für aktuelle Rangordnung.
AIME
Schwere Schulwettbewerbs-Mathematik: 15 Aufgaben mit Ganzzahl-Antwort pro Prüfung. Als Reasoning-Eval genutzt, weil jedes neue Paper anfangs kontaminationsresistent ist — bis es durchsickert.
Historisches Wettbewerbs-Mathe-Signal — einst nützlich für hartes Ganzzahl-Reasoning. Für Frontier-Modelle mit Extended Thinking gelöst; für Kontext behalten, nicht für aktuelle Rangordnung.
Nutze keine AIME-Headlines nahe 100 %, um heutige Frontier zu trennen. Winzige Jahresstichproben (15 Aufgaben) sind verrauscht; Prüfungsjahr und Versuchszahl immer nennen.
Auf die Skala dieses Benchmarks normalisiert (0–100). Die Tabelle zeigt die Rohwerte.
Scores nutzen die eigene Einheit und Skala dieses Benchmarks, keinen universellen Qualitätswert.
| # | Modell | Veröffentlichung | Score | Herkunft | Beleglage |
|---|---|---|---|---|---|
| 1 | GPT-5 Codex (high)OpenAI | 2025-09-23 | 98.67% | 2026-09-01 | Quelle geprüft |
| 2 | Gemini 3 Flash Preview (Reasoning)Google | 2025-12-17 | 97% | 2026-09-01 | Quelle geprüft |
| 3 | GPT-5.2 (medium)OpenAI | 2025-12-11 | 96.67% | 2026-09-01 | Quelle geprüft |
| 4 | MiMo-V2-Flash (Reasoning)Xiaomi | 2025-12-16 | 96.33% | 2026-09-01 | Quelle geprüft |
| 5 | Gemini 3 ProGoogle | 2025-11-18 | 95.67% | 2026-09-01 | Quelle geprüft |
| 6 | GPT-5.1 Codex (high)OpenAI | 2025-11-13 | 95.67% | 2026-09-01 | Quelle geprüft |
| 7 | GLM-4.7 (Reasoning)Zhipu | 2025-12-22 | 95% | 2026-09-01 | Quelle geprüft |
| 8 | Kimi K2 ThinkingMoonshot | 2025-11-06 | 94.67% | 2026-09-01 | Quelle geprüft |
| 9 | GPT-5 (high)OpenAI | 2025-08-07 | 94.33% | 2026-09-01 | Quelle geprüft |
| 1 | Claude Opus 4.8AnthropicAIME 2024 with extended thinking. | 2026-05-28 | 94.2% | Anthropic Claude 4 family2026-05-28 | Prüfung nötig |
| 11 | GPT-5.1OpenAI | 2025-11-13 | 94% | 2026-09-01 | Quelle geprüft |
| 2 | Claude 3.7 Sonnet (2025-02)AnthropicAIME 2024 with extended thinking enabled. | 2025-02-19 | 93.7% | Anthropic Claude 3.7 Sonnet announcement2025-02-19 | Quelle geprüft |
| 13 | Grok 4xAI | 2025-07-10 | 92.67% | 2026-09-01 | Quelle geprüft |
| 14 | DeepSeek V3.2 (Reasoning)DeepSeek | 2025-12-01 | 92% | 2026-09-01 | Quelle geprüft |
| 3 | GPT 5.5OpenAI | 2026-04-23 | 91.8% | OpenAI model release notes2026-04-23 | Prüfung nötig |
| 16 | GPT-5 (medium)OpenAI | 2025-08-07 | 91.67% | 2026-09-01 | Quelle geprüft |
| 17 | Claude Opus 4.5 (Reasoning)Anthropic | 2025-11-24 | 91.33% | 2026-09-01 | Quelle geprüft |
| 4 | GPT 5OpenAI | 2025-12-11 | 89.2% | OpenAI model release notes2025-12-01 | Prüfung nötig |
| 5 | DeepSeek R1DeepSeekAIME 2024 with chain-of-thought. | 2025-01-20 | 88.4% | DeepSeek R1 model card2025-01-20 | Prüfung nötig |
| 20 | OpenAI o3OpenAI | 2025-04-16 | 88.33% | 2026-09-01 | Quelle geprüft |
| 21 | Claude 4.5 Sonnet (Reasoning)Anthropic | 2025-09-29 | 88% | 2026-09-01 | Quelle geprüft |
| 6 | Gemini 3.1 ProGoogle | 2026-02-19 | 87.6% | Google Gemini 3.1 Pro2026-02-19 | Prüfung nötig |
| 7 | o3 (cons@64, AIME 2025)OpenAIAIME 2025 paper; 64-sample consensus. Single-shot is markedly lower. | 2025-04-16 | 87.5% | OpenAI: Learning to Reason2025-01-20 | Quelle geprüft |
| 24 | Gemini 3 Pro Preview (low)Google | 2025-11-18 | 86.67% | 2026-09-01 | Quelle geprüft |
| 9 | Kimi K2.6Moonshot | 2026-04-20 | 85.2% | Moonshot Kimi K2.62026-04-20 | Prüfung nötig |
| 10 | OpenAI o1 (AIME 2024, cons@64)OpenAIWith 64-sample consensus; single-shot is markedly lower. | 2024-09-12 | 83.3% | OpenAI: Learning to Reason2024-09-12 | Quelle geprüft |
| 27 | GPT-5 (low)OpenAI | 2025-08-07 | 83% | 2026-09-01 | Quelle geprüft |
| 28 | MiniMax-M2.1MiniMax | 2025-12-23 | 82.67% | 2026-09-01 | Quelle geprüft |
| 29 | Claude 4.1 Opus (Reasoning)Anthropic | 2025-08-05 | 80.33% | 2026-09-01 | Quelle geprüft |
| 30 | Claude 4 Opus (Reasoning)Anthropic | 2025-05-22 | 73.33% | 2026-09-01 | Quelle geprüft |
| 31 | Claude Opus 4.5Anthropic | 2025-11-24 | 62.67% | 2026-09-01 | Quelle geprüft |
| 32 | Gemini 3 Flash PreviewGoogle | 2025-12-17 | 55.67% | 2026-09-01 | Quelle geprüft |
| 33 | Mistral Large 3Mistral | 2025-12-02 | 38% | 2026-09-01 | Quelle geprüft |
| 34 | Llama 4 MaverickMeta | 2026-04-05 | 19.33% | 2026-09-01 | Quelle geprüft |
| 35 | Llama 4 ScoutMeta | 2026-04-05 | 14% | 2026-09-01 | Quelle geprüft |
| 36 | Command ACohere | 2026-03-15 | 13% | 2026-09-01 | Quelle geprüft |
| 37 | Claude 3 OpusAnthropic | 2024-03-04 | 3.33% | 2026-09-01 | Quelle geprüft |
Archiviert — GPT-5.2 und Peers melden 100 % auf aktuellen AIME-Papieren mit Extended Thinking. Als gelöst behandeln, nicht als Frontier-Trenner. /benchmarks/frontiermath bevorzugen.
Noch ist keine Obergrenze erfasst. Wenn sich Scores oben bündeln, kann der Benchmark Frontier-Modelle möglicherweise nicht mehr trennen.
Jede Antwort unten stammt aus den datierten Feldern dieser Seite. Nichts davon ist zusätzlich für Suchmaschinen geschrieben.
Schwere Schulwettbewerbs-Mathematik: 15 Aufgaben mit Ganzzahl-Antwort pro Prüfung. Als Reasoning-Eval genutzt, weil jedes neue Paper anfangs kontaminationsresistent ist — bis es durchsickert.
Ein starkes AIME-Ergebnis sagt nichts aus über:
Genauigkeit (oft pass@1 oder cons@64). Aufgabenformat: 15 Aufgaben, Ganzzahl-Antworten 0-999; berichtet als Genauigkeit auf AIME 2024/2025.
AIME ist im Atlas derzeit als Ausgedient markiert.
Das Kontaminationsrisiko für AIME ist als Kontamination mittel eingestuft. Behandle jede Zeile auf dieser Seite als öffentliche Angabe mit Quelle und Datum, nicht als kontrolliertes Experiment.
The Pack · Redaktionsnewsletter
Eine kurze E-Mail, wenn ein Tool erscheint oder den Status wechselt. Kein Tracking, keine Drittanbieter-Analytics. Abmeldung mit einem Klick.