Benchmarks / Mathe

American Invitational Mathematics Examination

AIME

Schwere Schulwettbewerbs-Mathematik: 15 Aufgaben mit Ganzzahl-Antwort pro Prüfung. Als Reasoning-Eval genutzt, weil jedes neue Paper anfangs kontaminationsresistent ist — bis es durchsickert.

Was dieser Benchmark nicht misst
  • Winzige Stichprobe (15 Aufgaben/Jahr) — eine Aufgabe ist ~6,7 %, Einzelläufe sind verrauscht; pass@k oder mehrere Seeds verlangen.
  • Allgemeine Fähigkeit — starke AIME-Werte korrelieren mit Reasoning-Training, nicht mit Alltagsnutzen.
  • Welches Jahr — '90 % bei AIME' ist ohne Prüfungsjahr und Versuchszahl bedeutungslos.
Analyse

Warum dieser Benchmark nützlich ist

Historisches Wettbewerbs-Mathe-Signal — einst nützlich für hartes Ganzzahl-Reasoning. Für Frontier-Modelle mit Extended Thinking gelöst; für Kontext behalten, nicht für aktuelle Rangordnung.

Umfang

Abdeckung

Aufgabenfamilie
Mathe
Format
15 Aufgaben, Ganzzahl-Antworten 0-999; berichtet als Genauigkeit auf AIME 2024/2025.
Bewertung
Genauigkeit (oft pass@1 oder cons@64).
Verantwortliche Stelle
MAA (exam) · used as an LLM eval
Lesehilfe

So liest du die Scores

Nutze keine AIME-Headlines nahe 100 %, um heutige Frontier zu trennen. Winzige Jahresstichproben (15 Aufgaben) sind verrauscht; Prüfungsjahr und Versuchszahl immer nennen.

Blinde Flecken

Was er nicht abdeckt

  • Winzige Stichprobe (15 Aufgaben/Jahr) — eine Aufgabe ist ~6,7 %, Einzelläufe sind verrauscht; pass@k oder mehrere Seeds verlangen.
  • Allgemeine Fähigkeit — starke AIME-Werte korrelieren mit Reasoning-Training, nicht mit Alltagsnutzen.
  • Welches Jahr — '90 % bei AIME' ist ohne Prüfungsjahr und Versuchszahl bedeutungslos.
Scores

Evidenz-Ledger

37 Zeilen
3737 Zeilen
98.67%bester Score
31quellgeprüft
3Quellen
2026-09-01bis 2024-09-12
28

api · api

Papers / model cards2

manual-snapshot · manual

Vendor claims7

manual-snapshot · manual

Verteilung

Wo die Zeilen liegen

0255075100

Auf die Skala dieses Benchmarks normalisiert (0–100). Die Tabelle zeigt die Rohwerte.

Zeitverlauf

Neueste Belege

  1. GPT-5 Codex (high)98.67% ·
  2. Gemini 3 Flash Preview (Reasoning)97% ·
  3. GPT-5.2 (medium)96.67% ·
  4. MiMo-V2-Flash (Reasoning)96.33% ·
  5. Gemini 3 Pro95.67% ·

Scores nutzen die eigene Einheit und Skala dieses Benchmarks, keinen universellen Qualitätswert.

#ModellVeröffentlichungScoreHerkunftBeleglage
1GPT-5 Codex (high)OpenAI2025-09-2398.67%
2026-09-01
Quelle geprüft
2Gemini 3 Flash Preview (Reasoning)Google2025-12-1797%
2026-09-01
Quelle geprüft
3GPT-5.2 (medium)OpenAI2025-12-1196.67%
2026-09-01
Quelle geprüft
4MiMo-V2-Flash (Reasoning)Xiaomi2025-12-1696.33%
2026-09-01
Quelle geprüft
5Gemini 3 ProGoogle2025-11-1895.67%
2026-09-01
Quelle geprüft
6GPT-5.1 Codex (high)OpenAI2025-11-1395.67%
2026-09-01
Quelle geprüft
7GLM-4.7 (Reasoning)Zhipu2025-12-2295%
2026-09-01
Quelle geprüft
8Kimi K2 ThinkingMoonshot2025-11-0694.67%
2026-09-01
Quelle geprüft
9GPT-5 (high)OpenAI2025-08-0794.33%
2026-09-01
Quelle geprüft
1Claude Opus 4.8AnthropicAIME 2024 with extended thinking.2026-05-2894.2%
Anthropic Claude 4 family2026-05-28
Prüfung nötig
11GPT-5.1OpenAI2025-11-1394%
2026-09-01
Quelle geprüft
2Claude 3.7 Sonnet (2025-02)AnthropicAIME 2024 with extended thinking enabled.2025-02-1993.7%
Anthropic Claude 3.7 Sonnet announcement2025-02-19
Quelle geprüft
13Grok 4xAI2025-07-1092.67%
2026-09-01
Quelle geprüft
14DeepSeek V3.2 (Reasoning)DeepSeek2025-12-0192%
2026-09-01
Quelle geprüft
3GPT 5.5OpenAI2026-04-2391.8%
OpenAI model release notes2026-04-23
Prüfung nötig
16GPT-5 (medium)OpenAI2025-08-0791.67%
2026-09-01
Quelle geprüft
17Claude Opus 4.5 (Reasoning)Anthropic2025-11-2491.33%
2026-09-01
Quelle geprüft
4GPT 5OpenAI2025-12-1189.2%
OpenAI model release notes2025-12-01
Prüfung nötig
5DeepSeek R1DeepSeekAIME 2024 with chain-of-thought.2025-01-2088.4%
DeepSeek R1 model card2025-01-20
Prüfung nötig
20OpenAI o3OpenAI2025-04-1688.33%
2026-09-01
Quelle geprüft
21Claude 4.5 Sonnet (Reasoning)Anthropic2025-09-2988%
2026-09-01
Quelle geprüft
6Gemini 3.1 ProGoogle2026-02-1987.6%
Google Gemini 3.1 Pro2026-02-19
Prüfung nötig
7o3 (cons@64, AIME 2025)OpenAIAIME 2025 paper; 64-sample consensus. Single-shot is markedly lower.2025-04-1687.5%
OpenAI: Learning to Reason2025-01-20
Quelle geprüft
24Gemini 3 Pro Preview (low)Google2025-11-1886.67%
2026-09-01
Quelle geprüft
9Kimi K2.6Moonshot2026-04-2085.2%
Moonshot Kimi K2.62026-04-20
Prüfung nötig
10OpenAI o1 (AIME 2024, cons@64)OpenAIWith 64-sample consensus; single-shot is markedly lower.2024-09-1283.3%
OpenAI: Learning to Reason2024-09-12
Quelle geprüft
27GPT-5 (low)OpenAI2025-08-0783%
2026-09-01
Quelle geprüft
28MiniMax-M2.1MiniMax2025-12-2382.67%
2026-09-01
Quelle geprüft
29Claude 4.1 Opus (Reasoning)Anthropic2025-08-0580.33%
2026-09-01
Quelle geprüft
30Claude 4 Opus (Reasoning)Anthropic2025-05-2273.33%
2026-09-01
Quelle geprüft
31Claude Opus 4.5Anthropic2025-11-2462.67%
2026-09-01
Quelle geprüft
32Gemini 3 Flash PreviewGoogle2025-12-1755.67%
2026-09-01
Quelle geprüft
33Mistral Large 3Mistral2025-12-0238%
2026-09-01
Quelle geprüft
34Llama 4 MaverickMeta2026-04-0519.33%
2026-09-01
Quelle geprüft
35Llama 4 ScoutMeta2026-04-0514%
2026-09-01
Quelle geprüft
36Command ACohere2026-03-1513%
2026-09-01
Quelle geprüft
37Claude 3 OpusAnthropic2024-03-043.33%
2026-09-01
Quelle geprüft
Methode

Was er abdeckt

Archiviert — GPT-5.2 und Peers melden 100 % auf aktuellen AIME-Papieren mit Extended Thinking. Als gelöst behandeln, nicht als Frontier-Trenner. /benchmarks/frontiermath bevorzugen.

Score-Obergrenze

Wo er an Grenzen stößt

Noch ist keine Obergrenze erfasst. Wenn sich Scores oben bündeln, kann der Benchmark Frontier-Modelle möglicherweise nicht mehr trennen.

Tools, die ihn ausweisen

Belege

Quellen und weiterführende Lektüre

Fragen zu diesem Benchmark

Jede Antwort unten stammt aus den datierten Feldern dieser Seite. Nichts davon ist zusätzlich für Suchmaschinen geschrieben.

Was misst AIME?

Schwere Schulwettbewerbs-Mathematik: 15 Aufgaben mit Ganzzahl-Antwort pro Prüfung. Als Reasoning-Eval genutzt, weil jedes neue Paper anfangs kontaminationsresistent ist — bis es durchsickert.

Was beweist ein hoher AIME-Wert nicht?

Ein starkes AIME-Ergebnis sagt nichts aus über:

  • Winzige Stichprobe (15 Aufgaben/Jahr) — eine Aufgabe ist ~6,7 %, Einzelläufe sind verrauscht; pass@k oder mehrere Seeds verlangen.
  • Allgemeine Fähigkeit — starke AIME-Werte korrelieren mit Reasoning-Training, nicht mit Alltagsnutzen.
  • Welches Jahr — '90 % bei AIME' ist ohne Prüfungsjahr und Versuchszahl bedeutungslos.

Wie wird AIME bewertet?

Genauigkeit (oft pass@1 oder cons@64). Aufgabenformat: 15 Aufgaben, Ganzzahl-Antworten 0-999; berichtet als Genauigkeit auf AIME 2024/2025.

Ist AIME gesättigt?

AIME ist im Atlas derzeit als Ausgedient markiert.

Können AIME-Ergebnisse durch Trainingsdaten verunreinigt sein?

Das Kontaminationsrisiko für AIME ist als Kontamination mittel eingestuft. Behandle jede Zeile auf dieser Seite als öffentliche Angabe mit Quelle und Datum, nicht als kontrolliertes Experiment.

The Pack · Redaktionsnewsletter

Neue Tools in dein Postfach. Kostenlos.

Eine kurze E-Mail, wenn ein Tool erscheint oder den Status wechselt. Kein Tracking, keine Drittanbieter-Analytics. Abmeldung mit einem Klick.