Benchmarks / Mathe

American Invitational Mathematics Examination

AIME

Schwere Schulwettbewerbs-Mathematik: 15 Aufgaben mit Ganzzahl-Antwort pro Prüfung. Als Reasoning-Eval genutzt, weil jedes neue Paper anfangs kontaminationsresistent ist — bis es durchsickert.

MatheSolidAusgedientMittleres KontaminationsrisikoSeit 2024
Was dieser Benchmark nicht misst
  • Winzige Stichprobe (15 Aufgaben/Jahr) — eine Aufgabe ist ~6,7 %, Einzelläufe sind verrauscht; pass@k oder mehrere Seeds verlangen.
  • Allgemeine Fähigkeit — starke AIME-Werte korrelieren mit Reasoning-Training, nicht mit Alltagsnutzen.
  • Welches Jahr — '90 % bei AIME' ist ohne Prüfungsjahr und Versuchszahl bedeutungslos.
Analyse

Warum dieser Benchmark nützlich ist

Er liefert ein klares Reasoning-Signal mit richtigen oder falschen Antworten. Vergleiche damit strukturiertes Problemlösen und achte auf Stichprobengröße sowie pass@k.

Umfang

Abdeckung

Aufgabenfamilie
Mathe
Format
15 Aufgaben, Ganzzahl-Antworten 0-999; berichtet als Genauigkeit auf AIME 2024/2025.
Bewertung
Genauigkeit (oft pass@1 oder cons@64).
Verantwortliche Stelle
MAA (exam) · used as an LLM eval
Lesehilfe

So liest du die Scores

Lies AIME als ausgedient Signal mit mittleres kontaminationsrisiko. Vergleiche Modelle nur, wenn Quelle, Testumgebung, Prompting, Sampling und Score-Einheit übereinstimmen.

Blinde Flecken

Was er nicht abdeckt

  • Winzige Stichprobe (15 Aufgaben/Jahr) — eine Aufgabe ist ~6,7 %, Einzelläufe sind verrauscht; pass@k oder mehrere Seeds verlangen.
  • Allgemeine Fähigkeit — starke AIME-Werte korrelieren mit Reasoning-Training, nicht mit Alltagsnutzen.
  • Welches Jahr — '90 % bei AIME' ist ohne Prüfungsjahr und Versuchszahl bedeutungslos.
Scores

Evidenz-Ledger

19 Zeilen
1919 Zeilen
95.67%bester Score
13quellgeprüft
3Quellen
2026-07-21bis 2024-09-12
10

api · api

Papers / model cards2

manual-snapshot · manual

Vendor claims7

manual-snapshot · manual

Verteilung

Wo die Zeilen liegen

0255075100

Auf die Skala dieses Benchmarks normalisiert (0–100). Die Tabelle zeigt die Rohwerte.

Zeitverlauf

Neueste Belege

  1. Gemini 3 Pro95.67% ·
  2. GPT-5.194% ·
  3. OpenAI o388.33% ·
  4. Claude Opus 4.562.67% ·
  5. Gemini 3 Flash Preview55.67% ·

Scores nutzen die eigene Einheit und Skala dieses Benchmarks, keinen universellen Qualitätswert.

#ModellVeröffentlichungScoreHerkunftBeleglage
1Gemini 3 ProGoogle2025-11-1895.67%
2026-07-21
Quelle geprüft
1Claude Opus 4.8AnthropicAIME 2024 with extended thinking.2026-05-2894.2%
Anthropic Claude 4 family2026-05-28
Prüfung nötig
3GPT-5.1OpenAI2025-11-1394%
2026-07-21
Quelle geprüft
2Claude 3.7 Sonnet (2025-02)AnthropicAIME 2024 with extended thinking enabled.2025-02-1993.7%
Anthropic Claude 3.7 Sonnet announcement2025-02-19
Quelle geprüft
3GPT 5.5OpenAI2026-04-2391.8%
OpenAI model release notes2026-04-23
Prüfung nötig
4GPT 5OpenAI2025-12-1189.2%
OpenAI model release notes2025-12-01
Prüfung nötig
5DeepSeek R1DeepSeekAIME 2024 with chain-of-thought.2025-01-2088.4%
DeepSeek R1 model card2025-01-20
Prüfung nötig
8OpenAI o3OpenAI2025-04-1688.33%
2026-07-21
Quelle geprüft
6Gemini 3.1 ProGoogle2026-02-1987.6%
Google Gemini 3.1 Pro2026-02-19
Prüfung nötig
7o3 (cons@64, AIME 2025)OpenAIAIME 2025 paper; 64-sample consensus. Single-shot is markedly lower.2025-04-1687.5%
OpenAI: Learning to Reason2025-01-20
Quelle geprüft
9Kimi K2.6Moonshot2026-04-2085.2%
Moonshot Kimi K2.62026-04-20
Prüfung nötig
10OpenAI o1 (AIME 2024, cons@64)OpenAIWith 64-sample consensus; single-shot is markedly lower.2024-09-1283.3%
OpenAI: Learning to Reason2024-09-12
Quelle geprüft
13Claude Opus 4.5Anthropic2025-11-2462.67%
2026-07-21
Quelle geprüft
14Gemini 3 Flash PreviewGoogle2025-12-1755.67%
2026-07-21
Quelle geprüft
15Mistral Large 3Mistral2025-12-0238%
2026-07-21
Quelle geprüft
16Llama 4 MaverickMeta2026-04-0519.33%
2026-07-21
Quelle geprüft
17Llama 4 ScoutMeta2026-04-0514%
2026-07-21
Quelle geprüft
18Command ACohere2026-03-1513%
2026-07-21
Quelle geprüft
19Claude 3 OpusAnthropic2024-03-043.33%
2026-07-21
Quelle geprüft
Methode

Was er abdeckt

Archiviert — GPT-5.2 und Peers melden 100 % auf aktuellen AIME-Papieren mit Extended Thinking. Als gelöst behandeln, nicht als Frontier-Trenner.

Score-Obergrenze

Wo er an Grenzen stößt

Noch ist keine Obergrenze erfasst. Wenn sich Scores oben bündeln, kann der Benchmark Frontier-Modelle möglicherweise nicht mehr trennen.

Tools, die ihn ausweisen

Belege

Quellen und weiterführende Lektüre

The Pack · Redaktionsnewsletter

Neue Karten in dein Postfach. Kostenlos.

Eine kurze E-Mail, wenn eine Karte erscheint oder den Status wechselt. Kein Tracking, keine Drittanbieter-Analytics. Abmeldung mit einem Klick.