Warum dieser Benchmark nützlich ist
Er liefert ein klares Reasoning-Signal mit richtigen oder falschen Antworten. Vergleiche damit strukturiertes Problemlösen und achte auf Stichprobengröße sowie pass@k.
Benchmarks / Mathe
AIME
Schwere Schulwettbewerbs-Mathematik: 15 Aufgaben mit Ganzzahl-Antwort pro Prüfung. Als Reasoning-Eval genutzt, weil jedes neue Paper anfangs kontaminationsresistent ist — bis es durchsickert.
Er liefert ein klares Reasoning-Signal mit richtigen oder falschen Antworten. Vergleiche damit strukturiertes Problemlösen und achte auf Stichprobengröße sowie pass@k.
Lies AIME als ausgedient Signal mit mittleres kontaminationsrisiko. Vergleiche Modelle nur, wenn Quelle, Testumgebung, Prompting, Sampling und Score-Einheit übereinstimmen.
Auf die Skala dieses Benchmarks normalisiert (0–100). Die Tabelle zeigt die Rohwerte.
Scores nutzen die eigene Einheit und Skala dieses Benchmarks, keinen universellen Qualitätswert.
| # | Modell | Veröffentlichung | Score | Herkunft | Beleglage |
|---|---|---|---|---|---|
| 1 | Gemini 3 ProGoogle | 2025-11-18 | 95.67% | 2026-07-21 | Quelle geprüft |
| 1 | Claude Opus 4.8AnthropicAIME 2024 with extended thinking. | 2026-05-28 | 94.2% | Anthropic Claude 4 family2026-05-28 | Prüfung nötig |
| 3 | GPT-5.1OpenAI | 2025-11-13 | 94% | 2026-07-21 | Quelle geprüft |
| 2 | Claude 3.7 Sonnet (2025-02)AnthropicAIME 2024 with extended thinking enabled. | 2025-02-19 | 93.7% | Anthropic Claude 3.7 Sonnet announcement2025-02-19 | Quelle geprüft |
| 3 | GPT 5.5OpenAI | 2026-04-23 | 91.8% | OpenAI model release notes2026-04-23 | Prüfung nötig |
| 4 | GPT 5OpenAI | 2025-12-11 | 89.2% | OpenAI model release notes2025-12-01 | Prüfung nötig |
| 5 | DeepSeek R1DeepSeekAIME 2024 with chain-of-thought. | 2025-01-20 | 88.4% | DeepSeek R1 model card2025-01-20 | Prüfung nötig |
| 8 | OpenAI o3OpenAI | 2025-04-16 | 88.33% | 2026-07-21 | Quelle geprüft |
| 6 | Gemini 3.1 ProGoogle | 2026-02-19 | 87.6% | Google Gemini 3.1 Pro2026-02-19 | Prüfung nötig |
| 7 | o3 (cons@64, AIME 2025)OpenAIAIME 2025 paper; 64-sample consensus. Single-shot is markedly lower. | 2025-04-16 | 87.5% | OpenAI: Learning to Reason2025-01-20 | Quelle geprüft |
| 9 | Kimi K2.6Moonshot | 2026-04-20 | 85.2% | Moonshot Kimi K2.62026-04-20 | Prüfung nötig |
| 10 | OpenAI o1 (AIME 2024, cons@64)OpenAIWith 64-sample consensus; single-shot is markedly lower. | 2024-09-12 | 83.3% | OpenAI: Learning to Reason2024-09-12 | Quelle geprüft |
| 13 | Claude Opus 4.5Anthropic | 2025-11-24 | 62.67% | 2026-07-21 | Quelle geprüft |
| 14 | Gemini 3 Flash PreviewGoogle | 2025-12-17 | 55.67% | 2026-07-21 | Quelle geprüft |
| 15 | Mistral Large 3Mistral | 2025-12-02 | 38% | 2026-07-21 | Quelle geprüft |
| 16 | Llama 4 MaverickMeta | 2026-04-05 | 19.33% | 2026-07-21 | Quelle geprüft |
| 17 | Llama 4 ScoutMeta | 2026-04-05 | 14% | 2026-07-21 | Quelle geprüft |
| 18 | Command ACohere | 2026-03-15 | 13% | 2026-07-21 | Quelle geprüft |
| 19 | Claude 3 OpusAnthropic | 2024-03-04 | 3.33% | 2026-07-21 | Quelle geprüft |
Archiviert — GPT-5.2 und Peers melden 100 % auf aktuellen AIME-Papieren mit Extended Thinking. Als gelöst behandeln, nicht als Frontier-Trenner.
Noch ist keine Obergrenze erfasst. Wenn sich Scores oben bündeln, kann der Benchmark Frontier-Modelle möglicherweise nicht mehr trennen.
The Pack · Redaktionsnewsletter
Eine kurze E-Mail, wenn eine Karte erscheint oder den Status wechselt. Kein Tracking, keine Drittanbieter-Analytics. Abmeldung mit einem Klick.