Warum dieser Benchmark nützlich ist
Wenn klassisches MMLU zu leicht oder zu erratbar ist — eine strengere Zehn-Optionen-, reasoning-lastige Wissensprüfung über Domänen.
Ein schwererer MMLU-Nachfolger: zehn statt vier Optionen, schlussfolgerungslastige Fragen und ein bereinigter Satz, der schwerer zu erraten ist.
Wenn klassisches MMLU zu leicht oder zu erratbar ist — eine strengere Zehn-Optionen-, reasoning-lastige Wissensprüfung über Domänen.
Genauigkeit (% korrekt), meist mit Chain-of-Thought. Bleibt Multiple-Choice; Prompt-Stil (CoT vs. Direkt) kann Werte um mehrere Punkte verschieben.
Auf die Skala dieses Benchmarks normalisiert (0–100). Die Tabelle zeigt die Rohwerte.
Scores nutzen die eigene Einheit und Skala dieses Benchmarks, keinen universellen Qualitätswert.
| # | Modell | Veröffentlichung | Score | Herkunft | Beleglage |
|---|---|---|---|---|---|
| 1 | Gemini 3 ProGoogle | 2025-11-18 | 89.8% | 2026-09-01 | Quelle geprüft |
| 2 | Claude Opus 4.5 (Reasoning)Anthropic | 2025-11-24 | 89.5% | 2026-09-01 | Quelle geprüft |
| 3 | Gemini 3 Pro Preview (low)Google | 2025-11-18 | 89.5% | 2026-09-01 | Quelle geprüft |
| 4 | Gemini 3 Flash Preview (Reasoning)Google | 2025-12-17 | 89% | 2026-09-01 | Quelle geprüft |
| 5 | Claude Opus 4.5Anthropic | 2025-11-24 | 88.9% | 2026-09-01 | Quelle geprüft |
| 6 | Gemini 3 Flash PreviewGoogle | 2025-12-17 | 88.2% | 2026-09-01 | Quelle geprüft |
| 7 | Claude 4.1 Opus (Reasoning)Anthropic | 2025-08-05 | 88% | 2026-09-01 | Quelle geprüft |
| 8 | Claude 4.5 Sonnet (Reasoning)Anthropic | 2025-09-29 | 87.5% | 2026-09-01 | Quelle geprüft |
| 9 | MiniMax-M2.1MiniMax | 2025-12-23 | 87.5% | 2026-09-01 | Quelle geprüft |
| 10 | GPT-5.2OpenAI | 2025-12-11 | 87.4% | 2026-09-01 | Quelle geprüft |
| 11 | Claude 4 Opus (Reasoning)Anthropic | 2025-05-22 | 87.3% | 2026-09-01 | Quelle geprüft |
| 12 | GPT-5 (high)OpenAI | 2025-08-07 | 87.1% | 2026-09-01 | Quelle geprüft |
| 13 | GPT-5.1OpenAI | 2025-11-13 | 87% | 2026-09-01 | Quelle geprüft |
| 14 | GPT-5 (medium)OpenAI | 2025-08-07 | 86.7% | 2026-09-01 | Quelle geprüft |
| 15 | Grok 4xAI | 2025-07-10 | 86.6% | 2026-09-01 | Quelle geprüft |
| 16 | GPT-5 Codex (high)OpenAI | 2025-09-23 | 86.5% | 2026-09-01 | Quelle geprüft |
| 17 | DeepSeek V3.2 (Reasoning)DeepSeek | 2025-12-01 | 86.2% | 2026-09-01 | Quelle geprüft |
| 18 | GPT-5 (low)OpenAI | 2025-08-07 | 86% | 2026-09-01 | Quelle geprüft |
| 19 | GPT-5.1 Codex (high)OpenAI | 2025-11-13 | 86% | 2026-09-01 | Quelle geprüft |
| 20 | GPT-5.2 (medium)OpenAI | 2025-12-11 | 85.9% | 2026-09-01 | Quelle geprüft |
| 21 | GLM-4.7 (Reasoning)Zhipu | 2025-12-22 | 85.6% | 2026-09-01 | Quelle geprüft |
| 22 | OpenAI o3OpenAI | 2025-04-16 | 85.3% | 2026-09-01 | Quelle geprüft |
| 23 | DeepSeek R1DeepSeek | 2025-01-20 | 84.9% | 2026-09-01 | Quelle geprüft |
| 24 | Kimi K2 ThinkingMoonshot | 2025-11-06 | 84.8% | 2026-09-01 | Quelle geprüft |
| 25 | MiMo-V2-Flash (Reasoning)Xiaomi | 2025-12-16 | 84.3% | 2026-09-01 | Quelle geprüft |
| 26 | OpenAI o1OpenAI | 2024-09-12 | 84.1% | 2026-09-01 | Quelle geprüft |
| 1 | Claude Opus 4.8AnthropicCoT prompting. Harder than base MMLU — gaps are wider at the frontier. | 2026-05-28 | 82.4% | MMLU-Pro HuggingFace leaderboard2026-05-28 | Prüfung nötig |
| 2 | GPT 5.5OpenAI | 2026-04-23 | 81.6% | MMLU-Pro HuggingFace leaderboard2026-04-23 | Prüfung nötig |
| 29 | Llama 4 MaverickMeta | 2026-04-05 | 80.9% | 2026-09-01 | Quelle geprüft |
| 3 | Gemini 3.1 ProGoogle | 2026-02-19 | 79.8% | MMLU-Pro HuggingFace leaderboard2026-02-19 | Prüfung nötig |
| 4 | Claude Sonnet 4.6Anthropic | 2026-02-17 | 78.2% | MMLU-Pro HuggingFace leaderboard2026-02-17 | Prüfung nötig |
| 5 | DeepSeek V4 Pro MaxDeepSeek | 2026-04-24 | 76.4% | MMLU-Pro HuggingFace leaderboard2026-04-24 | Prüfung nötig |
| 33 | Llama 4 ScoutMeta | 2026-04-05 | 75.2% | 2026-09-01 | Quelle geprüft |
| 6 | Qwen 3.7 MaxAlibaba | 2026-05-20 | 75.1% | MMLU-Pro HuggingFace leaderboard2026-05-20 | Prüfung nötig |
| 7 | Kimi K2.6Moonshot | 2026-04-20 | 74.6% | MMLU-Pro HuggingFace leaderboard2026-04-20 | Prüfung nötig |
| 8 | Mistral Large 3Mistral | 2025-12-02 | 72.8% | MMLU-Pro HuggingFace leaderboard2025-12-02 | Prüfung nötig |
| 9 | GPT-4o (2024)OpenAI | 2024-05-01 | 72.6% | MMLU-Pro paper2024-06-03 | Quelle geprüft |
| 38 | Command ACohere | 2026-03-15 | 71.2% | 2026-09-01 | Quelle geprüft |
| 10 | Claude 3 OpusAnthropic | 2024-03-04 | 68.4% | MMLU-Pro paper2024-06-03 | Quelle geprüft |
Dieser Benchmark gehört zur Familie wissen. Sein Format: ~12.000 Zehn-Optionen-Fragen über 14 Domänen; Chain-of-Thought wird erwartet. Der Score sollte immer mit Aufgabenformat, Bewertungsmethode, Quelldatum und Benchmark-Version gelesen werden.
Noch ist keine Obergrenze erfasst. Wenn sich Scores oben bündeln, kann der Benchmark Frontier-Modelle möglicherweise nicht mehr trennen.
Jede Antwort unten stammt aus den datierten Feldern dieser Seite. Nichts davon ist zusätzlich für Suchmaschinen geschrieben.
Ein schwererer MMLU-Nachfolger: zehn statt vier Optionen, schlussfolgerungslastige Fragen und ein bereinigter Satz, der schwerer zu erraten ist.
Ein starkes MMLU-Pro-Ergebnis sagt nichts aus über:
Genauigkeit (% korrekt) mit CoT. Aufgabenformat: ~12.000 Zehn-Optionen-Fragen über 14 Domänen; Chain-of-Thought wird erwartet.
MMLU-Pro ist im Atlas derzeit als Aktiv markiert.
Das Kontaminationsrisiko für MMLU-Pro ist als Kontamination mittel eingestuft. Behandle jede Zeile auf dieser Seite als öffentliche Angabe mit Quelle und Datum, nicht als kontrolliertes Experiment.
The Pack · Redaktionsnewsletter
Eine kurze E-Mail, wenn ein Tool erscheint oder den Status wechselt. Kein Tracking, keine Drittanbieter-Analytics. Abmeldung mit einem Klick.