Benchmarks / Wissen

MMLU-Pro

Ein schwererer MMLU-Nachfolger: zehn statt vier Optionen, schlussfolgerungslastige Fragen und ein bereinigter Satz, der schwerer zu erraten ist.

Was dieser Benchmark nicht misst
  • Offene Praxisfähigkeit — es bleibt eine Multiple-Choice-Prüfung, nur strenger.
  • Robustheit gegenüber Formulierung — Werte schwanken mehrere Punkte je nach CoT vs. Direktantwort.
Analyse

Warum dieser Benchmark nützlich ist

Wenn klassisches MMLU zu leicht oder zu erratbar ist — eine strengere Zehn-Optionen-, reasoning-lastige Wissensprüfung über Domänen.

Umfang

Abdeckung

Aufgabenfamilie
Wissen
Format
~12.000 Zehn-Optionen-Fragen über 14 Domänen; Chain-of-Thought wird erwartet.
Bewertung
Genauigkeit (% korrekt) mit CoT.
Verantwortliche Stelle
TIGER-Lab
Lesehilfe

So liest du die Scores

Genauigkeit (% korrekt), meist mit Chain-of-Thought. Bleibt Multiple-Choice; Prompt-Stil (CoT vs. Direkt) kann Werte um mehrere Punkte verschieben.

Blinde Flecken

Was er nicht abdeckt

  • Offene Praxisfähigkeit — es bleibt eine Multiple-Choice-Prüfung, nur strenger.
  • Robustheit gegenüber Formulierung — Werte schwanken mehrere Punkte je nach CoT vs. Direktantwort.
Scores

Evidenz-Ledger

39 Zeilen
3939 Zeilen
89.8%bester Score
31quellgeprüft
2Quellen
2026-09-01bis 2024-06-03
29

api · api

Papers / model cards10

manual-snapshot · manual

Verteilung

Wo die Zeilen liegen

0255075100

Auf die Skala dieses Benchmarks normalisiert (0–100). Die Tabelle zeigt die Rohwerte.

Zeitverlauf

Neueste Belege

  1. Gemini 3 Pro89.8% ·
  2. Claude Opus 4.5 (Reasoning)89.5% ·
  3. Gemini 3 Pro Preview (low)89.5% ·
  4. Gemini 3 Flash Preview (Reasoning)89% ·
  5. Claude Opus 4.588.9% ·

Scores nutzen die eigene Einheit und Skala dieses Benchmarks, keinen universellen Qualitätswert.

#ModellVeröffentlichungScoreHerkunftBeleglage
1Gemini 3 ProGoogle2025-11-1889.8%
2026-09-01
Quelle geprüft
2Claude Opus 4.5 (Reasoning)Anthropic2025-11-2489.5%
2026-09-01
Quelle geprüft
3Gemini 3 Pro Preview (low)Google2025-11-1889.5%
2026-09-01
Quelle geprüft
4Gemini 3 Flash Preview (Reasoning)Google2025-12-1789%
2026-09-01
Quelle geprüft
5Claude Opus 4.5Anthropic2025-11-2488.9%
2026-09-01
Quelle geprüft
6Gemini 3 Flash PreviewGoogle2025-12-1788.2%
2026-09-01
Quelle geprüft
7Claude 4.1 Opus (Reasoning)Anthropic2025-08-0588%
2026-09-01
Quelle geprüft
8Claude 4.5 Sonnet (Reasoning)Anthropic2025-09-2987.5%
2026-09-01
Quelle geprüft
9MiniMax-M2.1MiniMax2025-12-2387.5%
2026-09-01
Quelle geprüft
10GPT-5.2OpenAI2025-12-1187.4%
2026-09-01
Quelle geprüft
11Claude 4 Opus (Reasoning)Anthropic2025-05-2287.3%
2026-09-01
Quelle geprüft
12GPT-5 (high)OpenAI2025-08-0787.1%
2026-09-01
Quelle geprüft
13GPT-5.1OpenAI2025-11-1387%
2026-09-01
Quelle geprüft
14GPT-5 (medium)OpenAI2025-08-0786.7%
2026-09-01
Quelle geprüft
15Grok 4xAI2025-07-1086.6%
2026-09-01
Quelle geprüft
16GPT-5 Codex (high)OpenAI2025-09-2386.5%
2026-09-01
Quelle geprüft
17DeepSeek V3.2 (Reasoning)DeepSeek2025-12-0186.2%
2026-09-01
Quelle geprüft
18GPT-5 (low)OpenAI2025-08-0786%
2026-09-01
Quelle geprüft
19GPT-5.1 Codex (high)OpenAI2025-11-1386%
2026-09-01
Quelle geprüft
20GPT-5.2 (medium)OpenAI2025-12-1185.9%
2026-09-01
Quelle geprüft
21GLM-4.7 (Reasoning)Zhipu2025-12-2285.6%
2026-09-01
Quelle geprüft
22OpenAI o3OpenAI2025-04-1685.3%
2026-09-01
Quelle geprüft
23DeepSeek R1DeepSeek2025-01-2084.9%
2026-09-01
Quelle geprüft
24Kimi K2 ThinkingMoonshot2025-11-0684.8%
2026-09-01
Quelle geprüft
25MiMo-V2-Flash (Reasoning)Xiaomi2025-12-1684.3%
2026-09-01
Quelle geprüft
26OpenAI o1OpenAI2024-09-1284.1%
2026-09-01
Quelle geprüft
1Claude Opus 4.8AnthropicCoT prompting. Harder than base MMLU — gaps are wider at the frontier.2026-05-2882.4%
MMLU-Pro HuggingFace leaderboard2026-05-28
Prüfung nötig
2GPT 5.5OpenAI2026-04-2381.6%
MMLU-Pro HuggingFace leaderboard2026-04-23
Prüfung nötig
29Llama 4 MaverickMeta2026-04-0580.9%
2026-09-01
Quelle geprüft
3Gemini 3.1 ProGoogle2026-02-1979.8%
MMLU-Pro HuggingFace leaderboard2026-02-19
Prüfung nötig
4Claude Sonnet 4.6Anthropic2026-02-1778.2%
MMLU-Pro HuggingFace leaderboard2026-02-17
Prüfung nötig
5DeepSeek V4 Pro MaxDeepSeek2026-04-2476.4%
MMLU-Pro HuggingFace leaderboard2026-04-24
Prüfung nötig
33Llama 4 ScoutMeta2026-04-0575.2%
2026-09-01
Quelle geprüft
6Qwen 3.7 MaxAlibaba2026-05-2075.1%
MMLU-Pro HuggingFace leaderboard2026-05-20
Prüfung nötig
7Kimi K2.6Moonshot2026-04-2074.6%
MMLU-Pro HuggingFace leaderboard2026-04-20
Prüfung nötig
8Mistral Large 3Mistral2025-12-0272.8%
MMLU-Pro HuggingFace leaderboard2025-12-02
Prüfung nötig
9GPT-4o (2024)OpenAI2024-05-0172.6%
MMLU-Pro paper2024-06-03
Quelle geprüft
38Command ACohere2026-03-1571.2%
2026-09-01
Quelle geprüft
10Claude 3 OpusAnthropic2024-03-0468.4%
MMLU-Pro paper2024-06-03
Quelle geprüft
Methode

Was er abdeckt

Dieser Benchmark gehört zur Familie wissen. Sein Format: ~12.000 Zehn-Optionen-Fragen über 14 Domänen; Chain-of-Thought wird erwartet. Der Score sollte immer mit Aufgabenformat, Bewertungsmethode, Quelldatum und Benchmark-Version gelesen werden.

Score-Obergrenze

Wo er an Grenzen stößt

Noch ist keine Obergrenze erfasst. Wenn sich Scores oben bündeln, kann der Benchmark Frontier-Modelle möglicherweise nicht mehr trennen.

Tools, die ihn ausweisen

Belege

Quellen und weiterführende Lektüre

Fragen zu diesem Benchmark

Jede Antwort unten stammt aus den datierten Feldern dieser Seite. Nichts davon ist zusätzlich für Suchmaschinen geschrieben.

Was misst MMLU-Pro?

Ein schwererer MMLU-Nachfolger: zehn statt vier Optionen, schlussfolgerungslastige Fragen und ein bereinigter Satz, der schwerer zu erraten ist.

Was beweist ein hoher MMLU-Pro-Wert nicht?

Ein starkes MMLU-Pro-Ergebnis sagt nichts aus über:

  • Offene Praxisfähigkeit — es bleibt eine Multiple-Choice-Prüfung, nur strenger.
  • Robustheit gegenüber Formulierung — Werte schwanken mehrere Punkte je nach CoT vs. Direktantwort.

Wie wird MMLU-Pro bewertet?

Genauigkeit (% korrekt) mit CoT. Aufgabenformat: ~12.000 Zehn-Optionen-Fragen über 14 Domänen; Chain-of-Thought wird erwartet.

Ist MMLU-Pro gesättigt?

MMLU-Pro ist im Atlas derzeit als Aktiv markiert.

Können MMLU-Pro-Ergebnisse durch Trainingsdaten verunreinigt sein?

Das Kontaminationsrisiko für MMLU-Pro ist als Kontamination mittel eingestuft. Behandle jede Zeile auf dieser Seite als öffentliche Angabe mit Quelle und Datum, nicht als kontrolliertes Experiment.

The Pack · Redaktionsnewsletter

Neue Tools in dein Postfach. Kostenlos.

Eine kurze E-Mail, wenn ein Tool erscheint oder den Status wechselt. Kein Tracking, keine Drittanbieter-Analytics. Abmeldung mit einem Klick.