Benchmarks / Wissen

MMLU-Pro

Ein schwererer MMLU-Nachfolger: zehn statt vier Optionen, schlussfolgerungslastige Fragen und ein bereinigter Satz, der schwerer zu erraten ist.

WissenSolidAktivMittleres KontaminationsrisikoSeit 2024
Was dieser Benchmark nicht misst
  • Offene Praxisfähigkeit — es bleibt eine Multiple-Choice-Prüfung, nur strenger.
  • Robustheit gegenüber Formulierung — Werte schwanken mehrere Punkte je nach CoT vs. Direktantwort.
Analyse

Warum dieser Benchmark nützlich ist

Redaktionelle Einordnung ausstehendWir veröffentlichen zuerst Methodik und Ledger. Die benchmark-spezifische Analyse folgt nach der Desk-Prüfung.

Umfang

Abdeckung

Aufgabenfamilie
Wissen
Format
~12.000 Zehn-Optionen-Fragen über 14 Domänen; Chain-of-Thought wird erwartet.
Bewertung
Genauigkeit (% korrekt) mit CoT.
Verantwortliche Stelle
TIGER-Lab
Lesehilfe

So liest du die Scores

Die Lesehilfe steht noch aus. Nutze bis zur Desk-Einordnung Aufgabenformat, Bewertungsmethode und Quelldaten im Ledger.

Blinde Flecken

Was er nicht abdeckt

  • Offene Praxisfähigkeit — es bleibt eine Multiple-Choice-Prüfung, nur strenger.
  • Robustheit gegenüber Formulierung — Werte schwanken mehrere Punkte je nach CoT vs. Direktantwort.
Scores

Evidenz-Ledger

21 Zeilen
2121 Zeilen
89.8%bester Score
13quellgeprüft
2Quellen
2026-07-21bis 2024-06-03
11

api · api

Papers / model cards10

manual-snapshot · manual

Verteilung

Wo die Zeilen liegen

0255075100

Auf die Skala dieses Benchmarks normalisiert (0–100). Die Tabelle zeigt die Rohwerte.

Zeitverlauf

Neueste Belege

  1. Gemini 3 Pro89.8% ·
  2. Claude Opus 4.588.9% ·
  3. Gemini 3 Flash Preview88.2% ·
  4. GPT-5.287.4% ·
  5. GPT-5.187% ·

Scores nutzen die eigene Einheit und Skala dieses Benchmarks, keinen universellen Qualitätswert.

#ModellVeröffentlichungScoreHerkunftBeleglage
1Gemini 3 ProGoogle2025-11-1889.8%
2026-07-21
Quelle geprüft
2Claude Opus 4.5Anthropic2025-11-2488.9%
2026-07-21
Quelle geprüft
3Gemini 3 Flash PreviewGoogle2025-12-1788.2%
2026-07-21
Quelle geprüft
4GPT-5.2OpenAI2025-12-1187.4%
2026-07-21
Quelle geprüft
5GPT-5.1OpenAI2025-11-1387%
2026-07-21
Quelle geprüft
6OpenAI o3OpenAI2025-04-1685.3%
2026-07-21
Quelle geprüft
7DeepSeek R1DeepSeek2025-01-2084.9%
2026-07-21
Quelle geprüft
8OpenAI o1OpenAI2024-09-1284.1%
2026-07-21
Quelle geprüft
1Claude Opus 4.8AnthropicCoT prompting. Harder than base MMLU — gaps are wider at the frontier.2026-05-2882.4%
MMLU-Pro HuggingFace leaderboard2026-05-28
Prüfung nötig
2GPT 5.5OpenAI2026-04-2381.6%
MMLU-Pro HuggingFace leaderboard2026-04-23
Prüfung nötig
11Llama 4 MaverickMeta2026-04-0580.9%
2026-07-21
Quelle geprüft
3Gemini 3.1 ProGoogle2026-02-1979.8%
MMLU-Pro HuggingFace leaderboard2026-02-19
Prüfung nötig
4Claude Sonnet 4.6Anthropic2026-02-1778.2%
MMLU-Pro HuggingFace leaderboard2026-02-17
Prüfung nötig
5DeepSeek V4 Pro MaxDeepSeek2026-04-2476.4%
MMLU-Pro HuggingFace leaderboard2026-04-24
Prüfung nötig
15Llama 4 ScoutMeta2026-04-0575.2%
2026-07-21
Quelle geprüft
6Qwen 3.7 MaxAlibaba2026-05-2075.1%
MMLU-Pro HuggingFace leaderboard2026-05-20
Prüfung nötig
7Kimi K2.6Moonshot2026-04-2074.6%
MMLU-Pro HuggingFace leaderboard2026-04-20
Prüfung nötig
8Mistral Large 3Mistral2025-12-0272.8%
MMLU-Pro HuggingFace leaderboard2025-12-02
Prüfung nötig
9GPT-4o (2024)OpenAI2024-05-0172.6%
MMLU-Pro paper2024-06-03
Quelle geprüft
20Command ACohere2026-03-1571.2%
2026-07-21
Quelle geprüft
10Claude 3 OpusAnthropic2024-03-0468.4%
MMLU-Pro paper2024-06-03
Quelle geprüft
Methode

Was er abdeckt

Die Notiz zur Datenqualität steht aus. Jede Ledger-Zeile trägt weiterhin Quellen-URL, Quelldatum und Zeitpunkt des Einlesens.

Score-Obergrenze

Wo er an Grenzen stößt

Noch ist keine Obergrenze erfasst. Wenn sich Scores oben bündeln, kann der Benchmark Frontier-Modelle möglicherweise nicht mehr trennen.

Tools, die ihn ausweisen

Belege

Quellen und weiterführende Lektüre

The Pack · Redaktionsnewsletter

Neue Karten in dein Postfach. Kostenlos.

Eine kurze E-Mail, wenn eine Karte erscheint oder den Status wechselt. Kein Tracking, keine Drittanbieter-Analytics. Abmeldung mit einem Klick.