Benchmarks / Wissen

Massive Multitask Language Understanding

MMLU

Breites Multiple-Choice-Wissen über 57 Fächer — von US-Geschichte über Hochschulphysik bis Jura — im Vier-Optionen-Prüfungsformat.

WissenSolidGesättigtHohes KontaminationsrisikoSeit 2021
Was dieser Benchmark nicht misst
  • Schlussfolgern unter Unsicherheit — ein Modell kann den richtigen Buchstaben erraten, ohne die Frage zu verstehen.
  • Ob das Modell bei offener, realer Formulierung eine sichere, kalibrierte Antwort gibt.
  • Alles nach 2021 — die Fragenbank ist fix und enthält in mehreren Fächern bekannte Fehler.
Analyse

Warum dieser Benchmark nützlich ist

Er liefert ein kompaktes Signal für eine bestimmte Fähigkeit. Nutze ihn als datierten Beleg neben Preisen, Datenschutz und eigener Nutzung.

Umfang

Abdeckung

Aufgabenfamilie
Wissen
Format
~14.000 Vier-Optionen-Fragen; Wertung ist reine Genauigkeit.
Bewertung
Genauigkeit (% korrekt), oft few-shot.
Verantwortliche Stelle
Hendrycks et al.
Lesehilfe

So liest du die Scores

Lies MMLU als gesättigt Signal mit hohes kontaminationsrisiko. Vergleiche Modelle nur, wenn Quelle, Testumgebung, Prompting, Sampling und Score-Einheit übereinstimmen.

Blinde Flecken

Was er nicht abdeckt

  • Schlussfolgern unter Unsicherheit — ein Modell kann den richtigen Buchstaben erraten, ohne die Frage zu verstehen.
  • Ob das Modell bei offener, realer Formulierung eine sichere, kalibrierte Antwort gibt.
  • Alles nach 2021 — die Fragenbank ist fix und enthält in mehreren Fächern bekannte Fehler.
Scores

Evidenz-Ledger

22 Zeilen
2222 Zeilen
91.4%bester Score
5quellgeprüft
2Quellen
2026-05-31bis 2023-03-15
Papers / model cards13

manual-snapshot · manual

Vendor claims9

manual-snapshot · manual

Verteilung

Wo die Zeilen liegen

0255075100

Auf die Skala dieses Benchmarks normalisiert (0–100). Die Tabelle zeigt die Rohwerte.

Zeitverlauf

Neueste Belege

  1. MiniMax M384.8% · MiniMax M3
  2. Claude Opus 4.891.4% · Anthropic Claude 4 family
  3. Qwen 3.7 Max88.9% · Alibaba Qwen 3.7 Max
  4. Gemini 3.5 Flash88.4% · Google Gemini 3.5 Flash
  5. Grok 4.388.5% · xAI Grok 4.3

Scores nutzen die eigene Einheit und Skala dieses Benchmarks, keinen universellen Qualitätswert.

#ModellVeröffentlichungScoreHerkunftBeleglage
1Claude Opus 4.8Anthropic5-shot CoT. MMLU is saturated at the frontier.2026-05-2891.4%
Anthropic Claude 4 family2026-05-28
Prüfung nötig
2Claude Opus 4.6AnthropicReported with 5-shot chain-of-thought prompting.2026-02-0591.2%
Anthropic Claude 3.7/4.6 model card2026-01-01
Quelle geprüft
3GPT 5.5OpenAIMMLU is saturated at the frontier — high scores are table stakes, not differentiators.2026-04-2390.8%
OpenAI model release notes2025-12-01
Prüfung nötig
4Claude Sonnet 4.6Anthropic2026-02-1790.6%
Anthropic Claude 3.7/4.6 model card2026-02-17
Quelle geprüft
5Gemini 3.1 ProGoogle2026-02-1990.3%
Google Gemini 3.1 Pro2026-02-19
Prüfung nötig
6Gemini 1.5 Ultra (2024)GoogleReported with CoT@32 voting, not single-shot.2024-02-1590%
Gemini technical report2023-12-06
Quelle geprüft
7GPT 5.4OpenAI2026-03-0589.8%
OpenAI GPT-5.4 release2026-03-05
Prüfung nötig
8DeepSeek V4 Pro MaxDeepSeek2026-04-2489.7%
DeepSeek V4 release2026-04-24
Prüfung nötig
9Kimi K2.6Moonshot2026-04-2089.1%
Moonshot Kimi K2.62026-04-20
Prüfung nötig
10Qwen 3.7 MaxAlibaba2026-05-2088.9%
Alibaba Qwen 3.7 Max2026-05-20
Prüfung nötig
11Grok 4.3xAI2026-04-3088.5%
xAI Grok 4.32026-04-30
Prüfung nötig
12Gemini 3.5 FlashGoogle2026-05-1988.4%
Google Gemini 3.5 Flash2026-05-19
Prüfung nötig
13Mistral Large 3Mistral2025-12-0287.8%
Mistral Large 3 model card2025-12-02
Prüfung nötig
14DeepSeek R1DeepSeek2025-01-2087.4%
DeepSeek R1 model card2025-01-20
Prüfung nötig
15Gemini 3 FlashGoogle2025-12-1787.2%
Google Gemini 3 Flash2025-12-17
Prüfung nötig
16Claude 3 OpusAnthropic2024-03-0486.8%
Anthropic Claude 3 model card2024-03-04
Quelle geprüft
17GPT-4 (2023)OpenAI2023-03-1486.4%
GPT-4 Technical Report2023-03-15
Quelle geprüft
18Kimi K2.5Moonshot2026-01-2786.4%
Moonshot Kimi K2.52026-01-27
Prüfung nötig
19Llama 4 MaverickMeta2026-04-0586.1%
Meta Llama 4 model card2026-04-05
Prüfung nötig
20Claude Haiku 4.5Anthropic2025-10-0185.6%
Anthropic Claude Haiku 4.52025-10-01
Prüfung nötig
21Llama 4 ScoutMeta2026-04-0585.2%
Meta Llama 4 Scout model card2026-04-05
Prüfung nötig
22MiniMax M3MiniMax2026-05-3184.8%
MiniMax M32026-05-31
Prüfung nötig
Methode

Was er abdeckt

Gesättigter Glossar-Eintrag — nützlich für Kontext, nicht für Frontier-Trennung. Inline-Vendor-Zeilen können hinter dem Ledger liegen; Decken-Clustering ist die ehrliche Lesart.

Score-Obergrenze

Wo er an Grenzen stößt

Experten ~89,8 %; Spitzenmodelle liegen nahe der Decke, MMLU trennt die besten Systeme kaum noch.

Tools, die ihn ausweisen

Belege

Quellen und weiterführende Lektüre

The Pack · Redaktionsnewsletter

Neue Karten in dein Postfach. Kostenlos.

Eine kurze E-Mail, wenn eine Karte erscheint oder den Status wechselt. Kein Tracking, keine Drittanbieter-Analytics. Abmeldung mit einem Klick.