Benchmarks / Multimodal

Massive Multi-discipline Multimodal Understanding

MMMU

Fragen auf Hochschulniveau, die Bilder und Text zusammen erfordern — Diagramme, Schaltpläne, chemische Strukturen, medizinische Scans — über 30 Fächer.

Was dieser Benchmark nicht misst
  • Reine Bildqualität — viele Items lassen sich teils allein aus dem Text lösen, was Werte aufbläht.
  • Echte Dokument-Workflows — es ist eine Prüfung, kein 'lies dieses 40-seitige PDF und extrahiere die Tabelle'.
Analyse

Warum dieser Benchmark nützlich ist

Wenn du multimodales Verständnis auf Hochschulniveau brauchst — Diagramme, Schaltpläne, Strukturen, Scans — keine rein textlichen Wissensprüfungen.

Umfang

Abdeckung

Aufgabenfamilie
Multimodal
Format
~11.500 multimodale Fragen (Bild + Text), Multiple-Choice und offen.
Bewertung
Genauigkeit (% korrekt).
Verantwortliche Stelle
Yue et al.
Lesehilfe

So liest du die Scores

Genauigkeit auf Bild+Text-Items. Frontier-Zeilen sitzen jetzt an oder über der ~88-%-Experten-Decke, also ist diese Seite gesättigt — für die lebende multimodale Prüfung MMMU-Pro lesen.

Blinde Flecken

Was er nicht abdeckt

  • Reine Bildqualität — viele Items lassen sich teils allein aus dem Text lösen, was Werte aufbläht.
  • Echte Dokument-Workflows — es ist eine Prüfung, kein 'lies dieses 40-seitige PDF und extrahiere die Tabelle'.
Scores

Evidenz-Ledger

8 Zeilen
88 Zeilen
72.4%bester Score
2quellgeprüft
1Quellen
2026-05-28bis 2023-11-27
Papers / model cards8

manual-snapshot · manual

Verteilung

Wo die Zeilen liegen

0255075100

Auf die Skala dieses Benchmarks normalisiert (0–100). Die Tabelle zeigt die Rohwerte.

Zeitverlauf

Neueste Belege

  1. Claude Opus 4.870.6% · MMMU leaderboard
  2. Gemini 3.5 Flash68.9% · MMMU leaderboard
  3. GPT 5.571.8% · MMMU leaderboard
  4. Llama 4 Maverick61.4% · MMMU leaderboard
  5. Gemini 3.1 Pro72.4% · MMMU leaderboard

Scores nutzen die eigene Einheit und Skala dieses Benchmarks, keinen universellen Qualitätswert.

#ModellVeröffentlichungScoreHerkunftBeleglage
1Gemini 3.1 ProGoogle2026-02-1972.4%
MMMU leaderboard2026-02-19
Prüfung nötig
2GPT 5.5OpenAI2026-04-2371.8%
MMMU leaderboard2026-04-23
Prüfung nötig
3Claude Opus 4.8Anthropic2026-05-2870.6%
MMMU leaderboard2026-05-28
Prüfung nötig
4Gemini 3.5 FlashGoogle2026-05-1968.9%
MMMU leaderboard2026-05-19
Prüfung nötig
5Claude Sonnet 4.6Anthropic2026-02-1766.2%
MMMU leaderboard2026-02-17
Prüfung nötig
6Llama 4 MaverickMeta2026-04-0561.4%
MMMU leaderboard2026-04-05
Prüfung nötig
7Gemini 1.0 UltraGoogle2024-02-0859.4%
Gemini technical report2023-12-06
Quelle geprüft
8GPT-4V (2023)OpenAI2023-09-2556.8%
MMMU paper2023-11-27
Quelle geprüft
Methode

Was er abdeckt

Dieser Benchmark gehört zur Familie multimodal. Sein Format: ~11.500 multimodale Fragen (Bild + Text), Multiple-Choice und offen. Der Score sollte immer mit Aufgabenformat, Bewertungsmethode, Quelldatum und Benchmark-Version gelesen werden.

Score-Obergrenze

Wo er an Grenzen stößt

Menschliche Experten ~88 %.

Tools, die ihn ausweisen

Belege

Quellen und weiterführende Lektüre

Fragen zu diesem Benchmark

Jede Antwort unten stammt aus den datierten Feldern dieser Seite. Nichts davon ist zusätzlich für Suchmaschinen geschrieben.

Was misst MMMU?

Fragen auf Hochschulniveau, die Bilder und Text zusammen erfordern — Diagramme, Schaltpläne, chemische Strukturen, medizinische Scans — über 30 Fächer.

Was beweist ein hoher MMMU-Wert nicht?

Ein starkes MMMU-Ergebnis sagt nichts aus über:

  • Reine Bildqualität — viele Items lassen sich teils allein aus dem Text lösen, was Werte aufbläht.
  • Echte Dokument-Workflows — es ist eine Prüfung, kein 'lies dieses 40-seitige PDF und extrahiere die Tabelle'.

Wie wird MMMU bewertet?

Genauigkeit (% korrekt). Aufgabenformat: ~11.500 multimodale Fragen (Bild + Text), Multiple-Choice und offen.

Ist MMMU gesättigt?

MMMU ist im Atlas derzeit als Gesättigt markiert. Kontext zur Obergrenze: Menschliche Experten ~88 %.

Können MMMU-Ergebnisse durch Trainingsdaten verunreinigt sein?

Das Kontaminationsrisiko für MMMU ist als Kontamination mittel eingestuft. Behandle jede Zeile auf dieser Seite als öffentliche Angabe mit Quelle und Datum, nicht als kontrolliertes Experiment.

The Pack · Redaktionsnewsletter

Neue Tools in dein Postfach. Kostenlos.

Eine kurze E-Mail, wenn ein Tool erscheint oder den Status wechselt. Kein Tracking, keine Drittanbieter-Analytics. Abmeldung mit einem Klick.