Benchmarks / Multimodal

Massive Multi-discipline Multimodal Understanding

MMMU

Fragen auf Hochschulniveau, die Bilder und Text zusammen erfordern — Diagramme, Schaltpläne, chemische Strukturen, medizinische Scans — über 30 Fächer.

MultimodalSolidAktivMittleres KontaminationsrisikoSeit 2023
Was dieser Benchmark nicht misst
  • Reine Bildqualität — viele Items lassen sich teils allein aus dem Text lösen, was Werte aufbläht.
  • Echte Dokument-Workflows — es ist eine Prüfung, kein 'lies dieses 40-seitige PDF und extrahiere die Tabelle'.
Analyse

Warum dieser Benchmark nützlich ist

Redaktionelle Einordnung ausstehendWir veröffentlichen zuerst Methodik und Ledger. Die benchmark-spezifische Analyse folgt nach der Desk-Prüfung.

Umfang

Abdeckung

Aufgabenfamilie
Multimodal
Format
~11.500 multimodale Fragen (Bild + Text), Multiple-Choice und offen.
Bewertung
Genauigkeit (% korrekt).
Verantwortliche Stelle
Yue et al.
Lesehilfe

So liest du die Scores

Die Lesehilfe steht noch aus. Nutze bis zur Desk-Einordnung Aufgabenformat, Bewertungsmethode und Quelldaten im Ledger.

Blinde Flecken

Was er nicht abdeckt

  • Reine Bildqualität — viele Items lassen sich teils allein aus dem Text lösen, was Werte aufbläht.
  • Echte Dokument-Workflows — es ist eine Prüfung, kein 'lies dieses 40-seitige PDF und extrahiere die Tabelle'.
Scores

Evidenz-Ledger

8 Zeilen
88 Zeilen
72.4%bester Score
2quellgeprüft
1Quellen
2026-05-28bis 2023-11-27
Papers / model cards8

manual-snapshot · manual

Verteilung

Wo die Zeilen liegen

0255075100

Auf die Skala dieses Benchmarks normalisiert (0–100). Die Tabelle zeigt die Rohwerte.

Zeitverlauf

Neueste Belege

  1. Claude Opus 4.870.6% · MMMU leaderboard
  2. Gemini 3.5 Flash68.9% · MMMU leaderboard
  3. GPT 5.571.8% · MMMU leaderboard
  4. Llama 4 Maverick61.4% · MMMU leaderboard
  5. Gemini 3.1 Pro72.4% · MMMU leaderboard

Scores nutzen die eigene Einheit und Skala dieses Benchmarks, keinen universellen Qualitätswert.

#ModellVeröffentlichungScoreHerkunftBeleglage
1Gemini 3.1 ProGoogle2026-02-1972.4%
MMMU leaderboard2026-02-19
Prüfung nötig
2GPT 5.5OpenAI2026-04-2371.8%
MMMU leaderboard2026-04-23
Prüfung nötig
3Claude Opus 4.8Anthropic2026-05-2870.6%
MMMU leaderboard2026-05-28
Prüfung nötig
4Gemini 3.5 FlashGoogle2026-05-1968.9%
MMMU leaderboard2026-05-19
Prüfung nötig
5Claude Sonnet 4.6Anthropic2026-02-1766.2%
MMMU leaderboard2026-02-17
Prüfung nötig
6Llama 4 MaverickMeta2026-04-0561.4%
MMMU leaderboard2026-04-05
Prüfung nötig
7Gemini 1.0 UltraGoogle2024-02-0859.4%
Gemini technical report2023-12-06
Quelle geprüft
8GPT-4V (2023)OpenAI2023-09-2556.8%
MMMU paper2023-11-27
Quelle geprüft
Methode

Was er abdeckt

Die Notiz zur Datenqualität steht aus. Jede Ledger-Zeile trägt weiterhin Quellen-URL, Quelldatum und Zeitpunkt des Einlesens.

Score-Obergrenze

Wo er an Grenzen stößt

Menschliche Experten ~88 %.

Tools, die ihn ausweisen

Belege

Quellen und weiterführende Lektüre

The Pack · Redaktionsnewsletter

Neue Karten in dein Postfach. Kostenlos.

Eine kurze E-Mail, wenn eine Karte erscheint oder den Status wechselt. Kein Tracking, keine Drittanbieter-Analytics. Abmeldung mit einem Klick.