Benchmarks / Multimodal

MMMU-Pro

MMMU Pro

Härtere multimodale Hochschulprüfung: originale MMMU-Items ohne Text-only-Shortcuts, zehn statt vier Optionen, und ein Vision-only-Setting, in dem die Frage im Bild steckt. 3.460 Fragen über 30 Fächer.

Was dieser Benchmark nicht misst
  • Originale MMMU-Headlines — die enthalten noch textlösbare Items. Eine 88-%-MMMU-Zeile ist keine MMMU-Pro-Zeile.
  • Dokument-Workflows — bleibt eine Prüfung, kein 'lies dieses 40-seitige PDF und extrahiere die Tabelle'.
  • Vals' 'MMMU Pro'-4-Optionen-Lauf — dieses Board liegt nahe der 88,6-%-Experten-Decke. VerdictPal-Zeilen auf dieser Seite sind Artificial Analysis' härtere 10-Optionen-/Vision-Filter-Suite.
Analyse

Warum dieser Benchmark nützlich ist

Originales MMMU trennt die Frontier nicht mehr. MMMU-Pro ist die lebende multimodale Prüfung: Shortcuts entfernt, zehn Optionen, noch Spreizung unter der alten 88-%-Decke.

Umfang

Abdeckung

Aufgabenfamilie
Multimodal
Format
3.460 Bild+Text- (und Vision-only-)Items über Kunst, Business, Science, Gesundheit, Geisteswissenschaften und Engineering. Zehn Multiple-Choice-Optionen nach Filterung von Fragen, die ein Text-only-Modell lösen kann.
Bewertung
Genauigkeit (% korrekt). VerdictPal-Ledger-Zeilen sind Artificial Analysis' unabhängiger MMMU-Pro-Lauf.
Verantwortliche Stelle
Yue et al. / Artificial Analysis
Lesehilfe

So liest du die Scores

Lies AA-MMMU-Pro-Genauigkeit, keine originalen MMMU- oder Vals-4-Optionen-Headlines. Gemini 3.7 Flash führt das öffentliche AA-Board um 85 %; Claude Opus 5 und GPT-5.6 Sol liegen im selben Band. Nicht mit Vals-Zeilen nahe 90 % mischen.

Blinde Flecken

Was er nicht abdeckt

  • Originale MMMU-Headlines — die enthalten noch textlösbare Items. Eine 88-%-MMMU-Zeile ist keine MMMU-Pro-Zeile.
  • Dokument-Workflows — bleibt eine Prüfung, kein 'lies dieses 40-seitige PDF und extrahiere die Tabelle'.
  • Vals' 'MMMU Pro'-4-Optionen-Lauf — dieses Board liegt nahe der 88,6-%-Experten-Decke. VerdictPal-Zeilen auf dieser Seite sind Artificial Analysis' härtere 10-Optionen-/Vision-Filter-Suite.
Scores

Evidenz-Ledger

8 Zeilen
88 Zeilen
85.5%bester Score
8quellgeprüft
1Quellen
2026-09-01Quelldatum
8

api · api

Verteilung

Wo die Zeilen liegen

0255075100

Auf die Skala dieses Benchmarks normalisiert (0–100). Die Tabelle zeigt die Rohwerte.

Zeitverlauf

Neueste Belege

  1. Gemini 3.7 Flash85.5% ·
  2. Claude Opus 584.7% ·
  3. Gemini 3.5 Flash84.3% ·
  4. GPT-5.6 Sol83.4% ·
  5. Gemini 3.6 Flash83.2% ·

Scores nutzen die eigene Einheit und Skala dieses Benchmarks, keinen universellen Qualitätswert.

#ModellVeröffentlichungScoreHerkunftBeleglage
1Gemini 3.7 FlashGoogle2026-08-1385.5%
2026-09-01
Quelle geprüft
2Claude Opus 5Anthropic2026-07-2484.7%
2026-09-01
Quelle geprüft
3Gemini 3.5 FlashGoogle2026-05-1984.3%
2026-09-01
Quelle geprüft
4GPT-5.6 SolOpenAI2026-07-0983.4%
2026-09-01
Quelle geprüft
5Gemini 3.6 FlashGoogle2026-07-2183.2%
2026-09-01
Quelle geprüft
7Qwen3.8 MaxAlibaba2026-08-0382.3%
2026-09-01
Quelle geprüft
8GPT-5.6 TerraOpenAI2026-07-0980.7%
2026-09-01
Quelle geprüft
9Kimi K3Moonshot2026-07-1680.5%
2026-09-01
Quelle geprüft
Methode

Was er abdeckt

Ledger-Zeilen aus Artificial Analysis' öffentlicher MMMU-Pro-Evaluation (Board 1. Sep. 2026). Das Paper 2024 berichtete deutlich niedrigere Werte auf einem älteren Modellset; Frontier-Zeilen 2026 liegen im unteren bis mittleren 80er-Bereich. Vals fährt ein anderes, leichteres Protokoll unter ähnlichem Namen.

Score-Obergrenze

Wo er an Grenzen stößt

Noch ist keine Obergrenze erfasst. Wenn sich Scores oben bündeln, kann der Benchmark Frontier-Modelle möglicherweise nicht mehr trennen.

Tools, die ihn ausweisen

Belege

Quellen und weiterführende Lektüre

Fragen zu diesem Benchmark

Jede Antwort unten stammt aus den datierten Feldern dieser Seite. Nichts davon ist zusätzlich für Suchmaschinen geschrieben.

Was misst MMMU-Pro?

Härtere multimodale Hochschulprüfung: originale MMMU-Items ohne Text-only-Shortcuts, zehn statt vier Optionen, und ein Vision-only-Setting, in dem die Frage im Bild steckt. 3.460 Fragen über 30 Fächer.

Was beweist ein hoher MMMU-Pro-Wert nicht?

Ein starkes MMMU-Pro-Ergebnis sagt nichts aus über:

  • Originale MMMU-Headlines — die enthalten noch textlösbare Items. Eine 88-%-MMMU-Zeile ist keine MMMU-Pro-Zeile.
  • Dokument-Workflows — bleibt eine Prüfung, kein 'lies dieses 40-seitige PDF und extrahiere die Tabelle'.
  • Vals' 'MMMU Pro'-4-Optionen-Lauf — dieses Board liegt nahe der 88,6-%-Experten-Decke. VerdictPal-Zeilen auf dieser Seite sind Artificial Analysis' härtere 10-Optionen-/Vision-Filter-Suite.

Wie wird MMMU-Pro bewertet?

Genauigkeit (% korrekt). VerdictPal-Ledger-Zeilen sind Artificial Analysis' unabhängiger MMMU-Pro-Lauf. Aufgabenformat: 3.460 Bild+Text- (und Vision-only-)Items über Kunst, Business, Science, Gesundheit, Geisteswissenschaften und Engineering. Zehn Multiple-Choice-Optionen nach Filterung von Fragen, die ein Text-only-Modell lösen kann.

Ist MMMU-Pro gesättigt?

MMMU-Pro ist im Atlas derzeit als Aktiv markiert.

Können MMMU-Pro-Ergebnisse durch Trainingsdaten verunreinigt sein?

Das Kontaminationsrisiko für MMMU-Pro ist als Kontamination mittel eingestuft. Behandle jede Zeile auf dieser Seite als öffentliche Angabe mit Quelle und Datum, nicht als kontrolliertes Experiment.

The Pack · Redaktionsnewsletter

Neue Tools in dein Postfach. Kostenlos.

Eine kurze E-Mail, wenn ein Tool erscheint oder den Status wechselt. Kein Tracking, keine Drittanbieter-Analytics. Abmeldung mit einem Klick.