Warum dieser Benchmark nützlich ist
Originales MMMU trennt die Frontier nicht mehr. MMMU-Pro ist die lebende multimodale Prüfung: Shortcuts entfernt, zehn Optionen, noch Spreizung unter der alten 88-%-Decke.
MMMU Pro
Härtere multimodale Hochschulprüfung: originale MMMU-Items ohne Text-only-Shortcuts, zehn statt vier Optionen, und ein Vision-only-Setting, in dem die Frage im Bild steckt. 3.460 Fragen über 30 Fächer.
Originales MMMU trennt die Frontier nicht mehr. MMMU-Pro ist die lebende multimodale Prüfung: Shortcuts entfernt, zehn Optionen, noch Spreizung unter der alten 88-%-Decke.
Lies AA-MMMU-Pro-Genauigkeit, keine originalen MMMU- oder Vals-4-Optionen-Headlines. Gemini 3.7 Flash führt das öffentliche AA-Board um 85 %; Claude Opus 5 und GPT-5.6 Sol liegen im selben Band. Nicht mit Vals-Zeilen nahe 90 % mischen.
Auf die Skala dieses Benchmarks normalisiert (0–100). Die Tabelle zeigt die Rohwerte.
Scores nutzen die eigene Einheit und Skala dieses Benchmarks, keinen universellen Qualitätswert.
| # | Modell | Veröffentlichung | Score | Herkunft | Beleglage |
|---|---|---|---|---|---|
| 1 | Gemini 3.7 FlashGoogle | 2026-08-13 | 85.5% | 2026-09-01 | Quelle geprüft |
| 2 | Claude Opus 5Anthropic | 2026-07-24 | 84.7% | 2026-09-01 | Quelle geprüft |
| 3 | Gemini 3.5 FlashGoogle | 2026-05-19 | 84.3% | 2026-09-01 | Quelle geprüft |
| 4 | GPT-5.6 SolOpenAI | 2026-07-09 | 83.4% | 2026-09-01 | Quelle geprüft |
| 5 | Gemini 3.6 FlashGoogle | 2026-07-21 | 83.2% | 2026-09-01 | Quelle geprüft |
| 7 | Qwen3.8 MaxAlibaba | 2026-08-03 | 82.3% | 2026-09-01 | Quelle geprüft |
| 8 | GPT-5.6 TerraOpenAI | 2026-07-09 | 80.7% | 2026-09-01 | Quelle geprüft |
| 9 | Kimi K3Moonshot | 2026-07-16 | 80.5% | 2026-09-01 | Quelle geprüft |
Ledger-Zeilen aus Artificial Analysis' öffentlicher MMMU-Pro-Evaluation (Board 1. Sep. 2026). Das Paper 2024 berichtete deutlich niedrigere Werte auf einem älteren Modellset; Frontier-Zeilen 2026 liegen im unteren bis mittleren 80er-Bereich. Vals fährt ein anderes, leichteres Protokoll unter ähnlichem Namen.
Noch ist keine Obergrenze erfasst. Wenn sich Scores oben bündeln, kann der Benchmark Frontier-Modelle möglicherweise nicht mehr trennen.
Jede Antwort unten stammt aus den datierten Feldern dieser Seite. Nichts davon ist zusätzlich für Suchmaschinen geschrieben.
Härtere multimodale Hochschulprüfung: originale MMMU-Items ohne Text-only-Shortcuts, zehn statt vier Optionen, und ein Vision-only-Setting, in dem die Frage im Bild steckt. 3.460 Fragen über 30 Fächer.
Ein starkes MMMU-Pro-Ergebnis sagt nichts aus über:
Genauigkeit (% korrekt). VerdictPal-Ledger-Zeilen sind Artificial Analysis' unabhängiger MMMU-Pro-Lauf. Aufgabenformat: 3.460 Bild+Text- (und Vision-only-)Items über Kunst, Business, Science, Gesundheit, Geisteswissenschaften und Engineering. Zehn Multiple-Choice-Optionen nach Filterung von Fragen, die ein Text-only-Modell lösen kann.
MMMU-Pro ist im Atlas derzeit als Aktiv markiert.
Das Kontaminationsrisiko für MMMU-Pro ist als Kontamination mittel eingestuft. Behandle jede Zeile auf dieser Seite als öffentliche Angabe mit Quelle und Datum, nicht als kontrolliertes Experiment.
The Pack · Redaktionsnewsletter
Eine kurze E-Mail, wenn ein Tool erscheint oder den Status wechselt. Kein Tracking, keine Drittanbieter-Analytics. Abmeldung mit einem Klick.