Warum dieser Benchmark nützlich ist
Wenn du multimodales Verständnis auf Hochschulniveau brauchst — Diagramme, Schaltpläne, Strukturen, Scans — keine rein textlichen Wissensprüfungen.
MMMU
Fragen auf Hochschulniveau, die Bilder und Text zusammen erfordern — Diagramme, Schaltpläne, chemische Strukturen, medizinische Scans — über 30 Fächer.
Wenn du multimodales Verständnis auf Hochschulniveau brauchst — Diagramme, Schaltpläne, Strukturen, Scans — keine rein textlichen Wissensprüfungen.
Genauigkeit auf Bild+Text-Items. Frontier-Zeilen sitzen jetzt an oder über der ~88-%-Experten-Decke, also ist diese Seite gesättigt — für die lebende multimodale Prüfung MMMU-Pro lesen.
Auf die Skala dieses Benchmarks normalisiert (0–100). Die Tabelle zeigt die Rohwerte.
Scores nutzen die eigene Einheit und Skala dieses Benchmarks, keinen universellen Qualitätswert.
| # | Modell | Veröffentlichung | Score | Herkunft | Beleglage |
|---|---|---|---|---|---|
| 1 | Gemini 3.1 ProGoogle | 2026-02-19 | 72.4% | MMMU leaderboard2026-02-19 | Prüfung nötig |
| 2 | GPT 5.5OpenAI | 2026-04-23 | 71.8% | MMMU leaderboard2026-04-23 | Prüfung nötig |
| 3 | Claude Opus 4.8Anthropic | 2026-05-28 | 70.6% | MMMU leaderboard2026-05-28 | Prüfung nötig |
| 4 | Gemini 3.5 FlashGoogle | 2026-05-19 | 68.9% | MMMU leaderboard2026-05-19 | Prüfung nötig |
| 5 | Claude Sonnet 4.6Anthropic | 2026-02-17 | 66.2% | MMMU leaderboard2026-02-17 | Prüfung nötig |
| 6 | Llama 4 MaverickMeta | 2026-04-05 | 61.4% | MMMU leaderboard2026-04-05 | Prüfung nötig |
| 7 | Gemini 1.0 UltraGoogle | 2024-02-08 | 59.4% | Gemini technical report2023-12-06 | Quelle geprüft |
| 8 | GPT-4V (2023)OpenAI | 2023-09-25 | 56.8% | MMMU paper2023-11-27 | Quelle geprüft |
Dieser Benchmark gehört zur Familie multimodal. Sein Format: ~11.500 multimodale Fragen (Bild + Text), Multiple-Choice und offen. Der Score sollte immer mit Aufgabenformat, Bewertungsmethode, Quelldatum und Benchmark-Version gelesen werden.
Menschliche Experten ~88 %.
Jede Antwort unten stammt aus den datierten Feldern dieser Seite. Nichts davon ist zusätzlich für Suchmaschinen geschrieben.
Fragen auf Hochschulniveau, die Bilder und Text zusammen erfordern — Diagramme, Schaltpläne, chemische Strukturen, medizinische Scans — über 30 Fächer.
Ein starkes MMMU-Ergebnis sagt nichts aus über:
Genauigkeit (% korrekt). Aufgabenformat: ~11.500 multimodale Fragen (Bild + Text), Multiple-Choice und offen.
MMMU ist im Atlas derzeit als Gesättigt markiert. Kontext zur Obergrenze: Menschliche Experten ~88 %.
Das Kontaminationsrisiko für MMMU ist als Kontamination mittel eingestuft. Behandle jede Zeile auf dieser Seite als öffentliche Angabe mit Quelle und Datum, nicht als kontrolliertes Experiment.
The Pack · Redaktionsnewsletter
Eine kurze E-Mail, wenn ein Tool erscheint oder den Status wechselt. Kein Tracking, keine Drittanbieter-Analytics. Abmeldung mit einem Klick.