Warum dieser Benchmark nützlich ist
Redaktionelle Einordnung ausstehendWir veröffentlichen zuerst Methodik und Ledger. Die benchmark-spezifische Analyse folgt nach der Desk-Prüfung.
Benchmarks / Multimodal
MMMU
Fragen auf Hochschulniveau, die Bilder und Text zusammen erfordern — Diagramme, Schaltpläne, chemische Strukturen, medizinische Scans — über 30 Fächer.
Redaktionelle Einordnung ausstehendWir veröffentlichen zuerst Methodik und Ledger. Die benchmark-spezifische Analyse folgt nach der Desk-Prüfung.
Die Lesehilfe steht noch aus. Nutze bis zur Desk-Einordnung Aufgabenformat, Bewertungsmethode und Quelldaten im Ledger.
Auf die Skala dieses Benchmarks normalisiert (0–100). Die Tabelle zeigt die Rohwerte.
Scores nutzen die eigene Einheit und Skala dieses Benchmarks, keinen universellen Qualitätswert.
| # | Modell | Veröffentlichung | Score | Herkunft | Beleglage |
|---|---|---|---|---|---|
| 1 | Gemini 3.1 ProGoogle | 2026-02-19 | 72.4% | MMMU leaderboard2026-02-19 | Prüfung nötig |
| 2 | GPT 5.5OpenAI | 2026-04-23 | 71.8% | MMMU leaderboard2026-04-23 | Prüfung nötig |
| 3 | Claude Opus 4.8Anthropic | 2026-05-28 | 70.6% | MMMU leaderboard2026-05-28 | Prüfung nötig |
| 4 | Gemini 3.5 FlashGoogle | 2026-05-19 | 68.9% | MMMU leaderboard2026-05-19 | Prüfung nötig |
| 5 | Claude Sonnet 4.6Anthropic | 2026-02-17 | 66.2% | MMMU leaderboard2026-02-17 | Prüfung nötig |
| 6 | Llama 4 MaverickMeta | 2026-04-05 | 61.4% | MMMU leaderboard2026-04-05 | Prüfung nötig |
| 7 | Gemini 1.0 UltraGoogle | 2024-02-08 | 59.4% | Gemini technical report2023-12-06 | Quelle geprüft |
| 8 | GPT-4V (2023)OpenAI | 2023-09-25 | 56.8% | MMMU paper2023-11-27 | Quelle geprüft |
Die Notiz zur Datenqualität steht aus. Jede Ledger-Zeile trägt weiterhin Quellen-URL, Quelldatum und Zeitpunkt des Einlesens.
Menschliche Experten ~88 %.
The Pack · Redaktionsnewsletter
Eine kurze E-Mail, wenn eine Karte erscheint oder den Status wechselt. Kein Tracking, keine Drittanbieter-Analytics. Abmeldung mit einem Klick.