Warum dieser Benchmark nützlich ist
Redaktionelle Einordnung ausstehendWir veröffentlichen zuerst Methodik und Ledger. Die benchmark-spezifische Analyse folgt nach der Desk-Prüfung.
Benchmarks / Wissen
Ein schwererer MMLU-Nachfolger: zehn statt vier Optionen, schlussfolgerungslastige Fragen und ein bereinigter Satz, der schwerer zu erraten ist.
Redaktionelle Einordnung ausstehendWir veröffentlichen zuerst Methodik und Ledger. Die benchmark-spezifische Analyse folgt nach der Desk-Prüfung.
Die Lesehilfe steht noch aus. Nutze bis zur Desk-Einordnung Aufgabenformat, Bewertungsmethode und Quelldaten im Ledger.
Auf die Skala dieses Benchmarks normalisiert (0–100). Die Tabelle zeigt die Rohwerte.
Scores nutzen die eigene Einheit und Skala dieses Benchmarks, keinen universellen Qualitätswert.
| # | Modell | Veröffentlichung | Score | Herkunft | Beleglage |
|---|---|---|---|---|---|
| 1 | Gemini 3 ProGoogle | 2025-11-18 | 89.8% | 2026-07-21 | Quelle geprüft |
| 2 | Claude Opus 4.5Anthropic | 2025-11-24 | 88.9% | 2026-07-21 | Quelle geprüft |
| 3 | Gemini 3 Flash PreviewGoogle | 2025-12-17 | 88.2% | 2026-07-21 | Quelle geprüft |
| 4 | GPT-5.2OpenAI | 2025-12-11 | 87.4% | 2026-07-21 | Quelle geprüft |
| 5 | GPT-5.1OpenAI | 2025-11-13 | 87% | 2026-07-21 | Quelle geprüft |
| 6 | OpenAI o3OpenAI | 2025-04-16 | 85.3% | 2026-07-21 | Quelle geprüft |
| 7 | DeepSeek R1DeepSeek | 2025-01-20 | 84.9% | 2026-07-21 | Quelle geprüft |
| 8 | OpenAI o1OpenAI | 2024-09-12 | 84.1% | 2026-07-21 | Quelle geprüft |
| 1 | Claude Opus 4.8AnthropicCoT prompting. Harder than base MMLU — gaps are wider at the frontier. | 2026-05-28 | 82.4% | MMLU-Pro HuggingFace leaderboard2026-05-28 | Prüfung nötig |
| 2 | GPT 5.5OpenAI | 2026-04-23 | 81.6% | MMLU-Pro HuggingFace leaderboard2026-04-23 | Prüfung nötig |
| 11 | Llama 4 MaverickMeta | 2026-04-05 | 80.9% | 2026-07-21 | Quelle geprüft |
| 3 | Gemini 3.1 ProGoogle | 2026-02-19 | 79.8% | MMLU-Pro HuggingFace leaderboard2026-02-19 | Prüfung nötig |
| 4 | Claude Sonnet 4.6Anthropic | 2026-02-17 | 78.2% | MMLU-Pro HuggingFace leaderboard2026-02-17 | Prüfung nötig |
| 5 | DeepSeek V4 Pro MaxDeepSeek | 2026-04-24 | 76.4% | MMLU-Pro HuggingFace leaderboard2026-04-24 | Prüfung nötig |
| 15 | Llama 4 ScoutMeta | 2026-04-05 | 75.2% | 2026-07-21 | Quelle geprüft |
| 6 | Qwen 3.7 MaxAlibaba | 2026-05-20 | 75.1% | MMLU-Pro HuggingFace leaderboard2026-05-20 | Prüfung nötig |
| 7 | Kimi K2.6Moonshot | 2026-04-20 | 74.6% | MMLU-Pro HuggingFace leaderboard2026-04-20 | Prüfung nötig |
| 8 | Mistral Large 3Mistral | 2025-12-02 | 72.8% | MMLU-Pro HuggingFace leaderboard2025-12-02 | Prüfung nötig |
| 9 | GPT-4o (2024)OpenAI | 2024-05-01 | 72.6% | MMLU-Pro paper2024-06-03 | Quelle geprüft |
| 20 | Command ACohere | 2026-03-15 | 71.2% | 2026-07-21 | Quelle geprüft |
| 10 | Claude 3 OpusAnthropic | 2024-03-04 | 68.4% | MMLU-Pro paper2024-06-03 | Quelle geprüft |
Die Notiz zur Datenqualität steht aus. Jede Ledger-Zeile trägt weiterhin Quellen-URL, Quelldatum und Zeitpunkt des Einlesens.
Noch ist keine Obergrenze erfasst. Wenn sich Scores oben bündeln, kann der Benchmark Frontier-Modelle möglicherweise nicht mehr trennen.
The Pack · Redaktionsnewsletter
Eine kurze E-Mail, wenn eine Karte erscheint oder den Status wechselt. Kein Tracking, keine Drittanbieter-Analytics. Abmeldung mit einem Klick.