Warum dieser Benchmark nützlich ist
Er fordert Abstraktion und mehrstufiges Schlussfolgern. So erkennst du Modelle, die ein Problem zusammenhalten, auch wenn der Prompt nicht wie eine bekannte Prüfungsfrage aussieht.
Benchmarks / Reasoning
HLE
Fachübergreifende Fragen auf Expertenniveau — Mathematik, Naturwissenschaften, Geisteswissenschaften, professionelles Recht und Medizin — entworfen als die härteste öffentliche Prüfung, die ein Frontier-Modell ablegen kann.
Er fordert Abstraktion und mehrstufiges Schlussfolgern. So erkennst du Modelle, die ein Problem zusammenhalten, auch wenn der Prompt nicht wie eine bekannte Prüfungsfrage aussieht.
Lies Humanity's Last Exam als aktiv Signal mit niedriges kontaminationsrisiko. Vergleiche Modelle nur, wenn Quelle, Testumgebung, Prompting, Sampling und Score-Einheit übereinstimmen.
Auf die Skala dieses Benchmarks normalisiert (0–100). Die Tabelle zeigt die Rohwerte.
Scores nutzen die eigene Einheit und Skala dieses Benchmarks, keinen universellen Qualitätswert.
| # | Modell | Veröffentlichung | Score | Herkunft | Beleglage |
|---|---|---|---|---|---|
| 1 | Claude Fable 5Anthropic | 2026-06-09 | 53.3% | 2026-07-21 | Quelle geprüft |
| 2 | GPT-5.6 SolOpenAI | 2026-07-09 | 47.2% | 2026-07-21 | Quelle geprüft |
| 3 | Claude Opus 4.8Anthropic | 2026-05-28 | 45.7% | 2026-07-21 | Quelle geprüft |
| 4 | Muse Spark 1.1Meta | 2026-07-09 | 45.1% | 2026-07-21 | Quelle geprüft |
| 5 | Gemini 3.1 Pro PreviewGoogle | 2026-02-19 | 44.7% | 2026-07-21 | Quelle geprüft |
| 6 | GPT 5.5OpenAI | 2026-04-23 | 44.3% | 2026-07-21 | Quelle geprüft |
| 7 | Kimi K3Moonshot | 2026-07-16 | 44.3% | 2026-07-21 | Quelle geprüft |
| 8 | GPT-5.5 (high)OpenAI | 2026-04-23 | 43% | 2026-07-21 | Quelle geprüft |
| 9 | GPT-5.6 TerraOpenAI | 2026-07-09 | 41.8% | 2026-07-21 | Quelle geprüft |
| 10 | GPT 5.4OpenAI | 2026-03-05 | 41.6% | 2026-07-21 | Quelle geprüft |
| 11 | Gemini 3.5 FlashGoogle | 2026-05-19 | 41% | 2026-07-21 | Quelle geprüft |
| 12 | GPT-5.5 (medium)OpenAI | 2026-04-23 | 40.6% | 2026-07-21 | Quelle geprüft |
| 13 | Grok 4.5xAI | 2026-07-08 | 40.3% | 2026-07-21 | Quelle geprüft |
| 14 | GLM-5.2Zhipu | 2026-06-13 | 40.1% | 2026-07-21 | Quelle geprüft |
| 15 | Gemini 3.5 Flash (medium)Google | 2026-05-19 | 39.9% | 2026-07-21 | Quelle geprüft |
| 16 | GPT-5.3 Codex (xhigh)OpenAI | 2026-02-05 | 39.9% | 2026-07-21 | Quelle geprüft |
| 17 | Muse SparkOther | 2026-01-01 | 39.9% | 2026-07-21 | Quelle geprüft |
| 18 | Claude Opus 4.7Anthropic | 2026-04-16 | 39.6% | 2026-07-21 | Quelle geprüft |
| 19 | Claude Sonnet 5Anthropic | 2026-06-30 | 39.6% | 2026-07-21 | Quelle geprüft |
| 20 | Qwen3.7 MaxAlibaba | 2026-05-19 | 38.1% | 2026-07-21 | Quelle geprüft |
| 21 | Gemini 3 ProGoogle | 2025-11-18 | 37.2% | 2026-07-21 | Quelle geprüft |
| 22 | GPT-5.6 LunaOpenAI | 2026-07-09 | 37.2% | 2026-07-21 | Quelle geprüft |
| 23 | MiniMax M3MiniMax | 2026-05-31 | 37.1% | 2026-07-21 | Quelle geprüft |
| 24 | Claude Opus 4.6 (Adaptive Reasoning, Max Effort)Anthropic | 2026-02-05 | 36.7% | 2026-07-21 | Quelle geprüft |
| 25 | DeepSeek V4 Pro (Reasoning, Max Effort)DeepSeek | 2026-04-24 | 35.9% | 2026-07-21 | Quelle geprüft |
| 26 | Kimi K2.6Moonshot | 2026-04-20 | 35.9% | 2026-07-21 | Quelle geprüft |
| 27 | GPT-5.2OpenAI | 2025-12-11 | 35.4% | 2026-07-21 | Quelle geprüft |
| 28 | Grok 4.3xAI | 2026-04-30 | 35% | 2026-07-21 | Quelle geprüft |
| 29 | MiMo-V2.5-ProXiaomi | 2026-04-22 | 33.8% | 2026-07-21 | Quelle geprüft |
| 30 | Qwen 3.7 PlusAlibaba | 2026-06-02 | 33.4% | 2026-07-21 | Quelle geprüft |
| 31 | Kimi K2.7 CodeMoonshot | 2026-06-12 | 32.8% | 2026-07-21 | Quelle geprüft |
| 32 | Grok 4.20 ReasoningxAI | 2026-03-05 | 32.2% | 2026-07-21 | Quelle geprüft |
| 33 | LongCat-2.0Meituan | 2026-06-29 | 32.1% | 2026-07-21 | Quelle geprüft |
| 34 | Claude Opus 4.7 (Non-reasoning, High Effort)Anthropic | 2026-04-16 | 31.2% | 2026-07-21 | Quelle geprüft |
| 35 | GPT-5.5 (low)OpenAI | 2026-04-23 | 31% | 2026-07-21 | Quelle geprüft |
| 36 | Claude Sonnet 4.6 (Adaptive Reasoning, Max Effort)Anthropic | 2026-02-17 | 30% | 2026-07-21 | Quelle geprüft |
| 37 | Kimi K2.5Moonshot | 2026-01-27 | 29.4% | 2026-07-21 | Quelle geprüft |
| 38 | MiniMax M2.7MiniMax | 2026-04-15 | 28.1% | 2026-07-21 | Quelle geprüft |
| 39 | GLM-5.1Zhipu | 2026-04-07 | 28% | 2026-07-21 | Quelle geprüft |
| 40 | GPT-5.4 MiniOpenAI | 2026-03-17 | 26.6% | 2026-07-21 | Quelle geprüft |
| 41 | Nemotron 3 Ultra 550B A55B (Reasoning)NVIDIA | 2026-06-04 | 26.6% | 2026-07-21 | Quelle geprüft |
| 42 | GPT-5.1OpenAI | 2025-11-13 | 26.5% | 2026-07-21 | Quelle geprüft |
| 43 | GPT-5.4 NanoOpenAI | 2026-03-17 | 26.5% | 2026-07-21 | Quelle geprüft |
| 44 | Gemma 4 31B ITGoogle | 2026-03-01 | 22.7% | 2026-07-21 | Quelle geprüft |
| 45 | OpenAI o3OpenAI | 2025-04-16 | 20% | 2026-07-21 | Quelle geprüft |
| 46 | Step 3.7 FlashStepFun | 2026-06-01 | 19.9% | 2026-07-21 | Quelle geprüft |
| 47 | MiniMax M2.5MiniMax | 2026-04-01 | 19.1% | 2026-07-21 | Quelle geprüft |
| 48 | Claude Opus 4.6Anthropic | 2026-02-05 | 18.6% | 2026-07-21 | Quelle geprüft |
| 49 | Gemini 3.1 Flash LiteGoogle | 2026-05-07 | 16.2% | 2026-07-21 | Quelle geprüft |
| 50 | HyperNova 60B 2605Multiverse | 2026-05-06 | 15.1% | 2026-07-21 | Quelle geprüft |
| 51 | DeepSeek R1DeepSeek | 2025-01-20 | 14.9% | 2026-07-21 | Quelle geprüft |
| 52 | Gemma 4 12B (Reasoning)Google | 2026-06-07 | 14.8% | 2026-07-21 | Quelle geprüft |
| 53 | Gemini 3 Flash PreviewGoogle | 2025-12-17 | 14.1% | 2026-07-21 | Quelle geprüft |
| 54 | Claude Sonnet 4.6Anthropic | 2026-02-17 | 13.2% | 2026-07-21 | Quelle geprüft |
| 55 | Claude Opus 4.5Anthropic | 2025-11-24 | 12.9% | 2026-07-21 | Quelle geprüft |
| 56 | North Mini CodeCohere | 2026-06-09 | 10% | 2026-07-21 | Quelle geprüft |
| 57 | OpenAI o1OpenAI | 2024-09-12 | 7.7% | 2026-07-21 | Quelle geprüft |
| 58 | LFM2.5-8B-A1BLiquid | 2026-06-08 | 6.9% | 2026-07-21 | Quelle geprüft |
| 59 | MiniCPM5-1B (Reasoning)OpenBMB | 2026-06-04 | 6.5% | 2026-07-21 | Quelle geprüft |
| 60 | Gemma 4 12B (Non-reasoning)Google | 2026-06-10 | 6.2% | 2026-07-21 | Quelle geprüft |
| 61 | Llama 4 MaverickMeta | 2026-04-05 | 4.8% | 2026-07-21 | Quelle geprüft |
| 62 | Command ACohere | 2026-03-15 | 4.6% | 2026-07-21 | Quelle geprüft |
| 63 | Llama 4 ScoutMeta | 2026-04-05 | 4.3% | 2026-07-21 | Quelle geprüft |
| 64 | Mistral Large 3Mistral | 2025-12-02 | 4.1% | 2026-07-21 | Quelle geprüft |
| 65 | Claude 3 OpusAnthropic | 2024-03-04 | 3.1% | 2026-07-21 | Quelle geprüft |
Dieser Benchmark gehört zur Familie reasoning. Sein Format: Multiple-Choice- und Kurzantwortfragen, geprüft von Fachexpert:innen; Einreichungen werden vor der Bewertung auf Schwierigkeit geprüft. Der Score sollte immer mit Aufgabenformat, Bewertungsmethode, Quelldatum und Benchmark-Version gelesen werden.
Scores auf VerdictPal stammen aus Artificial Analysis' unabhängigem HLE-Lauf, sofern nicht anders vermerkt. Die offizielle Projektseite hostet Datensatz und Paper — keine einzelne gepflegte öffentliche Leaderboard-URL.
The Pack · Redaktionsnewsletter
Eine kurze E-Mail, wenn eine Karte erscheint oder den Status wechselt. Kein Tracking, keine Drittanbieter-Analytics. Abmeldung mit einem Klick.