Benchmarks / Reasoning

Humanity's Last Exam

HLE

Fachübergreifende Fragen auf Expertenniveau — Mathematik, Naturwissenschaften, Geisteswissenschaften, professionelles Recht und Medizin — entworfen als die härteste öffentliche Prüfung, die ein Frontier-Modell ablegen kann.

ReasoningFlagshipAktivNiedriges KontaminationsrisikoSeit 2025
Was dieser Benchmark nicht misst
  • Echte Forschungsproduktivität — Prüfungsfragen erfassen nicht die unordentliche Such-und-Synthetisieren-Arbeit, die eine Forscher:in tatsächlich leistet.
  • Werkzeuggestützter Einsatz — HLE ist standardmäßig Closed-Book; Modelle, die Taschenrechner, Code oder Websuche nutzen, bekommen ein eigenes Tier.
  • Kalibrierung — HLE berichtet Genauigkeit, nicht wie gut das Modell weiß, was es nicht weiß.
Analyse

Warum dieser Benchmark nützlich ist

Er fordert Abstraktion und mehrstufiges Schlussfolgern. So erkennst du Modelle, die ein Problem zusammenhalten, auch wenn der Prompt nicht wie eine bekannte Prüfungsfrage aussieht.

Umfang

Abdeckung

Aufgabenfamilie
Reasoning
Format
Multiple-Choice- und Kurzantwortfragen, geprüft von Fachexpert:innen; Einreichungen werden vor der Bewertung auf Schwierigkeit geprüft.
Bewertung
Prozent korrekt beantworteter Fragen am öffentlichen + privaten Split; HLE berichtet eine Genauigkeitszahl pro Modell.
Verantwortliche Stelle
Center for AI Safety / Scale AI
Lesehilfe

So liest du die Scores

Lies Humanity's Last Exam als aktiv Signal mit niedriges kontaminationsrisiko. Vergleiche Modelle nur, wenn Quelle, Testumgebung, Prompting, Sampling und Score-Einheit übereinstimmen.

Blinde Flecken

Was er nicht abdeckt

  • Echte Forschungsproduktivität — Prüfungsfragen erfassen nicht die unordentliche Such-und-Synthetisieren-Arbeit, die eine Forscher:in tatsächlich leistet.
  • Werkzeuggestützter Einsatz — HLE ist standardmäßig Closed-Book; Modelle, die Taschenrechner, Code oder Websuche nutzen, bekommen ein eigenes Tier.
  • Kalibrierung — HLE berichtet Genauigkeit, nicht wie gut das Modell weiß, was es nicht weiß.
Scores

Evidenz-Ledger

65 Zeilen
6565 Zeilen
53.3%bester Score
65quellgeprüft
1Quellen
2026-07-21Quelldatum
65

api · api

Verteilung

Wo die Zeilen liegen

0255075100

Auf die Skala dieses Benchmarks normalisiert (0–100). Die Tabelle zeigt die Rohwerte.

Zeitverlauf

Neueste Belege

  1. Claude Fable 553.3% ·
  2. GPT-5.6 Sol47.2% ·
  3. Claude Opus 4.845.7% ·
  4. Muse Spark 1.145.1% ·
  5. Gemini 3.1 Pro Preview44.7% ·

Scores nutzen die eigene Einheit und Skala dieses Benchmarks, keinen universellen Qualitätswert.

#ModellVeröffentlichungScoreHerkunftBeleglage
1Claude Fable 5Anthropic2026-06-0953.3%
2026-07-21
Quelle geprüft
2GPT-5.6 SolOpenAI2026-07-0947.2%
2026-07-21
Quelle geprüft
3Claude Opus 4.8Anthropic2026-05-2845.7%
2026-07-21
Quelle geprüft
4Muse Spark 1.1Meta2026-07-0945.1%
2026-07-21
Quelle geprüft
5Gemini 3.1 Pro PreviewGoogle2026-02-1944.7%
2026-07-21
Quelle geprüft
6GPT 5.5OpenAI2026-04-2344.3%
2026-07-21
Quelle geprüft
7Kimi K3Moonshot2026-07-1644.3%
2026-07-21
Quelle geprüft
8GPT-5.5 (high)OpenAI2026-04-2343%
2026-07-21
Quelle geprüft
9GPT-5.6 TerraOpenAI2026-07-0941.8%
2026-07-21
Quelle geprüft
10GPT 5.4OpenAI2026-03-0541.6%
2026-07-21
Quelle geprüft
11Gemini 3.5 FlashGoogle2026-05-1941%
2026-07-21
Quelle geprüft
12GPT-5.5 (medium)OpenAI2026-04-2340.6%
2026-07-21
Quelle geprüft
13Grok 4.5xAI2026-07-0840.3%
2026-07-21
Quelle geprüft
14GLM-5.2Zhipu2026-06-1340.1%
2026-07-21
Quelle geprüft
15Gemini 3.5 Flash (medium)Google2026-05-1939.9%
2026-07-21
Quelle geprüft
16GPT-5.3 Codex (xhigh)OpenAI2026-02-0539.9%
2026-07-21
Quelle geprüft
17Muse SparkOther2026-01-0139.9%
2026-07-21
Quelle geprüft
18Claude Opus 4.7Anthropic2026-04-1639.6%
2026-07-21
Quelle geprüft
19Claude Sonnet 5Anthropic2026-06-3039.6%
2026-07-21
Quelle geprüft
20Qwen3.7 MaxAlibaba2026-05-1938.1%
2026-07-21
Quelle geprüft
21Gemini 3 ProGoogle2025-11-1837.2%
2026-07-21
Quelle geprüft
22GPT-5.6 LunaOpenAI2026-07-0937.2%
2026-07-21
Quelle geprüft
23MiniMax M3MiniMax2026-05-3137.1%
2026-07-21
Quelle geprüft
24Claude Opus 4.6 (Adaptive Reasoning, Max Effort)Anthropic2026-02-0536.7%
2026-07-21
Quelle geprüft
25DeepSeek V4 Pro (Reasoning, Max Effort)DeepSeek2026-04-2435.9%
2026-07-21
Quelle geprüft
26Kimi K2.6Moonshot2026-04-2035.9%
2026-07-21
Quelle geprüft
27GPT-5.2OpenAI2025-12-1135.4%
2026-07-21
Quelle geprüft
28Grok 4.3xAI2026-04-3035%
2026-07-21
Quelle geprüft
29MiMo-V2.5-ProXiaomi2026-04-2233.8%
2026-07-21
Quelle geprüft
30Qwen 3.7 PlusAlibaba2026-06-0233.4%
2026-07-21
Quelle geprüft
31Kimi K2.7 CodeMoonshot2026-06-1232.8%
2026-07-21
Quelle geprüft
32Grok 4.20 ReasoningxAI2026-03-0532.2%
2026-07-21
Quelle geprüft
33LongCat-2.0Meituan2026-06-2932.1%
2026-07-21
Quelle geprüft
34Claude Opus 4.7 (Non-reasoning, High Effort)Anthropic2026-04-1631.2%
2026-07-21
Quelle geprüft
35GPT-5.5 (low)OpenAI2026-04-2331%
2026-07-21
Quelle geprüft
36Claude Sonnet 4.6 (Adaptive Reasoning, Max Effort)Anthropic2026-02-1730%
2026-07-21
Quelle geprüft
37Kimi K2.5Moonshot2026-01-2729.4%
2026-07-21
Quelle geprüft
38MiniMax M2.7MiniMax2026-04-1528.1%
2026-07-21
Quelle geprüft
39GLM-5.1Zhipu2026-04-0728%
2026-07-21
Quelle geprüft
40GPT-5.4 MiniOpenAI2026-03-1726.6%
2026-07-21
Quelle geprüft
41Nemotron 3 Ultra 550B A55B (Reasoning)NVIDIA2026-06-0426.6%
2026-07-21
Quelle geprüft
42GPT-5.1OpenAI2025-11-1326.5%
2026-07-21
Quelle geprüft
43GPT-5.4 NanoOpenAI2026-03-1726.5%
2026-07-21
Quelle geprüft
44Gemma 4 31B ITGoogle2026-03-0122.7%
2026-07-21
Quelle geprüft
45OpenAI o3OpenAI2025-04-1620%
2026-07-21
Quelle geprüft
46Step 3.7 FlashStepFun2026-06-0119.9%
2026-07-21
Quelle geprüft
47MiniMax M2.5MiniMax2026-04-0119.1%
2026-07-21
Quelle geprüft
48Claude Opus 4.6Anthropic2026-02-0518.6%
2026-07-21
Quelle geprüft
49Gemini 3.1 Flash LiteGoogle2026-05-0716.2%
2026-07-21
Quelle geprüft
50HyperNova 60B 2605Multiverse2026-05-0615.1%
2026-07-21
Quelle geprüft
51DeepSeek R1DeepSeek2025-01-2014.9%
2026-07-21
Quelle geprüft
52Gemma 4 12B (Reasoning)Google2026-06-0714.8%
2026-07-21
Quelle geprüft
53Gemini 3 Flash PreviewGoogle2025-12-1714.1%
2026-07-21
Quelle geprüft
54Claude Sonnet 4.6Anthropic2026-02-1713.2%
2026-07-21
Quelle geprüft
55Claude Opus 4.5Anthropic2025-11-2412.9%
2026-07-21
Quelle geprüft
56North Mini CodeCohere2026-06-0910%
2026-07-21
Quelle geprüft
57OpenAI o1OpenAI2024-09-127.7%
2026-07-21
Quelle geprüft
58LFM2.5-8B-A1BLiquid2026-06-086.9%
2026-07-21
Quelle geprüft
59MiniCPM5-1B (Reasoning)OpenBMB2026-06-046.5%
2026-07-21
Quelle geprüft
60Gemma 4 12B (Non-reasoning)Google2026-06-106.2%
2026-07-21
Quelle geprüft
61Llama 4 MaverickMeta2026-04-054.8%
2026-07-21
Quelle geprüft
62Command ACohere2026-03-154.6%
2026-07-21
Quelle geprüft
63Llama 4 ScoutMeta2026-04-054.3%
2026-07-21
Quelle geprüft
64Mistral Large 3Mistral2025-12-024.1%
2026-07-21
Quelle geprüft
65Claude 3 OpusAnthropic2024-03-043.1%
2026-07-21
Quelle geprüft
Methode

Was er abdeckt

Dieser Benchmark gehört zur Familie reasoning. Sein Format: Multiple-Choice- und Kurzantwortfragen, geprüft von Fachexpert:innen; Einreichungen werden vor der Bewertung auf Schwierigkeit geprüft. Der Score sollte immer mit Aufgabenformat, Bewertungsmethode, Quelldatum und Benchmark-Version gelesen werden.

Score-Obergrenze

Wo er an Grenzen stößt

Scores auf VerdictPal stammen aus Artificial Analysis' unabhängigem HLE-Lauf, sofern nicht anders vermerkt. Die offizielle Projektseite hostet Datensatz und Paper — keine einzelne gepflegte öffentliche Leaderboard-URL.

Belege

Quellen und weiterführende Lektüre

The Pack · Redaktionsnewsletter

Neue Karten in dein Postfach. Kostenlos.

Eine kurze E-Mail, wenn eine Karte erscheint oder den Status wechselt. Kein Tracking, keine Drittanbieter-Analytics. Abmeldung mit einem Klick.