Benchmarks / Reasoning

Humanity's Last Exam

HLE

Fachübergreifende Fragen auf Expertenniveau — Mathematik, Naturwissenschaften, Geisteswissenschaften, professionelles Recht und Medizin — entworfen als die härteste öffentliche Prüfung, die ein Frontier-Modell ablegen kann.

Was dieser Benchmark nicht misst
  • Echte Forschungsproduktivität — Prüfungsfragen erfassen nicht die unordentliche Such-und-Synthetisieren-Arbeit, die eine Forscher:in tatsächlich leistet.
  • Werkzeuggestützter Einsatz — HLE ist standardmäßig Closed-Book; Modelle, die Taschenrechner, Code oder Websuche nutzen, bekommen ein eigenes Tier.
  • Kalibrierung — HLE berichtet Genauigkeit, nicht wie gut das Modell weiß, was es nicht weiß.
Analyse

Warum dieser Benchmark nützlich ist

Wenn du eine harte, fachübergreifende Expertenprüfung brauchst — von Mathe bis professionellem Recht und Medizin — als Closed-Book-Stresstest, nicht als Forschungsproduktivitäts-Proxy.

Umfang

Abdeckung

Aufgabenfamilie
Reasoning
Format
Multiple-Choice- und Kurzantwortfragen, geprüft von Fachexpert:innen; Einreichungen werden vor der Bewertung auf Schwierigkeit geprüft.
Bewertung
Prozent korrekt beantworteter Fragen am öffentlichen + privaten Split; HLE berichtet eine Genauigkeitszahl pro Modell.
Verantwortliche Stelle
Center for AI Safety / Scale AI
Lesehilfe

So liest du die Scores

Eine Genauigkeitszahl auf öffentlichem + privatem Split. VerdictPal-Zahlen stammen meist aus Artificial Analysis' unabhängigen Lauf; tool-augmentierte Tiers sind getrennt. Genauigkeit ist keine Kalibrierung.

Blinde Flecken

Was er nicht abdeckt

  • Echte Forschungsproduktivität — Prüfungsfragen erfassen nicht die unordentliche Such-und-Synthetisieren-Arbeit, die eine Forscher:in tatsächlich leistet.
  • Werkzeuggestützter Einsatz — HLE ist standardmäßig Closed-Book; Modelle, die Taschenrechner, Code oder Websuche nutzen, bekommen ein eigenes Tier.
  • Kalibrierung — HLE berichtet Genauigkeit, nicht wie gut das Modell weiß, was es nicht weiß.
Scores

Evidenz-Ledger

180 Zeilen
180180 Zeilen
55.5%bester Score
180quellgeprüft
1Quellen
2026-09-01Quelldatum
180

api · api

Verteilung

Wo die Zeilen liegen

0255075100

Auf die Skala dieses Benchmarks normalisiert (0–100). Die Tabelle zeigt die Rohwerte.

Zeitverlauf

Neueste Belege

  1. Claude Fable 555.5% ·
  2. Claude Opus 5 (Adaptive Reasoning, Max Effort)54.9% ·
  3. Claude Opus 5 (Adaptive Reasoning, Xhigh Effort)54.4% ·
  4. Claude Opus 5 (Adaptive Reasoning, High Effort)52.8% ·
  5. Claude Opus 5 (Adaptive Reasoning, Medium Effort)51.3% ·

Scores nutzen die eigene Einheit und Skala dieses Benchmarks, keinen universellen Qualitätswert.

#ModellVeröffentlichungScoreHerkunftBeleglage
1Claude Fable 5Anthropic2026-06-0955.5%
2026-09-01
Quelle geprüft
2Claude Opus 5 (Adaptive Reasoning, Max Effort)Anthropic2026-07-2454.9%
2026-09-01
Quelle geprüft
3Claude Opus 5 (Adaptive Reasoning, Xhigh Effort)Anthropic2026-07-2454.4%
2026-09-01
Quelle geprüft
4Claude Opus 5 (Adaptive Reasoning, High Effort)Anthropic2026-07-2452.8%
2026-09-01
Quelle geprüft
5Claude Opus 5 (Adaptive Reasoning, Medium Effort)Anthropic2026-07-2451.3%
2026-09-01
Quelle geprüft
6GPT-5.6 SolOpenAI2026-07-0949.5%
2026-09-01
Quelle geprüft
7Claude Opus 4.8Anthropic2026-05-2848.7%
2026-09-01
Quelle geprüft
8Gemini 3.7 FlashGoogle2026-08-1347.9%
2026-09-01
Quelle geprüft
9Gemini 3.1 Pro PreviewGoogle2026-02-1947%
2026-09-01
Quelle geprüft
10Kimi K3Moonshot2026-07-1646.9%
2026-09-01
Quelle geprüft
11Muse Spark 1.1Meta2026-07-0946.2%
2026-09-01
Quelle geprüft
12GPT 5.5OpenAI2026-04-2345.8%
2026-09-01
Quelle geprüft
13Muse Spark 1.2Meta2026-08-0545.5%
2026-09-01
Quelle geprüft
14GPT-5.5 (high)OpenAI2026-04-2345%
2026-09-01
Quelle geprüft
15GPT 5.4OpenAI2026-03-0543.7%
2026-09-01
Quelle geprüft
16Claude Opus 5 (Adaptive Reasoning, Low Effort)Anthropic2026-07-2443.4%
2026-09-01
Quelle geprüft
17Qwen3.8 MaxAlibaba2026-08-0343%
2026-09-01
Quelle geprüft
18GPT-5.6 TerraOpenAI2026-07-0942.9%
2026-09-01
Quelle geprüft
19Grok 4.6xAI2026-08-1242.9%
2026-09-01
Quelle geprüft
20Gemini 3.5 FlashGoogle2026-05-1942.7%
2026-09-01
Quelle geprüft
21Grok 4.5xAI2026-07-0842.7%
2026-09-01
Quelle geprüft
22GPT-5.3 Codex (xhigh)OpenAI2026-02-0542.5%
2026-09-01
Quelle geprüft
23GPT-5.5 (medium)OpenAI2026-04-2342.4%
2026-09-01
Quelle geprüft
24Qwen3.8 2.4T A95BAlibaba2026-08-1242.4%
2026-09-01
Quelle geprüft
25Claude Opus 4.7Anthropic2026-04-1642.3%
2026-09-01
Quelle geprüft
26GLM-5.3Zhipu2026-08-1442.3%
2026-09-01
Quelle geprüft
27Claude Sonnet 5Anthropic2026-06-3041.3%
2026-09-01
Quelle geprüft
28Gemini 3.5 Flash (medium)Google2026-05-1941.3%
2026-09-01
Quelle geprüft
29GLM-5.2Zhipu2026-06-1341.1%
2026-09-01
Quelle geprüft
30DeepSeek V4 Pro 0813 (Reasoning, Max Effort)DeepSeek2026-08-1341%
2026-09-01
Quelle geprüft
31Gemini 3.6 Flash (high)Google2026-07-2140.8%
2026-09-01
Quelle geprüft
32Muse SparkOther2026-01-0140.7%
2026-09-01
Quelle geprüft
33Qwen3.7 MaxAlibaba2026-05-1940.5%
2026-09-01
Quelle geprüft
34Motif 3 (Beta)Other2026-07-2140.4%
2026-09-01
Quelle geprüft
35Claude Opus 4.6 (Adaptive Reasoning, Max Effort)Anthropic2026-02-0539.9%
2026-09-01
Quelle geprüft
36GLM-5.3-FlashZhipu2026-08-2639.9%
2026-09-01
Quelle geprüft
37Gemini 3 ProGoogle2025-11-1839.7%
2026-09-01
Quelle geprüft
38GPT-5.6 LunaOpenAI2026-07-0939.5%
2026-09-01
Quelle geprüft
39MiniMax M3MiniMax2026-05-3139%
2026-09-01
Quelle geprüft
40DeepSeek V4 Flash 0731 (Reasoning, Max Effort)DeepSeek2026-07-3138.6%
2026-09-01
Quelle geprüft
41Grok Build 0.1 0616xAI2026-06-1638.3%
2026-09-01
Quelle geprüft
42Qwen3.8-Flash-NextAlibaba2026-08-2638%
2026-09-01
Quelle geprüft
43GPT-5.2OpenAI2025-12-1137.7%
2026-09-01
Quelle geprüft
44Agnes 2.5 Pro BetaOther2026-08-2637.5%
2026-09-01
Quelle geprüft
45Kimi K2.6Moonshot2026-04-2037.5%
2026-09-01
Quelle geprüft
46Grok 4.3xAI2026-04-3037.2%
2026-09-01
Quelle geprüft
47Motif 3Other2026-08-1237%
2026-09-01
Quelle geprüft
48Gemini 3 Flash Preview (Reasoning)Google2025-12-1736.6%
2026-09-01
Quelle geprüft
49GPT-5.2 Codex (xhigh)OpenAI2025-12-1135.7%
2026-09-01
Quelle geprüft
50MiMo-V2.5-ProXiaomi2026-04-2235.7%
2026-09-01
Quelle geprüft
51Qwen 3.7 PlusAlibaba2026-06-0235.6%
2026-09-01
Quelle geprüft
52DeepSeek V4 Pro (Reasoning, High Effort)DeepSeek2026-04-2435.2%
2026-09-01
Quelle geprüft
53Kimi K2.7 CodeMoonshot2026-06-1235%
2026-09-01
Quelle geprüft
54DeepSeek V4 Flash Vision (Reasoning, Max Effort)DeepSeek2026-08-2134.5%
2026-09-01
Quelle geprüft
55Grok 4.20 ReasoningxAI2026-03-0534.5%
2026-09-01
Quelle geprüft
56Apodex 1.1Other2026-08-3034.1%
2026-09-01
Quelle geprüft
57Qwen3.8 27BAlibaba2026-08-1433.9%
2026-09-01
Quelle geprüft
58LongCat-2.0Meituan2026-06-2933.7%
2026-09-01
Quelle geprüft
59Nex-N2-ProOther2026-06-0233.7%
2026-09-01
Quelle geprüft
60Agnes 2.5 Pro AlphaOther2026-07-2433.6%
2026-09-01
Quelle geprüft
61Claude Sonnet 4.6 (Adaptive Reasoning, Max Effort)Anthropic2026-02-1733.6%
2026-09-01
Quelle geprüft
62Hy3Other2026-07-0633.5%
2026-09-01
Quelle geprüft
63Claude Opus 4.7 (Non-reasoning, High Effort)Anthropic2026-04-1633.3%
2026-09-01
Quelle geprüft
64Inkling SmallOther2026-07-3033.3%
2026-09-01
Quelle geprüft
65GPT-5.5 (low)OpenAI2026-04-2332.7%
2026-09-01
Quelle geprüft
66Grok 4.20 0309 (Reasoning)xAI2026-03-1032.4%
2026-09-01
Quelle geprüft
67Inkling (xhigh)Other2026-07-1531.9%
2026-09-01
Quelle geprüft
68GPT-5.4 (low)OpenAI2026-03-0530.8%
2026-09-01
Quelle geprüft
69Qwen3.6 Max PreviewAlibaba2026-04-2030.8%
2026-09-01
Quelle geprüft
70Kimi K2.5Moonshot2026-01-2730.7%
2026-09-01
Quelle geprüft
71MiMo-V2-ProXiaomi2026-03-1830.4%
2026-09-01
Quelle geprüft
72DeepSeek V4 Flash (Reasoning, High Effort)DeepSeek2026-04-2430.3%
2026-09-01
Quelle geprüft
73Claude Opus 4.5 (Reasoning)Anthropic2025-11-2430.1%
2026-09-01
Quelle geprüft
74GLM-5.1Zhipu2026-04-0730.1%
2026-09-01
Quelle geprüft
75Grok 4.3 (medium)xAI2026-04-3030%
2026-09-01
Quelle geprüft
76A.X-K2Other2026-08-1229.6%
2026-09-01
Quelle geprüft
77MiniMax M2.7MiniMax2026-04-1529.6%
2026-09-01
Quelle geprüft
78Gemini 3 Pro Preview (low)Google2025-11-1829.5%
2026-09-01
Quelle geprüft
79GLM-5 (Reasoning)Zhipu2026-02-1129.3%
2026-09-01
Quelle geprüft
80Solar Pro 4Other2026-08-0629.2%
2026-09-01
Quelle geprüft
81Qwen3.5 397B A17B (Reasoning)Alibaba2026-02-1629%
2026-09-01
Quelle geprüft
82GPT-5 (high)OpenAI2025-08-0728.5%
2026-09-01
Quelle geprüft
83GPT-5.1OpenAI2025-11-1328.5%
2026-09-01
Quelle geprüft
84Solar Open2 250BOther2026-08-1228.5%
2026-09-01
Quelle geprüft
85Nemotron 3 Ultra 550B A55B (Reasoning)NVIDIA2026-06-0428.4%
2026-09-01
Quelle geprüft
86GPT-5.4 NanoOpenAI2026-03-1728.3%
2026-09-01
Quelle geprüft
87GPT-5.4 MiniOpenAI2026-03-1728.1%
2026-09-01
Quelle geprüft
88Qwen3 Max ThinkingAlibaba2026-01-2628%
2026-09-01
Quelle geprüft
89Grok 4.20 0309 v2 (Non-reasoning)xAI2026-04-0727.9%
2026-09-01
Quelle geprüft
90GLM-5-TurboZhipu2026-03-1527.8%
2026-09-01
Quelle geprüft
91GPT-5 Codex (high)OpenAI2025-09-2327.8%
2026-09-01
Quelle geprüft
92Hy3-preview (Reasoning)Other2026-04-2327.8%
2026-09-01
Quelle geprüft
93Qwen3.6 PlusAlibaba2026-04-0227.8%
2026-09-01
Quelle geprüft
94GLM-4.7 (Reasoning)Zhipu2025-12-2227.4%
2026-09-01
Quelle geprüft
95MiMo-V2.5Xiaomi2026-04-2227.2%
2026-09-01
Quelle geprüft
96GPT-5.2 (medium)OpenAI2025-12-1126.7%
2026-09-01
Quelle geprüft
97Grok 4xAI2025-07-1026.7%
2026-09-01
Quelle geprüft
98GPT-5.1 Codex (high)OpenAI2025-11-1325.7%
2026-09-01
Quelle geprüft
99GPT-5 (medium)OpenAI2025-08-0725.4%
2026-09-01
Quelle geprüft
100Qwen3.5 122B A10B (Reasoning)Alibaba2026-02-2425.2%
2026-09-01
Quelle geprüft
101Kimi K3 (low)Moonshot2026-07-1625%
2026-09-01
Quelle geprüft
102DeepSeek V3.2 (Reasoning)DeepSeek2025-12-0124.6%
2026-09-01
Quelle geprüft
103Gemini 3.5 Flash (minimal)Google2026-05-1924.1%
2026-09-01
Quelle geprüft
104Qwen3.5 27B (Reasoning)Alibaba2026-02-2423.9%
2026-09-01
Quelle geprüft
105Kimi K2 ThinkingMoonshot2025-11-0623.8%
2026-09-01
Quelle geprüft
106Ling 3.0 FlashOther2026-08-0423.7%
2026-09-01
Quelle geprüft
107Gemma 4 31B ITGoogle2026-03-0123.6%
2026-09-01
Quelle geprüft
108MiniMax-M2.1MiniMax2025-12-2323.2%
2026-09-01
Quelle geprüft
109Qwen3.6 27B (Reasoning)Alibaba2026-04-2223.1%
2026-09-01
Quelle geprüft
110MiMo-V2-Flash (Reasoning)Xiaomi2025-12-1622.8%
2026-09-01
Quelle geprüft
111MiMo-V2-Omni-0327Xiaomi2026-03-2722.6%
2026-09-01
Quelle geprüft
112Qwen3.6 35B A3B (Reasoning)Alibaba2026-04-1622.2%
2026-09-01
Quelle geprüft
113MiMo-V2-Flash (Feb 2026)Xiaomi2025-12-1622.1%
2026-09-01
Quelle geprüft
114MiMo-V2-OmniXiaomi2026-03-1922.1%
2026-09-01
Quelle geprüft
115Muse GlimmerMeta2026-08-1022%
2026-09-01
Quelle geprüft
116GPT-5.5 Instant (May 2026)OpenAI2026-05-0521.6%
2026-09-01
Quelle geprüft
117Ring-2.6-1TOther2026-05-0821.6%
2026-09-01
Quelle geprüft
118Step 3.7 FlashStepFun2026-06-0121.4%
2026-09-01
Quelle geprüft
119MiniMax M2.5MiniMax2026-04-0120.5%
2026-09-01
Quelle geprüft
120OpenAI o3OpenAI2025-04-1620.1%
2026-09-01
Quelle geprüft
121GPT-5.5 Instant (June 2026)OpenAI2026-06-2519.9%
2026-09-01
Quelle geprüft
122Qwen3.5 397B A17B (Non-reasoning)Alibaba2026-02-1619.8%
2026-09-01
Quelle geprüft
123GPT-5 (low)OpenAI2025-08-0719.6%
2026-09-01
Quelle geprüft
124Kimi K2.6 (Non-reasoning)Other2026-04-2019.6%
2026-09-01
Quelle geprüft
125Claude Opus 4.6Anthropic2026-02-0519.1%
2026-09-01
Quelle geprüft
126Gemini 3.5 Flash-LiteGoogle2026-07-2118.8%
2026-09-01
Quelle geprüft
127K-EXAONE 2.0 0803Other2026-08-1218.6%
2026-09-01
Quelle geprüft
128Grok 4.3 (low)xAI2026-04-3018.4%
2026-09-01
Quelle geprüft
129Claude 4.5 Sonnet (Reasoning)Anthropic2025-09-2917.8%
2026-09-01
Quelle geprüft
130JT-4.1 Flash 236B A21BOther2026-07-0917.8%
2026-09-01
Quelle geprüft
131G9v3-39A5BOther2026-08-0317.5%
2026-09-01
Quelle geprüft
132Gemini 3.1 Flash LiteGoogle2026-05-0717.2%
2026-09-01
Quelle geprüft
133GLM 5V Turbo (Reasoning)Zhipu2026-04-0117.1%
2026-09-01
Quelle geprüft
134HyperNova 60B 2605Multiverse2026-05-0616.6%
2026-09-01
Quelle geprüft
135KAT Coder Pro V2Other2026-03-2716.1%
2026-09-01
Quelle geprüft
136DeepSeek R1DeepSeek2025-01-2015.8%
2026-09-01
Quelle geprüft
137Gemma 4 12B (Reasoning)Google2026-06-0715.7%
2026-09-01
Quelle geprüft
138Qwen3.6 27B (Non-reasoning)Alibaba2026-04-2215.1%
2026-09-01
Quelle geprüft
139Gemini 3 Flash PreviewGoogle2025-12-1715%
2026-09-01
Quelle geprüft
140MiMo-V2.5-Pro (Non-reasoning)Xiaomi2026-04-2214.8%
2026-09-01
Quelle geprüft
141Qwen3.6 35B A3B (Non-reasoning)Alibaba2026-04-1613.9%
2026-09-01
Quelle geprüft
142Mistral Medium 3.5Mistral2026-04-2913.8%
2026-09-01
Quelle geprüft
143GPT-5.5 (Non-reasoning)OpenAI2026-04-2313.7%
2026-09-01
Quelle geprüft
144Claude Sonnet 4.6Anthropic2026-02-1713.3%
2026-09-01
Quelle geprüft
145Claude Opus 4.5Anthropic2025-11-2413.2%
2026-09-01
Quelle geprüft
146EXAONE 4.5 33BOther2026-04-0912.9%
2026-09-01
Quelle geprüft
147Claude 4.1 Opus (Reasoning)Anthropic2025-08-0512.5%
2026-09-01
Quelle geprüft
148Claude 4 Opus (Reasoning)Anthropic2025-05-2212.3%
2026-09-01
Quelle geprüft
149Command ACohere2026-03-1512%
2026-09-01
Quelle geprüft
150Claude Sonnet 4.6 (Non-reasoning, Low Effort)Anthropic2026-02-1711.2%
2026-09-01
Quelle geprüft
151Granite 4.2 30BOther2026-08-2511.2%
2026-09-01
Quelle geprüft
152North Mini CodeCohere2026-06-0911.1%
2026-09-01
Quelle geprüft
153DiffusionGemma 26B A4BGoogle2026-06-1010.8%
2026-09-01
Quelle geprüft
154Nemotron 3.5 LightningNVIDIA2026-08-1110.6%
2026-09-01
Quelle geprüft
155GLM-5.2 (Non-reasoning)Zhipu2026-06-169.8%
2026-09-01
Quelle geprüft
156Granite 4.2 8BOther2026-08-259.7%
2026-09-01
Quelle geprüft
157Ling 3.0 TinyOther2026-08-069.3%
2026-09-01
Quelle geprüft
158Ling-2.6-1TOther2026-04-238.7%
2026-09-01
Quelle geprüft
159DeepSeek V4 Pro (Non-reasoning)DeepSeek2026-04-248.2%
2026-09-01
Quelle geprüft
160DeepSeek V4 Flash (Non-reasoning)DeepSeek2026-04-247.8%
2026-09-01
Quelle geprüft
161GLM-5 (Non-reasoning)Zhipu2026-02-117.6%
2026-09-01
Quelle geprüft
162Hy3-preview (Non-reasoning)Other2026-04-237%
2026-09-01
Quelle geprüft
163OpenAI o1OpenAI2024-09-127%
2026-09-01
Quelle geprüft
164LFM2.5-8B-A1BLiquid2026-06-086.9%
2026-09-01
Quelle geprüft
165Grok 4.3 (Non-reasoning)xAI2026-04-306.8%
2026-09-01
Quelle geprüft
166Granite 4.2 3BOther2026-08-256.6%
2026-09-01
Quelle geprüft
167MiniCPM5-1B (Reasoning)OpenBMB2026-06-046.5%
2026-09-01
Quelle geprüft
168JT-35B-FlashOther2026-05-146.4%
2026-09-01
Quelle geprüft
169JT-MINIOther2026-04-156.4%
2026-09-01
Quelle geprüft
170Gemma 4 12B (Non-reasoning)Google2026-06-106.3%
2026-09-01
Quelle geprüft
171Ling 2.6 FlashOther2026-04-216.3%
2026-09-01
Quelle geprüft
172MiniCPM-V 4.6 1.3BOpenBMB2026-05-115.1%
2026-09-01
Quelle geprüft
173Llama 4 MaverickMeta2026-04-054.9%
2026-09-01
Quelle geprüft
174Nemotron 3 Nano Omni 30B A3B ReasoningNVIDIA2026-04-294.8%
2026-09-01
Quelle geprüft
175G9v3-3BOther2026-07-234.5%
2026-09-01
Quelle geprüft
176MiniCPM5-1B (Non-reasoning)OpenBMB2026-05-254.5%
2026-09-01
Quelle geprüft
177Mistral Large 3Mistral2025-12-024.2%
2026-09-01
Quelle geprüft
178Granite 4.1 30BOther2026-04-294.1%
2026-09-01
Quelle geprüft
179Llama 4 ScoutMeta2026-04-053.8%
2026-09-01
Quelle geprüft
180Claude 3 OpusAnthropic2024-03-042.8%
2026-09-01
Quelle geprüft
Methode

Was er abdeckt

Dieser Benchmark gehört zur Familie reasoning. Sein Format: Multiple-Choice- und Kurzantwortfragen, geprüft von Fachexpert:innen; Einreichungen werden vor der Bewertung auf Schwierigkeit geprüft. Der Score sollte immer mit Aufgabenformat, Bewertungsmethode, Quelldatum und Benchmark-Version gelesen werden.

Score-Obergrenze

Wo er an Grenzen stößt

Scores auf VerdictPal stammen aus Artificial Analysis' unabhängigem HLE-Lauf, sofern nicht anders vermerkt. Die offizielle Projektseite hostet Datensatz und Paper — keine einzelne gepflegte öffentliche Leaderboard-URL.

Belege

Quellen und weiterführende Lektüre

Fragen zu diesem Benchmark

Jede Antwort unten stammt aus den datierten Feldern dieser Seite. Nichts davon ist zusätzlich für Suchmaschinen geschrieben.

Was misst Humanity's Last Exam?

Fachübergreifende Fragen auf Expertenniveau — Mathematik, Naturwissenschaften, Geisteswissenschaften, professionelles Recht und Medizin — entworfen als die härteste öffentliche Prüfung, die ein Frontier-Modell ablegen kann.

Was beweist ein hoher Humanity's Last Exam-Wert nicht?

Ein starkes Humanity's Last Exam-Ergebnis sagt nichts aus über:

  • Echte Forschungsproduktivität — Prüfungsfragen erfassen nicht die unordentliche Such-und-Synthetisieren-Arbeit, die eine Forscher:in tatsächlich leistet.
  • Werkzeuggestützter Einsatz — HLE ist standardmäßig Closed-Book; Modelle, die Taschenrechner, Code oder Websuche nutzen, bekommen ein eigenes Tier.
  • Kalibrierung — HLE berichtet Genauigkeit, nicht wie gut das Modell weiß, was es nicht weiß.

Wie wird Humanity's Last Exam bewertet?

Prozent korrekt beantworteter Fragen am öffentlichen + privaten Split; HLE berichtet eine Genauigkeitszahl pro Modell. Aufgabenformat: Multiple-Choice- und Kurzantwortfragen, geprüft von Fachexpert:innen; Einreichungen werden vor der Bewertung auf Schwierigkeit geprüft.

Ist Humanity's Last Exam gesättigt?

Humanity's Last Exam ist im Atlas derzeit als Aktiv markiert.

Können Humanity's Last Exam-Ergebnisse durch Trainingsdaten verunreinigt sein?

Das Kontaminationsrisiko für Humanity's Last Exam ist als Kontamination niedrig eingestuft. Behandle jede Zeile auf dieser Seite als öffentliche Angabe mit Quelle und Datum, nicht als kontrolliertes Experiment.

The Pack · Redaktionsnewsletter

Neue Tools in dein Postfach. Kostenlos.

Eine kurze E-Mail, wenn ein Tool erscheint oder den Status wechselt. Kein Tracking, keine Drittanbieter-Analytics. Abmeldung mit einem Klick.