Benchmarks / Reasoning

Humanity's Last Exam

HLE

Fachübergreifende Fragen auf Expertenniveau — Mathematik, Naturwissenschaften, Geisteswissenschaften, professionelles Recht und Medizin — entworfen als die härteste öffentliche Prüfung, die ein Frontier-Modell ablegen kann.

Was dieser Benchmark nicht misst
  • Echte Forschungsproduktivität — Prüfungsfragen erfassen nicht die unordentliche Such-und-Synthetisieren-Arbeit, die eine Forscher:in tatsächlich leistet.
  • Werkzeuggestützter Einsatz — HLE ist standardmäßig Closed-Book; Modelle, die Taschenrechner, Code oder Websuche nutzen, bekommen ein eigenes Tier.
  • Kalibrierung — HLE berichtet Genauigkeit, nicht wie gut das Modell weiß, was es nicht weiß.
Analyse

Warum dieser Benchmark nützlich ist

Wenn du eine harte, fachübergreifende Expertenprüfung brauchst — von Mathe bis professionellem Recht und Medizin — als Closed-Book-Stresstest, nicht als Forschungsproduktivitäts-Proxy.

Umfang

Abdeckung

Aufgabenfamilie
Reasoning
Format
Multiple-Choice- und Kurzantwortfragen, geprüft von Fachexpert:innen; Einreichungen werden vor der Bewertung auf Schwierigkeit geprüft.
Bewertung
Prozent korrekt beantworteter Fragen am öffentlichen + privaten Split; HLE berichtet eine Genauigkeitszahl pro Modell.
Verantwortliche Stelle
Center for AI Safety / Scale AI
Lesehilfe

So liest du die Scores

Eine Genauigkeitszahl auf öffentlichem + privatem Split. VerdictPal-Zahlen stammen meist aus Artificial Analysis' unabhängigen Lauf; tool-augmentierte Tiers sind getrennt. Genauigkeit ist keine Kalibrierung.

Blinde Flecken

Was er nicht abdeckt

  • Echte Forschungsproduktivität — Prüfungsfragen erfassen nicht die unordentliche Such-und-Synthetisieren-Arbeit, die eine Forscher:in tatsächlich leistet.
  • Werkzeuggestützter Einsatz — HLE ist standardmäßig Closed-Book; Modelle, die Taschenrechner, Code oder Websuche nutzen, bekommen ein eigenes Tier.
  • Kalibrierung — HLE berichtet Genauigkeit, nicht wie gut das Modell weiß, was es nicht weiß.
Scores

Evidenz-Ledger

185 Zeilen
185185 Zeilen
59.1%bester Score
185quellgeprüft
1Quellen
2026-09-10Quelldatum
185

api · api

Verteilung

Wo die Zeilen liegen

0255075100

Auf die Skala dieses Benchmarks normalisiert (0–100). Die Tabelle zeigt die Rohwerte.

Zeitverlauf

Neueste Belege

  1. Claude Fable 5.159.1% ·
  2. Claude Fable 555.5% ·
  3. Claude Opus 5 (Adaptive Reasoning, Max Effort)54.9% ·
  4. GPT-6 Astra54.7% ·
  5. Claude Opus 5 (Adaptive Reasoning, Xhigh Effort)54.4% ·

Scores nutzen die eigene Einheit und Skala dieses Benchmarks, keinen universellen Qualitätswert.

#ModellVeröffentlichungScoreHerkunftBeleglage
1Claude Fable 5.1Anthropic2026-09-0159.1%
2026-09-10
Quelle geprüft
2Claude Fable 5Anthropic2026-06-0955.5%
2026-09-10
Quelle geprüft
3Claude Opus 5 (Adaptive Reasoning, Max Effort)Anthropic2026-07-2454.9%
2026-09-10
Quelle geprüft
4GPT-6 AstraOpenAI2026-09-0354.7%
2026-09-10
Quelle geprüft
5Claude Opus 5 (Adaptive Reasoning, Xhigh Effort)Anthropic2026-07-2454.4%
2026-09-10
Quelle geprüft
6Claude Opus 5 (Adaptive Reasoning, High Effort)Anthropic2026-07-2452.8%
2026-09-10
Quelle geprüft
7Claude Opus 5 (Adaptive Reasoning, Medium Effort)Anthropic2026-07-2451.3%
2026-09-10
Quelle geprüft
8GPT-5.6 SolOpenAI2026-07-0949.5%
2026-09-10
Quelle geprüft
9Claude Opus 4.8Anthropic2026-05-2848.7%
2026-09-10
Quelle geprüft
10Muse Spark 1.3Meta2026-09-0248.7%
2026-09-10
Quelle geprüft
11Gemini 3.7 FlashGoogle2026-08-1347.9%
2026-09-10
Quelle geprüft
12Gemini 3.8 FlashGoogle2026-09-0247.8%
2026-09-10
Quelle geprüft
13Gemini 3.1 Pro PreviewGoogle2026-02-1947%
2026-09-10
Quelle geprüft
14Kimi K3Moonshot2026-07-1646.9%
2026-09-10
Quelle geprüft
15Muse Spark 1.1Meta2026-07-0946.2%
2026-09-10
Quelle geprüft
16GPT 5.5OpenAI2026-04-2345.8%
2026-09-10
Quelle geprüft
17Muse Spark 1.2Meta2026-08-0545.5%
2026-09-10
Quelle geprüft
18GPT-5.5 (high)OpenAI2026-04-2345%
2026-09-10
Quelle geprüft
19GPT 5.4OpenAI2026-03-0543.7%
2026-09-10
Quelle geprüft
20Claude Opus 5 (Adaptive Reasoning, Low Effort)Anthropic2026-07-2443.4%
2026-09-10
Quelle geprüft
21Qwen3.8 MaxAlibaba2026-08-0343%
2026-09-10
Quelle geprüft
22GPT-5.6 TerraOpenAI2026-07-0942.9%
2026-09-10
Quelle geprüft
23Grok 4.6xAI2026-08-1242.9%
2026-09-10
Quelle geprüft
24Gemini 3.5 FlashGoogle2026-05-1942.7%
2026-09-10
Quelle geprüft
25Grok 4.5xAI2026-07-0842.7%
2026-09-10
Quelle geprüft
26GPT-5.3 Codex (xhigh)OpenAI2026-02-0542.5%
2026-09-10
Quelle geprüft
27GPT-5.5 (medium)OpenAI2026-04-2342.4%
2026-09-10
Quelle geprüft
28Qwen3.8 2.4T A95BAlibaba2026-08-1242.4%
2026-09-10
Quelle geprüft
29Claude Opus 4.7Anthropic2026-04-1642.3%
2026-09-10
Quelle geprüft
30GLM-5.3Zhipu2026-08-1442.3%
2026-09-10
Quelle geprüft
31Claude Sonnet 5Anthropic2026-06-3041.3%
2026-09-10
Quelle geprüft
32Gemini 3.5 Flash (medium)Google2026-05-1941.3%
2026-09-10
Quelle geprüft
33GLM-5.2Zhipu2026-06-1341.1%
2026-09-10
Quelle geprüft
34DeepSeek V4 Pro 0813 (Reasoning, Max Effort)DeepSeek2026-08-1341%
2026-09-10
Quelle geprüft
35Gemini 3.6 Flash (high)Google2026-07-2140.8%
2026-09-10
Quelle geprüft
36Muse SparkOther2026-01-0140.7%
2026-09-10
Quelle geprüft
37Qwen3.7 MaxAlibaba2026-05-1940.5%
2026-09-10
Quelle geprüft
38Motif 3 (Beta)Other2026-07-2140.4%
2026-09-10
Quelle geprüft
39Claude Opus 4.6 (Adaptive Reasoning, Max Effort)Anthropic2026-02-0539.9%
2026-09-10
Quelle geprüft
40GLM-5.3-FlashZhipu2026-08-2639.9%
2026-09-10
Quelle geprüft
41Gemini 3 ProGoogle2025-11-1839.7%
2026-09-10
Quelle geprüft
42GPT-5.6 LunaOpenAI2026-07-0939.5%
2026-09-10
Quelle geprüft
43MiniMax M3MiniMax2026-05-3139%
2026-09-10
Quelle geprüft
44DeepSeek V4 Flash 0731 (Reasoning, Max Effort)DeepSeek2026-07-3138.6%
2026-09-10
Quelle geprüft
45Grok Build 0.1 0616xAI2026-06-1638.3%
2026-09-10
Quelle geprüft
46Qwen3.8-Flash-NextAlibaba2026-08-2638%
2026-09-10
Quelle geprüft
47GPT-5.2OpenAI2025-12-1137.7%
2026-09-10
Quelle geprüft
48Agnes 2.5 Pro BetaOther2026-08-2637.5%
2026-09-10
Quelle geprüft
49Kimi K2.6Moonshot2026-04-2037.5%
2026-09-10
Quelle geprüft
50Grok 4.3xAI2026-04-3037.2%
2026-09-10
Quelle geprüft
51Motif 3Other2026-08-1237%
2026-09-10
Quelle geprüft
52Gemini 3 Flash Preview (Reasoning)Google2025-12-1736.6%
2026-09-10
Quelle geprüft
53GPT-5.2 Codex (xhigh)OpenAI2025-12-1135.7%
2026-09-10
Quelle geprüft
54MiMo-V2.5-ProXiaomi2026-04-2235.7%
2026-09-10
Quelle geprüft
55Qwen 3.7 PlusAlibaba2026-06-0235.6%
2026-09-10
Quelle geprüft
56DeepSeek V4 Pro (Reasoning, High Effort)DeepSeek2026-04-2435.2%
2026-09-10
Quelle geprüft
57Kimi K2.7 CodeMoonshot2026-06-1235%
2026-09-10
Quelle geprüft
58DeepSeek V4 Flash Vision (Reasoning, Max Effort)DeepSeek2026-08-2134.5%
2026-09-10
Quelle geprüft
59Grok 4.20 ReasoningxAI2026-03-0534.5%
2026-09-10
Quelle geprüft
60Apodex 1.1Other2026-08-3034.1%
2026-09-10
Quelle geprüft
61Qwen3.8 27BAlibaba2026-08-1433.9%
2026-09-10
Quelle geprüft
62LongCat-2.0Meituan2026-06-2933.7%
2026-09-10
Quelle geprüft
63Nex-N2-ProOther2026-06-0233.7%
2026-09-10
Quelle geprüft
64Agnes 2.5 Pro AlphaOther2026-07-2433.6%
2026-09-10
Quelle geprüft
65Claude Sonnet 4.6 (Adaptive Reasoning, Max Effort)Anthropic2026-02-1733.6%
2026-09-10
Quelle geprüft
66Hy3Other2026-07-0633.5%
2026-09-10
Quelle geprüft
67Claude Opus 4.7 (Non-reasoning, High Effort)Anthropic2026-04-1633.3%
2026-09-10
Quelle geprüft
68Inkling SmallOther2026-07-3033.3%
2026-09-10
Quelle geprüft
69GPT-5.5 (low)OpenAI2026-04-2332.7%
2026-09-10
Quelle geprüft
70Grok 4.20 0309 (Reasoning)xAI2026-03-1032.4%
2026-09-10
Quelle geprüft
71K2 Horizon 375B A23BOther2026-09-0332%
2026-09-10
Quelle geprüft
72Inkling (xhigh)Other2026-07-1531.9%
2026-09-10
Quelle geprüft
73GPT-5.4 (low)OpenAI2026-03-0530.8%
2026-09-10
Quelle geprüft
74Qwen3.6 Max PreviewAlibaba2026-04-2030.8%
2026-09-10
Quelle geprüft
75Kimi K2.5Moonshot2026-01-2730.7%
2026-09-10
Quelle geprüft
76MiMo-V2-ProXiaomi2026-03-1830.4%
2026-09-10
Quelle geprüft
77DeepSeek V4 Flash (Reasoning, High Effort)DeepSeek2026-04-2430.3%
2026-09-10
Quelle geprüft
78Claude Opus 4.5 (Reasoning)Anthropic2025-11-2430.1%
2026-09-10
Quelle geprüft
79GLM-5.1Zhipu2026-04-0730.1%
2026-09-10
Quelle geprüft
80Grok 4.3 (medium)xAI2026-04-3030%
2026-09-10
Quelle geprüft
81A.X-K2Other2026-08-1229.6%
2026-09-10
Quelle geprüft
82MiniMax M2.7MiniMax2026-04-1529.6%
2026-09-10
Quelle geprüft
83Gemini 3 Pro Preview (low)Google2025-11-1829.5%
2026-09-10
Quelle geprüft
84GLM-5 (Reasoning)Zhipu2026-02-1129.3%
2026-09-10
Quelle geprüft
85Solar Pro 4Other2026-08-0629.2%
2026-09-10
Quelle geprüft
86Qwen3.5 397B A17B (Reasoning)Alibaba2026-02-1629%
2026-09-10
Quelle geprüft
87GPT-5 (high)OpenAI2025-08-0728.5%
2026-09-10
Quelle geprüft
88GPT-5.1OpenAI2025-11-1328.5%
2026-09-10
Quelle geprüft
89Solar Open2 250BOther2026-08-1228.5%
2026-09-10
Quelle geprüft
90Nemotron 3 Ultra 550B A55B (Reasoning)NVIDIA2026-06-0428.4%
2026-09-10
Quelle geprüft
91GPT-5.4 NanoOpenAI2026-03-1728.3%
2026-09-10
Quelle geprüft
92GPT-5.4 MiniOpenAI2026-03-1728.1%
2026-09-10
Quelle geprüft
93Qwen3 Max ThinkingAlibaba2026-01-2628%
2026-09-10
Quelle geprüft
94Grok 4.20 0309 v2 (Non-reasoning)xAI2026-04-0727.9%
2026-09-10
Quelle geprüft
95GLM-5-TurboZhipu2026-03-1527.8%
2026-09-10
Quelle geprüft
96GPT-5 Codex (high)OpenAI2025-09-2327.8%
2026-09-10
Quelle geprüft
97Hy3-preview (Reasoning)Other2026-04-2327.8%
2026-09-10
Quelle geprüft
98Qwen3.6 PlusAlibaba2026-04-0227.8%
2026-09-10
Quelle geprüft
99GLM-4.7 (Reasoning)Zhipu2025-12-2227.4%
2026-09-10
Quelle geprüft
100MiMo-V2.5Xiaomi2026-04-2227.2%
2026-09-10
Quelle geprüft
101GPT-5.2 (medium)OpenAI2025-12-1126.7%
2026-09-10
Quelle geprüft
102Grok 4xAI2025-07-1026.7%
2026-09-10
Quelle geprüft
103GPT-5.1 Codex (high)OpenAI2025-11-1325.7%
2026-09-10
Quelle geprüft
104GPT-5 (medium)OpenAI2025-08-0725.4%
2026-09-10
Quelle geprüft
105Qwen3.5 122B A10B (Reasoning)Alibaba2026-02-2425.2%
2026-09-10
Quelle geprüft
106Kimi K3 (low)Moonshot2026-07-1625%
2026-09-10
Quelle geprüft
107DeepSeek V3.2 (Reasoning)DeepSeek2025-12-0124.6%
2026-09-10
Quelle geprüft
108Gemini 3.5 Flash (minimal)Google2026-05-1924.1%
2026-09-10
Quelle geprüft
109Qwen3.5 27B (Reasoning)Alibaba2026-02-2423.9%
2026-09-10
Quelle geprüft
110Kimi K2 ThinkingMoonshot2025-11-0623.8%
2026-09-10
Quelle geprüft
111Ling 3.0 FlashOther2026-08-0423.7%
2026-09-10
Quelle geprüft
112Gemma 4 31B ITGoogle2026-03-0123.6%
2026-09-10
Quelle geprüft
113MiniMax-M2.1MiniMax2025-12-2323.2%
2026-09-10
Quelle geprüft
114Qwen3.6 27B (Reasoning)Alibaba2026-04-2223.1%
2026-09-10
Quelle geprüft
115MiMo-V2-Flash (Reasoning)Xiaomi2025-12-1622.8%
2026-09-10
Quelle geprüft
116MiMo-V2-Omni-0327Xiaomi2026-03-2722.6%
2026-09-10
Quelle geprüft
117Qwen3.6 35B A3B (Reasoning)Alibaba2026-04-1622.2%
2026-09-10
Quelle geprüft
118MiMo-V2-Flash (Feb 2026)Xiaomi2025-12-1622.1%
2026-09-10
Quelle geprüft
119MiMo-V2-OmniXiaomi2026-03-1922.1%
2026-09-10
Quelle geprüft
120Muse GlimmerMeta2026-08-1022%
2026-09-10
Quelle geprüft
121GPT-5.5 Instant (May 2026)OpenAI2026-05-0521.6%
2026-09-10
Quelle geprüft
122Ring-2.6-1TOther2026-05-0821.6%
2026-09-10
Quelle geprüft
123Step 3.7 FlashStepFun2026-06-0121.4%
2026-09-10
Quelle geprüft
124MiniMax M2.5MiniMax2026-04-0120.5%
2026-09-10
Quelle geprüft
125OpenAI o3OpenAI2025-04-1620.1%
2026-09-10
Quelle geprüft
126GPT-5.5 Instant (June 2026)OpenAI2026-06-2519.9%
2026-09-10
Quelle geprüft
127Qwen3.5 397B A17B (Non-reasoning)Alibaba2026-02-1619.8%
2026-09-10
Quelle geprüft
128GPT-5 (low)OpenAI2025-08-0719.6%
2026-09-10
Quelle geprüft
129Kimi K2.6 (Non-reasoning)Other2026-04-2019.6%
2026-09-10
Quelle geprüft
130Claude Opus 4.6Anthropic2026-02-0519.1%
2026-09-10
Quelle geprüft
131Gemini 3.5 Flash-LiteGoogle2026-07-2118.8%
2026-09-10
Quelle geprüft
132K-EXAONE 2.0 0803Other2026-08-1218.6%
2026-09-10
Quelle geprüft
133Grok 4.3 (low)xAI2026-04-3018.4%
2026-09-10
Quelle geprüft
134Claude 4.5 Sonnet (Reasoning)Anthropic2025-09-2917.8%
2026-09-10
Quelle geprüft
135JT-4.1 Flash 236B A21BOther2026-07-0917.8%
2026-09-10
Quelle geprüft
136G9v3-39A5BOther2026-08-0317.5%
2026-09-10
Quelle geprüft
137Gemini 3.1 Flash LiteGoogle2026-05-0717.2%
2026-09-10
Quelle geprüft
138GLM 5V Turbo (Reasoning)Zhipu2026-04-0117.1%
2026-09-10
Quelle geprüft
139KAT Coder Pro V2Other2026-03-2716.1%
2026-09-10
Quelle geprüft
140DeepSeek R1DeepSeek2025-01-2015.8%
2026-09-10
Quelle geprüft
141Gemma 4 12B (Reasoning)Google2026-06-0715.7%
2026-09-10
Quelle geprüft
142Qwen3.6 27B (Non-reasoning)Alibaba2026-04-2215.1%
2026-09-10
Quelle geprüft
143Gemini 3 Flash PreviewGoogle2025-12-1715%
2026-09-10
Quelle geprüft
144MiMo-V2.5-Pro (Non-reasoning)Xiaomi2026-04-2214.8%
2026-09-10
Quelle geprüft
145Qwen3.6 35B A3B (Non-reasoning)Alibaba2026-04-1613.9%
2026-09-10
Quelle geprüft
146Mistral Medium 3.5Mistral2026-04-2913.8%
2026-09-10
Quelle geprüft
147GPT-5.5 (Non-reasoning)OpenAI2026-04-2313.7%
2026-09-10
Quelle geprüft
148Claude Sonnet 4.6Anthropic2026-02-1713.3%
2026-09-10
Quelle geprüft
149Claude Opus 4.5Anthropic2025-11-2413.2%
2026-09-10
Quelle geprüft
150EXAONE 4.5 33BOther2026-04-0912.9%
2026-09-10
Quelle geprüft
151Claude 4.1 Opus (Reasoning)Anthropic2025-08-0512.5%
2026-09-10
Quelle geprüft
152Claude 4 Opus (Reasoning)Anthropic2025-05-2212.3%
2026-09-10
Quelle geprüft
153Claude Sonnet 4.6 (Non-reasoning, Low Effort)Anthropic2026-02-1711.2%
2026-09-10
Quelle geprüft
154Granite 4.2 30BOther2026-08-2511.2%
2026-09-10
Quelle geprüft
155North Mini CodeCohere2026-06-0911.1%
2026-09-10
Quelle geprüft
156DiffusionGemma 26B A4BGoogle2026-06-1010.8%
2026-09-10
Quelle geprüft
157Nemotron 3.5 LightningNVIDIA2026-08-1110.6%
2026-09-10
Quelle geprüft
158GLM-5.2 (Non-reasoning)Zhipu2026-06-169.8%
2026-09-10
Quelle geprüft
159Granite 4.2 8BOther2026-08-259.7%
2026-09-10
Quelle geprüft
160Ling 3.0 TinyOther2026-08-069.3%
2026-09-10
Quelle geprüft
161MiniCPM5-2BOpenBMB2026-09-078.9%
2026-09-10
Quelle geprüft
162Ling-2.6-1TOther2026-04-238.7%
2026-09-10
Quelle geprüft
163DeepSeek V4 Pro (Non-reasoning)DeepSeek2026-04-248.2%
2026-09-10
Quelle geprüft
164DeepSeek V4 Flash (Non-reasoning)DeepSeek2026-04-247.8%
2026-09-10
Quelle geprüft
165GLM-5 (Non-reasoning)Zhipu2026-02-117.6%
2026-09-10
Quelle geprüft
166Hy3-preview (Non-reasoning)Other2026-04-237%
2026-09-10
Quelle geprüft
167OpenAI o1OpenAI2024-09-127%
2026-09-10
Quelle geprüft
168LFM2.5-8B-A1BLiquid2026-06-086.9%
2026-09-10
Quelle geprüft
169Grok 4.3 (Non-reasoning)xAI2026-04-306.8%
2026-09-10
Quelle geprüft
170Granite 4.2 3BOther2026-08-256.6%
2026-09-10
Quelle geprüft
171MiniCPM5-1B (Reasoning)OpenBMB2026-06-046.5%
2026-09-10
Quelle geprüft
172JT-35B-FlashOther2026-05-146.4%
2026-09-10
Quelle geprüft
173JT-MINIOther2026-04-156.4%
2026-09-10
Quelle geprüft
174Gemma 4 12B (Non-reasoning)Google2026-06-106.3%
2026-09-10
Quelle geprüft
175Ling 2.6 FlashOther2026-04-216.3%
2026-09-10
Quelle geprüft
176MiniCPM-V 4.6 1.3BOpenBMB2026-05-115.1%
2026-09-10
Quelle geprüft
177Llama 4 MaverickMeta2026-04-054.9%
2026-09-10
Quelle geprüft
178Nemotron 3 Nano Omni 30B A3B ReasoningNVIDIA2026-04-294.8%
2026-09-10
Quelle geprüft
179G9v3-3BOther2026-07-234.5%
2026-09-10
Quelle geprüft
180MiniCPM5-1B (Non-reasoning)OpenBMB2026-05-254.5%
2026-09-10
Quelle geprüft
181Mistral Large 3Mistral2025-12-024.2%
2026-09-10
Quelle geprüft
182Granite 4.1 30BOther2026-04-294.1%
2026-09-10
Quelle geprüft
183Command ACohere2026-03-154%
2026-09-10
Quelle geprüft
184Llama 4 ScoutMeta2026-04-053.8%
2026-09-10
Quelle geprüft
185Claude 3 OpusAnthropic2024-03-042.8%
2026-09-10
Quelle geprüft
Methode

Was er abdeckt

Dieser Benchmark gehört zur Familie reasoning. Sein Format: Multiple-Choice- und Kurzantwortfragen, geprüft von Fachexpert:innen; Einreichungen werden vor der Bewertung auf Schwierigkeit geprüft. Der Score sollte immer mit Aufgabenformat, Bewertungsmethode, Quelldatum und Benchmark-Version gelesen werden.

Score-Obergrenze

Wo er an Grenzen stößt

Scores auf VerdictPal stammen aus Artificial Analysis' unabhängigem HLE-Lauf, sofern nicht anders vermerkt. Die offizielle Projektseite hostet Datensatz und Paper — keine einzelne gepflegte öffentliche Leaderboard-URL.

Belege

Quellen und weiterführende Lektüre

Fragen zu diesem Benchmark

Jede Antwort unten stammt aus den datierten Feldern dieser Seite. Nichts davon ist zusätzlich für Suchmaschinen geschrieben.

Was misst Humanity's Last Exam?

Fachübergreifende Fragen auf Expertenniveau — Mathematik, Naturwissenschaften, Geisteswissenschaften, professionelles Recht und Medizin — entworfen als die härteste öffentliche Prüfung, die ein Frontier-Modell ablegen kann.

Was beweist ein hoher Humanity's Last Exam-Wert nicht?

Ein starkes Humanity's Last Exam-Ergebnis sagt nichts aus über:

  • Echte Forschungsproduktivität — Prüfungsfragen erfassen nicht die unordentliche Such-und-Synthetisieren-Arbeit, die eine Forscher:in tatsächlich leistet.
  • Werkzeuggestützter Einsatz — HLE ist standardmäßig Closed-Book; Modelle, die Taschenrechner, Code oder Websuche nutzen, bekommen ein eigenes Tier.
  • Kalibrierung — HLE berichtet Genauigkeit, nicht wie gut das Modell weiß, was es nicht weiß.

Wie wird Humanity's Last Exam bewertet?

Prozent korrekt beantworteter Fragen am öffentlichen + privaten Split; HLE berichtet eine Genauigkeitszahl pro Modell. Aufgabenformat: Multiple-Choice- und Kurzantwortfragen, geprüft von Fachexpert:innen; Einreichungen werden vor der Bewertung auf Schwierigkeit geprüft.

Ist Humanity's Last Exam gesättigt?

Humanity's Last Exam ist im Atlas derzeit als Aktiv markiert.

Können Humanity's Last Exam-Ergebnisse durch Trainingsdaten verunreinigt sein?

Das Kontaminationsrisiko für Humanity's Last Exam ist als Kontamination niedrig eingestuft. Behandle jede Zeile auf dieser Seite als öffentliche Angabe mit Quelle und Datum, nicht als kontrolliertes Experiment.

The Pack · Redaktionsnewsletter

Neue Tools in dein Postfach. Kostenlos.

Eine kurze E-Mail, wenn ein Tool erscheint oder den Status wechselt. Kein Tracking, keine Drittanbieter-Analytics. Abmeldung mit einem Klick.