Benchmarks / Reasoning

Humanity's Last Exam

HLE

Cross-domain expert-level questions — math, sciences, humanities, professional law and medicine — designed to be the hardest public exam a frontier model can take.

What this does not measure
  • Real research productivity — exam-style questions do not capture the messy search-and-synthesize work a researcher actually does.
  • Tool-augmented use — HLE is closed-book by default; models that leverage calculators, code, or web search get a separate tier.
  • Calibration — HLE reports accuracy, not how well the model knows what it doesn't know.
Analysis

Why this benchmark is useful

When you need a hard, cross-domain expert exam — math through professional law and medicine — as a closed-book stress test, not a research-productivity proxy.

Scope

Coverage map

Task family
Reasoning
Format
Multiple-choice and short-answer questions vetted by domain experts; submissions are reviewed for difficulty before scoring.
Scoring
Percent of questions answered correctly on the public + private split; HLE reports a single accuracy figure per model.
Maintainer
Center for AI Safety / Scale AI
Reading guide

How to read the scores

Single accuracy figure on the public + private split. VerdictPal figures usually come from Artificial Analysis' independent run; tool-augmented tiers are separate. Accuracy is not calibration.

Blind spots

What it does not cover

  • Real research productivity — exam-style questions do not capture the messy search-and-synthesize work a researcher actually does.
  • Tool-augmented use — HLE is closed-book by default; models that leverage calculators, code, or web search get a separate tier.
  • Calibration — HLE reports accuracy, not how well the model knows what it doesn't know.
Scores

Evidence ledger

180 rows
180180 rows
55.5%best score
180source-checked
1sources
2026-09-01source date
180

api · api

Distribution

Where the rows land

0255075100

Normalized to this benchmark's axis (0–100). Open the table for raw units.

Timeline

Newest receipts

  1. Claude Fable 555.5% ·
  2. Claude Opus 5 (Adaptive Reasoning, Max Effort)54.9% ·
  3. Claude Opus 5 (Adaptive Reasoning, Xhigh Effort)54.4% ·
  4. Claude Opus 5 (Adaptive Reasoning, High Effort)52.8% ·
  5. Claude Opus 5 (Adaptive Reasoning, Medium Effort)51.3% ·

Scores use this benchmark's own unit and axis, not a universal quality score.

#ModelRelease dateScoreProvenanceTrust
1Claude Fable 5Anthropic2026-06-0955.5%
2026-09-01
Source-checked
2Claude Opus 5 (Adaptive Reasoning, Max Effort)Anthropic2026-07-2454.9%
2026-09-01
Source-checked
3Claude Opus 5 (Adaptive Reasoning, Xhigh Effort)Anthropic2026-07-2454.4%
2026-09-01
Source-checked
4Claude Opus 5 (Adaptive Reasoning, High Effort)Anthropic2026-07-2452.8%
2026-09-01
Source-checked
5Claude Opus 5 (Adaptive Reasoning, Medium Effort)Anthropic2026-07-2451.3%
2026-09-01
Source-checked
6GPT-5.6 SolOpenAI2026-07-0949.5%
2026-09-01
Source-checked
7Claude Opus 4.8Anthropic2026-05-2848.7%
2026-09-01
Source-checked
8Gemini 3.7 FlashGoogle2026-08-1347.9%
2026-09-01
Source-checked
9Gemini 3.1 Pro PreviewGoogle2026-02-1947%
2026-09-01
Source-checked
10Kimi K3Moonshot2026-07-1646.9%
2026-09-01
Source-checked
11Muse Spark 1.1Meta2026-07-0946.2%
2026-09-01
Source-checked
12GPT 5.5OpenAI2026-04-2345.8%
2026-09-01
Source-checked
13Muse Spark 1.2Meta2026-08-0545.5%
2026-09-01
Source-checked
14GPT-5.5 (high)OpenAI2026-04-2345%
2026-09-01
Source-checked
15GPT 5.4OpenAI2026-03-0543.7%
2026-09-01
Source-checked
16Claude Opus 5 (Adaptive Reasoning, Low Effort)Anthropic2026-07-2443.4%
2026-09-01
Source-checked
17Qwen3.8 MaxAlibaba2026-08-0343%
2026-09-01
Source-checked
18GPT-5.6 TerraOpenAI2026-07-0942.9%
2026-09-01
Source-checked
19Grok 4.6xAI2026-08-1242.9%
2026-09-01
Source-checked
20Gemini 3.5 FlashGoogle2026-05-1942.7%
2026-09-01
Source-checked
21Grok 4.5xAI2026-07-0842.7%
2026-09-01
Source-checked
22GPT-5.3 Codex (xhigh)OpenAI2026-02-0542.5%
2026-09-01
Source-checked
23GPT-5.5 (medium)OpenAI2026-04-2342.4%
2026-09-01
Source-checked
24Qwen3.8 2.4T A95BAlibaba2026-08-1242.4%
2026-09-01
Source-checked
25Claude Opus 4.7Anthropic2026-04-1642.3%
2026-09-01
Source-checked
26GLM-5.3Zhipu2026-08-1442.3%
2026-09-01
Source-checked
27Claude Sonnet 5Anthropic2026-06-3041.3%
2026-09-01
Source-checked
28Gemini 3.5 Flash (medium)Google2026-05-1941.3%
2026-09-01
Source-checked
29GLM-5.2Zhipu2026-06-1341.1%
2026-09-01
Source-checked
30DeepSeek V4 Pro 0813 (Reasoning, Max Effort)DeepSeek2026-08-1341%
2026-09-01
Source-checked
31Gemini 3.6 Flash (high)Google2026-07-2140.8%
2026-09-01
Source-checked
32Muse SparkOther2026-01-0140.7%
2026-09-01
Source-checked
33Qwen3.7 MaxAlibaba2026-05-1940.5%
2026-09-01
Source-checked
34Motif 3 (Beta)Other2026-07-2140.4%
2026-09-01
Source-checked
35Claude Opus 4.6 (Adaptive Reasoning, Max Effort)Anthropic2026-02-0539.9%
2026-09-01
Source-checked
36GLM-5.3-FlashZhipu2026-08-2639.9%
2026-09-01
Source-checked
37Gemini 3 ProGoogle2025-11-1839.7%
2026-09-01
Source-checked
38GPT-5.6 LunaOpenAI2026-07-0939.5%
2026-09-01
Source-checked
39MiniMax M3MiniMax2026-05-3139%
2026-09-01
Source-checked
40DeepSeek V4 Flash 0731 (Reasoning, Max Effort)DeepSeek2026-07-3138.6%
2026-09-01
Source-checked
41Grok Build 0.1 0616xAI2026-06-1638.3%
2026-09-01
Source-checked
42Qwen3.8-Flash-NextAlibaba2026-08-2638%
2026-09-01
Source-checked
43GPT-5.2OpenAI2025-12-1137.7%
2026-09-01
Source-checked
44Agnes 2.5 Pro BetaOther2026-08-2637.5%
2026-09-01
Source-checked
45Kimi K2.6Moonshot2026-04-2037.5%
2026-09-01
Source-checked
46Grok 4.3xAI2026-04-3037.2%
2026-09-01
Source-checked
47Motif 3Other2026-08-1237%
2026-09-01
Source-checked
48Gemini 3 Flash Preview (Reasoning)Google2025-12-1736.6%
2026-09-01
Source-checked
49GPT-5.2 Codex (xhigh)OpenAI2025-12-1135.7%
2026-09-01
Source-checked
50MiMo-V2.5-ProXiaomi2026-04-2235.7%
2026-09-01
Source-checked
51Qwen 3.7 PlusAlibaba2026-06-0235.6%
2026-09-01
Source-checked
52DeepSeek V4 Pro (Reasoning, High Effort)DeepSeek2026-04-2435.2%
2026-09-01
Source-checked
53Kimi K2.7 CodeMoonshot2026-06-1235%
2026-09-01
Source-checked
54DeepSeek V4 Flash Vision (Reasoning, Max Effort)DeepSeek2026-08-2134.5%
2026-09-01
Source-checked
55Grok 4.20 ReasoningxAI2026-03-0534.5%
2026-09-01
Source-checked
56Apodex 1.1Other2026-08-3034.1%
2026-09-01
Source-checked
57Qwen3.8 27BAlibaba2026-08-1433.9%
2026-09-01
Source-checked
58LongCat-2.0Meituan2026-06-2933.7%
2026-09-01
Source-checked
59Nex-N2-ProOther2026-06-0233.7%
2026-09-01
Source-checked
60Agnes 2.5 Pro AlphaOther2026-07-2433.6%
2026-09-01
Source-checked
61Claude Sonnet 4.6 (Adaptive Reasoning, Max Effort)Anthropic2026-02-1733.6%
2026-09-01
Source-checked
62Hy3Other2026-07-0633.5%
2026-09-01
Source-checked
63Claude Opus 4.7 (Non-reasoning, High Effort)Anthropic2026-04-1633.3%
2026-09-01
Source-checked
64Inkling SmallOther2026-07-3033.3%
2026-09-01
Source-checked
65GPT-5.5 (low)OpenAI2026-04-2332.7%
2026-09-01
Source-checked
66Grok 4.20 0309 (Reasoning)xAI2026-03-1032.4%
2026-09-01
Source-checked
67Inkling (xhigh)Other2026-07-1531.9%
2026-09-01
Source-checked
68GPT-5.4 (low)OpenAI2026-03-0530.8%
2026-09-01
Source-checked
69Qwen3.6 Max PreviewAlibaba2026-04-2030.8%
2026-09-01
Source-checked
70Kimi K2.5Moonshot2026-01-2730.7%
2026-09-01
Source-checked
71MiMo-V2-ProXiaomi2026-03-1830.4%
2026-09-01
Source-checked
72DeepSeek V4 Flash (Reasoning, High Effort)DeepSeek2026-04-2430.3%
2026-09-01
Source-checked
73Claude Opus 4.5 (Reasoning)Anthropic2025-11-2430.1%
2026-09-01
Source-checked
74GLM-5.1Zhipu2026-04-0730.1%
2026-09-01
Source-checked
75Grok 4.3 (medium)xAI2026-04-3030%
2026-09-01
Source-checked
76A.X-K2Other2026-08-1229.6%
2026-09-01
Source-checked
77MiniMax M2.7MiniMax2026-04-1529.6%
2026-09-01
Source-checked
78Gemini 3 Pro Preview (low)Google2025-11-1829.5%
2026-09-01
Source-checked
79GLM-5 (Reasoning)Zhipu2026-02-1129.3%
2026-09-01
Source-checked
80Solar Pro 4Other2026-08-0629.2%
2026-09-01
Source-checked
81Qwen3.5 397B A17B (Reasoning)Alibaba2026-02-1629%
2026-09-01
Source-checked
82GPT-5 (high)OpenAI2025-08-0728.5%
2026-09-01
Source-checked
83GPT-5.1OpenAI2025-11-1328.5%
2026-09-01
Source-checked
84Solar Open2 250BOther2026-08-1228.5%
2026-09-01
Source-checked
85Nemotron 3 Ultra 550B A55B (Reasoning)NVIDIA2026-06-0428.4%
2026-09-01
Source-checked
86GPT-5.4 NanoOpenAI2026-03-1728.3%
2026-09-01
Source-checked
87GPT-5.4 MiniOpenAI2026-03-1728.1%
2026-09-01
Source-checked
88Qwen3 Max ThinkingAlibaba2026-01-2628%
2026-09-01
Source-checked
89Grok 4.20 0309 v2 (Non-reasoning)xAI2026-04-0727.9%
2026-09-01
Source-checked
90GLM-5-TurboZhipu2026-03-1527.8%
2026-09-01
Source-checked
91GPT-5 Codex (high)OpenAI2025-09-2327.8%
2026-09-01
Source-checked
92Hy3-preview (Reasoning)Other2026-04-2327.8%
2026-09-01
Source-checked
93Qwen3.6 PlusAlibaba2026-04-0227.8%
2026-09-01
Source-checked
94GLM-4.7 (Reasoning)Zhipu2025-12-2227.4%
2026-09-01
Source-checked
95MiMo-V2.5Xiaomi2026-04-2227.2%
2026-09-01
Source-checked
96GPT-5.2 (medium)OpenAI2025-12-1126.7%
2026-09-01
Source-checked
97Grok 4xAI2025-07-1026.7%
2026-09-01
Source-checked
98GPT-5.1 Codex (high)OpenAI2025-11-1325.7%
2026-09-01
Source-checked
99GPT-5 (medium)OpenAI2025-08-0725.4%
2026-09-01
Source-checked
100Qwen3.5 122B A10B (Reasoning)Alibaba2026-02-2425.2%
2026-09-01
Source-checked
101Kimi K3 (low)Moonshot2026-07-1625%
2026-09-01
Source-checked
102DeepSeek V3.2 (Reasoning)DeepSeek2025-12-0124.6%
2026-09-01
Source-checked
103Gemini 3.5 Flash (minimal)Google2026-05-1924.1%
2026-09-01
Source-checked
104Qwen3.5 27B (Reasoning)Alibaba2026-02-2423.9%
2026-09-01
Source-checked
105Kimi K2 ThinkingMoonshot2025-11-0623.8%
2026-09-01
Source-checked
106Ling 3.0 FlashOther2026-08-0423.7%
2026-09-01
Source-checked
107Gemma 4 31B ITGoogle2026-03-0123.6%
2026-09-01
Source-checked
108MiniMax-M2.1MiniMax2025-12-2323.2%
2026-09-01
Source-checked
109Qwen3.6 27B (Reasoning)Alibaba2026-04-2223.1%
2026-09-01
Source-checked
110MiMo-V2-Flash (Reasoning)Xiaomi2025-12-1622.8%
2026-09-01
Source-checked
111MiMo-V2-Omni-0327Xiaomi2026-03-2722.6%
2026-09-01
Source-checked
112Qwen3.6 35B A3B (Reasoning)Alibaba2026-04-1622.2%
2026-09-01
Source-checked
113MiMo-V2-Flash (Feb 2026)Xiaomi2025-12-1622.1%
2026-09-01
Source-checked
114MiMo-V2-OmniXiaomi2026-03-1922.1%
2026-09-01
Source-checked
115Muse GlimmerMeta2026-08-1022%
2026-09-01
Source-checked
116GPT-5.5 Instant (May 2026)OpenAI2026-05-0521.6%
2026-09-01
Source-checked
117Ring-2.6-1TOther2026-05-0821.6%
2026-09-01
Source-checked
118Step 3.7 FlashStepFun2026-06-0121.4%
2026-09-01
Source-checked
119MiniMax M2.5MiniMax2026-04-0120.5%
2026-09-01
Source-checked
120OpenAI o3OpenAI2025-04-1620.1%
2026-09-01
Source-checked
121GPT-5.5 Instant (June 2026)OpenAI2026-06-2519.9%
2026-09-01
Source-checked
122Qwen3.5 397B A17B (Non-reasoning)Alibaba2026-02-1619.8%
2026-09-01
Source-checked
123GPT-5 (low)OpenAI2025-08-0719.6%
2026-09-01
Source-checked
124Kimi K2.6 (Non-reasoning)Other2026-04-2019.6%
2026-09-01
Source-checked
125Claude Opus 4.6Anthropic2026-02-0519.1%
2026-09-01
Source-checked
126Gemini 3.5 Flash-LiteGoogle2026-07-2118.8%
2026-09-01
Source-checked
127K-EXAONE 2.0 0803Other2026-08-1218.6%
2026-09-01
Source-checked
128Grok 4.3 (low)xAI2026-04-3018.4%
2026-09-01
Source-checked
129Claude 4.5 Sonnet (Reasoning)Anthropic2025-09-2917.8%
2026-09-01
Source-checked
130JT-4.1 Flash 236B A21BOther2026-07-0917.8%
2026-09-01
Source-checked
131G9v3-39A5BOther2026-08-0317.5%
2026-09-01
Source-checked
132Gemini 3.1 Flash LiteGoogle2026-05-0717.2%
2026-09-01
Source-checked
133GLM 5V Turbo (Reasoning)Zhipu2026-04-0117.1%
2026-09-01
Source-checked
134HyperNova 60B 2605Multiverse2026-05-0616.6%
2026-09-01
Source-checked
135KAT Coder Pro V2Other2026-03-2716.1%
2026-09-01
Source-checked
136DeepSeek R1DeepSeek2025-01-2015.8%
2026-09-01
Source-checked
137Gemma 4 12B (Reasoning)Google2026-06-0715.7%
2026-09-01
Source-checked
138Qwen3.6 27B (Non-reasoning)Alibaba2026-04-2215.1%
2026-09-01
Source-checked
139Gemini 3 Flash PreviewGoogle2025-12-1715%
2026-09-01
Source-checked
140MiMo-V2.5-Pro (Non-reasoning)Xiaomi2026-04-2214.8%
2026-09-01
Source-checked
141Qwen3.6 35B A3B (Non-reasoning)Alibaba2026-04-1613.9%
2026-09-01
Source-checked
142Mistral Medium 3.5Mistral2026-04-2913.8%
2026-09-01
Source-checked
143GPT-5.5 (Non-reasoning)OpenAI2026-04-2313.7%
2026-09-01
Source-checked
144Claude Sonnet 4.6Anthropic2026-02-1713.3%
2026-09-01
Source-checked
145Claude Opus 4.5Anthropic2025-11-2413.2%
2026-09-01
Source-checked
146EXAONE 4.5 33BOther2026-04-0912.9%
2026-09-01
Source-checked
147Claude 4.1 Opus (Reasoning)Anthropic2025-08-0512.5%
2026-09-01
Source-checked
148Claude 4 Opus (Reasoning)Anthropic2025-05-2212.3%
2026-09-01
Source-checked
149Command ACohere2026-03-1512%
2026-09-01
Source-checked
150Claude Sonnet 4.6 (Non-reasoning, Low Effort)Anthropic2026-02-1711.2%
2026-09-01
Source-checked
151Granite 4.2 30BOther2026-08-2511.2%
2026-09-01
Source-checked
152North Mini CodeCohere2026-06-0911.1%
2026-09-01
Source-checked
153DiffusionGemma 26B A4BGoogle2026-06-1010.8%
2026-09-01
Source-checked
154Nemotron 3.5 LightningNVIDIA2026-08-1110.6%
2026-09-01
Source-checked
155GLM-5.2 (Non-reasoning)Zhipu2026-06-169.8%
2026-09-01
Source-checked
156Granite 4.2 8BOther2026-08-259.7%
2026-09-01
Source-checked
157Ling 3.0 TinyOther2026-08-069.3%
2026-09-01
Source-checked
158Ling-2.6-1TOther2026-04-238.7%
2026-09-01
Source-checked
159DeepSeek V4 Pro (Non-reasoning)DeepSeek2026-04-248.2%
2026-09-01
Source-checked
160DeepSeek V4 Flash (Non-reasoning)DeepSeek2026-04-247.8%
2026-09-01
Source-checked
161GLM-5 (Non-reasoning)Zhipu2026-02-117.6%
2026-09-01
Source-checked
162Hy3-preview (Non-reasoning)Other2026-04-237%
2026-09-01
Source-checked
163OpenAI o1OpenAI2024-09-127%
2026-09-01
Source-checked
164LFM2.5-8B-A1BLiquid2026-06-086.9%
2026-09-01
Source-checked
165Grok 4.3 (Non-reasoning)xAI2026-04-306.8%
2026-09-01
Source-checked
166Granite 4.2 3BOther2026-08-256.6%
2026-09-01
Source-checked
167MiniCPM5-1B (Reasoning)OpenBMB2026-06-046.5%
2026-09-01
Source-checked
168JT-35B-FlashOther2026-05-146.4%
2026-09-01
Source-checked
169JT-MINIOther2026-04-156.4%
2026-09-01
Source-checked
170Gemma 4 12B (Non-reasoning)Google2026-06-106.3%
2026-09-01
Source-checked
171Ling 2.6 FlashOther2026-04-216.3%
2026-09-01
Source-checked
172MiniCPM-V 4.6 1.3BOpenBMB2026-05-115.1%
2026-09-01
Source-checked
173Llama 4 MaverickMeta2026-04-054.9%
2026-09-01
Source-checked
174Nemotron 3 Nano Omni 30B A3B ReasoningNVIDIA2026-04-294.8%
2026-09-01
Source-checked
175G9v3-3BOther2026-07-234.5%
2026-09-01
Source-checked
176MiniCPM5-1B (Non-reasoning)OpenBMB2026-05-254.5%
2026-09-01
Source-checked
177Mistral Large 3Mistral2025-12-024.2%
2026-09-01
Source-checked
178Granite 4.1 30BOther2026-04-294.1%
2026-09-01
Source-checked
179Llama 4 ScoutMeta2026-04-053.8%
2026-09-01
Source-checked
180Claude 3 OpusAnthropic2024-03-042.8%
2026-09-01
Source-checked
Method

What it covers

This benchmark sits in the reasoning family. It uses Multiple-choice and short-answer questions vetted by domain experts; submissions are reviewed for difficulty before scoring. The score should travel with its task format, scoring method, source date, and benchmark version.

Score ceiling

Where it breaks down

Scores on VerdictPal come from Artificial Analysis' independent HLE run unless noted. The official project site hosts the dataset and paper — not a single maintained public leaderboard URL.

Receipts

Sources and further reading

Questions about this benchmark

Every answer below is assembled from the dated fields on this page. Nothing is written separately for search.

What does Humanity's Last Exam measure?

Cross-domain expert-level questions — math, sciences, humanities, professional law and medicine — designed to be the hardest public exam a frontier model can take.

What does a high Humanity's Last Exam score not prove?

A strong Humanity's Last Exam result says nothing about:

  • Real research productivity — exam-style questions do not capture the messy search-and-synthesize work a researcher actually does.
  • Tool-augmented use — HLE is closed-book by default; models that leverage calculators, code, or web search get a separate tier.
  • Calibration — HLE reports accuracy, not how well the model knows what it doesn't know.

How is Humanity's Last Exam scored?

Percent of questions answered correctly on the public + private split; HLE reports a single accuracy figure per model. Task format: Multiple-choice and short-answer questions vetted by domain experts; submissions are reviewed for difficulty before scoring.

Is Humanity's Last Exam saturated?

Humanity's Last Exam is currently marked Active in the atlas.

Can Humanity's Last Exam results be contaminated by training data?

Contamination risk for Humanity's Last Exam is graded Low contamination. Treat every row on this page as a public claim with a source and a date, not as a controlled experiment.

The Pack · Editorial newsletter

New tools in your inbox. Free.

One short email when a tool ships or changes status. No tracking, no third-party analytics. Unsubscribe in one click.