Why this benchmark is useful
When you need a hard, cross-domain expert exam — math through professional law and medicine — as a closed-book stress test, not a research-productivity proxy.
HLE
Cross-domain expert-level questions — math, sciences, humanities, professional law and medicine — designed to be the hardest public exam a frontier model can take.
When you need a hard, cross-domain expert exam — math through professional law and medicine — as a closed-book stress test, not a research-productivity proxy.
Single accuracy figure on the public + private split. VerdictPal figures usually come from Artificial Analysis' independent run; tool-augmented tiers are separate. Accuracy is not calibration.
Normalized to this benchmark's axis (0–100). Open the table for raw units.
Scores use this benchmark's own unit and axis, not a universal quality score.
| # | Model | Release date | Score | Provenance | Trust |
|---|---|---|---|---|---|
| 1 | Claude Fable 5Anthropic | 2026-06-09 | 55.5% | 2026-09-01 | Source-checked |
| 2 | Claude Opus 5 (Adaptive Reasoning, Max Effort)Anthropic | 2026-07-24 | 54.9% | 2026-09-01 | Source-checked |
| 3 | Claude Opus 5 (Adaptive Reasoning, Xhigh Effort)Anthropic | 2026-07-24 | 54.4% | 2026-09-01 | Source-checked |
| 4 | Claude Opus 5 (Adaptive Reasoning, High Effort)Anthropic | 2026-07-24 | 52.8% | 2026-09-01 | Source-checked |
| 5 | Claude Opus 5 (Adaptive Reasoning, Medium Effort)Anthropic | 2026-07-24 | 51.3% | 2026-09-01 | Source-checked |
| 6 | GPT-5.6 SolOpenAI | 2026-07-09 | 49.5% | 2026-09-01 | Source-checked |
| 7 | Claude Opus 4.8Anthropic | 2026-05-28 | 48.7% | 2026-09-01 | Source-checked |
| 8 | Gemini 3.7 FlashGoogle | 2026-08-13 | 47.9% | 2026-09-01 | Source-checked |
| 9 | Gemini 3.1 Pro PreviewGoogle | 2026-02-19 | 47% | 2026-09-01 | Source-checked |
| 10 | Kimi K3Moonshot | 2026-07-16 | 46.9% | 2026-09-01 | Source-checked |
| 11 | Muse Spark 1.1Meta | 2026-07-09 | 46.2% | 2026-09-01 | Source-checked |
| 12 | GPT 5.5OpenAI | 2026-04-23 | 45.8% | 2026-09-01 | Source-checked |
| 13 | Muse Spark 1.2Meta | 2026-08-05 | 45.5% | 2026-09-01 | Source-checked |
| 14 | GPT-5.5 (high)OpenAI | 2026-04-23 | 45% | 2026-09-01 | Source-checked |
| 15 | GPT 5.4OpenAI | 2026-03-05 | 43.7% | 2026-09-01 | Source-checked |
| 16 | Claude Opus 5 (Adaptive Reasoning, Low Effort)Anthropic | 2026-07-24 | 43.4% | 2026-09-01 | Source-checked |
| 17 | Qwen3.8 MaxAlibaba | 2026-08-03 | 43% | 2026-09-01 | Source-checked |
| 18 | GPT-5.6 TerraOpenAI | 2026-07-09 | 42.9% | 2026-09-01 | Source-checked |
| 19 | Grok 4.6xAI | 2026-08-12 | 42.9% | 2026-09-01 | Source-checked |
| 20 | Gemini 3.5 FlashGoogle | 2026-05-19 | 42.7% | 2026-09-01 | Source-checked |
| 21 | Grok 4.5xAI | 2026-07-08 | 42.7% | 2026-09-01 | Source-checked |
| 22 | GPT-5.3 Codex (xhigh)OpenAI | 2026-02-05 | 42.5% | 2026-09-01 | Source-checked |
| 23 | GPT-5.5 (medium)OpenAI | 2026-04-23 | 42.4% | 2026-09-01 | Source-checked |
| 24 | Qwen3.8 2.4T A95BAlibaba | 2026-08-12 | 42.4% | 2026-09-01 | Source-checked |
| 25 | Claude Opus 4.7Anthropic | 2026-04-16 | 42.3% | 2026-09-01 | Source-checked |
| 26 | GLM-5.3Zhipu | 2026-08-14 | 42.3% | 2026-09-01 | Source-checked |
| 27 | Claude Sonnet 5Anthropic | 2026-06-30 | 41.3% | 2026-09-01 | Source-checked |
| 28 | Gemini 3.5 Flash (medium)Google | 2026-05-19 | 41.3% | 2026-09-01 | Source-checked |
| 29 | GLM-5.2Zhipu | 2026-06-13 | 41.1% | 2026-09-01 | Source-checked |
| 30 | DeepSeek V4 Pro 0813 (Reasoning, Max Effort)DeepSeek | 2026-08-13 | 41% | 2026-09-01 | Source-checked |
| 31 | Gemini 3.6 Flash (high)Google | 2026-07-21 | 40.8% | 2026-09-01 | Source-checked |
| 32 | Muse SparkOther | 2026-01-01 | 40.7% | 2026-09-01 | Source-checked |
| 33 | Qwen3.7 MaxAlibaba | 2026-05-19 | 40.5% | 2026-09-01 | Source-checked |
| 34 | Motif 3 (Beta)Other | 2026-07-21 | 40.4% | 2026-09-01 | Source-checked |
| 35 | Claude Opus 4.6 (Adaptive Reasoning, Max Effort)Anthropic | 2026-02-05 | 39.9% | 2026-09-01 | Source-checked |
| 36 | GLM-5.3-FlashZhipu | 2026-08-26 | 39.9% | 2026-09-01 | Source-checked |
| 37 | Gemini 3 ProGoogle | 2025-11-18 | 39.7% | 2026-09-01 | Source-checked |
| 38 | GPT-5.6 LunaOpenAI | 2026-07-09 | 39.5% | 2026-09-01 | Source-checked |
| 39 | MiniMax M3MiniMax | 2026-05-31 | 39% | 2026-09-01 | Source-checked |
| 40 | DeepSeek V4 Flash 0731 (Reasoning, Max Effort)DeepSeek | 2026-07-31 | 38.6% | 2026-09-01 | Source-checked |
| 41 | Grok Build 0.1 0616xAI | 2026-06-16 | 38.3% | 2026-09-01 | Source-checked |
| 42 | Qwen3.8-Flash-NextAlibaba | 2026-08-26 | 38% | 2026-09-01 | Source-checked |
| 43 | GPT-5.2OpenAI | 2025-12-11 | 37.7% | 2026-09-01 | Source-checked |
| 44 | Agnes 2.5 Pro BetaOther | 2026-08-26 | 37.5% | 2026-09-01 | Source-checked |
| 45 | Kimi K2.6Moonshot | 2026-04-20 | 37.5% | 2026-09-01 | Source-checked |
| 46 | Grok 4.3xAI | 2026-04-30 | 37.2% | 2026-09-01 | Source-checked |
| 47 | Motif 3Other | 2026-08-12 | 37% | 2026-09-01 | Source-checked |
| 48 | Gemini 3 Flash Preview (Reasoning)Google | 2025-12-17 | 36.6% | 2026-09-01 | Source-checked |
| 49 | GPT-5.2 Codex (xhigh)OpenAI | 2025-12-11 | 35.7% | 2026-09-01 | Source-checked |
| 50 | MiMo-V2.5-ProXiaomi | 2026-04-22 | 35.7% | 2026-09-01 | Source-checked |
| 51 | Qwen 3.7 PlusAlibaba | 2026-06-02 | 35.6% | 2026-09-01 | Source-checked |
| 52 | DeepSeek V4 Pro (Reasoning, High Effort)DeepSeek | 2026-04-24 | 35.2% | 2026-09-01 | Source-checked |
| 53 | Kimi K2.7 CodeMoonshot | 2026-06-12 | 35% | 2026-09-01 | Source-checked |
| 54 | DeepSeek V4 Flash Vision (Reasoning, Max Effort)DeepSeek | 2026-08-21 | 34.5% | 2026-09-01 | Source-checked |
| 55 | Grok 4.20 ReasoningxAI | 2026-03-05 | 34.5% | 2026-09-01 | Source-checked |
| 56 | Apodex 1.1Other | 2026-08-30 | 34.1% | 2026-09-01 | Source-checked |
| 57 | Qwen3.8 27BAlibaba | 2026-08-14 | 33.9% | 2026-09-01 | Source-checked |
| 58 | LongCat-2.0Meituan | 2026-06-29 | 33.7% | 2026-09-01 | Source-checked |
| 59 | Nex-N2-ProOther | 2026-06-02 | 33.7% | 2026-09-01 | Source-checked |
| 60 | Agnes 2.5 Pro AlphaOther | 2026-07-24 | 33.6% | 2026-09-01 | Source-checked |
| 61 | Claude Sonnet 4.6 (Adaptive Reasoning, Max Effort)Anthropic | 2026-02-17 | 33.6% | 2026-09-01 | Source-checked |
| 62 | Hy3Other | 2026-07-06 | 33.5% | 2026-09-01 | Source-checked |
| 63 | Claude Opus 4.7 (Non-reasoning, High Effort)Anthropic | 2026-04-16 | 33.3% | 2026-09-01 | Source-checked |
| 64 | Inkling SmallOther | 2026-07-30 | 33.3% | 2026-09-01 | Source-checked |
| 65 | GPT-5.5 (low)OpenAI | 2026-04-23 | 32.7% | 2026-09-01 | Source-checked |
| 66 | Grok 4.20 0309 (Reasoning)xAI | 2026-03-10 | 32.4% | 2026-09-01 | Source-checked |
| 67 | Inkling (xhigh)Other | 2026-07-15 | 31.9% | 2026-09-01 | Source-checked |
| 68 | GPT-5.4 (low)OpenAI | 2026-03-05 | 30.8% | 2026-09-01 | Source-checked |
| 69 | Qwen3.6 Max PreviewAlibaba | 2026-04-20 | 30.8% | 2026-09-01 | Source-checked |
| 70 | Kimi K2.5Moonshot | 2026-01-27 | 30.7% | 2026-09-01 | Source-checked |
| 71 | MiMo-V2-ProXiaomi | 2026-03-18 | 30.4% | 2026-09-01 | Source-checked |
| 72 | DeepSeek V4 Flash (Reasoning, High Effort)DeepSeek | 2026-04-24 | 30.3% | 2026-09-01 | Source-checked |
| 73 | Claude Opus 4.5 (Reasoning)Anthropic | 2025-11-24 | 30.1% | 2026-09-01 | Source-checked |
| 74 | GLM-5.1Zhipu | 2026-04-07 | 30.1% | 2026-09-01 | Source-checked |
| 75 | Grok 4.3 (medium)xAI | 2026-04-30 | 30% | 2026-09-01 | Source-checked |
| 76 | A.X-K2Other | 2026-08-12 | 29.6% | 2026-09-01 | Source-checked |
| 77 | MiniMax M2.7MiniMax | 2026-04-15 | 29.6% | 2026-09-01 | Source-checked |
| 78 | Gemini 3 Pro Preview (low)Google | 2025-11-18 | 29.5% | 2026-09-01 | Source-checked |
| 79 | GLM-5 (Reasoning)Zhipu | 2026-02-11 | 29.3% | 2026-09-01 | Source-checked |
| 80 | Solar Pro 4Other | 2026-08-06 | 29.2% | 2026-09-01 | Source-checked |
| 81 | Qwen3.5 397B A17B (Reasoning)Alibaba | 2026-02-16 | 29% | 2026-09-01 | Source-checked |
| 82 | GPT-5 (high)OpenAI | 2025-08-07 | 28.5% | 2026-09-01 | Source-checked |
| 83 | GPT-5.1OpenAI | 2025-11-13 | 28.5% | 2026-09-01 | Source-checked |
| 84 | Solar Open2 250BOther | 2026-08-12 | 28.5% | 2026-09-01 | Source-checked |
| 85 | Nemotron 3 Ultra 550B A55B (Reasoning)NVIDIA | 2026-06-04 | 28.4% | 2026-09-01 | Source-checked |
| 86 | GPT-5.4 NanoOpenAI | 2026-03-17 | 28.3% | 2026-09-01 | Source-checked |
| 87 | GPT-5.4 MiniOpenAI | 2026-03-17 | 28.1% | 2026-09-01 | Source-checked |
| 88 | Qwen3 Max ThinkingAlibaba | 2026-01-26 | 28% | 2026-09-01 | Source-checked |
| 89 | Grok 4.20 0309 v2 (Non-reasoning)xAI | 2026-04-07 | 27.9% | 2026-09-01 | Source-checked |
| 90 | GLM-5-TurboZhipu | 2026-03-15 | 27.8% | 2026-09-01 | Source-checked |
| 91 | GPT-5 Codex (high)OpenAI | 2025-09-23 | 27.8% | 2026-09-01 | Source-checked |
| 92 | Hy3-preview (Reasoning)Other | 2026-04-23 | 27.8% | 2026-09-01 | Source-checked |
| 93 | Qwen3.6 PlusAlibaba | 2026-04-02 | 27.8% | 2026-09-01 | Source-checked |
| 94 | GLM-4.7 (Reasoning)Zhipu | 2025-12-22 | 27.4% | 2026-09-01 | Source-checked |
| 95 | MiMo-V2.5Xiaomi | 2026-04-22 | 27.2% | 2026-09-01 | Source-checked |
| 96 | GPT-5.2 (medium)OpenAI | 2025-12-11 | 26.7% | 2026-09-01 | Source-checked |
| 97 | Grok 4xAI | 2025-07-10 | 26.7% | 2026-09-01 | Source-checked |
| 98 | GPT-5.1 Codex (high)OpenAI | 2025-11-13 | 25.7% | 2026-09-01 | Source-checked |
| 99 | GPT-5 (medium)OpenAI | 2025-08-07 | 25.4% | 2026-09-01 | Source-checked |
| 100 | Qwen3.5 122B A10B (Reasoning)Alibaba | 2026-02-24 | 25.2% | 2026-09-01 | Source-checked |
| 101 | Kimi K3 (low)Moonshot | 2026-07-16 | 25% | 2026-09-01 | Source-checked |
| 102 | DeepSeek V3.2 (Reasoning)DeepSeek | 2025-12-01 | 24.6% | 2026-09-01 | Source-checked |
| 103 | Gemini 3.5 Flash (minimal)Google | 2026-05-19 | 24.1% | 2026-09-01 | Source-checked |
| 104 | Qwen3.5 27B (Reasoning)Alibaba | 2026-02-24 | 23.9% | 2026-09-01 | Source-checked |
| 105 | Kimi K2 ThinkingMoonshot | 2025-11-06 | 23.8% | 2026-09-01 | Source-checked |
| 106 | Ling 3.0 FlashOther | 2026-08-04 | 23.7% | 2026-09-01 | Source-checked |
| 107 | Gemma 4 31B ITGoogle | 2026-03-01 | 23.6% | 2026-09-01 | Source-checked |
| 108 | MiniMax-M2.1MiniMax | 2025-12-23 | 23.2% | 2026-09-01 | Source-checked |
| 109 | Qwen3.6 27B (Reasoning)Alibaba | 2026-04-22 | 23.1% | 2026-09-01 | Source-checked |
| 110 | MiMo-V2-Flash (Reasoning)Xiaomi | 2025-12-16 | 22.8% | 2026-09-01 | Source-checked |
| 111 | MiMo-V2-Omni-0327Xiaomi | 2026-03-27 | 22.6% | 2026-09-01 | Source-checked |
| 112 | Qwen3.6 35B A3B (Reasoning)Alibaba | 2026-04-16 | 22.2% | 2026-09-01 | Source-checked |
| 113 | MiMo-V2-Flash (Feb 2026)Xiaomi | 2025-12-16 | 22.1% | 2026-09-01 | Source-checked |
| 114 | MiMo-V2-OmniXiaomi | 2026-03-19 | 22.1% | 2026-09-01 | Source-checked |
| 115 | Muse GlimmerMeta | 2026-08-10 | 22% | 2026-09-01 | Source-checked |
| 116 | GPT-5.5 Instant (May 2026)OpenAI | 2026-05-05 | 21.6% | 2026-09-01 | Source-checked |
| 117 | Ring-2.6-1TOther | 2026-05-08 | 21.6% | 2026-09-01 | Source-checked |
| 118 | Step 3.7 FlashStepFun | 2026-06-01 | 21.4% | 2026-09-01 | Source-checked |
| 119 | MiniMax M2.5MiniMax | 2026-04-01 | 20.5% | 2026-09-01 | Source-checked |
| 120 | OpenAI o3OpenAI | 2025-04-16 | 20.1% | 2026-09-01 | Source-checked |
| 121 | GPT-5.5 Instant (June 2026)OpenAI | 2026-06-25 | 19.9% | 2026-09-01 | Source-checked |
| 122 | Qwen3.5 397B A17B (Non-reasoning)Alibaba | 2026-02-16 | 19.8% | 2026-09-01 | Source-checked |
| 123 | GPT-5 (low)OpenAI | 2025-08-07 | 19.6% | 2026-09-01 | Source-checked |
| 124 | Kimi K2.6 (Non-reasoning)Other | 2026-04-20 | 19.6% | 2026-09-01 | Source-checked |
| 125 | Claude Opus 4.6Anthropic | 2026-02-05 | 19.1% | 2026-09-01 | Source-checked |
| 126 | Gemini 3.5 Flash-LiteGoogle | 2026-07-21 | 18.8% | 2026-09-01 | Source-checked |
| 127 | K-EXAONE 2.0 0803Other | 2026-08-12 | 18.6% | 2026-09-01 | Source-checked |
| 128 | Grok 4.3 (low)xAI | 2026-04-30 | 18.4% | 2026-09-01 | Source-checked |
| 129 | Claude 4.5 Sonnet (Reasoning)Anthropic | 2025-09-29 | 17.8% | 2026-09-01 | Source-checked |
| 130 | JT-4.1 Flash 236B A21BOther | 2026-07-09 | 17.8% | 2026-09-01 | Source-checked |
| 131 | G9v3-39A5BOther | 2026-08-03 | 17.5% | 2026-09-01 | Source-checked |
| 132 | Gemini 3.1 Flash LiteGoogle | 2026-05-07 | 17.2% | 2026-09-01 | Source-checked |
| 133 | GLM 5V Turbo (Reasoning)Zhipu | 2026-04-01 | 17.1% | 2026-09-01 | Source-checked |
| 134 | HyperNova 60B 2605Multiverse | 2026-05-06 | 16.6% | 2026-09-01 | Source-checked |
| 135 | KAT Coder Pro V2Other | 2026-03-27 | 16.1% | 2026-09-01 | Source-checked |
| 136 | DeepSeek R1DeepSeek | 2025-01-20 | 15.8% | 2026-09-01 | Source-checked |
| 137 | Gemma 4 12B (Reasoning)Google | 2026-06-07 | 15.7% | 2026-09-01 | Source-checked |
| 138 | Qwen3.6 27B (Non-reasoning)Alibaba | 2026-04-22 | 15.1% | 2026-09-01 | Source-checked |
| 139 | Gemini 3 Flash PreviewGoogle | 2025-12-17 | 15% | 2026-09-01 | Source-checked |
| 140 | MiMo-V2.5-Pro (Non-reasoning)Xiaomi | 2026-04-22 | 14.8% | 2026-09-01 | Source-checked |
| 141 | Qwen3.6 35B A3B (Non-reasoning)Alibaba | 2026-04-16 | 13.9% | 2026-09-01 | Source-checked |
| 142 | Mistral Medium 3.5Mistral | 2026-04-29 | 13.8% | 2026-09-01 | Source-checked |
| 143 | GPT-5.5 (Non-reasoning)OpenAI | 2026-04-23 | 13.7% | 2026-09-01 | Source-checked |
| 144 | Claude Sonnet 4.6Anthropic | 2026-02-17 | 13.3% | 2026-09-01 | Source-checked |
| 145 | Claude Opus 4.5Anthropic | 2025-11-24 | 13.2% | 2026-09-01 | Source-checked |
| 146 | EXAONE 4.5 33BOther | 2026-04-09 | 12.9% | 2026-09-01 | Source-checked |
| 147 | Claude 4.1 Opus (Reasoning)Anthropic | 2025-08-05 | 12.5% | 2026-09-01 | Source-checked |
| 148 | Claude 4 Opus (Reasoning)Anthropic | 2025-05-22 | 12.3% | 2026-09-01 | Source-checked |
| 149 | Command ACohere | 2026-03-15 | 12% | 2026-09-01 | Source-checked |
| 150 | Claude Sonnet 4.6 (Non-reasoning, Low Effort)Anthropic | 2026-02-17 | 11.2% | 2026-09-01 | Source-checked |
| 151 | Granite 4.2 30BOther | 2026-08-25 | 11.2% | 2026-09-01 | Source-checked |
| 152 | North Mini CodeCohere | 2026-06-09 | 11.1% | 2026-09-01 | Source-checked |
| 153 | DiffusionGemma 26B A4BGoogle | 2026-06-10 | 10.8% | 2026-09-01 | Source-checked |
| 154 | Nemotron 3.5 LightningNVIDIA | 2026-08-11 | 10.6% | 2026-09-01 | Source-checked |
| 155 | GLM-5.2 (Non-reasoning)Zhipu | 2026-06-16 | 9.8% | 2026-09-01 | Source-checked |
| 156 | Granite 4.2 8BOther | 2026-08-25 | 9.7% | 2026-09-01 | Source-checked |
| 157 | Ling 3.0 TinyOther | 2026-08-06 | 9.3% | 2026-09-01 | Source-checked |
| 158 | Ling-2.6-1TOther | 2026-04-23 | 8.7% | 2026-09-01 | Source-checked |
| 159 | DeepSeek V4 Pro (Non-reasoning)DeepSeek | 2026-04-24 | 8.2% | 2026-09-01 | Source-checked |
| 160 | DeepSeek V4 Flash (Non-reasoning)DeepSeek | 2026-04-24 | 7.8% | 2026-09-01 | Source-checked |
| 161 | GLM-5 (Non-reasoning)Zhipu | 2026-02-11 | 7.6% | 2026-09-01 | Source-checked |
| 162 | Hy3-preview (Non-reasoning)Other | 2026-04-23 | 7% | 2026-09-01 | Source-checked |
| 163 | OpenAI o1OpenAI | 2024-09-12 | 7% | 2026-09-01 | Source-checked |
| 164 | LFM2.5-8B-A1BLiquid | 2026-06-08 | 6.9% | 2026-09-01 | Source-checked |
| 165 | Grok 4.3 (Non-reasoning)xAI | 2026-04-30 | 6.8% | 2026-09-01 | Source-checked |
| 166 | Granite 4.2 3BOther | 2026-08-25 | 6.6% | 2026-09-01 | Source-checked |
| 167 | MiniCPM5-1B (Reasoning)OpenBMB | 2026-06-04 | 6.5% | 2026-09-01 | Source-checked |
| 168 | JT-35B-FlashOther | 2026-05-14 | 6.4% | 2026-09-01 | Source-checked |
| 169 | JT-MINIOther | 2026-04-15 | 6.4% | 2026-09-01 | Source-checked |
| 170 | Gemma 4 12B (Non-reasoning)Google | 2026-06-10 | 6.3% | 2026-09-01 | Source-checked |
| 171 | Ling 2.6 FlashOther | 2026-04-21 | 6.3% | 2026-09-01 | Source-checked |
| 172 | MiniCPM-V 4.6 1.3BOpenBMB | 2026-05-11 | 5.1% | 2026-09-01 | Source-checked |
| 173 | Llama 4 MaverickMeta | 2026-04-05 | 4.9% | 2026-09-01 | Source-checked |
| 174 | Nemotron 3 Nano Omni 30B A3B ReasoningNVIDIA | 2026-04-29 | 4.8% | 2026-09-01 | Source-checked |
| 175 | G9v3-3BOther | 2026-07-23 | 4.5% | 2026-09-01 | Source-checked |
| 176 | MiniCPM5-1B (Non-reasoning)OpenBMB | 2026-05-25 | 4.5% | 2026-09-01 | Source-checked |
| 177 | Mistral Large 3Mistral | 2025-12-02 | 4.2% | 2026-09-01 | Source-checked |
| 178 | Granite 4.1 30BOther | 2026-04-29 | 4.1% | 2026-09-01 | Source-checked |
| 179 | Llama 4 ScoutMeta | 2026-04-05 | 3.8% | 2026-09-01 | Source-checked |
| 180 | Claude 3 OpusAnthropic | 2024-03-04 | 2.8% | 2026-09-01 | Source-checked |
This benchmark sits in the reasoning family. It uses Multiple-choice and short-answer questions vetted by domain experts; submissions are reviewed for difficulty before scoring. The score should travel with its task format, scoring method, source date, and benchmark version.
Scores on VerdictPal come from Artificial Analysis' independent HLE run unless noted. The official project site hosts the dataset and paper — not a single maintained public leaderboard URL.
Every answer below is assembled from the dated fields on this page. Nothing is written separately for search.
Cross-domain expert-level questions — math, sciences, humanities, professional law and medicine — designed to be the hardest public exam a frontier model can take.
A strong Humanity's Last Exam result says nothing about:
Percent of questions answered correctly on the public + private split; HLE reports a single accuracy figure per model. Task format: Multiple-choice and short-answer questions vetted by domain experts; submissions are reviewed for difficulty before scoring.
Humanity's Last Exam is currently marked Active in the atlas.
Contamination risk for Humanity's Last Exam is graded Low contamination. Treat every row on this page as a public claim with a source and a date, not as a controlled experiment.
The Pack · Editorial newsletter
One short email when a tool ships or changes status. No tracking, no third-party analytics. Unsubscribe in one click.