Benchmarks / Reasoning

GPQA Diamond

Graduate-Level Google-Proof Q&A

Hard graduate-level science questions (biology, physics, chemistry) written so that non-experts cannot solve them even with web access — the 'Diamond' subset is the highest-quality, expert-validated slice.

What this does not measure
  • General usefulness — it is a narrow slice of frontier science, not everyday tasks.
  • Whether a model knows when it is out of its depth; it still answers every question.
  • Small size (198 Diamond questions) means a few lucky guesses move the score noticeably.
Analysis

Why this benchmark is useful

When you want graduate-level science that non-experts struggle to Google — a narrow but still discriminating knowledge/reasoning slice.

Scope

Coverage map

Task family
Reasoning
Format
198 expert-validated multiple-choice questions in the Diamond set; designed to be 'Google-proof'.
Scoring
Accuracy (% correct).
Maintainer
Rein et al.
Reading guide

How to read the scores

Accuracy on 198 Diamond MCQs. Small set: a few lucky items move the number. Compare to expert (~65–74%) and web-aided non-expert (~34%) ceilings, not everyday usefulness.

Blind spots

What it does not cover

  • General usefulness — it is a narrow slice of frontier science, not everyday tasks.
  • Whether a model knows when it is out of its depth; it still answers every question.
  • Small size (198 Diamond questions) means a few lucky guesses move the score noticeably.
Scores

Evidence ledger

185 rows
185185 rows
94.9%best score
178source-checked
2sources
2026-09-01to 2026-05-15
173

api · api

Papers / model cards12

manual-snapshot · manual

Distribution

Where the rows land

0255075100

Normalized to this benchmark's axis (0–100). Open the table for raw units.

Timeline

Newest receipts

  1. Grok 4.694.9% ·
  2. Gemini 3.7 Flash94.5% ·
  3. Gemini 3.1 Pro Preview94.1% ·
  4. GPT-5.6 Sol94.1% ·
  5. Claude Opus 5 (Adaptive Reasoning, High Effort)93.7% ·

Scores use this benchmark's own unit and axis, not a universal quality score.

#ModelRelease dateScoreProvenanceTrust
1Grok 4.6xAI2026-08-1294.9%
2026-09-01
Source-checked
1Claude Mythos PreviewAnthropic2026-06-0194.6%
GPQA Diamond paper leaderboard2026-06-02
Source-checked
3Gemini 3.7 FlashGoogle2026-08-1394.5%
2026-09-01
Source-checked
4Gemini 3.1 Pro PreviewGoogle2026-02-1994.1%
2026-09-01
Source-checked
5GPT-5.6 SolOpenAI2026-07-0994.1%
2026-09-01
Source-checked
6Claude Opus 5 (Adaptive Reasoning, High Effort)Anthropic2026-07-2493.7%
2026-09-01
Source-checked
7Claude Opus 5 (Adaptive Reasoning, Xhigh Effort)Anthropic2026-07-2493.7%
2026-09-01
Source-checked
8Kimi K3Moonshot2026-07-1693.5%
2026-09-01
Source-checked
9Qwen3.8 2.4T A95BAlibaba2026-08-1293.5%
2026-09-01
Source-checked
10Claude Opus 5 (Adaptive Reasoning, Max Effort)Anthropic2026-07-2493.2%
2026-09-01
Source-checked
11GPT-5.5 (high)OpenAI2026-04-2393.2%
2026-09-01
Source-checked
12Grok 4.5xAI2026-07-0893.1%
2026-09-01
Source-checked
13MiniMax M3MiniMax2026-05-3192.9%
2026-09-01
Source-checked
14DeepSeek V4 Pro 0813 (Reasoning, Max Effort)DeepSeek2026-08-1392.8%
2026-09-01
Source-checked
15Gemini 3.6 Flash (high)Google2026-07-2192.8%
2026-09-01
Source-checked
16Qwen3.8 MaxAlibaba2026-08-0392.7%
2026-09-01
Source-checked
17Claude Fable 5Anthropic2026-06-0992.6%
2026-09-01
Source-checked
18GPT-5.5 (medium)OpenAI2026-04-2392.6%
2026-09-01
Source-checked
19GPT-5.6 TerraOpenAI2026-07-0992.5%
2026-09-01
Source-checked
20Qwen3.7 MaxAlibaba2026-05-1992.3%
2026-09-01
Source-checked
21Qwen3.8-Flash-NextAlibaba2026-08-2692.3%
2026-09-01
Source-checked
22Gemini 3.5 Flash (medium)Google2026-05-1992.1%
2026-09-01
Source-checked
23GPT 5.4OpenAI2026-03-0592%
2026-09-01
Source-checked
24Claude Opus 5 (Adaptive Reasoning, Medium Effort)Anthropic2026-07-2491.9%
2026-09-01
Source-checked
25GLM-5.3Zhipu2026-08-1491.7%
2026-09-01
Source-checked
26GPT-5.3 Codex (xhigh)OpenAI2026-02-0591.5%
2026-09-01
Source-checked
27Claude Opus 4.7Anthropic2026-04-1691.4%
2026-09-01
Source-checked
28DeepSeek V4 Flash Vision (Reasoning, Max Effort)DeepSeek2026-08-2191.3%
2026-09-01
Source-checked
29GLM-5.3-FlashZhipu2026-08-2691.2%
2026-09-01
Source-checked
30Claude Sonnet 5Anthropic2026-06-3091.1%
2026-09-01
Source-checked
31GPT-5.6 LunaOpenAI2026-07-0991.1%
2026-09-01
Source-checked
32Grok 4.20 ReasoningxAI2026-03-0591.1%
2026-09-01
Source-checked
33GPT-5.5 (low)OpenAI2026-04-2391%
2026-09-01
Source-checked
34DeepSeek V4 Flash 0731 (Reasoning, Max Effort)DeepSeek2026-07-3190.8%
2026-09-01
Source-checked
35Gemini 3 ProGoogle2025-11-1890.8%
2026-09-01
Source-checked
1Kimi K2.6Moonshot2026-04-2090.5%
GPQA Diamond paper leaderboard2026-05-15
Source-checked
37Agnes 2.5 Pro BetaOther2026-08-2690.5%
2026-09-01
Source-checked
38DeepSeek V4 Pro (Reasoning, High Effort)DeepSeek2026-04-2490.5%
2026-09-01
Source-checked
39Qwen3.8 27BAlibaba2026-08-1490.5%
2026-09-01
Source-checked
40Muse Spark 1.2Meta2026-08-0590.4%
2026-09-01
Source-checked
41GPT-5.2OpenAI2025-12-1190.3%
2026-09-01
Source-checked
42Qwen 3.7 PlusAlibaba2026-06-0290%
2026-09-01
Source-checked
43GPT-5.2 Codex (xhigh)OpenAI2025-12-1189.9%
2026-09-01
Source-checked
44Gemini 3 Flash Preview (Reasoning)Google2025-12-1789.8%
2026-09-01
Source-checked
45Muse Spark 1.1Meta2026-07-0989.8%
2026-09-01
Source-checked
46Hy3Other2026-07-0689.7%
2026-09-01
Source-checked
47Claude Opus 4.6 (Adaptive Reasoning, Max Effort)Anthropic2026-02-0589.6%
2026-09-01
Source-checked
48Kimi K2.7 CodeMoonshot2026-06-1289.6%
2026-09-01
Source-checked
49GLM-5.2Zhipu2026-06-1389.5%
2026-09-01
Source-checked
50Grok Build 0.1 0616xAI2026-06-1689.5%
2026-09-01
Source-checked
51Inkling SmallOther2026-07-3089.5%
2026-09-01
Source-checked
52Qwen3.5 397B A17B (Reasoning)Alibaba2026-02-1689.3%
2026-09-01
Source-checked
53Nex-N2-ProOther2026-06-0289.2%
2026-09-01
Source-checked
54Solar Pro 4Other2026-08-0689.1%
2026-09-01
Source-checked
55Grok 4.3 (medium)xAI2026-04-3089%
2026-09-01
Source-checked
56Claude Opus 5 (Adaptive Reasoning, Low Effort)Anthropic2026-07-2488.9%
2026-09-01
Source-checked
57Qwen3.6 Max PreviewAlibaba2026-04-2088.8%
2026-09-01
Source-checked
58Gemini 3 Pro Preview (low)Google2025-11-1888.7%
2026-09-01
Source-checked
59Claude Opus 4.7 (Non-reasoning, High Effort)Anthropic2026-04-1688.5%
2026-09-01
Source-checked
60Grok 4.20 0309 (Reasoning)xAI2026-03-1088.5%
2026-09-01
Source-checked
61Muse SparkOther2026-01-0188.4%
2026-09-01
Source-checked
62Qwen3.6 PlusAlibaba2026-04-0288.2%
2026-09-01
Source-checked
63Claude Sonnet 4.6 (Adaptive Reasoning, Max Effort)Anthropic2026-02-1787.5%
2026-09-01
Source-checked
64GPT-5.4 MiniOpenAI2026-03-1787.5%
2026-09-01
Source-checked
65GPT-5.1OpenAI2025-11-1387.3%
2026-09-01
Source-checked
66GPT-5.4 (low)OpenAI2026-03-0587.1%
2026-09-01
Source-checked
67GLM-5.1Zhipu2026-04-0786.8%
2026-09-01
Source-checked
68DeepSeek V4 Flash (Reasoning, High Effort)DeepSeek2026-04-2486.7%
2026-09-01
Source-checked
69Claude Opus 4.5 (Reasoning)Anthropic2025-11-2486.6%
2026-09-01
Source-checked
70Apodex 1.1Other2026-08-3086.4%
2026-09-01
Source-checked
71GPT-5.2 (medium)OpenAI2025-12-1186.4%
2026-09-01
Source-checked
72GPT-5.1 Codex (high)OpenAI2025-11-1386%
2026-09-01
Source-checked
73GLM-4.7 (Reasoning)Zhipu2025-12-2285.9%
2026-09-01
Source-checked
74Gemma 4 31B ITGoogle2026-03-0185.7%
2026-09-01
Source-checked
75GPT-5 (high)OpenAI2025-08-0785.4%
2026-09-01
Source-checked
76GLM-5-TurboZhipu2026-03-1584.7%
2026-09-01
Source-checked
77GPT-5.5 Instant (May 2026)OpenAI2026-05-0584.6%
2026-09-01
Source-checked
78GPT-5 (medium)OpenAI2025-08-0784.2%
2026-09-01
Source-checked
79DeepSeek V3.2 (Reasoning)DeepSeek2025-12-0184%
2026-09-01
Source-checked
80Gemini 3.5 Flash-LiteGoogle2026-07-2183.8%
2026-09-01
Source-checked
81GPT-5 Codex (high)OpenAI2025-09-2383.7%
2026-09-01
Source-checked
82Gemini 3.5 Flash (minimal)Google2026-05-1982.8%
2026-09-01
Source-checked
83GPT-5.5 Instant (June 2026)OpenAI2026-06-2582.3%
2026-09-01
Source-checked
84Gemini 3.1 Flash LiteGoogle2026-05-0782.2%
2026-09-01
Source-checked
85GLM-5 (Reasoning)Zhipu2026-02-1182%
2026-09-01
Source-checked
86GPT-5.4 NanoOpenAI2026-03-1781.7%
2026-09-01
Source-checked
87DeepSeek R1DeepSeek2025-01-2081.3%
2026-09-01
Source-checked
88Gemini 3 Flash PreviewGoogle2025-12-1781.2%
2026-09-01
Source-checked
89Claude 4.1 Opus (Reasoning)Anthropic2025-08-0580.9%
2026-09-01
Source-checked
90GLM 5V Turbo (Reasoning)Zhipu2026-04-0180.9%
2026-09-01
Source-checked
91GPT-5 (low)OpenAI2025-08-0780.8%
2026-09-01
Source-checked
92G9v3-39A5BOther2026-08-0380.5%
2026-09-01
Source-checked
93Claude Sonnet 4.6 (Non-reasoning, Low Effort)Anthropic2026-02-1779.7%
2026-09-01
Source-checked
94Claude 4 Opus (Reasoning)Anthropic2025-05-2279.6%
2026-09-01
Source-checked
1Gemini 3.1 ProGoogleCoT prompting. PhD-level science MCQ.2026-02-1978.4%
Artificial Analysis GPQA Diamond evaluation2026-06-09
Needs audit
2Grok 4.3xAI2026-04-3088%
GPQA Diamond paper leaderboard2026-05-15
Source-checked
97Kimi K2.5Moonshot2026-01-2787.9%
2026-09-01
Source-checked
98Grok 4xAI2025-07-1087.7%
2026-09-01
Source-checked
99Agnes 2.5 Pro AlphaOther2026-07-2487.6%
2026-09-01
Source-checked
100MiniMax M2.7MiniMax2026-04-1587.4%
2026-09-01
Source-checked
101Inkling (xhigh)Other2026-07-1587.2%
2026-09-01
Source-checked
102MiMo-V2-ProXiaomi2026-03-1887%
2026-09-01
Source-checked
103Motif 3 (Beta)Other2026-07-2186.9%
2026-09-01
Source-checked
104Hy3-preview (Reasoning)Other2026-04-2386.7%
2026-09-01
Source-checked
105Nemotron 3 Ultra 550B A55B (Reasoning)NVIDIA2026-06-0486.7%
2026-09-01
Source-checked
106MiMo-V2.5-ProXiaomi2026-04-2286.6%
2026-09-01
Source-checked
107Qwen3 Max ThinkingAlibaba2026-01-2686.1%
2026-09-01
Source-checked
108Qwen3.5 397B A17B (Non-reasoning)Alibaba2026-02-1686.1%
2026-09-01
Source-checked
109Qwen3.5 27B (Reasoning)Alibaba2026-02-2485.8%
2026-09-01
Source-checked
110A.X-K2Other2026-08-1285.7%
2026-09-01
Source-checked
111Qwen3.5 122B A10B (Reasoning)Alibaba2026-02-2485.7%
2026-09-01
Source-checked
112Ring-2.6-1TOther2026-05-0885.7%
2026-09-01
Source-checked
113Solar Open2 250BOther2026-08-1285.7%
2026-09-01
Source-checked
114KAT Coder Pro V2Other2026-03-2785.5%
2026-09-01
Source-checked
115Ling 3.0 FlashOther2026-08-0485.5%
2026-09-01
Source-checked
116MiMo-V2-Omni-0327Xiaomi2026-03-2785.5%
2026-09-01
Source-checked
117MiMo-V2.5Xiaomi2026-04-2284.9%
2026-09-01
Source-checked
118MiniMax M2.5MiniMax2026-04-0184.8%
2026-09-01
Source-checked
119MiMo-V2-Flash (Reasoning)Xiaomi2025-12-1684.6%
2026-09-01
Source-checked
120JT-4.1 Flash 236B A21BOther2026-07-0984.5%
2026-09-01
Source-checked
121o3-proOpenAI2025-06-1084.5%
2026-09-01
Source-checked
122Grok 4.3 (low)xAI2026-04-3084.3%
2026-09-01
Source-checked
123Kimi K3 (low)Moonshot2026-07-1684.2%
2026-09-01
Source-checked
124Qwen3.6 27B (Reasoning)Alibaba2026-04-2284.2%
2026-09-01
Source-checked
125Qwen3.6 35B A3B (Reasoning)Alibaba2026-04-1684.1%
2026-09-01
Source-checked
126Claude Opus 4.6Anthropic2026-02-0584%
2026-09-01
Source-checked
127Kimi K2 ThinkingMoonshot2025-11-0683.8%
2026-09-01
Source-checked
128MiMo-V2-Flash (Feb 2026)Xiaomi2025-12-1683.5%
2026-09-01
Source-checked
129Muse GlimmerMeta2026-08-1083.5%
2026-09-01
Source-checked
130Claude 4.5 Sonnet (Reasoning)Anthropic2025-09-2983.4%
2026-09-01
Source-checked
131Motif 3Other2026-08-1283.4%
2026-09-01
Source-checked
132MiniMax-M2.1MiniMax2025-12-2383%
2026-09-01
Source-checked
133JT-35B-FlashOther2026-05-1482.9%
2026-09-01
Source-checked
134K-EXAONE 2.0 0803Other2026-08-1282.9%
2026-09-01
Source-checked
135Qwen3.6 27B (Non-reasoning)Alibaba2026-04-2282.9%
2026-09-01
Source-checked
136MiMo-V2-OmniXiaomi2026-03-1982.8%
2026-09-01
Source-checked
137OpenAI o3OpenAI2025-04-1682.7%
2026-09-01
Source-checked
138Qwen3.6 35B A3B (Non-reasoning)Alibaba2026-04-1681.7%
2026-09-01
Source-checked
139EXAONE 4.5 33BOther2026-04-0979.4%
2026-09-01
Source-checked
2Claude Sonnet 4.6Anthropic2026-02-1777.2%
Artificial Analysis GPQA Diamond evaluation2026-06-09
Needs audit
3GPT 5.5OpenAI2026-04-2381.2%
GPQA Diamond paper leaderboard2026-05-15
Source-checked
142Claude Opus 4.5Anthropic2025-11-2481%
2026-09-01
Source-checked
143Step 3.7 FlashStepFun2026-06-0180.9%
2026-09-01
Source-checked
3DeepSeek V4 Pro MaxDeepSeek2026-04-2475.6%
Artificial Analysis GPQA Diamond evaluation2026-06-09
Needs audit
4Claude Opus 4.8Anthropic2026-05-2879.8%
GPQA Diamond paper leaderboard2026-05-15
Source-checked
146Kimi K2.6 (Non-reasoning)Other2026-04-2078.8%
2026-09-01
Source-checked
147LongCat-2.0Meituan2026-06-2978%
2026-09-01
Source-checked
148Grok 4.20 0309 v2 (Non-reasoning)xAI2026-04-0777.6%
2026-09-01
Source-checked
149GPT-5.5 (Non-reasoning)OpenAI2026-04-2376.8%
2026-09-01
Source-checked
150MiMo-V2.5-Pro (Non-reasoning)Xiaomi2026-04-2276.2%
2026-09-01
Source-checked
151Command ACohere2026-03-1576.1%
2026-09-01
Source-checked
152North Mini CodeCohere2026-06-0975.7%
2026-09-01
Source-checked
153Gemma 4 12B (Reasoning)Google2026-06-0775.3%
2026-09-01
Source-checked
154Ling-2.6-1TOther2026-04-2375.2%
2026-09-01
Source-checked
155Mistral Medium 3.5Mistral2026-04-2974.8%
2026-09-01
Source-checked
156OpenAI o1OpenAI2024-09-1274.7%
2026-09-01
Source-checked
157Nemotron 3.5 LightningNVIDIA2026-08-1174.3%
2026-09-01
Source-checked
4Gemini 3.5 FlashGoogle2026-05-1974.1%
Artificial Analysis GPQA Diamond evaluation2026-06-09
Needs audit
5Qwen 3.7 MaxAlibaba2026-05-2073.8%
Artificial Analysis GPQA Diamond evaluation2026-06-09
Needs audit
160Ling 3.0 TinyOther2026-08-0673.4%
2026-09-01
Source-checked
161HyperNova 60B 2605Multiverse2026-05-0673.3%
2026-09-01
Source-checked
162Hy3-preview (Non-reasoning)Other2026-04-2373.2%
2026-09-01
Source-checked
163DeepSeek V4 Pro (Non-reasoning)DeepSeek2026-04-2471.7%
2026-09-01
Source-checked
164DeepSeek V4 Flash (Non-reasoning)DeepSeek2026-04-2471.6%
2026-09-01
Source-checked
6Mistral Large 3Mistral2025-12-0271.2%
Artificial Analysis GPQA Diamond evaluation2026-06-09
Needs audit
7Llama 4 MaverickMeta2026-04-0569.4%
Artificial Analysis GPQA Diamond evaluation2026-06-09
Needs audit
167GLM-5.2 (Non-reasoning)Zhipu2026-06-1668.6%
2026-09-01
Source-checked
168JT-MINIOther2026-04-1567.6%
2026-09-01
Source-checked
169DiffusionGemma 26B A4BGoogle2026-06-1066.9%
2026-09-01
Source-checked
170GLM-5 (Non-reasoning)Zhipu2026-02-1166.6%
2026-09-01
Source-checked
171Gemma 4 12B (Non-reasoning)Google2026-06-1066.1%
2026-09-01
Source-checked
172Grok 4.3 (Non-reasoning)xAI2026-04-3065.8%
2026-09-01
Source-checked
173Granite 4.2 30BOther2026-08-2564.4%
2026-09-01
Source-checked
174Granite 4.2 8BOther2026-08-2563.1%
2026-09-01
Source-checked
175Ling 2.6 FlashOther2026-04-2159.3%
2026-09-01
Source-checked
176Llama 4 ScoutMeta2026-04-0558.7%
2026-09-01
Source-checked
177Granite 4.2 3BOther2026-08-2555.9%
2026-09-01
Source-checked
178LFM2.5-8B-A1BLiquid2026-06-0851.3%
2026-09-01
Source-checked
179Claude 3 OpusAnthropic2024-03-0448.9%
2026-09-01
Source-checked
180Granite 4.1 30BOther2026-04-2948.1%
2026-09-01
Source-checked
181Nemotron 3 Nano Omni 30B A3B ReasoningNVIDIA2026-04-2946.9%
2026-09-01
Source-checked
182G9v3-3BOther2026-07-2343.8%
2026-09-01
Source-checked
183MiniCPM-V 4.6 1.3BOpenBMB2026-05-1130.5%
2026-09-01
Source-checked
184MiniCPM5-1B (Reasoning)OpenBMB2026-06-0427.8%
2026-09-01
Source-checked
185MiniCPM5-1B (Non-reasoning)OpenBMB2026-05-2526.9%
2026-09-01
Source-checked
Method

What it covers

This benchmark sits in the reasoning family. It uses 198 expert-validated multiple-choice questions in the Diamond set; designed to be 'Google-proof'. The score should travel with its task format, scoring method, source date, and benchmark version.

Score ceiling

Where it breaks down

PhD-level domain experts score ~65-74% in their own field; skilled non-experts with web access ~34%.

Tools that report it

Receipts

Sources and further reading

Questions about this benchmark

Every answer below is assembled from the dated fields on this page. Nothing is written separately for search.

What does GPQA Diamond measure?

Hard graduate-level science questions (biology, physics, chemistry) written so that non-experts cannot solve them even with web access — the 'Diamond' subset is the highest-quality, expert-validated slice.

What does a high GPQA Diamond score not prove?

A strong GPQA Diamond result says nothing about:

  • General usefulness — it is a narrow slice of frontier science, not everyday tasks.
  • Whether a model knows when it is out of its depth; it still answers every question.
  • Small size (198 Diamond questions) means a few lucky guesses move the score noticeably.

How is GPQA Diamond scored?

Accuracy (% correct). Task format: 198 expert-validated multiple-choice questions in the Diamond set; designed to be 'Google-proof'.

Is GPQA Diamond saturated?

GPQA Diamond is currently marked Active in the atlas. Ceiling context: PhD-level domain experts score ~65-74% in their own field; skilled non-experts with web access ~34%.

Can GPQA Diamond results be contaminated by training data?

Contamination risk for GPQA Diamond is graded Low contamination. Treat every row on this page as a public claim with a source and a date, not as a controlled experiment.

The Pack · Editorial newsletter

New tools in your inbox. Free.

One short email when a tool ships or changes status. No tracking, no third-party analytics. Unsubscribe in one click.