Why this benchmark is useful
Editorial brief pendingWe publish the methodology and ledger first; benchmark-specific analysis ships after desk review.
Benchmarks / Reasoning
Graduate-Level Google-Proof Q&A
Hard graduate-level science questions (biology, physics, chemistry) written so that non-experts cannot solve them even with web access — the 'Diamond' subset is the highest-quality, expert-validated slice.
Editorial brief pendingWe publish the methodology and ledger first; benchmark-specific analysis ships after desk review.
Reading guide pending. Use task format, scoring method, and source dates in the ledger until the desk brief ships.
Normalized to this benchmark's axis (0–100). Open the table for raw units.
Scores use this benchmark's own unit and axis, not a universal quality score.
| # | Model | Release date | Score | Provenance | Trust |
|---|---|---|---|---|---|
| 1 | Claude Mythos PreviewAnthropic | 2026-06-01 | 94.6% | GPQA Diamond paper leaderboard2026-06-02 | Source-checked |
| 2 | Gemini 3.1 Pro PreviewGoogle | 2026-02-19 | 94.1% | 2026-07-21 | Source-checked |
| 3 | GPT-5.6 SolOpenAI | 2026-07-09 | 94.1% | 2026-07-21 | Source-checked |
| 4 | Kimi K3Moonshot | 2026-07-16 | 93.5% | 2026-07-21 | Source-checked |
| 5 | GPT-5.5 (high)OpenAI | 2026-04-23 | 93.2% | 2026-07-21 | Source-checked |
| 6 | Grok 4.5xAI | 2026-07-08 | 93.1% | 2026-07-21 | Source-checked |
| 7 | MiniMax M3MiniMax | 2026-05-31 | 92.9% | 2026-07-21 | Source-checked |
| 8 | Claude Fable 5Anthropic | 2026-06-09 | 92.6% | 2026-07-21 | Source-checked |
| 9 | GPT-5.5 (medium)OpenAI | 2026-04-23 | 92.6% | 2026-07-21 | Source-checked |
| 10 | GPT-5.6 TerraOpenAI | 2026-07-09 | 92.5% | 2026-07-21 | Source-checked |
| 11 | Qwen3.7 MaxAlibaba | 2026-05-19 | 92.3% | 2026-07-21 | Source-checked |
| 12 | Gemini 3.5 Flash (medium)Google | 2026-05-19 | 92.1% | 2026-07-21 | Source-checked |
| 13 | GPT 5.4OpenAI | 2026-03-05 | 92% | 2026-07-21 | Source-checked |
| 14 | GPT-5.3 Codex (xhigh)OpenAI | 2026-02-05 | 91.5% | 2026-07-21 | Source-checked |
| 15 | Claude Opus 4.7Anthropic | 2026-04-16 | 91.4% | 2026-07-21 | Source-checked |
| 16 | Claude Sonnet 5Anthropic | 2026-06-30 | 91.1% | 2026-07-21 | Source-checked |
| 17 | GPT-5.6 LunaOpenAI | 2026-07-09 | 91.1% | 2026-07-21 | Source-checked |
| 18 | Grok 4.20 ReasoningxAI | 2026-03-05 | 91.1% | 2026-07-21 | Source-checked |
| 19 | GPT-5.5 (low)OpenAI | 2026-04-23 | 91% | 2026-07-21 | Source-checked |
| 20 | Gemini 3 ProGoogle | 2025-11-18 | 90.8% | 2026-07-21 | Source-checked |
| 1 | Kimi K2.6Moonshot | 2026-04-20 | 90.5% | GPQA Diamond paper leaderboard2026-05-15 | Source-checked |
| 22 | GPT-5.2OpenAI | 2025-12-11 | 90.3% | 2026-07-21 | Source-checked |
| 23 | Qwen 3.7 PlusAlibaba | 2026-06-02 | 90% | 2026-07-21 | Source-checked |
| 24 | Muse Spark 1.1Meta | 2026-07-09 | 89.8% | 2026-07-21 | Source-checked |
| 25 | Claude Opus 4.6 (Adaptive Reasoning, Max Effort)Anthropic | 2026-02-05 | 89.6% | 2026-07-21 | Source-checked |
| 26 | Kimi K2.7 CodeMoonshot | 2026-06-12 | 89.6% | 2026-07-21 | Source-checked |
| 27 | GLM-5.2Zhipu | 2026-06-13 | 89.5% | 2026-07-21 | Source-checked |
| 28 | DeepSeek V4 Pro (Reasoning, Max Effort)DeepSeek | 2026-04-24 | 88.8% | 2026-07-21 | Source-checked |
| 29 | Claude Opus 4.7 (Non-reasoning, High Effort)Anthropic | 2026-04-16 | 88.5% | 2026-07-21 | Source-checked |
| 30 | Muse SparkOther | 2026-01-01 | 88.4% | 2026-07-21 | Source-checked |
| 31 | Kimi K2.5Moonshot | 2026-01-27 | 87.9% | 2026-07-21 | Source-checked |
| 32 | GPT-5.4 MiniOpenAI | 2026-03-17 | 87.5% | 2026-07-21 | Source-checked |
| 33 | MiniMax M2.7MiniMax | 2026-04-15 | 87.4% | 2026-07-21 | Source-checked |
| 34 | GPT-5.1OpenAI | 2025-11-13 | 87.3% | 2026-07-21 | Source-checked |
| 35 | GLM-5.1Zhipu | 2026-04-07 | 86.8% | 2026-07-21 | Source-checked |
| 36 | Nemotron 3 Ultra 550B A55B (Reasoning)NVIDIA | 2026-06-04 | 86.7% | 2026-07-21 | Source-checked |
| 37 | MiMo-V2.5-ProXiaomi | 2026-04-22 | 86.6% | 2026-07-21 | Source-checked |
| 38 | MiniMax M2.5MiniMax | 2026-04-01 | 84.8% | 2026-07-21 | Source-checked |
| 39 | Claude Opus 4.6Anthropic | 2026-02-05 | 84% | 2026-07-21 | Source-checked |
| 40 | OpenAI o3OpenAI | 2025-04-16 | 82.7% | 2026-07-21 | Source-checked |
| 41 | GPT-5.4 NanoOpenAI | 2026-03-17 | 81.7% | 2026-07-21 | Source-checked |
| 42 | Claude Opus 4.5Anthropic | 2025-11-24 | 81% | 2026-07-21 | Source-checked |
| 43 | Step 3.7 FlashStepFun | 2026-06-01 | 80.9% | 2026-07-21 | Source-checked |
| 1 | Gemini 3.1 ProGoogleCoT prompting. PhD-level science MCQ. | 2026-02-19 | 78.4% | Artificial Analysis GPQA Diamond evaluation2026-06-09 | Needs audit |
| 2 | Grok 4.3xAI | 2026-04-30 | 88% | GPQA Diamond paper leaderboard2026-05-15 | Source-checked |
| 46 | Claude Sonnet 4.6 (Adaptive Reasoning, Max Effort)Anthropic | 2026-02-17 | 87.5% | 2026-07-21 | Source-checked |
| 47 | Gemma 4 31B ITGoogle | 2026-03-01 | 85.7% | 2026-07-21 | Source-checked |
| 48 | Gemini 3.1 Flash LiteGoogle | 2026-05-07 | 82.2% | 2026-07-21 | Source-checked |
| 49 | DeepSeek R1DeepSeek | 2025-01-20 | 81.3% | 2026-07-21 | Source-checked |
| 50 | LongCat-2.0Meituan | 2026-06-29 | 78% | 2026-07-21 | Source-checked |
| 2 | Claude Sonnet 4.6Anthropic | 2026-02-17 | 77.2% | Artificial Analysis GPQA Diamond evaluation2026-06-09 | Needs audit |
| 3 | GPT 5.5OpenAI | 2026-04-23 | 81.2% | GPQA Diamond paper leaderboard2026-05-15 | Source-checked |
| 53 | Gemini 3 Flash PreviewGoogle | 2025-12-17 | 81.2% | 2026-07-21 | Source-checked |
| 54 | North Mini CodeCohere | 2026-06-09 | 75.7% | 2026-07-21 | Source-checked |
| 3 | DeepSeek V4 Pro MaxDeepSeek | 2026-04-24 | 75.6% | Artificial Analysis GPQA Diamond evaluation2026-06-09 | Needs audit |
| 4 | Claude Opus 4.8Anthropic | 2026-05-28 | 79.8% | GPQA Diamond paper leaderboard2026-05-15 | Source-checked |
| 57 | Gemma 4 12B (Reasoning)Google | 2026-06-07 | 75.3% | 2026-07-21 | Source-checked |
| 58 | OpenAI o1OpenAI | 2024-09-12 | 74.7% | 2026-07-21 | Source-checked |
| 4 | Gemini 3.5 FlashGoogle | 2026-05-19 | 74.1% | Artificial Analysis GPQA Diamond evaluation2026-06-09 | Needs audit |
| 5 | Qwen 3.7 MaxAlibaba | 2026-05-20 | 73.8% | Artificial Analysis GPQA Diamond evaluation2026-06-09 | Needs audit |
| 61 | HyperNova 60B 2605Multiverse | 2026-05-06 | 73.3% | 2026-07-21 | Source-checked |
| 6 | Mistral Large 3Mistral | 2025-12-02 | 71.2% | Artificial Analysis GPQA Diamond evaluation2026-06-09 | Needs audit |
| 7 | Llama 4 MaverickMeta | 2026-04-05 | 69.4% | Artificial Analysis GPQA Diamond evaluation2026-06-09 | Needs audit |
| 64 | Gemma 4 12B (Non-reasoning)Google | 2026-06-10 | 66.1% | 2026-07-21 | Source-checked |
| 65 | Llama 4 ScoutMeta | 2026-04-05 | 58.7% | 2026-07-21 | Source-checked |
| 66 | Command ACohere | 2026-03-15 | 52.7% | 2026-07-21 | Source-checked |
| 67 | LFM2.5-8B-A1BLiquid | 2026-06-08 | 51.3% | 2026-07-21 | Source-checked |
| 68 | Claude 3 OpusAnthropic | 2024-03-04 | 48.9% | 2026-07-21 | Source-checked |
| 69 | MiniCPM5-1B (Reasoning)OpenBMB | 2026-06-04 | 27.8% | 2026-07-21 | Source-checked |
Data-quality note pending. Every ledger row still carries source URL, source date, and ingest timestamp.
PhD-level domain experts score ~65-74% in their own field; skilled non-experts with web access ~34%.
The Pack · Editorial newsletter
One short email when a card ships or changes status. No tracking, no third-party analytics. Unsubscribe in one click.