Benchmarks / Reasoning

GPQA Diamond

Graduate-Level Google-Proof Q&A

Schwere Wissenschaftsfragen auf Graduiertenniveau (Biologie, Physik, Chemie), so geschrieben, dass Laien sie auch mit Websuche nicht lösen — die 'Diamond'-Teilmenge ist der hochwertigste, von Experten geprüfte Anteil.

ReasoningSolidAktivNiedriges KontaminationsrisikoSeit 2023
Was dieser Benchmark nicht misst
  • Allgemeine Nützlichkeit — ein schmaler Ausschnitt der Spitzenwissenschaft, keine Alltagsaufgaben.
  • Ob ein Modell merkt, wann es überfordert ist; es beantwortet trotzdem jede Frage.
  • Geringe Größe (198 Diamond-Fragen) — wenige Glückstreffer verschieben den Wert spürbar.
Analyse

Warum dieser Benchmark nützlich ist

Redaktionelle Einordnung ausstehendWir veröffentlichen zuerst Methodik und Ledger. Die benchmark-spezifische Analyse folgt nach der Desk-Prüfung.

Umfang

Abdeckung

Aufgabenfamilie
Reasoning
Format
198 von Experten geprüfte Multiple-Choice-Fragen im Diamond-Satz; 'Google-sicher' konzipiert.
Bewertung
Genauigkeit (% korrekt).
Verantwortliche Stelle
Rein et al.
Lesehilfe

So liest du die Scores

Die Lesehilfe steht noch aus. Nutze bis zur Desk-Einordnung Aufgabenformat, Bewertungsmethode und Quelldaten im Ledger.

Blinde Flecken

Was er nicht abdeckt

  • Allgemeine Nützlichkeit — ein schmaler Ausschnitt der Spitzenwissenschaft, keine Alltagsaufgaben.
  • Ob ein Modell merkt, wann es überfordert ist; es beantwortet trotzdem jede Frage.
  • Geringe Größe (198 Diamond-Fragen) — wenige Glückstreffer verschieben den Wert spürbar.
Scores

Evidenz-Ledger

69 Zeilen
6969 Zeilen
94.6%bester Score
62quellgeprüft
2Quellen
2026-07-21bis 2026-05-15
57

api · api

Papers / model cards12

manual-snapshot · manual

Verteilung

Wo die Zeilen liegen

0255075100

Auf die Skala dieses Benchmarks normalisiert (0–100). Die Tabelle zeigt die Rohwerte.

Zeitverlauf

Neueste Belege

  1. Gemini 3.1 Pro Preview94.1% ·
  2. GPT-5.6 Sol94.1% ·
  3. Kimi K393.5% ·
  4. GPT-5.5 (high)93.2% ·
  5. Grok 4.593.1% ·

Scores nutzen die eigene Einheit und Skala dieses Benchmarks, keinen universellen Qualitätswert.

#ModellVeröffentlichungScoreHerkunftBeleglage
1Claude Mythos PreviewAnthropic2026-06-0194.6%
GPQA Diamond paper leaderboard2026-06-02
Quelle geprüft
2Gemini 3.1 Pro PreviewGoogle2026-02-1994.1%
2026-07-21
Quelle geprüft
3GPT-5.6 SolOpenAI2026-07-0994.1%
2026-07-21
Quelle geprüft
4Kimi K3Moonshot2026-07-1693.5%
2026-07-21
Quelle geprüft
5GPT-5.5 (high)OpenAI2026-04-2393.2%
2026-07-21
Quelle geprüft
6Grok 4.5xAI2026-07-0893.1%
2026-07-21
Quelle geprüft
7MiniMax M3MiniMax2026-05-3192.9%
2026-07-21
Quelle geprüft
8Claude Fable 5Anthropic2026-06-0992.6%
2026-07-21
Quelle geprüft
9GPT-5.5 (medium)OpenAI2026-04-2392.6%
2026-07-21
Quelle geprüft
10GPT-5.6 TerraOpenAI2026-07-0992.5%
2026-07-21
Quelle geprüft
11Qwen3.7 MaxAlibaba2026-05-1992.3%
2026-07-21
Quelle geprüft
12Gemini 3.5 Flash (medium)Google2026-05-1992.1%
2026-07-21
Quelle geprüft
13GPT 5.4OpenAI2026-03-0592%
2026-07-21
Quelle geprüft
14GPT-5.3 Codex (xhigh)OpenAI2026-02-0591.5%
2026-07-21
Quelle geprüft
15Claude Opus 4.7Anthropic2026-04-1691.4%
2026-07-21
Quelle geprüft
16Claude Sonnet 5Anthropic2026-06-3091.1%
2026-07-21
Quelle geprüft
17GPT-5.6 LunaOpenAI2026-07-0991.1%
2026-07-21
Quelle geprüft
18Grok 4.20 ReasoningxAI2026-03-0591.1%
2026-07-21
Quelle geprüft
19GPT-5.5 (low)OpenAI2026-04-2391%
2026-07-21
Quelle geprüft
20Gemini 3 ProGoogle2025-11-1890.8%
2026-07-21
Quelle geprüft
1Kimi K2.6Moonshot2026-04-2090.5%
GPQA Diamond paper leaderboard2026-05-15
Quelle geprüft
22GPT-5.2OpenAI2025-12-1190.3%
2026-07-21
Quelle geprüft
23Qwen 3.7 PlusAlibaba2026-06-0290%
2026-07-21
Quelle geprüft
24Muse Spark 1.1Meta2026-07-0989.8%
2026-07-21
Quelle geprüft
25Claude Opus 4.6 (Adaptive Reasoning, Max Effort)Anthropic2026-02-0589.6%
2026-07-21
Quelle geprüft
26Kimi K2.7 CodeMoonshot2026-06-1289.6%
2026-07-21
Quelle geprüft
27GLM-5.2Zhipu2026-06-1389.5%
2026-07-21
Quelle geprüft
28DeepSeek V4 Pro (Reasoning, Max Effort)DeepSeek2026-04-2488.8%
2026-07-21
Quelle geprüft
29Claude Opus 4.7 (Non-reasoning, High Effort)Anthropic2026-04-1688.5%
2026-07-21
Quelle geprüft
30Muse SparkOther2026-01-0188.4%
2026-07-21
Quelle geprüft
31Kimi K2.5Moonshot2026-01-2787.9%
2026-07-21
Quelle geprüft
32GPT-5.4 MiniOpenAI2026-03-1787.5%
2026-07-21
Quelle geprüft
33MiniMax M2.7MiniMax2026-04-1587.4%
2026-07-21
Quelle geprüft
34GPT-5.1OpenAI2025-11-1387.3%
2026-07-21
Quelle geprüft
35GLM-5.1Zhipu2026-04-0786.8%
2026-07-21
Quelle geprüft
36Nemotron 3 Ultra 550B A55B (Reasoning)NVIDIA2026-06-0486.7%
2026-07-21
Quelle geprüft
37MiMo-V2.5-ProXiaomi2026-04-2286.6%
2026-07-21
Quelle geprüft
38MiniMax M2.5MiniMax2026-04-0184.8%
2026-07-21
Quelle geprüft
39Claude Opus 4.6Anthropic2026-02-0584%
2026-07-21
Quelle geprüft
40OpenAI o3OpenAI2025-04-1682.7%
2026-07-21
Quelle geprüft
41GPT-5.4 NanoOpenAI2026-03-1781.7%
2026-07-21
Quelle geprüft
42Claude Opus 4.5Anthropic2025-11-2481%
2026-07-21
Quelle geprüft
43Step 3.7 FlashStepFun2026-06-0180.9%
2026-07-21
Quelle geprüft
1Gemini 3.1 ProGoogleCoT prompting. PhD-level science MCQ.2026-02-1978.4%
Artificial Analysis GPQA Diamond evaluation2026-06-09
Prüfung nötig
2Grok 4.3xAI2026-04-3088%
GPQA Diamond paper leaderboard2026-05-15
Quelle geprüft
46Claude Sonnet 4.6 (Adaptive Reasoning, Max Effort)Anthropic2026-02-1787.5%
2026-07-21
Quelle geprüft
47Gemma 4 31B ITGoogle2026-03-0185.7%
2026-07-21
Quelle geprüft
48Gemini 3.1 Flash LiteGoogle2026-05-0782.2%
2026-07-21
Quelle geprüft
49DeepSeek R1DeepSeek2025-01-2081.3%
2026-07-21
Quelle geprüft
50LongCat-2.0Meituan2026-06-2978%
2026-07-21
Quelle geprüft
2Claude Sonnet 4.6Anthropic2026-02-1777.2%
Artificial Analysis GPQA Diamond evaluation2026-06-09
Prüfung nötig
3GPT 5.5OpenAI2026-04-2381.2%
GPQA Diamond paper leaderboard2026-05-15
Quelle geprüft
53Gemini 3 Flash PreviewGoogle2025-12-1781.2%
2026-07-21
Quelle geprüft
54North Mini CodeCohere2026-06-0975.7%
2026-07-21
Quelle geprüft
3DeepSeek V4 Pro MaxDeepSeek2026-04-2475.6%
Artificial Analysis GPQA Diamond evaluation2026-06-09
Prüfung nötig
4Claude Opus 4.8Anthropic2026-05-2879.8%
GPQA Diamond paper leaderboard2026-05-15
Quelle geprüft
57Gemma 4 12B (Reasoning)Google2026-06-0775.3%
2026-07-21
Quelle geprüft
58OpenAI o1OpenAI2024-09-1274.7%
2026-07-21
Quelle geprüft
4Gemini 3.5 FlashGoogle2026-05-1974.1%
Artificial Analysis GPQA Diamond evaluation2026-06-09
Prüfung nötig
5Qwen 3.7 MaxAlibaba2026-05-2073.8%
Artificial Analysis GPQA Diamond evaluation2026-06-09
Prüfung nötig
61HyperNova 60B 2605Multiverse2026-05-0673.3%
2026-07-21
Quelle geprüft
6Mistral Large 3Mistral2025-12-0271.2%
Artificial Analysis GPQA Diamond evaluation2026-06-09
Prüfung nötig
7Llama 4 MaverickMeta2026-04-0569.4%
Artificial Analysis GPQA Diamond evaluation2026-06-09
Prüfung nötig
64Gemma 4 12B (Non-reasoning)Google2026-06-1066.1%
2026-07-21
Quelle geprüft
65Llama 4 ScoutMeta2026-04-0558.7%
2026-07-21
Quelle geprüft
66Command ACohere2026-03-1552.7%
2026-07-21
Quelle geprüft
67LFM2.5-8B-A1BLiquid2026-06-0851.3%
2026-07-21
Quelle geprüft
68Claude 3 OpusAnthropic2024-03-0448.9%
2026-07-21
Quelle geprüft
69MiniCPM5-1B (Reasoning)OpenBMB2026-06-0427.8%
2026-07-21
Quelle geprüft
Methode

Was er abdeckt

Die Notiz zur Datenqualität steht aus. Jede Ledger-Zeile trägt weiterhin Quellen-URL, Quelldatum und Zeitpunkt des Einlesens.

Score-Obergrenze

Wo er an Grenzen stößt

Promovierte Fachexperten erreichen ~65-74 % im eigenen Fach; geübte Laien mit Websuche ~34 %.

Tools, die ihn ausweisen

Belege

Quellen und weiterführende Lektüre

The Pack · Redaktionsnewsletter

Neue Karten in dein Postfach. Kostenlos.

Eine kurze E-Mail, wenn eine Karte erscheint oder den Status wechselt. Kein Tracking, keine Drittanbieter-Analytics. Abmeldung mit einem Klick.