Benchmarks / Reasoning

GPQA Diamond

Graduate-Level Google-Proof Q&A

Schwere Wissenschaftsfragen auf Graduiertenniveau (Biologie, Physik, Chemie), so geschrieben, dass Laien sie auch mit Websuche nicht lösen — die 'Diamond'-Teilmenge ist der hochwertigste, von Experten geprüfte Anteil.

Was dieser Benchmark nicht misst
  • Allgemeine Nützlichkeit — ein schmaler Ausschnitt der Spitzenwissenschaft, keine Alltagsaufgaben.
  • Ob ein Modell merkt, wann es überfordert ist; es beantwortet trotzdem jede Frage.
  • Geringe Größe (198 Diamond-Fragen) — wenige Glückstreffer verschieben den Wert spürbar.
Analyse

Warum dieser Benchmark nützlich ist

Wenn du Graduierten-Wissenschaft willst, die Laien schwer googeln — ein schmaler, aber noch trennender Wissens-/Reasoning-Ausschnitt.

Umfang

Abdeckung

Aufgabenfamilie
Reasoning
Format
198 von Experten geprüfte Multiple-Choice-Fragen im Diamond-Satz; 'Google-sicher' konzipiert.
Bewertung
Genauigkeit (% korrekt).
Verantwortliche Stelle
Rein et al.
Lesehilfe

So liest du die Scores

Genauigkeit auf 198 Diamond-MCQs. Kleiner Satz: wenige Glückstreffer verschieben den Wert. Mit Experten- (~65–74 %) und Web-Laien-Decke (~34 %) vergleichen, nicht mit Alltagsnutzen.

Blinde Flecken

Was er nicht abdeckt

  • Allgemeine Nützlichkeit — ein schmaler Ausschnitt der Spitzenwissenschaft, keine Alltagsaufgaben.
  • Ob ein Modell merkt, wann es überfordert ist; es beantwortet trotzdem jede Frage.
  • Geringe Größe (198 Diamond-Fragen) — wenige Glückstreffer verschieben den Wert spürbar.
Scores

Evidenz-Ledger

185 Zeilen
185185 Zeilen
94.9%bester Score
178quellgeprüft
2Quellen
2026-09-01bis 2026-05-15
173

api · api

Papers / model cards12

manual-snapshot · manual

Verteilung

Wo die Zeilen liegen

0255075100

Auf die Skala dieses Benchmarks normalisiert (0–100). Die Tabelle zeigt die Rohwerte.

Zeitverlauf

Neueste Belege

  1. Grok 4.694.9% ·
  2. Gemini 3.7 Flash94.5% ·
  3. Gemini 3.1 Pro Preview94.1% ·
  4. GPT-5.6 Sol94.1% ·
  5. Claude Opus 5 (Adaptive Reasoning, High Effort)93.7% ·

Scores nutzen die eigene Einheit und Skala dieses Benchmarks, keinen universellen Qualitätswert.

#ModellVeröffentlichungScoreHerkunftBeleglage
1Grok 4.6xAI2026-08-1294.9%
2026-09-01
Quelle geprüft
1Claude Mythos PreviewAnthropic2026-06-0194.6%
GPQA Diamond paper leaderboard2026-06-02
Quelle geprüft
3Gemini 3.7 FlashGoogle2026-08-1394.5%
2026-09-01
Quelle geprüft
4Gemini 3.1 Pro PreviewGoogle2026-02-1994.1%
2026-09-01
Quelle geprüft
5GPT-5.6 SolOpenAI2026-07-0994.1%
2026-09-01
Quelle geprüft
6Claude Opus 5 (Adaptive Reasoning, High Effort)Anthropic2026-07-2493.7%
2026-09-01
Quelle geprüft
7Claude Opus 5 (Adaptive Reasoning, Xhigh Effort)Anthropic2026-07-2493.7%
2026-09-01
Quelle geprüft
8Kimi K3Moonshot2026-07-1693.5%
2026-09-01
Quelle geprüft
9Qwen3.8 2.4T A95BAlibaba2026-08-1293.5%
2026-09-01
Quelle geprüft
10Claude Opus 5 (Adaptive Reasoning, Max Effort)Anthropic2026-07-2493.2%
2026-09-01
Quelle geprüft
11GPT-5.5 (high)OpenAI2026-04-2393.2%
2026-09-01
Quelle geprüft
12Grok 4.5xAI2026-07-0893.1%
2026-09-01
Quelle geprüft
13MiniMax M3MiniMax2026-05-3192.9%
2026-09-01
Quelle geprüft
14DeepSeek V4 Pro 0813 (Reasoning, Max Effort)DeepSeek2026-08-1392.8%
2026-09-01
Quelle geprüft
15Gemini 3.6 Flash (high)Google2026-07-2192.8%
2026-09-01
Quelle geprüft
16Qwen3.8 MaxAlibaba2026-08-0392.7%
2026-09-01
Quelle geprüft
17Claude Fable 5Anthropic2026-06-0992.6%
2026-09-01
Quelle geprüft
18GPT-5.5 (medium)OpenAI2026-04-2392.6%
2026-09-01
Quelle geprüft
19GPT-5.6 TerraOpenAI2026-07-0992.5%
2026-09-01
Quelle geprüft
20Qwen3.7 MaxAlibaba2026-05-1992.3%
2026-09-01
Quelle geprüft
21Qwen3.8-Flash-NextAlibaba2026-08-2692.3%
2026-09-01
Quelle geprüft
22Gemini 3.5 Flash (medium)Google2026-05-1992.1%
2026-09-01
Quelle geprüft
23GPT 5.4OpenAI2026-03-0592%
2026-09-01
Quelle geprüft
24Claude Opus 5 (Adaptive Reasoning, Medium Effort)Anthropic2026-07-2491.9%
2026-09-01
Quelle geprüft
25GLM-5.3Zhipu2026-08-1491.7%
2026-09-01
Quelle geprüft
26GPT-5.3 Codex (xhigh)OpenAI2026-02-0591.5%
2026-09-01
Quelle geprüft
27Claude Opus 4.7Anthropic2026-04-1691.4%
2026-09-01
Quelle geprüft
28DeepSeek V4 Flash Vision (Reasoning, Max Effort)DeepSeek2026-08-2191.3%
2026-09-01
Quelle geprüft
29GLM-5.3-FlashZhipu2026-08-2691.2%
2026-09-01
Quelle geprüft
30Claude Sonnet 5Anthropic2026-06-3091.1%
2026-09-01
Quelle geprüft
31GPT-5.6 LunaOpenAI2026-07-0991.1%
2026-09-01
Quelle geprüft
32Grok 4.20 ReasoningxAI2026-03-0591.1%
2026-09-01
Quelle geprüft
33GPT-5.5 (low)OpenAI2026-04-2391%
2026-09-01
Quelle geprüft
34DeepSeek V4 Flash 0731 (Reasoning, Max Effort)DeepSeek2026-07-3190.8%
2026-09-01
Quelle geprüft
35Gemini 3 ProGoogle2025-11-1890.8%
2026-09-01
Quelle geprüft
1Kimi K2.6Moonshot2026-04-2090.5%
GPQA Diamond paper leaderboard2026-05-15
Quelle geprüft
37Agnes 2.5 Pro BetaOther2026-08-2690.5%
2026-09-01
Quelle geprüft
38DeepSeek V4 Pro (Reasoning, High Effort)DeepSeek2026-04-2490.5%
2026-09-01
Quelle geprüft
39Qwen3.8 27BAlibaba2026-08-1490.5%
2026-09-01
Quelle geprüft
40Muse Spark 1.2Meta2026-08-0590.4%
2026-09-01
Quelle geprüft
41GPT-5.2OpenAI2025-12-1190.3%
2026-09-01
Quelle geprüft
42Qwen 3.7 PlusAlibaba2026-06-0290%
2026-09-01
Quelle geprüft
43GPT-5.2 Codex (xhigh)OpenAI2025-12-1189.9%
2026-09-01
Quelle geprüft
44Gemini 3 Flash Preview (Reasoning)Google2025-12-1789.8%
2026-09-01
Quelle geprüft
45Muse Spark 1.1Meta2026-07-0989.8%
2026-09-01
Quelle geprüft
46Hy3Other2026-07-0689.7%
2026-09-01
Quelle geprüft
47Claude Opus 4.6 (Adaptive Reasoning, Max Effort)Anthropic2026-02-0589.6%
2026-09-01
Quelle geprüft
48Kimi K2.7 CodeMoonshot2026-06-1289.6%
2026-09-01
Quelle geprüft
49GLM-5.2Zhipu2026-06-1389.5%
2026-09-01
Quelle geprüft
50Grok Build 0.1 0616xAI2026-06-1689.5%
2026-09-01
Quelle geprüft
51Inkling SmallOther2026-07-3089.5%
2026-09-01
Quelle geprüft
52Qwen3.5 397B A17B (Reasoning)Alibaba2026-02-1689.3%
2026-09-01
Quelle geprüft
53Nex-N2-ProOther2026-06-0289.2%
2026-09-01
Quelle geprüft
54Solar Pro 4Other2026-08-0689.1%
2026-09-01
Quelle geprüft
55Grok 4.3 (medium)xAI2026-04-3089%
2026-09-01
Quelle geprüft
56Claude Opus 5 (Adaptive Reasoning, Low Effort)Anthropic2026-07-2488.9%
2026-09-01
Quelle geprüft
57Qwen3.6 Max PreviewAlibaba2026-04-2088.8%
2026-09-01
Quelle geprüft
58Gemini 3 Pro Preview (low)Google2025-11-1888.7%
2026-09-01
Quelle geprüft
59Claude Opus 4.7 (Non-reasoning, High Effort)Anthropic2026-04-1688.5%
2026-09-01
Quelle geprüft
60Grok 4.20 0309 (Reasoning)xAI2026-03-1088.5%
2026-09-01
Quelle geprüft
61Muse SparkOther2026-01-0188.4%
2026-09-01
Quelle geprüft
62Qwen3.6 PlusAlibaba2026-04-0288.2%
2026-09-01
Quelle geprüft
63Claude Sonnet 4.6 (Adaptive Reasoning, Max Effort)Anthropic2026-02-1787.5%
2026-09-01
Quelle geprüft
64GPT-5.4 MiniOpenAI2026-03-1787.5%
2026-09-01
Quelle geprüft
65GPT-5.1OpenAI2025-11-1387.3%
2026-09-01
Quelle geprüft
66GPT-5.4 (low)OpenAI2026-03-0587.1%
2026-09-01
Quelle geprüft
67GLM-5.1Zhipu2026-04-0786.8%
2026-09-01
Quelle geprüft
68DeepSeek V4 Flash (Reasoning, High Effort)DeepSeek2026-04-2486.7%
2026-09-01
Quelle geprüft
69Claude Opus 4.5 (Reasoning)Anthropic2025-11-2486.6%
2026-09-01
Quelle geprüft
70Apodex 1.1Other2026-08-3086.4%
2026-09-01
Quelle geprüft
71GPT-5.2 (medium)OpenAI2025-12-1186.4%
2026-09-01
Quelle geprüft
72GPT-5.1 Codex (high)OpenAI2025-11-1386%
2026-09-01
Quelle geprüft
73GLM-4.7 (Reasoning)Zhipu2025-12-2285.9%
2026-09-01
Quelle geprüft
74Gemma 4 31B ITGoogle2026-03-0185.7%
2026-09-01
Quelle geprüft
75GPT-5 (high)OpenAI2025-08-0785.4%
2026-09-01
Quelle geprüft
76GLM-5-TurboZhipu2026-03-1584.7%
2026-09-01
Quelle geprüft
77GPT-5.5 Instant (May 2026)OpenAI2026-05-0584.6%
2026-09-01
Quelle geprüft
78GPT-5 (medium)OpenAI2025-08-0784.2%
2026-09-01
Quelle geprüft
79DeepSeek V3.2 (Reasoning)DeepSeek2025-12-0184%
2026-09-01
Quelle geprüft
80Gemini 3.5 Flash-LiteGoogle2026-07-2183.8%
2026-09-01
Quelle geprüft
81GPT-5 Codex (high)OpenAI2025-09-2383.7%
2026-09-01
Quelle geprüft
82Gemini 3.5 Flash (minimal)Google2026-05-1982.8%
2026-09-01
Quelle geprüft
83GPT-5.5 Instant (June 2026)OpenAI2026-06-2582.3%
2026-09-01
Quelle geprüft
84Gemini 3.1 Flash LiteGoogle2026-05-0782.2%
2026-09-01
Quelle geprüft
85GLM-5 (Reasoning)Zhipu2026-02-1182%
2026-09-01
Quelle geprüft
86GPT-5.4 NanoOpenAI2026-03-1781.7%
2026-09-01
Quelle geprüft
87DeepSeek R1DeepSeek2025-01-2081.3%
2026-09-01
Quelle geprüft
88Gemini 3 Flash PreviewGoogle2025-12-1781.2%
2026-09-01
Quelle geprüft
89Claude 4.1 Opus (Reasoning)Anthropic2025-08-0580.9%
2026-09-01
Quelle geprüft
90GLM 5V Turbo (Reasoning)Zhipu2026-04-0180.9%
2026-09-01
Quelle geprüft
91GPT-5 (low)OpenAI2025-08-0780.8%
2026-09-01
Quelle geprüft
92G9v3-39A5BOther2026-08-0380.5%
2026-09-01
Quelle geprüft
93Claude Sonnet 4.6 (Non-reasoning, Low Effort)Anthropic2026-02-1779.7%
2026-09-01
Quelle geprüft
94Claude 4 Opus (Reasoning)Anthropic2025-05-2279.6%
2026-09-01
Quelle geprüft
1Gemini 3.1 ProGoogleCoT prompting. PhD-level science MCQ.2026-02-1978.4%
Artificial Analysis GPQA Diamond evaluation2026-06-09
Prüfung nötig
2Grok 4.3xAI2026-04-3088%
GPQA Diamond paper leaderboard2026-05-15
Quelle geprüft
97Kimi K2.5Moonshot2026-01-2787.9%
2026-09-01
Quelle geprüft
98Grok 4xAI2025-07-1087.7%
2026-09-01
Quelle geprüft
99Agnes 2.5 Pro AlphaOther2026-07-2487.6%
2026-09-01
Quelle geprüft
100MiniMax M2.7MiniMax2026-04-1587.4%
2026-09-01
Quelle geprüft
101Inkling (xhigh)Other2026-07-1587.2%
2026-09-01
Quelle geprüft
102MiMo-V2-ProXiaomi2026-03-1887%
2026-09-01
Quelle geprüft
103Motif 3 (Beta)Other2026-07-2186.9%
2026-09-01
Quelle geprüft
104Hy3-preview (Reasoning)Other2026-04-2386.7%
2026-09-01
Quelle geprüft
105Nemotron 3 Ultra 550B A55B (Reasoning)NVIDIA2026-06-0486.7%
2026-09-01
Quelle geprüft
106MiMo-V2.5-ProXiaomi2026-04-2286.6%
2026-09-01
Quelle geprüft
107Qwen3 Max ThinkingAlibaba2026-01-2686.1%
2026-09-01
Quelle geprüft
108Qwen3.5 397B A17B (Non-reasoning)Alibaba2026-02-1686.1%
2026-09-01
Quelle geprüft
109Qwen3.5 27B (Reasoning)Alibaba2026-02-2485.8%
2026-09-01
Quelle geprüft
110A.X-K2Other2026-08-1285.7%
2026-09-01
Quelle geprüft
111Qwen3.5 122B A10B (Reasoning)Alibaba2026-02-2485.7%
2026-09-01
Quelle geprüft
112Ring-2.6-1TOther2026-05-0885.7%
2026-09-01
Quelle geprüft
113Solar Open2 250BOther2026-08-1285.7%
2026-09-01
Quelle geprüft
114KAT Coder Pro V2Other2026-03-2785.5%
2026-09-01
Quelle geprüft
115Ling 3.0 FlashOther2026-08-0485.5%
2026-09-01
Quelle geprüft
116MiMo-V2-Omni-0327Xiaomi2026-03-2785.5%
2026-09-01
Quelle geprüft
117MiMo-V2.5Xiaomi2026-04-2284.9%
2026-09-01
Quelle geprüft
118MiniMax M2.5MiniMax2026-04-0184.8%
2026-09-01
Quelle geprüft
119MiMo-V2-Flash (Reasoning)Xiaomi2025-12-1684.6%
2026-09-01
Quelle geprüft
120JT-4.1 Flash 236B A21BOther2026-07-0984.5%
2026-09-01
Quelle geprüft
121o3-proOpenAI2025-06-1084.5%
2026-09-01
Quelle geprüft
122Grok 4.3 (low)xAI2026-04-3084.3%
2026-09-01
Quelle geprüft
123Kimi K3 (low)Moonshot2026-07-1684.2%
2026-09-01
Quelle geprüft
124Qwen3.6 27B (Reasoning)Alibaba2026-04-2284.2%
2026-09-01
Quelle geprüft
125Qwen3.6 35B A3B (Reasoning)Alibaba2026-04-1684.1%
2026-09-01
Quelle geprüft
126Claude Opus 4.6Anthropic2026-02-0584%
2026-09-01
Quelle geprüft
127Kimi K2 ThinkingMoonshot2025-11-0683.8%
2026-09-01
Quelle geprüft
128MiMo-V2-Flash (Feb 2026)Xiaomi2025-12-1683.5%
2026-09-01
Quelle geprüft
129Muse GlimmerMeta2026-08-1083.5%
2026-09-01
Quelle geprüft
130Claude 4.5 Sonnet (Reasoning)Anthropic2025-09-2983.4%
2026-09-01
Quelle geprüft
131Motif 3Other2026-08-1283.4%
2026-09-01
Quelle geprüft
132MiniMax-M2.1MiniMax2025-12-2383%
2026-09-01
Quelle geprüft
133JT-35B-FlashOther2026-05-1482.9%
2026-09-01
Quelle geprüft
134K-EXAONE 2.0 0803Other2026-08-1282.9%
2026-09-01
Quelle geprüft
135Qwen3.6 27B (Non-reasoning)Alibaba2026-04-2282.9%
2026-09-01
Quelle geprüft
136MiMo-V2-OmniXiaomi2026-03-1982.8%
2026-09-01
Quelle geprüft
137OpenAI o3OpenAI2025-04-1682.7%
2026-09-01
Quelle geprüft
138Qwen3.6 35B A3B (Non-reasoning)Alibaba2026-04-1681.7%
2026-09-01
Quelle geprüft
139EXAONE 4.5 33BOther2026-04-0979.4%
2026-09-01
Quelle geprüft
2Claude Sonnet 4.6Anthropic2026-02-1777.2%
Artificial Analysis GPQA Diamond evaluation2026-06-09
Prüfung nötig
3GPT 5.5OpenAI2026-04-2381.2%
GPQA Diamond paper leaderboard2026-05-15
Quelle geprüft
142Claude Opus 4.5Anthropic2025-11-2481%
2026-09-01
Quelle geprüft
143Step 3.7 FlashStepFun2026-06-0180.9%
2026-09-01
Quelle geprüft
3DeepSeek V4 Pro MaxDeepSeek2026-04-2475.6%
Artificial Analysis GPQA Diamond evaluation2026-06-09
Prüfung nötig
4Claude Opus 4.8Anthropic2026-05-2879.8%
GPQA Diamond paper leaderboard2026-05-15
Quelle geprüft
146Kimi K2.6 (Non-reasoning)Other2026-04-2078.8%
2026-09-01
Quelle geprüft
147LongCat-2.0Meituan2026-06-2978%
2026-09-01
Quelle geprüft
148Grok 4.20 0309 v2 (Non-reasoning)xAI2026-04-0777.6%
2026-09-01
Quelle geprüft
149GPT-5.5 (Non-reasoning)OpenAI2026-04-2376.8%
2026-09-01
Quelle geprüft
150MiMo-V2.5-Pro (Non-reasoning)Xiaomi2026-04-2276.2%
2026-09-01
Quelle geprüft
151Command ACohere2026-03-1576.1%
2026-09-01
Quelle geprüft
152North Mini CodeCohere2026-06-0975.7%
2026-09-01
Quelle geprüft
153Gemma 4 12B (Reasoning)Google2026-06-0775.3%
2026-09-01
Quelle geprüft
154Ling-2.6-1TOther2026-04-2375.2%
2026-09-01
Quelle geprüft
155Mistral Medium 3.5Mistral2026-04-2974.8%
2026-09-01
Quelle geprüft
156OpenAI o1OpenAI2024-09-1274.7%
2026-09-01
Quelle geprüft
157Nemotron 3.5 LightningNVIDIA2026-08-1174.3%
2026-09-01
Quelle geprüft
4Gemini 3.5 FlashGoogle2026-05-1974.1%
Artificial Analysis GPQA Diamond evaluation2026-06-09
Prüfung nötig
5Qwen 3.7 MaxAlibaba2026-05-2073.8%
Artificial Analysis GPQA Diamond evaluation2026-06-09
Prüfung nötig
160Ling 3.0 TinyOther2026-08-0673.4%
2026-09-01
Quelle geprüft
161HyperNova 60B 2605Multiverse2026-05-0673.3%
2026-09-01
Quelle geprüft
162Hy3-preview (Non-reasoning)Other2026-04-2373.2%
2026-09-01
Quelle geprüft
163DeepSeek V4 Pro (Non-reasoning)DeepSeek2026-04-2471.7%
2026-09-01
Quelle geprüft
164DeepSeek V4 Flash (Non-reasoning)DeepSeek2026-04-2471.6%
2026-09-01
Quelle geprüft
6Mistral Large 3Mistral2025-12-0271.2%
Artificial Analysis GPQA Diamond evaluation2026-06-09
Prüfung nötig
7Llama 4 MaverickMeta2026-04-0569.4%
Artificial Analysis GPQA Diamond evaluation2026-06-09
Prüfung nötig
167GLM-5.2 (Non-reasoning)Zhipu2026-06-1668.6%
2026-09-01
Quelle geprüft
168JT-MINIOther2026-04-1567.6%
2026-09-01
Quelle geprüft
169DiffusionGemma 26B A4BGoogle2026-06-1066.9%
2026-09-01
Quelle geprüft
170GLM-5 (Non-reasoning)Zhipu2026-02-1166.6%
2026-09-01
Quelle geprüft
171Gemma 4 12B (Non-reasoning)Google2026-06-1066.1%
2026-09-01
Quelle geprüft
172Grok 4.3 (Non-reasoning)xAI2026-04-3065.8%
2026-09-01
Quelle geprüft
173Granite 4.2 30BOther2026-08-2564.4%
2026-09-01
Quelle geprüft
174Granite 4.2 8BOther2026-08-2563.1%
2026-09-01
Quelle geprüft
175Ling 2.6 FlashOther2026-04-2159.3%
2026-09-01
Quelle geprüft
176Llama 4 ScoutMeta2026-04-0558.7%
2026-09-01
Quelle geprüft
177Granite 4.2 3BOther2026-08-2555.9%
2026-09-01
Quelle geprüft
178LFM2.5-8B-A1BLiquid2026-06-0851.3%
2026-09-01
Quelle geprüft
179Claude 3 OpusAnthropic2024-03-0448.9%
2026-09-01
Quelle geprüft
180Granite 4.1 30BOther2026-04-2948.1%
2026-09-01
Quelle geprüft
181Nemotron 3 Nano Omni 30B A3B ReasoningNVIDIA2026-04-2946.9%
2026-09-01
Quelle geprüft
182G9v3-3BOther2026-07-2343.8%
2026-09-01
Quelle geprüft
183MiniCPM-V 4.6 1.3BOpenBMB2026-05-1130.5%
2026-09-01
Quelle geprüft
184MiniCPM5-1B (Reasoning)OpenBMB2026-06-0427.8%
2026-09-01
Quelle geprüft
185MiniCPM5-1B (Non-reasoning)OpenBMB2026-05-2526.9%
2026-09-01
Quelle geprüft
Methode

Was er abdeckt

Dieser Benchmark gehört zur Familie reasoning. Sein Format: 198 von Experten geprüfte Multiple-Choice-Fragen im Diamond-Satz; 'Google-sicher' konzipiert. Der Score sollte immer mit Aufgabenformat, Bewertungsmethode, Quelldatum und Benchmark-Version gelesen werden.

Score-Obergrenze

Wo er an Grenzen stößt

Promovierte Fachexperten erreichen ~65-74 % im eigenen Fach; geübte Laien mit Websuche ~34 %.

Tools, die ihn ausweisen

Belege

Quellen und weiterführende Lektüre

Fragen zu diesem Benchmark

Jede Antwort unten stammt aus den datierten Feldern dieser Seite. Nichts davon ist zusätzlich für Suchmaschinen geschrieben.

Was misst GPQA Diamond?

Schwere Wissenschaftsfragen auf Graduiertenniveau (Biologie, Physik, Chemie), so geschrieben, dass Laien sie auch mit Websuche nicht lösen — die 'Diamond'-Teilmenge ist der hochwertigste, von Experten geprüfte Anteil.

Was beweist ein hoher GPQA Diamond-Wert nicht?

Ein starkes GPQA Diamond-Ergebnis sagt nichts aus über:

  • Allgemeine Nützlichkeit — ein schmaler Ausschnitt der Spitzenwissenschaft, keine Alltagsaufgaben.
  • Ob ein Modell merkt, wann es überfordert ist; es beantwortet trotzdem jede Frage.
  • Geringe Größe (198 Diamond-Fragen) — wenige Glückstreffer verschieben den Wert spürbar.

Wie wird GPQA Diamond bewertet?

Genauigkeit (% korrekt). Aufgabenformat: 198 von Experten geprüfte Multiple-Choice-Fragen im Diamond-Satz; 'Google-sicher' konzipiert.

Ist GPQA Diamond gesättigt?

GPQA Diamond ist im Atlas derzeit als Aktiv markiert. Kontext zur Obergrenze: Promovierte Fachexperten erreichen ~65-74 % im eigenen Fach; geübte Laien mit Websuche ~34 %.

Können GPQA Diamond-Ergebnisse durch Trainingsdaten verunreinigt sein?

Das Kontaminationsrisiko für GPQA Diamond ist als Kontamination niedrig eingestuft. Behandle jede Zeile auf dieser Seite als öffentliche Angabe mit Quelle und Datum, nicht als kontrolliertes Experiment.

The Pack · Redaktionsnewsletter

Neue Tools in dein Postfach. Kostenlos.

Eine kurze E-Mail, wenn ein Tool erscheint oder den Status wechselt. Kein Tracking, keine Drittanbieter-Analytics. Abmeldung mit einem Klick.