Benchmarks / Reasoning

GPQA Diamond

Graduate-Level Google-Proof Q&A

Schwere Wissenschaftsfragen auf Graduiertenniveau (Biologie, Physik, Chemie), so geschrieben, dass Laien sie auch mit Websuche nicht lösen — die 'Diamond'-Teilmenge ist der hochwertigste, von Experten geprüfte Anteil.

Was dieser Benchmark nicht misst
  • Allgemeine Nützlichkeit — ein schmaler Ausschnitt der Spitzenwissenschaft, keine Alltagsaufgaben.
  • Ob ein Modell merkt, wann es überfordert ist; es beantwortet trotzdem jede Frage.
  • Geringe Größe (198 Diamond-Fragen) — wenige Glückstreffer verschieben den Wert spürbar.
Analyse

Warum dieser Benchmark nützlich ist

Wenn du Graduierten-Wissenschaft willst, die Laien schwer googeln — ein schmaler, aber noch trennender Wissens-/Reasoning-Ausschnitt.

Umfang

Abdeckung

Aufgabenfamilie
Reasoning
Format
198 von Experten geprüfte Multiple-Choice-Fragen im Diamond-Satz; 'Google-sicher' konzipiert.
Bewertung
Genauigkeit (% korrekt).
Verantwortliche Stelle
Rein et al.
Lesehilfe

So liest du die Scores

Genauigkeit auf 198 Diamond-MCQs. Kleiner Satz: wenige Glückstreffer verschieben den Wert. Mit Experten- (~65–74 %) und Web-Laien-Decke (~34 %) vergleichen, nicht mit Alltagsnutzen.

Blinde Flecken

Was er nicht abdeckt

  • Allgemeine Nützlichkeit — ein schmaler Ausschnitt der Spitzenwissenschaft, keine Alltagsaufgaben.
  • Ob ein Modell merkt, wann es überfordert ist; es beantwortet trotzdem jede Frage.
  • Geringe Größe (198 Diamond-Fragen) — wenige Glückstreffer verschieben den Wert spürbar.
Scores

Evidenz-Ledger

190 Zeilen
190190 Zeilen
96.1%bester Score
183quellgeprüft
2Quellen
2026-09-10bis 2026-05-15
178

api · api

Papers / model cards12

manual-snapshot · manual

Verteilung

Wo die Zeilen liegen

0255075100

Auf die Skala dieses Benchmarks normalisiert (0–100). Die Tabelle zeigt die Rohwerte.

Zeitverlauf

Neueste Belege

  1. GPT-6 Astra96.1% ·
  2. Gemini 3.8 Flash95.3% ·
  3. Grok 4.694.9% ·
  4. Gemini 3.7 Flash94.5% ·
  5. Gemini 3.1 Pro Preview94.1% ·

Scores nutzen die eigene Einheit und Skala dieses Benchmarks, keinen universellen Qualitätswert.

#ModellVeröffentlichungScoreHerkunftBeleglage
1GPT-6 AstraOpenAI2026-09-0396.1%
2026-09-10
Quelle geprüft
2Gemini 3.8 FlashGoogle2026-09-0295.3%
2026-09-10
Quelle geprüft
3Grok 4.6xAI2026-08-1294.9%
2026-09-10
Quelle geprüft
1Claude Mythos PreviewAnthropic2026-06-0194.6%
GPQA Diamond paper leaderboard2026-06-02
Quelle geprüft
5Gemini 3.7 FlashGoogle2026-08-1394.5%
2026-09-10
Quelle geprüft
6Gemini 3.1 Pro PreviewGoogle2026-02-1994.1%
2026-09-10
Quelle geprüft
7GPT-5.6 SolOpenAI2026-07-0994.1%
2026-09-10
Quelle geprüft
8Claude Fable 5.1Anthropic2026-09-0193.7%
2026-09-10
Quelle geprüft
9Claude Opus 5 (Adaptive Reasoning, High Effort)Anthropic2026-07-2493.7%
2026-09-10
Quelle geprüft
10Claude Opus 5 (Adaptive Reasoning, Xhigh Effort)Anthropic2026-07-2493.7%
2026-09-10
Quelle geprüft
11Kimi K3Moonshot2026-07-1693.5%
2026-09-10
Quelle geprüft
12Muse Spark 1.3Meta2026-09-0293.5%
2026-09-10
Quelle geprüft
13Qwen3.8 2.4T A95BAlibaba2026-08-1293.5%
2026-09-10
Quelle geprüft
14Claude Opus 5 (Adaptive Reasoning, Max Effort)Anthropic2026-07-2493.2%
2026-09-10
Quelle geprüft
15GPT-5.5 (high)OpenAI2026-04-2393.2%
2026-09-10
Quelle geprüft
16Grok 4.5xAI2026-07-0893.1%
2026-09-10
Quelle geprüft
17MiniMax M3MiniMax2026-05-3192.9%
2026-09-10
Quelle geprüft
18DeepSeek V4 Pro 0813 (Reasoning, Max Effort)DeepSeek2026-08-1392.8%
2026-09-10
Quelle geprüft
19Gemini 3.6 Flash (high)Google2026-07-2192.8%
2026-09-10
Quelle geprüft
20Qwen3.8 MaxAlibaba2026-08-0392.7%
2026-09-10
Quelle geprüft
21Claude Fable 5Anthropic2026-06-0992.6%
2026-09-10
Quelle geprüft
22GPT-5.5 (medium)OpenAI2026-04-2392.6%
2026-09-10
Quelle geprüft
23GPT-5.6 TerraOpenAI2026-07-0992.5%
2026-09-10
Quelle geprüft
24Qwen3.7 MaxAlibaba2026-05-1992.3%
2026-09-10
Quelle geprüft
25Qwen3.8-Flash-NextAlibaba2026-08-2692.3%
2026-09-10
Quelle geprüft
26Gemini 3.5 Flash (medium)Google2026-05-1992.1%
2026-09-10
Quelle geprüft
27GPT 5.4OpenAI2026-03-0592%
2026-09-10
Quelle geprüft
28Claude Opus 5 (Adaptive Reasoning, Medium Effort)Anthropic2026-07-2491.9%
2026-09-10
Quelle geprüft
29GLM-5.3Zhipu2026-08-1491.7%
2026-09-10
Quelle geprüft
30GPT-5.3 Codex (xhigh)OpenAI2026-02-0591.5%
2026-09-10
Quelle geprüft
31Claude Opus 4.7Anthropic2026-04-1691.4%
2026-09-10
Quelle geprüft
32DeepSeek V4 Flash Vision (Reasoning, Max Effort)DeepSeek2026-08-2191.3%
2026-09-10
Quelle geprüft
33GLM-5.3-FlashZhipu2026-08-2691.2%
2026-09-10
Quelle geprüft
34Claude Sonnet 5Anthropic2026-06-3091.1%
2026-09-10
Quelle geprüft
35GPT-5.6 LunaOpenAI2026-07-0991.1%
2026-09-10
Quelle geprüft
36Grok 4.20 ReasoningxAI2026-03-0591.1%
2026-09-10
Quelle geprüft
37GPT-5.5 (low)OpenAI2026-04-2391%
2026-09-10
Quelle geprüft
38DeepSeek V4 Flash 0731 (Reasoning, Max Effort)DeepSeek2026-07-3190.8%
2026-09-10
Quelle geprüft
39Gemini 3 ProGoogle2025-11-1890.8%
2026-09-10
Quelle geprüft
1Kimi K2.6Moonshot2026-04-2090.5%
GPQA Diamond paper leaderboard2026-05-15
Quelle geprüft
41Agnes 2.5 Pro BetaOther2026-08-2690.5%
2026-09-10
Quelle geprüft
42DeepSeek V4 Pro (Reasoning, High Effort)DeepSeek2026-04-2490.5%
2026-09-10
Quelle geprüft
43Qwen3.8 27BAlibaba2026-08-1490.5%
2026-09-10
Quelle geprüft
44Muse Spark 1.2Meta2026-08-0590.4%
2026-09-10
Quelle geprüft
45GPT-5.2OpenAI2025-12-1190.3%
2026-09-10
Quelle geprüft
46Qwen 3.7 PlusAlibaba2026-06-0290%
2026-09-10
Quelle geprüft
47GPT-5.2 Codex (xhigh)OpenAI2025-12-1189.9%
2026-09-10
Quelle geprüft
48Gemini 3 Flash Preview (Reasoning)Google2025-12-1789.8%
2026-09-10
Quelle geprüft
49Muse Spark 1.1Meta2026-07-0989.8%
2026-09-10
Quelle geprüft
50Hy3Other2026-07-0689.7%
2026-09-10
Quelle geprüft
51Claude Opus 4.6 (Adaptive Reasoning, Max Effort)Anthropic2026-02-0589.6%
2026-09-10
Quelle geprüft
52Kimi K2.7 CodeMoonshot2026-06-1289.6%
2026-09-10
Quelle geprüft
53GLM-5.2Zhipu2026-06-1389.5%
2026-09-10
Quelle geprüft
54Grok Build 0.1 0616xAI2026-06-1689.5%
2026-09-10
Quelle geprüft
55Inkling SmallOther2026-07-3089.5%
2026-09-10
Quelle geprüft
56Qwen3.5 397B A17B (Reasoning)Alibaba2026-02-1689.3%
2026-09-10
Quelle geprüft
57Nex-N2-ProOther2026-06-0289.2%
2026-09-10
Quelle geprüft
58Solar Pro 4Other2026-08-0689.1%
2026-09-10
Quelle geprüft
59Grok 4.3 (medium)xAI2026-04-3089%
2026-09-10
Quelle geprüft
60Claude Opus 5 (Adaptive Reasoning, Low Effort)Anthropic2026-07-2488.9%
2026-09-10
Quelle geprüft
61Qwen3.6 Max PreviewAlibaba2026-04-2088.8%
2026-09-10
Quelle geprüft
62Gemini 3 Pro Preview (low)Google2025-11-1888.7%
2026-09-10
Quelle geprüft
63Claude Opus 4.7 (Non-reasoning, High Effort)Anthropic2026-04-1688.5%
2026-09-10
Quelle geprüft
64Grok 4.20 0309 (Reasoning)xAI2026-03-1088.5%
2026-09-10
Quelle geprüft
65Muse SparkOther2026-01-0188.4%
2026-09-10
Quelle geprüft
66Qwen3.6 PlusAlibaba2026-04-0288.2%
2026-09-10
Quelle geprüft
67Claude Sonnet 4.6 (Adaptive Reasoning, Max Effort)Anthropic2026-02-1787.5%
2026-09-10
Quelle geprüft
68DeepSeek V4 Flash (Reasoning, High Effort)DeepSeek2026-04-2486.7%
2026-09-10
Quelle geprüft
69Claude Opus 4.5 (Reasoning)Anthropic2025-11-2486.6%
2026-09-10
Quelle geprüft
70Apodex 1.1Other2026-08-3086.4%
2026-09-10
Quelle geprüft
71DeepSeek V3.2 (Reasoning)DeepSeek2025-12-0184%
2026-09-10
Quelle geprüft
72DeepSeek R1DeepSeek2025-01-2081.3%
2026-09-10
Quelle geprüft
73Claude 4.1 Opus (Reasoning)Anthropic2025-08-0580.9%
2026-09-10
Quelle geprüft
74Claude Sonnet 4.6 (Non-reasoning, Low Effort)Anthropic2026-02-1779.7%
2026-09-10
Quelle geprüft
75Claude 4 Opus (Reasoning)Anthropic2025-05-2279.6%
2026-09-10
Quelle geprüft
1Gemini 3.1 ProGoogleCoT prompting. PhD-level science MCQ.2026-02-1978.4%
Artificial Analysis GPQA Diamond evaluation2026-06-09
Prüfung nötig
2Grok 4.3xAI2026-04-3088%
GPQA Diamond paper leaderboard2026-05-15
Quelle geprüft
78Kimi K2.5Moonshot2026-01-2787.9%
2026-09-10
Quelle geprüft
79Grok 4xAI2025-07-1087.7%
2026-09-10
Quelle geprüft
80Agnes 2.5 Pro AlphaOther2026-07-2487.6%
2026-09-10
Quelle geprüft
81GPT-5.4 MiniOpenAI2026-03-1787.5%
2026-09-10
Quelle geprüft
82MiniMax M2.7MiniMax2026-04-1587.4%
2026-09-10
Quelle geprüft
83GPT-5.1OpenAI2025-11-1387.3%
2026-09-10
Quelle geprüft
84K2 Horizon 375B A23BOther2026-09-0387.3%
2026-09-10
Quelle geprüft
85Inkling (xhigh)Other2026-07-1587.2%
2026-09-10
Quelle geprüft
86GPT-5.4 (low)OpenAI2026-03-0587.1%
2026-09-10
Quelle geprüft
87MiMo-V2-ProXiaomi2026-03-1887%
2026-09-10
Quelle geprüft
88Motif 3 (Beta)Other2026-07-2186.9%
2026-09-10
Quelle geprüft
89GLM-5.1Zhipu2026-04-0786.8%
2026-09-10
Quelle geprüft
90Hy3-preview (Reasoning)Other2026-04-2386.7%
2026-09-10
Quelle geprüft
91Nemotron 3 Ultra 550B A55B (Reasoning)NVIDIA2026-06-0486.7%
2026-09-10
Quelle geprüft
92MiMo-V2.5-ProXiaomi2026-04-2286.6%
2026-09-10
Quelle geprüft
93GPT-5.2 (medium)OpenAI2025-12-1186.4%
2026-09-10
Quelle geprüft
94Qwen3 Max ThinkingAlibaba2026-01-2686.1%
2026-09-10
Quelle geprüft
95Qwen3.5 397B A17B (Non-reasoning)Alibaba2026-02-1686.1%
2026-09-10
Quelle geprüft
96GPT-5.1 Codex (high)OpenAI2025-11-1386%
2026-09-10
Quelle geprüft
97GLM-4.7 (Reasoning)Zhipu2025-12-2285.9%
2026-09-10
Quelle geprüft
98Qwen3.5 27B (Reasoning)Alibaba2026-02-2485.8%
2026-09-10
Quelle geprüft
99A.X-K2Other2026-08-1285.7%
2026-09-10
Quelle geprüft
100Gemma 4 31B ITGoogle2026-03-0185.7%
2026-09-10
Quelle geprüft
101Qwen3.5 122B A10B (Reasoning)Alibaba2026-02-2485.7%
2026-09-10
Quelle geprüft
102Ring-2.6-1TOther2026-05-0885.7%
2026-09-10
Quelle geprüft
103Solar Open2 250BOther2026-08-1285.7%
2026-09-10
Quelle geprüft
104KAT Coder Pro V2Other2026-03-2785.5%
2026-09-10
Quelle geprüft
105Ling 3.0 FlashOther2026-08-0485.5%
2026-09-10
Quelle geprüft
106MiMo-V2-Omni-0327Xiaomi2026-03-2785.5%
2026-09-10
Quelle geprüft
107GPT-5 (high)OpenAI2025-08-0785.4%
2026-09-10
Quelle geprüft
108MiMo-V2.5Xiaomi2026-04-2284.9%
2026-09-10
Quelle geprüft
109MiniMax M2.5MiniMax2026-04-0184.8%
2026-09-10
Quelle geprüft
110GLM-5-TurboZhipu2026-03-1584.7%
2026-09-10
Quelle geprüft
111GPT-5.5 Instant (May 2026)OpenAI2026-05-0584.6%
2026-09-10
Quelle geprüft
112MiMo-V2-Flash (Reasoning)Xiaomi2025-12-1684.6%
2026-09-10
Quelle geprüft
113JT-4.1 Flash 236B A21BOther2026-07-0984.5%
2026-09-10
Quelle geprüft
114o3-proOpenAI2025-06-1084.5%
2026-09-10
Quelle geprüft
115Grok 4.3 (low)xAI2026-04-3084.3%
2026-09-10
Quelle geprüft
116GPT-5 (medium)OpenAI2025-08-0784.2%
2026-09-10
Quelle geprüft
117Kimi K3 (low)Moonshot2026-07-1684.2%
2026-09-10
Quelle geprüft
118Qwen3.6 27B (Reasoning)Alibaba2026-04-2284.2%
2026-09-10
Quelle geprüft
119Qwen3.6 35B A3B (Reasoning)Alibaba2026-04-1684.1%
2026-09-10
Quelle geprüft
120Claude Opus 4.6Anthropic2026-02-0584%
2026-09-10
Quelle geprüft
121Gemini 3.5 Flash-LiteGoogle2026-07-2183.8%
2026-09-10
Quelle geprüft
122Kimi K2 ThinkingMoonshot2025-11-0683.8%
2026-09-10
Quelle geprüft
123GPT-5 Codex (high)OpenAI2025-09-2383.7%
2026-09-10
Quelle geprüft
124MiMo-V2-Flash (Feb 2026)Xiaomi2025-12-1683.5%
2026-09-10
Quelle geprüft
125Muse GlimmerMeta2026-08-1083.5%
2026-09-10
Quelle geprüft
126Claude 4.5 Sonnet (Reasoning)Anthropic2025-09-2983.4%
2026-09-10
Quelle geprüft
127Motif 3Other2026-08-1283.4%
2026-09-10
Quelle geprüft
128MiniMax-M2.1MiniMax2025-12-2383%
2026-09-10
Quelle geprüft
129JT-35B-FlashOther2026-05-1482.9%
2026-09-10
Quelle geprüft
130K-EXAONE 2.0 0803Other2026-08-1282.9%
2026-09-10
Quelle geprüft
131Qwen3.6 27B (Non-reasoning)Alibaba2026-04-2282.9%
2026-09-10
Quelle geprüft
132Gemini 3.5 Flash (minimal)Google2026-05-1982.8%
2026-09-10
Quelle geprüft
133MiMo-V2-OmniXiaomi2026-03-1982.8%
2026-09-10
Quelle geprüft
134OpenAI o3OpenAI2025-04-1682.7%
2026-09-10
Quelle geprüft
135GPT-5.5 Instant (June 2026)OpenAI2026-06-2582.3%
2026-09-10
Quelle geprüft
136Gemini 3.1 Flash LiteGoogle2026-05-0782.2%
2026-09-10
Quelle geprüft
137GLM-5 (Reasoning)Zhipu2026-02-1182%
2026-09-10
Quelle geprüft
138GPT-5.4 NanoOpenAI2026-03-1781.7%
2026-09-10
Quelle geprüft
139Qwen3.6 35B A3B (Non-reasoning)Alibaba2026-04-1681.7%
2026-09-10
Quelle geprüft
2Claude Sonnet 4.6Anthropic2026-02-1777.2%
Artificial Analysis GPQA Diamond evaluation2026-06-09
Prüfung nötig
3GPT 5.5OpenAI2026-04-2381.2%
GPQA Diamond paper leaderboard2026-05-15
Quelle geprüft
142Gemini 3 Flash PreviewGoogle2025-12-1781.2%
2026-09-10
Quelle geprüft
143Claude Opus 4.5Anthropic2025-11-2481%
2026-09-10
Quelle geprüft
144GLM 5V Turbo (Reasoning)Zhipu2026-04-0180.9%
2026-09-10
Quelle geprüft
145Step 3.7 FlashStepFun2026-06-0180.9%
2026-09-10
Quelle geprüft
146GPT-5 (low)OpenAI2025-08-0780.8%
2026-09-10
Quelle geprüft
147G9v3-39A5BOther2026-08-0380.5%
2026-09-10
Quelle geprüft
3DeepSeek V4 Pro MaxDeepSeek2026-04-2475.6%
Artificial Analysis GPQA Diamond evaluation2026-06-09
Prüfung nötig
4Claude Opus 4.8Anthropic2026-05-2879.8%
GPQA Diamond paper leaderboard2026-05-15
Quelle geprüft
150EXAONE 4.5 33BOther2026-04-0979.4%
2026-09-10
Quelle geprüft
151Kimi K2.6 (Non-reasoning)Other2026-04-2078.8%
2026-09-10
Quelle geprüft
152LongCat-2.0Meituan2026-06-2978%
2026-09-10
Quelle geprüft
153Grok 4.20 0309 v2 (Non-reasoning)xAI2026-04-0777.6%
2026-09-10
Quelle geprüft
154GPT-5.5 (Non-reasoning)OpenAI2026-04-2376.8%
2026-09-10
Quelle geprüft
155MiMo-V2.5-Pro (Non-reasoning)Xiaomi2026-04-2276.2%
2026-09-10
Quelle geprüft
156North Mini CodeCohere2026-06-0975.7%
2026-09-10
Quelle geprüft
157Gemma 4 12B (Reasoning)Google2026-06-0775.3%
2026-09-10
Quelle geprüft
158Ling-2.6-1TOther2026-04-2375.2%
2026-09-10
Quelle geprüft
159Mistral Medium 3.5Mistral2026-04-2974.8%
2026-09-10
Quelle geprüft
160OpenAI o1OpenAI2024-09-1274.7%
2026-09-10
Quelle geprüft
161Nemotron 3.5 LightningNVIDIA2026-08-1174.3%
2026-09-10
Quelle geprüft
4Gemini 3.5 FlashGoogle2026-05-1974.1%
Artificial Analysis GPQA Diamond evaluation2026-06-09
Prüfung nötig
5Qwen 3.7 MaxAlibaba2026-05-2073.8%
Artificial Analysis GPQA Diamond evaluation2026-06-09
Prüfung nötig
164Ling 3.0 TinyOther2026-08-0673.4%
2026-09-10
Quelle geprüft
165Hy3-preview (Non-reasoning)Other2026-04-2373.2%
2026-09-10
Quelle geprüft
166DeepSeek V4 Pro (Non-reasoning)DeepSeek2026-04-2471.7%
2026-09-10
Quelle geprüft
167DeepSeek V4 Flash (Non-reasoning)DeepSeek2026-04-2471.6%
2026-09-10
Quelle geprüft
6Mistral Large 3Mistral2025-12-0271.2%
Artificial Analysis GPQA Diamond evaluation2026-06-09
Prüfung nötig
169MiniCPM5-2BOpenBMB2026-09-0770.2%
2026-09-10
Quelle geprüft
7Llama 4 MaverickMeta2026-04-0569.4%
Artificial Analysis GPQA Diamond evaluation2026-06-09
Prüfung nötig
171GLM-5.2 (Non-reasoning)Zhipu2026-06-1668.6%
2026-09-10
Quelle geprüft
172JT-MINIOther2026-04-1567.6%
2026-09-10
Quelle geprüft
173DiffusionGemma 26B A4BGoogle2026-06-1066.9%
2026-09-10
Quelle geprüft
174GLM-5 (Non-reasoning)Zhipu2026-02-1166.6%
2026-09-10
Quelle geprüft
175Gemma 4 12B (Non-reasoning)Google2026-06-1066.1%
2026-09-10
Quelle geprüft
176Grok 4.3 (Non-reasoning)xAI2026-04-3065.8%
2026-09-10
Quelle geprüft
177Granite 4.2 30BOther2026-08-2564.4%
2026-09-10
Quelle geprüft
178Granite 4.2 8BOther2026-08-2563.1%
2026-09-10
Quelle geprüft
179Ling 2.6 FlashOther2026-04-2159.3%
2026-09-10
Quelle geprüft
180Llama 4 ScoutMeta2026-04-0558.7%
2026-09-10
Quelle geprüft
181Granite 4.2 3BOther2026-08-2555.9%
2026-09-10
Quelle geprüft
182Command ACohere2026-03-1552.7%
2026-09-10
Quelle geprüft
183LFM2.5-8B-A1BLiquid2026-06-0851.3%
2026-09-10
Quelle geprüft
184Claude 3 OpusAnthropic2024-03-0448.9%
2026-09-10
Quelle geprüft
185Granite 4.1 30BOther2026-04-2948.1%
2026-09-10
Quelle geprüft
186Nemotron 3 Nano Omni 30B A3B ReasoningNVIDIA2026-04-2946.9%
2026-09-10
Quelle geprüft
187G9v3-3BOther2026-07-2343.8%
2026-09-10
Quelle geprüft
188MiniCPM-V 4.6 1.3BOpenBMB2026-05-1130.5%
2026-09-10
Quelle geprüft
189MiniCPM5-1B (Reasoning)OpenBMB2026-06-0427.8%
2026-09-10
Quelle geprüft
190MiniCPM5-1B (Non-reasoning)OpenBMB2026-05-2526.9%
2026-09-10
Quelle geprüft
Methode

Was er abdeckt

Dieser Benchmark gehört zur Familie reasoning. Sein Format: 198 von Experten geprüfte Multiple-Choice-Fragen im Diamond-Satz; 'Google-sicher' konzipiert. Der Score sollte immer mit Aufgabenformat, Bewertungsmethode, Quelldatum und Benchmark-Version gelesen werden.

Score-Obergrenze

Wo er an Grenzen stößt

Promovierte Fachexperten erreichen ~65-74 % im eigenen Fach; geübte Laien mit Websuche ~34 %.

Tools, die ihn ausweisen

Belege

Quellen und weiterführende Lektüre

Fragen zu diesem Benchmark

Jede Antwort unten stammt aus den datierten Feldern dieser Seite. Nichts davon ist zusätzlich für Suchmaschinen geschrieben.

Was misst GPQA Diamond?

Schwere Wissenschaftsfragen auf Graduiertenniveau (Biologie, Physik, Chemie), so geschrieben, dass Laien sie auch mit Websuche nicht lösen — die 'Diamond'-Teilmenge ist der hochwertigste, von Experten geprüfte Anteil.

Was beweist ein hoher GPQA Diamond-Wert nicht?

Ein starkes GPQA Diamond-Ergebnis sagt nichts aus über:

  • Allgemeine Nützlichkeit — ein schmaler Ausschnitt der Spitzenwissenschaft, keine Alltagsaufgaben.
  • Ob ein Modell merkt, wann es überfordert ist; es beantwortet trotzdem jede Frage.
  • Geringe Größe (198 Diamond-Fragen) — wenige Glückstreffer verschieben den Wert spürbar.

Wie wird GPQA Diamond bewertet?

Genauigkeit (% korrekt). Aufgabenformat: 198 von Experten geprüfte Multiple-Choice-Fragen im Diamond-Satz; 'Google-sicher' konzipiert.

Ist GPQA Diamond gesättigt?

GPQA Diamond ist im Atlas derzeit als Aktiv markiert. Kontext zur Obergrenze: Promovierte Fachexperten erreichen ~65-74 % im eigenen Fach; geübte Laien mit Websuche ~34 %.

Können GPQA Diamond-Ergebnisse durch Trainingsdaten verunreinigt sein?

Das Kontaminationsrisiko für GPQA Diamond ist als Kontamination niedrig eingestuft. Behandle jede Zeile auf dieser Seite als öffentliche Angabe mit Quelle und Datum, nicht als kontrolliertes Experiment.

The Pack · Redaktionsnewsletter

Neue Tools in dein Postfach. Kostenlos.

Eine kurze E-Mail, wenn ein Tool erscheint oder den Status wechselt. Kein Tracking, keine Drittanbieter-Analytics. Abmeldung mit einem Klick.