Benchmarks / Agentisch

GDPval

Real-work deliverables vs experts

GDPval-AA v2 — echte Wissensarbeits-Lieferungen über 44 Berufe, blind paarweise gegen menschliche Experten bewertet (Elo bei 1000 verankert). 20 % Gewicht im AA Intelligence Index v4.1.

AgentischSolidAktivNiedriges KontaminationsrisikoSeit 2025
Was dieser Benchmark nicht misst
  • Keine VerdictPal-Empfehlung — GDPval ist eine Quelle, mit eigener Aufgabenmischung.
  • Ende-zu-Ende-Autonomie — das sind bewertete Artefakte, nicht langlaufende autonome Workflows.
  • Domänenabdeckung — das veröffentlichte Aufgabenset ist eine Stichprobe, keine umfassende Erhebung wirtschaftlich wertvoller Arbeit.
Analyse

Warum dieser Benchmark nützlich ist

MCQ-Suites verpassen, ob ein Modell ein echtes Artefakt liefern kann. GDPval bewertet Lieferungen aus 44 Berufen blind gegen menschliche Experten — der schwerste Anteil im AA Intelligence Index v4.1.

Umfang

Abdeckung

Aufgabenfamilie
Agentisch
Format
Lieferbar bewertete Aufgaben aus realen Berufen, gegen menschliche Experten-Baselines bewertet.
Bewertung
Gewinnrate vs. menschliche Experten-Baseline (ELO-Stil, Mensch = 1000). v2 erhöht Turn-Limit auf 250 und nutzt rotierendes Frontier-Modell-Judge-Panel.
Verantwortliche Stelle
OpenAI
Lesehilfe

So liest du die Scores

Lies ELO-artige Gewinnraten gegen eine 1000-Punkte-Menschen-Baseline, keine Roh-Prozente. v2 ändert Turn-Limits und das Judge-Panel — nicht mit Headlines vor v2 vergleichen.

Blinde Flecken

Was er nicht abdeckt

  • Keine VerdictPal-Empfehlung — GDPval ist eine Quelle, mit eigener Aufgabenmischung.
  • Ende-zu-Ende-Autonomie — das sind bewertete Artefakte, nicht langlaufende autonome Workflows.
  • Domänenabdeckung — das veröffentlichte Aufgabenset ist eine Stichprobe, keine umfassende Erhebung wirtschaftlich wertvoller Arbeit.
Scores

Evidenz-Ledger

6 Zeilen
66 Zeilen
1818bester Score
5quellgeprüft
3Quellen
2026-06-17bis 2025-12-11
3

api · api

Papers / model cards2

manual-snapshot · manual

Vendor claims1

manual-snapshot · manual

Verteilung

Wo die Zeilen liegen

0255075100

Auf die Skala dieses Benchmarks normalisiert (0–100). Die Tabelle zeigt die Rohwerte.

Zeitverlauf

Neueste Belege

  1. Claude Fable 51818 ·
  2. Claude Opus 4.81638 ·
  3. GPT 5.5 (xhigh)1531 ·
  4. GPT 5.2 Pro74.1% · OpenAI GDPval paper (arXiv)
  5. GPT 5.5 Pro82.3% · OpenAI GDPval grading portal

Scores nutzen die eigene Einheit und Skala dieses Benchmarks, keinen universellen Qualitätswert.

#ModellVeröffentlichungScoreHerkunftBeleglage
1Claude Fable 5Anthropic2026-06-091818
2026-06-17
Quelle geprüft
1GPT 5.2 ProOpenAI2026-05-1274.1%
OpenAI GDPval paper (arXiv)2026-05-12
Quelle geprüft
2Claude Opus 4.8Anthropic2026-05-281638
2026-06-17
Quelle geprüft
2GPT 5.5 ProOpenAI2026-04-2382.3%
OpenAI GDPval grading portal2026-04-23
Quelle geprüft
3GPT 5.5 (xhigh)OpenAI2026-04-231531
2026-06-17
Quelle geprüft
6GPT 5.2OpenAI2025-12-1171.8%
OpenAI GDPval2025-12-11
Prüfung nötig
Methode

Was er abdeckt

Dieser Benchmark gehört zur Familie agentisch. Sein Format: Lieferbar bewertete Aufgaben aus realen Berufen, gegen menschliche Experten-Baselines bewertet. Der Score sollte immer mit Aufgabenformat, Bewertungsmethode, Quelldatum und Benchmark-Version gelesen werden.

Score-Obergrenze

Wo er an Grenzen stößt

Bewertete Artefakte sind keine autonomen Mehrtages-Workflows. Starkes GDPval beweist keinen sicheren Einsatz in regulierten oder kundenorientierten Settings.

Tools, die ihn ausweisen

Belege

Quellen und weiterführende Lektüre

The Pack · Redaktionsnewsletter

Neue Karten in dein Postfach. Kostenlos.

Eine kurze E-Mail, wenn eine Karte erscheint oder den Status wechselt. Kein Tracking, keine Drittanbieter-Analytics. Abmeldung mit einem Klick.