Benchmarks / Agentisch

GDPval

Real-work deliverables vs experts

GDPval-AA v2 — echte Wissensarbeits-Lieferungen über 44 Berufe, blind paarweise gegen menschliche Experten bewertet (Elo bei 1000 verankert). 10 % Gewicht im AA Intelligence Index v4.2 (war 20 % in v4.1).

Was dieser Benchmark nicht misst
  • Keine VerdictPal-Empfehlung — GDPval ist eine Quelle, mit eigener Aufgabenmischung.
  • Ende-zu-Ende-Autonomie — das sind bewertete Artefakte, nicht langlaufende autonome Workflows.
  • Domänenabdeckung — das veröffentlichte Aufgabenset ist eine Stichprobe, keine umfassende Erhebung wirtschaftlich wertvoller Arbeit.
Analyse

Warum dieser Benchmark nützlich ist

MCQ-Suites verpassen, ob ein Modell ein echtes Artefakt liefern kann. GDPval bewertet Lieferungen aus 44 Berufen blind gegen menschliche Experten — weiter ein großer Agents-Anteil im AA Intelligence Index v4.2, jetzt geteilt mit AA-Briefcase.

Umfang

Abdeckung

Aufgabenfamilie
Agentisch
Format
Lieferbar bewertete Aufgaben aus realen Berufen, gegen menschliche Experten-Baselines bewertet.
Bewertung
Gewinnrate vs. menschliche Experten-Baseline (ELO-Stil, Mensch = 1000). v2 erhöht Turn-Limit auf 250 und nutzt rotierendes Frontier-Modell-Judge-Panel.
Verantwortliche Stelle
OpenAI
Lesehilfe

So liest du die Scores

Lies ELO-artige Gewinnraten gegen eine 1000-Punkte-Menschen-Baseline, keine Roh-Prozente. v2 ändert Turn-Limits und das Judge-Panel — nicht mit Headlines vor v2 vergleichen.

Blinde Flecken

Was er nicht abdeckt

  • Keine VerdictPal-Empfehlung — GDPval ist eine Quelle, mit eigener Aufgabenmischung.
  • Ende-zu-Ende-Autonomie — das sind bewertete Artefakte, nicht langlaufende autonome Workflows.
  • Domänenabdeckung — das veröffentlichte Aufgabenset ist eine Stichprobe, keine umfassende Erhebung wirtschaftlich wertvoller Arbeit.
Scores

Evidenz-Ledger

6 Zeilen
66 Zeilen
1818bester Score
5quellgeprüft
3Quellen
2026-06-17bis 2025-12-11
3

api · api

Papers / model cards2

manual-snapshot · manual

Vendor claims1

manual-snapshot · manual

Verteilung

Wo die Zeilen liegen

0255075100

Auf die Skala dieses Benchmarks normalisiert (0–100). Die Tabelle zeigt die Rohwerte.

Zeitverlauf

Neueste Belege

  1. Claude Fable 51818 ·
  2. Claude Opus 4.81638 ·
  3. GPT 5.5 (xhigh)1531 ·
  4. GPT 5.2 Pro74.1% · OpenAI GDPval paper (arXiv)
  5. GPT 5.5 Pro82.3% · OpenAI GDPval grading portal

Scores nutzen die eigene Einheit und Skala dieses Benchmarks, keinen universellen Qualitätswert.

#ModellVeröffentlichungScoreHerkunftBeleglage
1Claude Fable 5Anthropic2026-06-091818
2026-06-17
Quelle geprüft
1GPT 5.2 ProOpenAI2026-05-1274.1%
OpenAI GDPval paper (arXiv)2026-05-12
Quelle geprüft
2Claude Opus 4.8Anthropic2026-05-281638
2026-06-17
Quelle geprüft
2GPT 5.5 ProOpenAI2026-04-2382.3%
OpenAI GDPval grading portal2026-04-23
Quelle geprüft
3GPT 5.5 (xhigh)OpenAI2026-04-231531
2026-06-17
Quelle geprüft
6GPT 5.2OpenAI2025-12-1171.8%
OpenAI GDPval2025-12-11
Prüfung nötig
Methode

Was er abdeckt

Dieser Benchmark gehört zur Familie agentisch. Sein Format: Lieferbar bewertete Aufgaben aus realen Berufen, gegen menschliche Experten-Baselines bewertet. Der Score sollte immer mit Aufgabenformat, Bewertungsmethode, Quelldatum und Benchmark-Version gelesen werden.

Score-Obergrenze

Wo er an Grenzen stößt

Bewertete Artefakte sind keine autonomen Mehrtages-Workflows. Starkes GDPval beweist keinen sicheren Einsatz in regulierten oder kundenorientierten Settings.

Tools, die ihn ausweisen

Belege

Quellen und weiterführende Lektüre

Fragen zu diesem Benchmark

Jede Antwort unten stammt aus den datierten Feldern dieser Seite. Nichts davon ist zusätzlich für Suchmaschinen geschrieben.

Was misst GDPval?

GDPval-AA v2 — echte Wissensarbeits-Lieferungen über 44 Berufe, blind paarweise gegen menschliche Experten bewertet (Elo bei 1000 verankert). 10 % Gewicht im AA Intelligence Index v4.2 (war 20 % in v4.1).

Was beweist ein hoher GDPval-Wert nicht?

Ein starkes GDPval-Ergebnis sagt nichts aus über:

  • Keine VerdictPal-Empfehlung — GDPval ist eine Quelle, mit eigener Aufgabenmischung.
  • Ende-zu-Ende-Autonomie — das sind bewertete Artefakte, nicht langlaufende autonome Workflows.
  • Domänenabdeckung — das veröffentlichte Aufgabenset ist eine Stichprobe, keine umfassende Erhebung wirtschaftlich wertvoller Arbeit.

Wie wird GDPval bewertet?

Gewinnrate vs. menschliche Experten-Baseline (ELO-Stil, Mensch = 1000). v2 erhöht Turn-Limit auf 250 und nutzt rotierendes Frontier-Modell-Judge-Panel. Aufgabenformat: Lieferbar bewertete Aufgaben aus realen Berufen, gegen menschliche Experten-Baselines bewertet.

Ist GDPval gesättigt?

GDPval ist im Atlas derzeit als Aktiv markiert.

Können GDPval-Ergebnisse durch Trainingsdaten verunreinigt sein?

Das Kontaminationsrisiko für GDPval ist als Kontamination niedrig eingestuft. Behandle jede Zeile auf dieser Seite als öffentliche Angabe mit Quelle und Datum, nicht als kontrolliertes Experiment.

The Pack · Redaktionsnewsletter

Neue Tools in dein Postfach. Kostenlos.

Eine kurze E-Mail, wenn ein Tool erscheint oder den Status wechselt. Kein Tracking, keine Drittanbieter-Analytics. Abmeldung mit einem Klick.