Benchmarks / Reasoning

CritPt

Critical Physics Tasks

Unveröffentlichte Forschungsphysik: 71 zusammengesetzte Challenges (70 Test + 1 Beispiel) von 50+ aktiven Physiker:innen über 11 Teilgebiete, plus 190 einfachere Checkpoint-Aufgaben. 6 % Gewicht im AA Intelligence Index v4.1.

Was dieser Benchmark nicht misst
  • Lehrbuch- oder Contest-Physik — die Aufgaben sind originale Forschungsmaßstab-Tasks, keine recycelten Qualifying-Exam-Items.
  • Ob die Herleitung ein lesbares Paper ist — gewertet wird maschinenprüfbar auf rate-resistenten Formaten (Arrays, symbolische Ausdrücke, Python-Funktionen), keine Beweisnote.
  • Fachübergreifendes wissenschaftliches Reasoning — CritPt ist nur Physik. Für breitere Wissenschaft HLE oder SciCode nutzen.
Analyse

Warum dieser Benchmark nützlich ist

Wenn GPQA und HLE nicht mehr sagen, ob ein Modell Forschungsphysik kann: originale, unveröffentlichte Aufgaben mit rate-resistenten Antworten, noch weit von der Decke (Frontier um 30 %).

Umfang

Abdeckung

Aufgabenfamilie
Reasoning
Format
71 zusammengesetzte Research-Challenges über Festkörper, Quanten, AMO, Astrophysik, HEP, mathematische Physik, Statistik, Kernphysik, nichtlineare Dynamik, Fluide und Biophysik. Modelle dürfen in manchen AA-Läufen Coding-Tools nutzen; Checkpoint-Aufgaben (190) sind ein separates, leichteres Slice.
Bewertung
Durchschnittsgenauigkeit auf dem 70-Test-Composite-Set. Automatische Bewertung für physikspezifische Ausgabeformate. VerdictPal-Zeilen nutzen Artificial Analysis' unabhängigen CritPt-Lauf.
Verantwortliche Stelle
Argonne / UIUC / Artificial Analysis
Lesehilfe

So liest du die Scores

Lies die Composite-Challenge-Genauigkeit, keine Checkpoint-only-Headlines. GPT-5.6 Sol (max) führt das AA-Board vom 1. Sep. 2026 mit 32,3 %. Tool-augmentierte Läufe sind ein separates, höheres Tier — nicht mit Basis-Zeilen mischen.

Blinde Flecken

Was er nicht abdeckt

  • Lehrbuch- oder Contest-Physik — die Aufgaben sind originale Forschungsmaßstab-Tasks, keine recycelten Qualifying-Exam-Items.
  • Ob die Herleitung ein lesbares Paper ist — gewertet wird maschinenprüfbar auf rate-resistenten Formaten (Arrays, symbolische Ausdrücke, Python-Funktionen), keine Beweisnote.
  • Fachübergreifendes wissenschaftliches Reasoning — CritPt ist nur Physik. Für breitere Wissenschaft HLE oder SciCode nutzen.
Scores

Evidenz-Ledger

12 Zeilen
1212 Zeilen
32.3%bester Score
12quellgeprüft
1Quellen
2026-09-01Quelldatum
12

api · api

Verteilung

Wo die Zeilen liegen

0255075100

Auf die Skala dieses Benchmarks normalisiert (0–100). Die Tabelle zeigt die Rohwerte.

Zeitverlauf

Neueste Belege

  1. GPT-5.6 Sol32.3% ·
  2. GPT-5.5 Pro30.6% ·
  3. GPT-5.6 Terra30% ·
  4. GPT-5.4 Pro30% ·
  5. Claude Opus 529.1% ·

Scores nutzen die eigene Einheit und Skala dieses Benchmarks, keinen universellen Qualitätswert.

#ModellVeröffentlichungScoreHerkunftBeleglage
1GPT-5.6 SolOpenAIÖffentliches AA-CritPt-Board, 1. Sep. 2026. Headline-Leader auf der Evaluationsseite.2026-07-0932.3%
2026-09-01
Quelle geprüft
2GPT-5.5 ProOpenAI2026-04-2330.6%
2026-09-01
Quelle geprüft
3GPT-5.6 TerraOpenAI2026-07-0930%
2026-09-01
Quelle geprüft
4GPT-5.4 ProOpenAI2026-03-0530%
2026-09-01
Quelle geprüft
5Claude Opus 5Anthropic2026-07-2429.1%
2026-09-01
Quelle geprüft
6Claude Fable 5Anthropic2026-06-0928.6%
2026-09-01
Quelle geprüft
7GPT-5.5OpenAI2026-04-2327.1%
2026-09-01
Quelle geprüft
8Gemini 3 Pro Deep ThinkGoogle2025-12-0125.7%
2026-09-01
Quelle geprüft
9Kimi K3Moonshot2026-07-1623.4%
2026-09-01
Quelle geprüft
11Claude Opus 4.8Anthropic2026-05-2820.9%
2026-09-01
Quelle geprüft
15GLM-5.3Zhipu2026-08-1419.1%
2026-09-01
Quelle geprüft
19Grok 4.6xAI2026-08-1217.1%
2026-09-01
Quelle geprüft
Methode

Was er abdeckt

Ledger-Zeilen stammen aus Artificial Analysis' öffentlicher CritPt-Evaluation (unabhängig gelaufen). Das Paper 2025 berichtete ~4 % beste Base-Model-Genauigkeit; Frontier-Zeilen 2026 liegen nahe 30 %. Die Datensatz-Kuratierung filterte adversariell gegen ältere Modelle.

Score-Obergrenze

Wo er an Grenzen stößt

Menschliche Expertenzeit ist Forschungsmaßstab. Veröffentlichte Frontier-Genauigkeit 2026 clustert auf dem Composite-Set klar unter 40 %.

Tools, die ihn ausweisen

Belege

Quellen und weiterführende Lektüre

Fragen zu diesem Benchmark

Jede Antwort unten stammt aus den datierten Feldern dieser Seite. Nichts davon ist zusätzlich für Suchmaschinen geschrieben.

Was misst CritPt?

Unveröffentlichte Forschungsphysik: 71 zusammengesetzte Challenges (70 Test + 1 Beispiel) von 50+ aktiven Physiker:innen über 11 Teilgebiete, plus 190 einfachere Checkpoint-Aufgaben. 6 % Gewicht im AA Intelligence Index v4.1.

Was beweist ein hoher CritPt-Wert nicht?

Ein starkes CritPt-Ergebnis sagt nichts aus über:

  • Lehrbuch- oder Contest-Physik — die Aufgaben sind originale Forschungsmaßstab-Tasks, keine recycelten Qualifying-Exam-Items.
  • Ob die Herleitung ein lesbares Paper ist — gewertet wird maschinenprüfbar auf rate-resistenten Formaten (Arrays, symbolische Ausdrücke, Python-Funktionen), keine Beweisnote.
  • Fachübergreifendes wissenschaftliches Reasoning — CritPt ist nur Physik. Für breitere Wissenschaft HLE oder SciCode nutzen.

Wie wird CritPt bewertet?

Durchschnittsgenauigkeit auf dem 70-Test-Composite-Set. Automatische Bewertung für physikspezifische Ausgabeformate. VerdictPal-Zeilen nutzen Artificial Analysis' unabhängigen CritPt-Lauf. Aufgabenformat: 71 zusammengesetzte Research-Challenges über Festkörper, Quanten, AMO, Astrophysik, HEP, mathematische Physik, Statistik, Kernphysik, nichtlineare Dynamik, Fluide und Biophysik. Modelle dürfen in manchen AA-Läufen Coding-Tools nutzen; Checkpoint-Aufgaben (190) sind ein separates, leichteres Slice.

Ist CritPt gesättigt?

CritPt ist im Atlas derzeit als Aktiv markiert. Kontext zur Obergrenze: Menschliche Expertenzeit ist Forschungsmaßstab. Veröffentlichte Frontier-Genauigkeit 2026 clustert auf dem Composite-Set klar unter 40 %.

Können CritPt-Ergebnisse durch Trainingsdaten verunreinigt sein?

Das Kontaminationsrisiko für CritPt ist als Kontamination niedrig eingestuft. Behandle jede Zeile auf dieser Seite als öffentliche Angabe mit Quelle und Datum, nicht als kontrolliertes Experiment.

The Pack · Redaktionsnewsletter

Neue Tools in dein Postfach. Kostenlos.

Eine kurze E-Mail, wenn ein Tool erscheint oder den Status wechselt. Kein Tracking, keine Drittanbieter-Analytics. Abmeldung mit einem Klick.