Warum dieser Benchmark nützlich ist
Wenn GPQA und HLE nicht mehr sagen, ob ein Modell Forschungsphysik kann: originale, unveröffentlichte Aufgaben mit rate-resistenten Antworten, noch weit von der Decke (Frontier um 30 %).
Critical Physics Tasks
Unveröffentlichte Forschungsphysik: 71 zusammengesetzte Challenges (70 Test + 1 Beispiel) von 50+ aktiven Physiker:innen über 11 Teilgebiete, plus 190 einfachere Checkpoint-Aufgaben. 6 % Gewicht im AA Intelligence Index v4.1.
Wenn GPQA und HLE nicht mehr sagen, ob ein Modell Forschungsphysik kann: originale, unveröffentlichte Aufgaben mit rate-resistenten Antworten, noch weit von der Decke (Frontier um 30 %).
Lies die Composite-Challenge-Genauigkeit, keine Checkpoint-only-Headlines. GPT-5.6 Sol (max) führt das AA-Board vom 1. Sep. 2026 mit 32,3 %. Tool-augmentierte Läufe sind ein separates, höheres Tier — nicht mit Basis-Zeilen mischen.
Auf die Skala dieses Benchmarks normalisiert (0–100). Die Tabelle zeigt die Rohwerte.
Scores nutzen die eigene Einheit und Skala dieses Benchmarks, keinen universellen Qualitätswert.
| # | Modell | Veröffentlichung | Score | Herkunft | Beleglage |
|---|---|---|---|---|---|
| 1 | GPT-5.6 SolOpenAIÖffentliches AA-CritPt-Board, 1. Sep. 2026. Headline-Leader auf der Evaluationsseite. | 2026-07-09 | 32.3% | 2026-09-01 | Quelle geprüft |
| 2 | GPT-5.5 ProOpenAI | 2026-04-23 | 30.6% | 2026-09-01 | Quelle geprüft |
| 3 | GPT-5.6 TerraOpenAI | 2026-07-09 | 30% | 2026-09-01 | Quelle geprüft |
| 4 | GPT-5.4 ProOpenAI | 2026-03-05 | 30% | 2026-09-01 | Quelle geprüft |
| 5 | Claude Opus 5Anthropic | 2026-07-24 | 29.1% | 2026-09-01 | Quelle geprüft |
| 6 | Claude Fable 5Anthropic | 2026-06-09 | 28.6% | 2026-09-01 | Quelle geprüft |
| 7 | GPT-5.5OpenAI | 2026-04-23 | 27.1% | 2026-09-01 | Quelle geprüft |
| 8 | Gemini 3 Pro Deep ThinkGoogle | 2025-12-01 | 25.7% | 2026-09-01 | Quelle geprüft |
| 9 | Kimi K3Moonshot | 2026-07-16 | 23.4% | 2026-09-01 | Quelle geprüft |
| 11 | Claude Opus 4.8Anthropic | 2026-05-28 | 20.9% | 2026-09-01 | Quelle geprüft |
| 15 | GLM-5.3Zhipu | 2026-08-14 | 19.1% | 2026-09-01 | Quelle geprüft |
| 19 | Grok 4.6xAI | 2026-08-12 | 17.1% | 2026-09-01 | Quelle geprüft |
Ledger-Zeilen stammen aus Artificial Analysis' öffentlicher CritPt-Evaluation (unabhängig gelaufen). Das Paper 2025 berichtete ~4 % beste Base-Model-Genauigkeit; Frontier-Zeilen 2026 liegen nahe 30 %. Die Datensatz-Kuratierung filterte adversariell gegen ältere Modelle.
Menschliche Expertenzeit ist Forschungsmaßstab. Veröffentlichte Frontier-Genauigkeit 2026 clustert auf dem Composite-Set klar unter 40 %.
Jede Antwort unten stammt aus den datierten Feldern dieser Seite. Nichts davon ist zusätzlich für Suchmaschinen geschrieben.
Unveröffentlichte Forschungsphysik: 71 zusammengesetzte Challenges (70 Test + 1 Beispiel) von 50+ aktiven Physiker:innen über 11 Teilgebiete, plus 190 einfachere Checkpoint-Aufgaben. 6 % Gewicht im AA Intelligence Index v4.1.
Ein starkes CritPt-Ergebnis sagt nichts aus über:
Durchschnittsgenauigkeit auf dem 70-Test-Composite-Set. Automatische Bewertung für physikspezifische Ausgabeformate. VerdictPal-Zeilen nutzen Artificial Analysis' unabhängigen CritPt-Lauf. Aufgabenformat: 71 zusammengesetzte Research-Challenges über Festkörper, Quanten, AMO, Astrophysik, HEP, mathematische Physik, Statistik, Kernphysik, nichtlineare Dynamik, Fluide und Biophysik. Modelle dürfen in manchen AA-Läufen Coding-Tools nutzen; Checkpoint-Aufgaben (190) sind ein separates, leichteres Slice.
CritPt ist im Atlas derzeit als Aktiv markiert. Kontext zur Obergrenze: Menschliche Expertenzeit ist Forschungsmaßstab. Veröffentlichte Frontier-Genauigkeit 2026 clustert auf dem Composite-Set klar unter 40 %.
Das Kontaminationsrisiko für CritPt ist als Kontamination niedrig eingestuft. Behandle jede Zeile auf dieser Seite als öffentliche Angabe mit Quelle und Datum, nicht als kontrolliertes Experiment.
The Pack · Redaktionsnewsletter
Eine kurze E-Mail, wenn ein Tool erscheint oder den Status wechselt. Kein Tracking, keine Drittanbieter-Analytics. Abmeldung mit einem Klick.