Benchmarks / Reasoning

Abstraction and Reasoning Corpus

ARC-AGI

Flüssiges, dateneffizientes Schließen über die ARC-Prize-Benchmark-Serie — von statischen Gitter-Rätseln (ARC-AGI-1/2) bis zu interaktiven agentischen Umgebungen (ARC-AGI-3). Gegen Auswendiglernen gebaut, belohnt echte Generalisierung.

Was dieser Benchmark nicht misst
  • Wissen oder Sprache — Aufgaben sind bewusst wissensfrei; Werte sagen nichts über faktische Genauigkeit.
  • Kostenblinde Werte täuschen — manche hohe ARC-AGI-1-Ergebnisse nutzten enorme Rechenleistung pro Aufgabe; immer die $/Aufgabe-Fußnote lesen.
  • Vergleich über Versionen — ARC-AGI-1, ARC-AGI-2 und ARC-AGI-3 sind verschiedene Aufgaben mit verschiedenen Decken. Version-Switcher nutzen.
Analyse

Warum dieser Benchmark nützlich ist

ARC Prize ist die einzige Benchmark-Serie, die wiederholt neue Wendepunkte zeigt — von Reasoning-Systemen (ARC-AGI-2) bis agentischer Intelligenz (ARC-AGI-3).

Umfang

Abdeckung

Aufgabenfamilie
Reasoning
Format
Edition-abhängig: Gitter-zu-Gitter-Rätsel (v1/v2) oder interaktive turn-basierte Umgebungen (v3). Zurückgehaltene Privat-Sets verhindern Overfitting.
Bewertung
% gelöster zurückgehaltener Aufgaben oder Umgebungen. ARC-AGI-3 misst Skill-Acquisition-Effizienz über die Zeit.
Verantwortliche Stelle
François Chollet / ARC Prize Foundation
Lesehilfe

So liest du die Scores

Zuerst die Edition wählen. ARC-AGI-2-Werte sind statische Puzzle-Genauigkeit; ARC-AGI-3-Werte sind Umgebungs-Löseraten mit spärlichem Feedback. Niemals in einem Composite mischen.

Blinde Flecken

Was er nicht abdeckt

  • Wissen oder Sprache — Aufgaben sind bewusst wissensfrei; Werte sagen nichts über faktische Genauigkeit.
  • Kostenblinde Werte täuschen — manche hohe ARC-AGI-1-Ergebnisse nutzten enorme Rechenleistung pro Aufgabe; immer die $/Aufgabe-Fußnote lesen.
  • Vergleich über Versionen — ARC-AGI-1, ARC-AGI-2 und ARC-AGI-3 sind verschiedene Aufgaben mit verschiedenen Decken. Version-Switcher nutzen.
Scores

Evidenz-Ledger

Interaktiver Benchmark März 2026: Agenten erkunden neue Umgebungen, erwerben Ziele spontan und passen sich ohne Sprachanweisungen an. Misst agentische fluide Intelligenz.

4 Zeilen
44 Zeilen
0.5%bester Score
100%menschliche Obergrenze
99.5 ptsAbstand
4quellgeprüft
1Quellen
2026-03-20Quelldatum
Papers / model cards4

manual-snapshot · manual

Verteilung

Wo die Zeilen liegen

0255075100

Auf die Skala dieses Benchmarks normalisiert (0–100). Die Tabelle zeigt die Rohwerte.

Zeitverlauf

Neueste Belege

  1. Claude Opus 4.6 (Max)0.5% · ARC-AGI-3 paper (arXiv 2603.24621)
  2. Gemini 3.1 Pro Preview0.4% · ARC-AGI-3 paper (arXiv 2603.24621)
  3. GPT 5.4 (High)0.2% · ARC-AGI-3 paper (arXiv 2603.24621)
  4. Grok 4.20 (Reasoning)0.1% · ARC-AGI-3 paper (arXiv 2603.24621)

Scores nutzen die eigene Einheit und Skala dieses Benchmarks, keinen universellen Qualitätswert.

#ModellVeröffentlichungScoreHerkunftBeleglage
1Claude Opus 4.6 (Max)Anthropic2026-03-090.5%
ARC-AGI-3 paper (arXiv 2603.24621)2026-03-20
Quelle geprüft
2Gemini 3.1 Pro PreviewGoogle2026-02-190.4%
ARC-AGI-3 paper (arXiv 2603.24621)2026-03-20
Quelle geprüft
3GPT 5.4 (High)OpenAI2026-04-150.2%
ARC-AGI-3 paper (arXiv 2603.24621)2026-03-20
Quelle geprüft
4Grok 4.20 (Reasoning)xAI2026-03-090.1%
ARC-AGI-3 paper (arXiv 2603.24621)2026-03-20
Quelle geprüft
Methode

Was er abdeckt

Dieser Benchmark gehört zur Familie reasoning. Sein Format: Edition-abhängig: Gitter-zu-Gitter-Rätsel (v1/v2) oder interaktive turn-basierte Umgebungen (v3). Zurückgehaltene Privat-Sets verhindern Overfitting. Der Score sollte immer mit Aufgabenformat, Bewertungsmethode, Quelldatum und Benchmark-Version gelesen werden.

Score-Obergrenze

Wo er an Grenzen stößt

Menschen lösen 100 % der Umgebungen. Offizielle Release-Zeilen clusterten unter 1 %. OpenAIs GPT-6-Astra-Launch vom 3. Sep. 2026 nennt 99,9 % — Vendor-Claim, keine ARC-Prize-Leaderboard-Zeile. Diese Edition nicht als gelöst markieren, bis das offizielle Board das bestätigt.

Tools, die ihn ausweisen

Belege

Quellen und weiterführende Lektüre

Fragen zu diesem Benchmark

Jede Antwort unten stammt aus den datierten Feldern dieser Seite. Nichts davon ist zusätzlich für Suchmaschinen geschrieben.

Was misst ARC-AGI?

Flüssiges, dateneffizientes Schließen über die ARC-Prize-Benchmark-Serie — von statischen Gitter-Rätseln (ARC-AGI-1/2) bis zu interaktiven agentischen Umgebungen (ARC-AGI-3). Gegen Auswendiglernen gebaut, belohnt echte Generalisierung.

Was beweist ein hoher ARC-AGI-Wert nicht?

Ein starkes ARC-AGI-Ergebnis sagt nichts aus über:

  • Wissen oder Sprache — Aufgaben sind bewusst wissensfrei; Werte sagen nichts über faktische Genauigkeit.
  • Kostenblinde Werte täuschen — manche hohe ARC-AGI-1-Ergebnisse nutzten enorme Rechenleistung pro Aufgabe; immer die $/Aufgabe-Fußnote lesen.
  • Vergleich über Versionen — ARC-AGI-1, ARC-AGI-2 und ARC-AGI-3 sind verschiedene Aufgaben mit verschiedenen Decken. Version-Switcher nutzen.

Wie wird ARC-AGI bewertet?

% gelöster zurückgehaltener Aufgaben oder Umgebungen. ARC-AGI-3 misst Skill-Acquisition-Effizienz über die Zeit. Aufgabenformat: Edition-abhängig: Gitter-zu-Gitter-Rätsel (v1/v2) oder interaktive turn-basierte Umgebungen (v3). Zurückgehaltene Privat-Sets verhindern Overfitting.

Ist ARC-AGI gesättigt?

ARC-AGI ist im Atlas derzeit als Aktiv markiert. Kontext zur Obergrenze: Edition-abhängig — Versionen oben wechseln. ARC-AGI-3 bleibt die offiziell ungelöste Edition, bis ARC Prize eine bestätigende Leaderboard-Zeile veröffentlicht.

Können ARC-AGI-Ergebnisse durch Trainingsdaten verunreinigt sein?

Das Kontaminationsrisiko für ARC-AGI ist als Kontamination niedrig eingestuft. Behandle jede Zeile auf dieser Seite als öffentliche Angabe mit Quelle und Datum, nicht als kontrolliertes Experiment.

The Pack · Redaktionsnewsletter

Neue Tools in dein Postfach. Kostenlos.

Eine kurze E-Mail, wenn ein Tool erscheint oder den Status wechselt. Kein Tracking, keine Drittanbieter-Analytics. Abmeldung mit einem Klick.