Benchmarks / Reasoning

Abstraction and Reasoning Corpus

ARC-AGI

Flüssiges, dateneffizientes Schließen über die ARC-Prize-Benchmark-Serie — von statischen Gitter-Rätseln (ARC-AGI-1/2) bis zu interaktiven agentischen Umgebungen (ARC-AGI-3). Gegen Auswendiglernen gebaut, belohnt echte Generalisierung.

ReasoningFlagshipAktivNiedriges KontaminationsrisikoSeit 2019
Was dieser Benchmark nicht misst
  • Wissen oder Sprache — Aufgaben sind bewusst wissensfrei; Werte sagen nichts über faktische Genauigkeit.
  • Kostenblinde Werte täuschen — manche hohe ARC-AGI-1-Ergebnisse nutzten enorme Rechenleistung pro Aufgabe; immer die $/Aufgabe-Fußnote lesen.
  • Vergleich über Versionen — ARC-AGI-1, ARC-AGI-2 und ARC-AGI-3 sind verschiedene Aufgaben mit verschiedenen Decken. Version-Switcher nutzen.
Analyse

Warum dieser Benchmark nützlich ist

ARC Prize ist die einzige Benchmark-Serie, die wiederholt neue Wendepunkte zeigt — von Reasoning-Systemen (ARC-AGI-2) bis agentischer Intelligenz (ARC-AGI-3).

Umfang

Abdeckung

Aufgabenfamilie
Reasoning
Format
Edition-abhängig: Gitter-zu-Gitter-Rätsel (v1/v2) oder interaktive turn-basierte Umgebungen (v3). Zurückgehaltene Privat-Sets verhindern Overfitting.
Bewertung
% gelöster zurückgehaltener Aufgaben oder Umgebungen. ARC-AGI-3 misst Skill-Acquisition-Effizienz über die Zeit.
Verantwortliche Stelle
François Chollet / ARC Prize Foundation
Lesehilfe

So liest du die Scores

Zuerst die Edition wählen. ARC-AGI-2-Werte sind statische Puzzle-Genauigkeit; ARC-AGI-3-Werte sind Umgebungs-Löseraten mit spärlichem Feedback. Niemals in einem Composite mischen.

Blinde Flecken

Was er nicht abdeckt

  • Wissen oder Sprache — Aufgaben sind bewusst wissensfrei; Werte sagen nichts über faktische Genauigkeit.
  • Kostenblinde Werte täuschen — manche hohe ARC-AGI-1-Ergebnisse nutzten enorme Rechenleistung pro Aufgabe; immer die $/Aufgabe-Fußnote lesen.
  • Vergleich über Versionen — ARC-AGI-1, ARC-AGI-2 und ARC-AGI-3 sind verschiedene Aufgaben mit verschiedenen Decken. Version-Switcher nutzen.
Scores

Evidenz-Ledger

Interaktiver Benchmark März 2026: Agenten erkunden neue Umgebungen, erwerben Ziele spontan und passen sich ohne Sprachanweisungen an. Misst agentische fluide Intelligenz.

4 Zeilen
44 Zeilen
0.5%bester Score
100%menschliche Obergrenze
99.5 ptsAbstand
4quellgeprüft
1Quellen
2026-03-20Quelldatum
Papers / model cards4

manual-snapshot · manual

Verteilung

Wo die Zeilen liegen

0255075100

Auf die Skala dieses Benchmarks normalisiert (0–100). Die Tabelle zeigt die Rohwerte.

Zeitverlauf

Neueste Belege

  1. Claude Opus 4.6 (Max)0.5% · ARC-AGI-3 paper (arXiv 2603.24621)
  2. Gemini 3.1 Pro Preview0.4% · ARC-AGI-3 paper (arXiv 2603.24621)
  3. GPT 5.4 (High)0.2% · ARC-AGI-3 paper (arXiv 2603.24621)
  4. Grok 4.20 (Reasoning)0.1% · ARC-AGI-3 paper (arXiv 2603.24621)

Scores nutzen die eigene Einheit und Skala dieses Benchmarks, keinen universellen Qualitätswert.

#ModellVeröffentlichungScoreHerkunftBeleglage
1Claude Opus 4.6 (Max)Anthropic2026-03-090.5%
ARC-AGI-3 paper (arXiv 2603.24621)2026-03-20
Quelle geprüft
2Gemini 3.1 Pro PreviewGoogle2026-02-190.4%
ARC-AGI-3 paper (arXiv 2603.24621)2026-03-20
Quelle geprüft
3GPT 5.4 (High)OpenAI2026-04-150.2%
ARC-AGI-3 paper (arXiv 2603.24621)2026-03-20
Quelle geprüft
4Grok 4.20 (Reasoning)xAI2026-03-090.1%
ARC-AGI-3 paper (arXiv 2603.24621)2026-03-20
Quelle geprüft
Methode

Was er abdeckt

Dieser Benchmark gehört zur Familie reasoning. Sein Format: Edition-abhängig: Gitter-zu-Gitter-Rätsel (v1/v2) oder interaktive turn-basierte Umgebungen (v3). Zurückgehaltene Privat-Sets verhindern Overfitting. Der Score sollte immer mit Aufgabenformat, Bewertungsmethode, Quelldatum und Benchmark-Version gelesen werden.

Score-Obergrenze

Wo er an Grenzen stößt

Menschen lösen 100 % der Umgebungen. Frontier-Modelle liegen bei Release unter 1 % (Opus 4.6 ~0,5 %, Gemini 3.1 Pro ~0,4 %).

Tools, die ihn ausweisen

Belege

Quellen und weiterführende Lektüre

The Pack · Redaktionsnewsletter

Neue Karten in dein Postfach. Kostenlos.

Eine kurze E-Mail, wenn eine Karte erscheint oder den Status wechselt. Kein Tracking, keine Drittanbieter-Analytics. Abmeldung mit einem Klick.