Warum dieser Benchmark nützlich ist
ARC Prize ist die einzige Benchmark-Serie, die wiederholt neue Wendepunkte zeigt — von Reasoning-Systemen (ARC-AGI-2) bis agentischer Intelligenz (ARC-AGI-3).
ARC-AGI
Flüssiges, dateneffizientes Schließen über die ARC-Prize-Benchmark-Serie — von statischen Gitter-Rätseln (ARC-AGI-1/2) bis zu interaktiven agentischen Umgebungen (ARC-AGI-3). Gegen Auswendiglernen gebaut, belohnt echte Generalisierung.
ARC Prize ist die einzige Benchmark-Serie, die wiederholt neue Wendepunkte zeigt — von Reasoning-Systemen (ARC-AGI-2) bis agentischer Intelligenz (ARC-AGI-3).
Zuerst die Edition wählen. ARC-AGI-2-Werte sind statische Puzzle-Genauigkeit; ARC-AGI-3-Werte sind Umgebungs-Löseraten mit spärlichem Feedback. Niemals in einem Composite mischen.
Interaktiver Benchmark März 2026: Agenten erkunden neue Umgebungen, erwerben Ziele spontan und passen sich ohne Sprachanweisungen an. Misst agentische fluide Intelligenz.
Auf die Skala dieses Benchmarks normalisiert (0–100). Die Tabelle zeigt die Rohwerte.
Scores nutzen die eigene Einheit und Skala dieses Benchmarks, keinen universellen Qualitätswert.
| # | Modell | Veröffentlichung | Score | Herkunft | Beleglage |
|---|---|---|---|---|---|
| 1 | Claude Opus 4.6 (Max)Anthropic | 2026-03-09 | 0.5% | ARC-AGI-3 paper (arXiv 2603.24621)2026-03-20 | Quelle geprüft |
| 2 | Gemini 3.1 Pro PreviewGoogle | 2026-02-19 | 0.4% | ARC-AGI-3 paper (arXiv 2603.24621)2026-03-20 | Quelle geprüft |
| 3 | GPT 5.4 (High)OpenAI | 2026-04-15 | 0.2% | ARC-AGI-3 paper (arXiv 2603.24621)2026-03-20 | Quelle geprüft |
| 4 | Grok 4.20 (Reasoning)xAI | 2026-03-09 | 0.1% | ARC-AGI-3 paper (arXiv 2603.24621)2026-03-20 | Quelle geprüft |
Dieser Benchmark gehört zur Familie reasoning. Sein Format: Edition-abhängig: Gitter-zu-Gitter-Rätsel (v1/v2) oder interaktive turn-basierte Umgebungen (v3). Zurückgehaltene Privat-Sets verhindern Overfitting. Der Score sollte immer mit Aufgabenformat, Bewertungsmethode, Quelldatum und Benchmark-Version gelesen werden.
Menschen lösen 100 % der Umgebungen. Offizielle Release-Zeilen clusterten unter 1 %. OpenAIs GPT-6-Astra-Launch vom 3. Sep. 2026 nennt 99,9 % — Vendor-Claim, keine ARC-Prize-Leaderboard-Zeile. Diese Edition nicht als gelöst markieren, bis das offizielle Board das bestätigt.
Jede Antwort unten stammt aus den datierten Feldern dieser Seite. Nichts davon ist zusätzlich für Suchmaschinen geschrieben.
Flüssiges, dateneffizientes Schließen über die ARC-Prize-Benchmark-Serie — von statischen Gitter-Rätseln (ARC-AGI-1/2) bis zu interaktiven agentischen Umgebungen (ARC-AGI-3). Gegen Auswendiglernen gebaut, belohnt echte Generalisierung.
Ein starkes ARC-AGI-Ergebnis sagt nichts aus über:
% gelöster zurückgehaltener Aufgaben oder Umgebungen. ARC-AGI-3 misst Skill-Acquisition-Effizienz über die Zeit. Aufgabenformat: Edition-abhängig: Gitter-zu-Gitter-Rätsel (v1/v2) oder interaktive turn-basierte Umgebungen (v3). Zurückgehaltene Privat-Sets verhindern Overfitting.
ARC-AGI ist im Atlas derzeit als Aktiv markiert. Kontext zur Obergrenze: Edition-abhängig — Versionen oben wechseln. ARC-AGI-3 bleibt die offiziell ungelöste Edition, bis ARC Prize eine bestätigende Leaderboard-Zeile veröffentlicht.
Das Kontaminationsrisiko für ARC-AGI ist als Kontamination niedrig eingestuft. Behandle jede Zeile auf dieser Seite als öffentliche Angabe mit Quelle und Datum, nicht als kontrolliertes Experiment.
The Pack · Redaktionsnewsletter
Eine kurze E-Mail, wenn ein Tool erscheint oder den Status wechselt. Kein Tracking, keine Drittanbieter-Analytics. Abmeldung mit einem Klick.