Warum dieser Benchmark nützlich ist
ARC Prize ist die einzige Benchmark-Serie, die wiederholt neue Wendepunkte zeigt — von Reasoning-Systemen (ARC-AGI-2) bis agentischer Intelligenz (ARC-AGI-3).
Benchmarks / Reasoning
ARC-AGI
Flüssiges, dateneffizientes Schließen über die ARC-Prize-Benchmark-Serie — von statischen Gitter-Rätseln (ARC-AGI-1/2) bis zu interaktiven agentischen Umgebungen (ARC-AGI-3). Gegen Auswendiglernen gebaut, belohnt echte Generalisierung.
ARC Prize ist die einzige Benchmark-Serie, die wiederholt neue Wendepunkte zeigt — von Reasoning-Systemen (ARC-AGI-2) bis agentischer Intelligenz (ARC-AGI-3).
Zuerst die Edition wählen. ARC-AGI-2-Werte sind statische Puzzle-Genauigkeit; ARC-AGI-3-Werte sind Umgebungs-Löseraten mit spärlichem Feedback. Niemals in einem Composite mischen.
Interaktiver Benchmark März 2026: Agenten erkunden neue Umgebungen, erwerben Ziele spontan und passen sich ohne Sprachanweisungen an. Misst agentische fluide Intelligenz.
Auf die Skala dieses Benchmarks normalisiert (0–100). Die Tabelle zeigt die Rohwerte.
Scores nutzen die eigene Einheit und Skala dieses Benchmarks, keinen universellen Qualitätswert.
| # | Modell | Veröffentlichung | Score | Herkunft | Beleglage |
|---|---|---|---|---|---|
| 1 | Claude Opus 4.6 (Max)Anthropic | 2026-03-09 | 0.5% | ARC-AGI-3 paper (arXiv 2603.24621)2026-03-20 | Quelle geprüft |
| 2 | Gemini 3.1 Pro PreviewGoogle | 2026-02-19 | 0.4% | ARC-AGI-3 paper (arXiv 2603.24621)2026-03-20 | Quelle geprüft |
| 3 | GPT 5.4 (High)OpenAI | 2026-04-15 | 0.2% | ARC-AGI-3 paper (arXiv 2603.24621)2026-03-20 | Quelle geprüft |
| 4 | Grok 4.20 (Reasoning)xAI | 2026-03-09 | 0.1% | ARC-AGI-3 paper (arXiv 2603.24621)2026-03-20 | Quelle geprüft |
Dieser Benchmark gehört zur Familie reasoning. Sein Format: Edition-abhängig: Gitter-zu-Gitter-Rätsel (v1/v2) oder interaktive turn-basierte Umgebungen (v3). Zurückgehaltene Privat-Sets verhindern Overfitting. Der Score sollte immer mit Aufgabenformat, Bewertungsmethode, Quelldatum und Benchmark-Version gelesen werden.
Menschen lösen 100 % der Umgebungen. Frontier-Modelle liegen bei Release unter 1 % (Opus 4.6 ~0,5 %, Gemini 3.1 Pro ~0,4 %).
The Pack · Redaktionsnewsletter
Eine kurze E-Mail, wenn eine Karte erscheint oder den Status wechselt. Kein Tracking, keine Drittanbieter-Analytics. Abmeldung mit einem Klick.