Warum dieser Benchmark nützlich ist
Wenn du Contest-Coding mit frischeren Aufgaben willst, die Trainingsdaten-Leakage besser widerstehen als klassische statische Suites.
Kontaminationsresistente Coding-Probleme aus aktuellen Contest-Releases — AA führt Modelle im öffentlichen Harness erneut aus.
Wenn du Contest-Coding mit frischeren Aufgaben willst, die Trainingsdaten-Leakage besser widerstehen als klassische statische Suites.
pass@1 aus öffentlichen AA-Harness-Läufen. Zeitgebundene Contest-Slices, keine Mehrdatei-IDE-Agenten — nicht als Produktions-Codebase-Fähigkeit lesen.
Auf die Skala dieses Benchmarks normalisiert (0–100). Die Tabelle zeigt die Rohwerte.
Scores nutzen die eigene Einheit und Skala dieses Benchmarks, keinen universellen Qualitätswert.
| # | Modell | Veröffentlichung | Score | Herkunft | Beleglage |
|---|---|---|---|---|---|
| 1 | Gemini 3 ProGoogle | 2025-11-18 | 91.7% | 2026-09-01 | Quelle geprüft |
| 2 | Gemini 3 Flash Preview (Reasoning)Google | 2025-12-17 | 90.8% | 2026-09-01 | Quelle geprüft |
| 3 | GLM-4.7 (Reasoning)Zhipu | 2025-12-22 | 89.4% | 2026-09-01 | Quelle geprüft |
| 4 | GPT-5.2 (medium)OpenAI | 2025-12-11 | 89.4% | 2026-09-01 | Quelle geprüft |
| 5 | GPT-5.2OpenAI | 2025-12-11 | 88.9% | 2026-09-01 | Quelle geprüft |
| 6 | Claude Opus 4.5 (Reasoning)Anthropic | 2025-11-24 | 87.1% | 2026-09-01 | Quelle geprüft |
| 7 | GPT-5.1OpenAI | 2025-11-13 | 86.8% | 2026-09-01 | Quelle geprüft |
| 8 | MiMo-V2-Flash (Reasoning)Xiaomi | 2025-12-16 | 86.8% | 2026-09-01 | Quelle geprüft |
| 9 | DeepSeek V3.2 (Reasoning)DeepSeek | 2025-12-01 | 86.2% | 2026-09-01 | Quelle geprüft |
| 10 | Gemini 3 Pro Preview (low)Google | 2025-11-18 | 85.7% | 2026-09-01 | Quelle geprüft |
| 11 | Kimi K2 ThinkingMoonshot | 2025-11-06 | 85.3% | 2026-09-01 | Quelle geprüft |
| 12 | GPT-5.1 Codex (high)OpenAI | 2025-11-13 | 84.9% | 2026-09-01 | Quelle geprüft |
| 13 | GPT-5 (high)OpenAI | 2025-08-07 | 84.6% | 2026-09-01 | Quelle geprüft |
| 14 | GPT-5 Codex (high)OpenAI | 2025-09-23 | 84% | 2026-09-01 | Quelle geprüft |
| 15 | Grok 4xAI | 2025-07-10 | 81.9% | 2026-09-01 | Quelle geprüft |
| 16 | MiniMax-M2.1MiniMax | 2025-12-23 | 81% | 2026-09-01 | Quelle geprüft |
| 17 | OpenAI o3OpenAI | 2025-04-16 | 80.8% | 2026-09-01 | Quelle geprüft |
| 18 | Gemini 3 Flash PreviewGoogle | 2025-12-17 | 79.7% | 2026-09-01 | Quelle geprüft |
| 19 | DeepSeek R1DeepSeek | 2025-01-20 | 77% | 2026-09-01 | Quelle geprüft |
| 20 | GPT-5 (low)OpenAI | 2025-08-07 | 76.3% | 2026-09-01 | Quelle geprüft |
| 21 | Claude Opus 4.5Anthropic | 2025-11-24 | 73.8% | 2026-09-01 | Quelle geprüft |
| 22 | Claude 4.5 Sonnet (Reasoning)Anthropic | 2025-09-29 | 71.4% | 2026-09-01 | Quelle geprüft |
| 23 | GPT-5 (medium)OpenAI | 2025-08-07 | 70.3% | 2026-09-01 | Quelle geprüft |
| 24 | OpenAI o1OpenAI | 2024-09-12 | 67.9% | 2026-09-01 | Quelle geprüft |
| 25 | Claude 4.1 Opus (Reasoning)Anthropic | 2025-08-05 | 65.4% | 2026-09-01 | Quelle geprüft |
| 26 | Claude 4 Opus (Reasoning)Anthropic | 2025-05-22 | 63.6% | 2026-09-01 | Quelle geprüft |
| 27 | Mistral Large 3Mistral | 2025-12-02 | 46.5% | 2026-09-01 | Quelle geprüft |
| 28 | Llama 4 MaverickMeta | 2026-04-05 | 39.7% | 2026-09-01 | Quelle geprüft |
| 29 | Llama 4 ScoutMeta | 2026-04-05 | 29.9% | 2026-09-01 | Quelle geprüft |
| 30 | Command ACohere | 2026-03-15 | 28.7% | 2026-09-01 | Quelle geprüft |
| 31 | Claude 3 OpusAnthropic | 2024-03-04 | 27.9% | 2026-09-01 | Quelle geprüft |
Dieser Benchmark gehört zur Familie coding. Sein Format: Zeitgebundene Coding-Tasks mit öffentlichem Grader. Der Score sollte immer mit Aufgabenformat, Bewertungsmethode, Quelldatum und Benchmark-Version gelesen werden.
Noch ist keine Obergrenze erfasst. Wenn sich Scores oben bündeln, kann der Benchmark Frontier-Modelle möglicherweise nicht mehr trennen.
Jede Antwort unten stammt aus den datierten Feldern dieser Seite. Nichts davon ist zusätzlich für Suchmaschinen geschrieben.
Kontaminationsresistente Coding-Probleme aus aktuellen Contest-Releases — AA führt Modelle im öffentlichen Harness erneut aus.
Ein starkes LiveCodeBench-Ergebnis sagt nichts aus über:
pass@1-Prozent aus AA-Läufen. Aufgabenformat: Zeitgebundene Coding-Tasks mit öffentlichem Grader.
LiveCodeBench ist im Atlas derzeit als Aktiv markiert.
Das Kontaminationsrisiko für LiveCodeBench ist als Kontamination niedrig eingestuft. Behandle jede Zeile auf dieser Seite als öffentliche Angabe mit Quelle und Datum, nicht als kontrolliertes Experiment.
The Pack · Redaktionsnewsletter
Eine kurze E-Mail, wenn ein Tool erscheint oder den Status wechselt. Kein Tracking, keine Drittanbieter-Analytics. Abmeldung mit einem Klick.