Benchmarks / Coding

LiveCodeBench

Kontaminationsresistente Coding-Probleme aus aktuellen Contest-Releases — AA führt Modelle im öffentlichen Harness erneut aus.

Was dieser Benchmark nicht misst
  • Mehrdatei-Refactors oder IDE-Agent-Loops.
  • Privater Codebase-Kontext — Aufgaben sind nur öffentliche Contest-Slices.
Analyse

Warum dieser Benchmark nützlich ist

Wenn du Contest-Coding mit frischeren Aufgaben willst, die Trainingsdaten-Leakage besser widerstehen als klassische statische Suites.

Umfang

Abdeckung

Aufgabenfamilie
Coding
Format
Zeitgebundene Coding-Tasks mit öffentlichem Grader.
Bewertung
pass@1-Prozent aus AA-Läufen.
Verantwortliche Stelle
LiveCodeBench authors
Lesehilfe

So liest du die Scores

pass@1 aus öffentlichen AA-Harness-Läufen. Zeitgebundene Contest-Slices, keine Mehrdatei-IDE-Agenten — nicht als Produktions-Codebase-Fähigkeit lesen.

Blinde Flecken

Was er nicht abdeckt

  • Mehrdatei-Refactors oder IDE-Agent-Loops.
  • Privater Codebase-Kontext — Aufgaben sind nur öffentliche Contest-Slices.
Scores

Evidenz-Ledger

31 Zeilen
3131 Zeilen
91.7%bester Score
31quellgeprüft
1Quellen
2026-09-01Quelldatum
31

api · api

Verteilung

Wo die Zeilen liegen

0255075100

Auf die Skala dieses Benchmarks normalisiert (0–100). Die Tabelle zeigt die Rohwerte.

Zeitverlauf

Neueste Belege

  1. Gemini 3 Pro91.7% ·
  2. Gemini 3 Flash Preview (Reasoning)90.8% ·
  3. GLM-4.7 (Reasoning)89.4% ·
  4. GPT-5.2 (medium)89.4% ·
  5. GPT-5.288.9% ·

Scores nutzen die eigene Einheit und Skala dieses Benchmarks, keinen universellen Qualitätswert.

#ModellVeröffentlichungScoreHerkunftBeleglage
1Gemini 3 ProGoogle2025-11-1891.7%
2026-09-01
Quelle geprüft
2Gemini 3 Flash Preview (Reasoning)Google2025-12-1790.8%
2026-09-01
Quelle geprüft
3GLM-4.7 (Reasoning)Zhipu2025-12-2289.4%
2026-09-01
Quelle geprüft
4GPT-5.2 (medium)OpenAI2025-12-1189.4%
2026-09-01
Quelle geprüft
5GPT-5.2OpenAI2025-12-1188.9%
2026-09-01
Quelle geprüft
6Claude Opus 4.5 (Reasoning)Anthropic2025-11-2487.1%
2026-09-01
Quelle geprüft
7GPT-5.1OpenAI2025-11-1386.8%
2026-09-01
Quelle geprüft
8MiMo-V2-Flash (Reasoning)Xiaomi2025-12-1686.8%
2026-09-01
Quelle geprüft
9DeepSeek V3.2 (Reasoning)DeepSeek2025-12-0186.2%
2026-09-01
Quelle geprüft
10Gemini 3 Pro Preview (low)Google2025-11-1885.7%
2026-09-01
Quelle geprüft
11Kimi K2 ThinkingMoonshot2025-11-0685.3%
2026-09-01
Quelle geprüft
12GPT-5.1 Codex (high)OpenAI2025-11-1384.9%
2026-09-01
Quelle geprüft
13GPT-5 (high)OpenAI2025-08-0784.6%
2026-09-01
Quelle geprüft
14GPT-5 Codex (high)OpenAI2025-09-2384%
2026-09-01
Quelle geprüft
15Grok 4xAI2025-07-1081.9%
2026-09-01
Quelle geprüft
16MiniMax-M2.1MiniMax2025-12-2381%
2026-09-01
Quelle geprüft
17OpenAI o3OpenAI2025-04-1680.8%
2026-09-01
Quelle geprüft
18Gemini 3 Flash PreviewGoogle2025-12-1779.7%
2026-09-01
Quelle geprüft
19DeepSeek R1DeepSeek2025-01-2077%
2026-09-01
Quelle geprüft
20GPT-5 (low)OpenAI2025-08-0776.3%
2026-09-01
Quelle geprüft
21Claude Opus 4.5Anthropic2025-11-2473.8%
2026-09-01
Quelle geprüft
22Claude 4.5 Sonnet (Reasoning)Anthropic2025-09-2971.4%
2026-09-01
Quelle geprüft
23GPT-5 (medium)OpenAI2025-08-0770.3%
2026-09-01
Quelle geprüft
24OpenAI o1OpenAI2024-09-1267.9%
2026-09-01
Quelle geprüft
25Claude 4.1 Opus (Reasoning)Anthropic2025-08-0565.4%
2026-09-01
Quelle geprüft
26Claude 4 Opus (Reasoning)Anthropic2025-05-2263.6%
2026-09-01
Quelle geprüft
27Mistral Large 3Mistral2025-12-0246.5%
2026-09-01
Quelle geprüft
28Llama 4 MaverickMeta2026-04-0539.7%
2026-09-01
Quelle geprüft
29Llama 4 ScoutMeta2026-04-0529.9%
2026-09-01
Quelle geprüft
30Command ACohere2026-03-1528.7%
2026-09-01
Quelle geprüft
31Claude 3 OpusAnthropic2024-03-0427.9%
2026-09-01
Quelle geprüft
Methode

Was er abdeckt

Dieser Benchmark gehört zur Familie coding. Sein Format: Zeitgebundene Coding-Tasks mit öffentlichem Grader. Der Score sollte immer mit Aufgabenformat, Bewertungsmethode, Quelldatum und Benchmark-Version gelesen werden.

Score-Obergrenze

Wo er an Grenzen stößt

Noch ist keine Obergrenze erfasst. Wenn sich Scores oben bündeln, kann der Benchmark Frontier-Modelle möglicherweise nicht mehr trennen.

Belege

Quellen und weiterführende Lektüre

Fragen zu diesem Benchmark

Jede Antwort unten stammt aus den datierten Feldern dieser Seite. Nichts davon ist zusätzlich für Suchmaschinen geschrieben.

Was misst LiveCodeBench?

Kontaminationsresistente Coding-Probleme aus aktuellen Contest-Releases — AA führt Modelle im öffentlichen Harness erneut aus.

Was beweist ein hoher LiveCodeBench-Wert nicht?

Ein starkes LiveCodeBench-Ergebnis sagt nichts aus über:

  • Mehrdatei-Refactors oder IDE-Agent-Loops.
  • Privater Codebase-Kontext — Aufgaben sind nur öffentliche Contest-Slices.

Wie wird LiveCodeBench bewertet?

pass@1-Prozent aus AA-Läufen. Aufgabenformat: Zeitgebundene Coding-Tasks mit öffentlichem Grader.

Ist LiveCodeBench gesättigt?

LiveCodeBench ist im Atlas derzeit als Aktiv markiert.

Können LiveCodeBench-Ergebnisse durch Trainingsdaten verunreinigt sein?

Das Kontaminationsrisiko für LiveCodeBench ist als Kontamination niedrig eingestuft. Behandle jede Zeile auf dieser Seite als öffentliche Angabe mit Quelle und Datum, nicht als kontrolliertes Experiment.

The Pack · Redaktionsnewsletter

Neue Tools in dein Postfach. Kostenlos.

Eine kurze E-Mail, wenn ein Tool erscheint oder den Status wechselt. Kein Tracking, keine Drittanbieter-Analytics. Abmeldung mit einem Klick.