Benchmarks / Coding

LiveCodeBench

Kontaminationsresistente Coding-Probleme aus aktuellen Contest-Releases — AA führt Modelle im öffentlichen Harness erneut aus.

CodingSolidAktivNiedriges KontaminationsrisikoSeit 2024
Was dieser Benchmark nicht misst
  • Mehrdatei-Refactors oder IDE-Agent-Loops.
  • Privater Codebase-Kontext — Aufgaben sind nur öffentliche Contest-Slices.
Analyse

Warum dieser Benchmark nützlich ist

Redaktionelle Einordnung ausstehendWir veröffentlichen zuerst Methodik und Ledger. Die benchmark-spezifische Analyse folgt nach der Desk-Prüfung.

Umfang

Abdeckung

Aufgabenfamilie
Coding
Format
Zeitgebundene Coding-Tasks mit öffentlichem Grader.
Bewertung
pass@1-Prozent aus AA-Läufen.
Verantwortliche Stelle
LiveCodeBench authors
Lesehilfe

So liest du die Scores

Die Lesehilfe steht noch aus. Nutze bis zur Desk-Einordnung Aufgabenformat, Bewertungsmethode und Quelldaten im Ledger.

Blinde Flecken

Was er nicht abdeckt

  • Mehrdatei-Refactors oder IDE-Agent-Loops.
  • Privater Codebase-Kontext — Aufgaben sind nur öffentliche Contest-Slices.
Scores

Evidenz-Ledger

13 Zeilen
1313 Zeilen
91.7%bester Score
13quellgeprüft
1Quellen
2026-07-21Quelldatum
13

api · api

Verteilung

Wo die Zeilen liegen

0255075100

Auf die Skala dieses Benchmarks normalisiert (0–100). Die Tabelle zeigt die Rohwerte.

Zeitverlauf

Neueste Belege

  1. Gemini 3 Pro91.7% ·
  2. GPT-5.288.9% ·
  3. GPT-5.186.8% ·
  4. OpenAI o380.8% ·
  5. Gemini 3 Flash Preview79.7% ·

Scores nutzen die eigene Einheit und Skala dieses Benchmarks, keinen universellen Qualitätswert.

#ModellVeröffentlichungScoreHerkunftBeleglage
1Gemini 3 ProGoogle2025-11-1891.7%
2026-07-21
Quelle geprüft
2GPT-5.2OpenAI2025-12-1188.9%
2026-07-21
Quelle geprüft
3GPT-5.1OpenAI2025-11-1386.8%
2026-07-21
Quelle geprüft
4OpenAI o3OpenAI2025-04-1680.8%
2026-07-21
Quelle geprüft
5Gemini 3 Flash PreviewGoogle2025-12-1779.7%
2026-07-21
Quelle geprüft
6DeepSeek R1DeepSeek2025-01-2077%
2026-07-21
Quelle geprüft
7Claude Opus 4.5Anthropic2025-11-2473.8%
2026-07-21
Quelle geprüft
8OpenAI o1OpenAI2024-09-1267.9%
2026-07-21
Quelle geprüft
9Mistral Large 3Mistral2025-12-0246.5%
2026-07-21
Quelle geprüft
10Llama 4 MaverickMeta2026-04-0539.7%
2026-07-21
Quelle geprüft
11Llama 4 ScoutMeta2026-04-0529.9%
2026-07-21
Quelle geprüft
12Command ACohere2026-03-1528.7%
2026-07-21
Quelle geprüft
13Claude 3 OpusAnthropic2024-03-0427.9%
2026-07-21
Quelle geprüft
Methode

Was er abdeckt

Die Notiz zur Datenqualität steht aus. Jede Ledger-Zeile trägt weiterhin Quellen-URL, Quelldatum und Zeitpunkt des Einlesens.

Score-Obergrenze

Wo er an Grenzen stößt

Noch ist keine Obergrenze erfasst. Wenn sich Scores oben bündeln, kann der Benchmark Frontier-Modelle möglicherweise nicht mehr trennen.

Belege

Quellen und weiterführende Lektüre

The Pack · Redaktionsnewsletter

Neue Karten in dein Postfach. Kostenlos.

Eine kurze E-Mail, wenn eine Karte erscheint oder den Status wechselt. Kein Tracking, keine Drittanbieter-Analytics. Abmeldung mit einem Klick.