Benchmarks / Reasoning

LiveBench

Ein kontaminationsarmer Benchmark, der Fragen über Zeit erneuert und Reasoning, Coding, Mathe, Datenanalyse, Sprache und Instruction Following abdeckt.

ReasoningSolidAktivNiedriges KontaminationsrisikoSeit 2024
Was dieser Benchmark nicht misst
  • Keine statische Benchmark-Meisterschaft — der Sinn ist Frische; alte Snapshots sind keine dauerhafte Modellwahrheit.
  • Keine domänenspezifische Zuverlässigkeit — ein breiter Score kann Schwächen in der Domäne verstecken, die der Leser wirklich braucht.
  • Keine Kosten, Latenz oder Datenschutz — LiveBench ist Capability-Evidenz, keine Produktreife-Evidenz.
Analyse

Warum dieser Benchmark nützlich ist

Viele klassische Tests sind memorisiert, gesättigt oder alt. LiveBench verdient einen Platz, weil der Fragenpool explizit regelmäßig erneuert wird.

Umfang

Abdeckung

Aufgabenfamilie
Reasoning
Format
Regelmäßig erneuerte Aufgaben über mehrere Kategorien; aktuelle Releases stehen auf der LiveBench-Seite.
Bewertung
Kategorie- und globale Durchschnitte je LiveBench-Release. Nur innerhalb desselben Releases vergleichen.
Verantwortliche Stelle
LiveBench team
Lesehilfe

So liest du die Scores

Zum Score immer das LiveBench-Release-Datum lesen. Die Position eines Modells auf einem alten Snapshot kann nach dem nächsten Refresh kippen.

Blinde Flecken

Was er nicht abdeckt

  • Keine statische Benchmark-Meisterschaft — der Sinn ist Frische; alte Snapshots sind keine dauerhafte Modellwahrheit.
  • Keine domänenspezifische Zuverlässigkeit — ein breiter Score kann Schwächen in der Domäne verstecken, die der Leser wirklich braucht.
  • Keine Kosten, Latenz oder Datenschutz — LiveBench ist Capability-Evidenz, keine Produktreife-Evidenz.
Scores

Evidenz-Ledger

21 Zeilen
2121 Zeilen
71.4%bester Score
0quellgeprüft
1Quellen
2026-04-15Quelldatum
LiveBench21

official-page · manual

Verteilung

Wo die Zeilen liegen

0255075100

Auf die Skala dieses Benchmarks normalisiert (0–100). Die Tabelle zeigt die Rohwerte.

Zeitverlauf

Neueste Belege

  1. Claude Opus 4.671.4% · LiveBench leaderboard
  2. Claude Opus 4.870.8% · LiveBench leaderboard
  3. GPT 5.569.8% · LiveBench leaderboard
  4. o368.5% · LiveBench leaderboard
  5. Claude Sonnet 4.667.2% · LiveBench leaderboard

Scores nutzen die eigene Einheit und Skala dieses Benchmarks, keinen universellen Qualitätswert.

#ModellVeröffentlichungScoreHerkunftBeleglage
1Claude Opus 4.6AnthropicLatest LiveBench release. Compare within same release only.2026-02-0571.4%
LiveBench leaderboard2026-04-15
Prüfung nötig
2Claude Opus 4.8Anthropic2026-05-2870.8%
LiveBench leaderboard2026-04-15
Prüfung nötig
3GPT 5.5OpenAI2026-04-2369.8%
LiveBench leaderboard2026-04-15
Prüfung nötig
4o3OpenAIStrong in math and reasoning categories; softer in instruction-following.2025-04-1668.5%
LiveBench leaderboard2026-04-15
Prüfung nötig
5Claude Sonnet 4.6Anthropic2026-02-1767.2%
LiveBench leaderboard2026-04-15
Prüfung nötig
6GPT 5.4OpenAI2026-03-0566.4%
LiveBench leaderboard2026-04-15
Prüfung nötig
7Gemini 3.1 ProGoogle2026-02-1965.8%
LiveBench leaderboard2026-04-15
Prüfung nötig
8Gemini 3.5 FlashGoogle2026-05-1964.2%
LiveBench leaderboard2026-04-15
Prüfung nötig
9DeepSeek R1DeepSeek2025-01-2064.1%
LiveBench leaderboard2026-04-15
Prüfung nötig
10Gemini 3 Flash PreviewGoogle2025-12-1763.5%
LiveBench leaderboard2026-04-15
Prüfung nötig
11Mistral Large 3Mistral2025-12-0262.8%
LiveBench leaderboard2026-04-15
Prüfung nötig
12Kimi K2.6Moonshot2026-04-2062.4%
LiveBench leaderboard2026-04-15
Prüfung nötig
13Llama 4 MaverickMeta2026-04-0562.1%
LiveBench leaderboard2026-04-15
Prüfung nötig
14DeepSeek V4DeepSeek2026-04-2461.9%
LiveBench leaderboard2026-04-15
Prüfung nötig
15Qwen 3.7 MaxAlibaba2026-05-2061.6%
LiveBench leaderboard2026-04-15
Prüfung nötig
16Kimi K2.5Moonshot2026-01-2761.2%
LiveBench leaderboard2026-04-15
Prüfung nötig
17Grok 4.3xAI2026-04-3060.8%
LiveBench leaderboard2026-04-15
Prüfung nötig
19MiniMax M3MiniMax2026-05-3159.6%
LiveBench leaderboard2026-04-15
Prüfung nötig
20Llama 4 ScoutMeta2026-04-0558.9%
LiveBench leaderboard2026-04-15
Prüfung nötig
21Claude Haiku 4.5Anthropic2025-10-0157.8%
LiveBench leaderboard2026-04-15
Prüfung nötig
22Grok 4.20 ReasoningxAI2026-03-0556.4%
LiveBench leaderboard2026-04-15
Prüfung nötig
Methode

Was er abdeckt

Primärquelle ist livebench.ai. VerdictPal sollte das LiveBench-Release-Label in jeder Score-Zeile speichern.

Score-Obergrenze

Wo er an Grenzen stößt

Der breite Durchschnitt ist eine Karte, kein Urteil. Vor der Toolwahl in die Aufgabenfamilien hineinzoomen.

Tools, die ihn ausweisen

Belege

Quellen und weiterführende Lektüre

The Pack · Redaktionsnewsletter

Neue Karten in dein Postfach. Kostenlos.

Eine kurze E-Mail, wenn eine Karte erscheint oder den Status wechselt. Kein Tracking, keine Drittanbieter-Analytics. Abmeldung mit einem Klick.