Warum dieser Benchmark nützlich ist
Viele klassische Tests sind memorisiert, gesättigt oder alt. LiveBench verdient einen Platz, weil der Fragenpool explizit regelmäßig erneuert wird.
Benchmarks / Reasoning
Ein kontaminationsarmer Benchmark, der Fragen über Zeit erneuert und Reasoning, Coding, Mathe, Datenanalyse, Sprache und Instruction Following abdeckt.
Viele klassische Tests sind memorisiert, gesättigt oder alt. LiveBench verdient einen Platz, weil der Fragenpool explizit regelmäßig erneuert wird.
Zum Score immer das LiveBench-Release-Datum lesen. Die Position eines Modells auf einem alten Snapshot kann nach dem nächsten Refresh kippen.
Auf die Skala dieses Benchmarks normalisiert (0–100). Die Tabelle zeigt die Rohwerte.
Scores nutzen die eigene Einheit und Skala dieses Benchmarks, keinen universellen Qualitätswert.
| # | Modell | Veröffentlichung | Score | Herkunft | Beleglage |
|---|---|---|---|---|---|
| 1 | Claude Opus 4.6AnthropicLatest LiveBench release. Compare within same release only. | 2026-02-05 | 71.4% | LiveBench leaderboard2026-04-15 | Prüfung nötig |
| 2 | Claude Opus 4.8Anthropic | 2026-05-28 | 70.8% | LiveBench leaderboard2026-04-15 | Prüfung nötig |
| 3 | GPT 5.5OpenAI | 2026-04-23 | 69.8% | LiveBench leaderboard2026-04-15 | Prüfung nötig |
| 4 | o3OpenAIStrong in math and reasoning categories; softer in instruction-following. | 2025-04-16 | 68.5% | LiveBench leaderboard2026-04-15 | Prüfung nötig |
| 5 | Claude Sonnet 4.6Anthropic | 2026-02-17 | 67.2% | LiveBench leaderboard2026-04-15 | Prüfung nötig |
| 6 | GPT 5.4OpenAI | 2026-03-05 | 66.4% | LiveBench leaderboard2026-04-15 | Prüfung nötig |
| 7 | Gemini 3.1 ProGoogle | 2026-02-19 | 65.8% | LiveBench leaderboard2026-04-15 | Prüfung nötig |
| 8 | Gemini 3.5 FlashGoogle | 2026-05-19 | 64.2% | LiveBench leaderboard2026-04-15 | Prüfung nötig |
| 9 | DeepSeek R1DeepSeek | 2025-01-20 | 64.1% | LiveBench leaderboard2026-04-15 | Prüfung nötig |
| 10 | Gemini 3 Flash PreviewGoogle | 2025-12-17 | 63.5% | LiveBench leaderboard2026-04-15 | Prüfung nötig |
| 11 | Mistral Large 3Mistral | 2025-12-02 | 62.8% | LiveBench leaderboard2026-04-15 | Prüfung nötig |
| 12 | Kimi K2.6Moonshot | 2026-04-20 | 62.4% | LiveBench leaderboard2026-04-15 | Prüfung nötig |
| 13 | Llama 4 MaverickMeta | 2026-04-05 | 62.1% | LiveBench leaderboard2026-04-15 | Prüfung nötig |
| 14 | DeepSeek V4DeepSeek | 2026-04-24 | 61.9% | LiveBench leaderboard2026-04-15 | Prüfung nötig |
| 15 | Qwen 3.7 MaxAlibaba | 2026-05-20 | 61.6% | LiveBench leaderboard2026-04-15 | Prüfung nötig |
| 16 | Kimi K2.5Moonshot | 2026-01-27 | 61.2% | LiveBench leaderboard2026-04-15 | Prüfung nötig |
| 17 | Grok 4.3xAI | 2026-04-30 | 60.8% | LiveBench leaderboard2026-04-15 | Prüfung nötig |
| 19 | MiniMax M3MiniMax | 2026-05-31 | 59.6% | LiveBench leaderboard2026-04-15 | Prüfung nötig |
| 20 | Llama 4 ScoutMeta | 2026-04-05 | 58.9% | LiveBench leaderboard2026-04-15 | Prüfung nötig |
| 21 | Claude Haiku 4.5Anthropic | 2025-10-01 | 57.8% | LiveBench leaderboard2026-04-15 | Prüfung nötig |
| 22 | Grok 4.20 ReasoningxAI | 2026-03-05 | 56.4% | LiveBench leaderboard2026-04-15 | Prüfung nötig |
Primärquelle ist livebench.ai. VerdictPal sollte das LiveBench-Release-Label in jeder Score-Zeile speichern.
Der breite Durchschnitt ist eine Karte, kein Urteil. Vor der Toolwahl in die Aufgabenfamilien hineinzoomen.
The Pack · Redaktionsnewsletter
Eine kurze E-Mail, wenn eine Karte erscheint oder den Status wechselt. Kein Tracking, keine Drittanbieter-Analytics. Abmeldung mit einem Klick.