Warum dieser Benchmark nützlich ist
Long Context ist heute ein Produktversprechen fast jedes Frontier-Modells. LongBench v2 trennt Fenstergröße von echter Langkontext-Schlussfolgerung.
Benchmarks / Langer Kontext
LongBench 2
Ob Long-Context-Modelle über lange, realistische Inputs schlussfolgern können, statt nur ein großes Tokenfenster anzunehmen.
Long Context ist heute ein Produktversprechen fast jedes Frontier-Modells. LongBench v2 trennt Fenstergröße von echter Langkontext-Schlussfolgerung.
Werte immer neben Kontextlänge, Prompt-Setting und CoT-Erlaubnis lesen. Dasselbe Modell kann sich bewegen, wenn sich das Reasoning-Setup ändert.
Auf die Skala dieses Benchmarks normalisiert (0–100). Die Tabelle zeigt die Rohwerte.
Scores nutzen die eigene Einheit und Skala dieses Benchmarks, keinen universellen Qualitätswert.
| # | Modell | Veröffentlichung | Score | Herkunft | Beleglage |
|---|---|---|---|---|---|
| 1 | Claude Opus 4.8AnthropicNo-CoT setting. CoT evaluation shows different results — read both. | 2026-05-28 | 58.4% | LongBench v2 leaderboard2026-04-01 | Prüfung nötig |
| 2 | Llama 4 ScoutMeta10M context variant — strong on retrieval-heavy document tasks. | 2026-04-05 | 57.2% | LongBench v2 leaderboard2026-04-01 | Prüfung nötig |
| 3 | GPT 5.5OpenAI | 2026-04-23 | 56.1% | LongBench v2 leaderboard2026-04-01 | Prüfung nötig |
| 4 | Gemini 3.1 ProGoogle | 2026-02-19 | 55.4% | LongBench v2 leaderboard2026-04-01 | Prüfung nötig |
| 5 | Gemini 2.0 UltraGoogle | 2024-12-11 | 54.8% | LongBench v2 leaderboard2026-04-01 | Prüfung nötig |
| 6 | GPT 5.4OpenAI | 2026-03-05 | 54.2% | LongBench v2 leaderboard2026-04-01 | Prüfung nötig |
| 7 | Gemini 3.5 FlashGoogle | 2026-05-19 | 53.8% | LongBench v2 leaderboard2026-04-01 | Prüfung nötig |
| 8 | Claude Sonnet 4.6Anthropic | 2026-02-17 | 52.6% | LongBench v2 leaderboard2026-04-01 | Prüfung nötig |
| 9 | Gemini 3 Flash PreviewGoogle | 2025-12-17 | 51.4% | LongBench v2 leaderboard2026-04-01 | Prüfung nötig |
| 10 | o3OpenAIReasoning models show mixed results on retrieval-heavy long-context tasks. | 2025-04-16 | 51.2% | LongBench v2 leaderboard2026-04-01 | Prüfung nötig |
| 11 | Mistral Large 3Mistral | 2025-12-02 | 50.8% | LongBench v2 leaderboard2026-04-01 | Prüfung nötig |
| 12 | Llama 4 MaverickMeta | 2026-04-05 | 49.8% | LongBench v2 leaderboard2026-04-01 | Prüfung nötig |
| 13 | Kimi K2.6Moonshot | 2026-04-20 | 49.1% | LongBench v2 leaderboard2026-04-01 | Prüfung nötig |
| 14 | DeepSeek V4DeepSeek | 2026-04-24 | 48.6% | LongBench v2 leaderboard2026-04-01 | Prüfung nötig |
| 15 | Kimi K2.5Moonshot | 2026-01-27 | 48.2% | LongBench v2 leaderboard2026-04-01 | Prüfung nötig |
| 16 | Qwen 3.7 MaxAlibaba | 2026-05-20 | 47.8% | LongBench v2 leaderboard2026-04-01 | Prüfung nötig |
| 17 | Grok 4.3xAI | 2026-04-30 | 46.2% | LongBench v2 leaderboard2026-04-01 | Prüfung nötig |
| 18 | MiniMax M3MiniMax | 2026-05-31 | 45.6% | LongBench v2 leaderboard2026-04-01 | Prüfung nötig |
| 19 | Claude Haiku 4.5Anthropic | 2025-10-01 | 44.8% | LongBench v2 leaderboard2026-04-01 | Prüfung nötig |
Primärquelle ist das LongBench-v2-Leaderboard. VerdictPal sollte das no-CoT-/CoT-Setting in jeder Zeile erhalten.
Ein guter LongBench-Wert beweist keine Citation Fidelity, keine Quellenwahl und keinen datenschutzsicheren Dokumentenumgang.
The Pack · Redaktionsnewsletter
Eine kurze E-Mail, wenn eine Karte erscheint oder den Status wechselt. Kein Tracking, keine Drittanbieter-Analytics. Abmeldung mit einem Klick.