Warum dieser Benchmark nützlich ist
Long Context ist heute ein Produktversprechen fast jedes Frontier-Modells. LongBench v2 trennt Fenstergröße von echter Langkontext-Schlussfolgerung.
LongBench 2
Ob Long-Context-Modelle über lange, realistische Inputs schlussfolgern können, statt nur ein großes Tokenfenster anzunehmen.
Long Context ist heute ein Produktversprechen fast jedes Frontier-Modells. LongBench v2 trennt Fenstergröße von echter Langkontext-Schlussfolgerung.
Werte immer neben Kontextlänge, Prompt-Setting und CoT-Erlaubnis lesen. Dasselbe Modell kann sich bewegen, wenn sich das Reasoning-Setup ändert.
Auf die Skala dieses Benchmarks normalisiert (0–100). Die Tabelle zeigt die Rohwerte.
Scores nutzen die eigene Einheit und Skala dieses Benchmarks, keinen universellen Qualitätswert.
| # | Modell | Veröffentlichung | Score | Herkunft | Beleglage |
|---|---|---|---|---|---|
| 1 | Claude Opus 4.8AnthropicNo-CoT setting. CoT evaluation shows different results — read both. | 2026-05-28 | 58.4% | LongBench v2 leaderboard2026-04-01 | Prüfung nötig |
| 2 | Llama 4 ScoutMeta10M context variant — strong on retrieval-heavy document tasks. | 2026-04-05 | 57.2% | LongBench v2 leaderboard2026-04-01 | Prüfung nötig |
| 3 | GPT 5.5OpenAI | 2026-04-23 | 56.1% | LongBench v2 leaderboard2026-04-01 | Prüfung nötig |
| 4 | Gemini 3.1 ProGoogle | 2026-02-19 | 55.4% | LongBench v2 leaderboard2026-04-01 | Prüfung nötig |
| 5 | Gemini 2.0 UltraGoogle | 2024-12-11 | 54.8% | LongBench v2 leaderboard2026-04-01 | Prüfung nötig |
| 6 | GPT 5.4OpenAI | 2026-03-05 | 54.2% | LongBench v2 leaderboard2026-04-01 | Prüfung nötig |
| 7 | Gemini 3.5 FlashGoogle | 2026-05-19 | 53.8% | LongBench v2 leaderboard2026-04-01 | Prüfung nötig |
| 8 | Claude Sonnet 4.6Anthropic | 2026-02-17 | 52.6% | LongBench v2 leaderboard2026-04-01 | Prüfung nötig |
| 9 | Gemini 3 Flash PreviewGoogle | 2025-12-17 | 51.4% | LongBench v2 leaderboard2026-04-01 | Prüfung nötig |
| 10 | o3OpenAIReasoning models show mixed results on retrieval-heavy long-context tasks. | 2025-04-16 | 51.2% | LongBench v2 leaderboard2026-04-01 | Prüfung nötig |
| 11 | Mistral Large 3Mistral | 2025-12-02 | 50.8% | LongBench v2 leaderboard2026-04-01 | Prüfung nötig |
| 12 | Llama 4 MaverickMeta | 2026-04-05 | 49.8% | LongBench v2 leaderboard2026-04-01 | Prüfung nötig |
| 13 | Kimi K2.6Moonshot | 2026-04-20 | 49.1% | LongBench v2 leaderboard2026-04-01 | Prüfung nötig |
| 14 | DeepSeek V4DeepSeek | 2026-04-24 | 48.6% | LongBench v2 leaderboard2026-04-01 | Prüfung nötig |
| 15 | Kimi K2.5Moonshot | 2026-01-27 | 48.2% | LongBench v2 leaderboard2026-04-01 | Prüfung nötig |
| 16 | Qwen 3.7 MaxAlibaba | 2026-05-20 | 47.8% | LongBench v2 leaderboard2026-04-01 | Prüfung nötig |
| 17 | Grok 4.3xAI | 2026-04-30 | 46.2% | LongBench v2 leaderboard2026-04-01 | Prüfung nötig |
| 18 | MiniMax M3MiniMax | 2026-05-31 | 45.6% | LongBench v2 leaderboard2026-04-01 | Prüfung nötig |
| 19 | Claude Haiku 4.5Anthropic | 2025-10-01 | 44.8% | LongBench v2 leaderboard2026-04-01 | Prüfung nötig |
Primärquelle ist das LongBench-v2-Leaderboard. VerdictPal sollte das no-CoT-/CoT-Setting in jeder Zeile erhalten.
Ein guter LongBench-Wert beweist keine Citation Fidelity, keine Quellenwahl und keinen datenschutzsicheren Dokumentenumgang.
Jede Antwort unten stammt aus den datierten Feldern dieser Seite. Nichts davon ist zusätzlich für Suchmaschinen geschrieben.
Ob Long-Context-Modelle über lange, realistische Inputs schlussfolgern können, statt nur ein großes Tokenfenster anzunehmen.
Ein starkes LongBench v2-Ergebnis sagt nichts aus über:
Accuracy-artiges Aggregat je Evaluationssetting. Nur innerhalb desselben Settings vergleichen. Aufgabenformat: Langdokument- und Langkontext-Reasoning-Aufgaben mit Leaderboard-Settings für no-CoT- und CoT-Evaluation.
LongBench v2 ist im Atlas derzeit als Aktiv markiert.
Das Kontaminationsrisiko für LongBench v2 ist als Kontamination mittel eingestuft. Behandle jede Zeile auf dieser Seite als öffentliche Angabe mit Quelle und Datum, nicht als kontrolliertes Experiment.
The Pack · Redaktionsnewsletter
Eine kurze E-Mail, wenn ein Tool erscheint oder den Status wechselt. Kein Tracking, keine Drittanbieter-Analytics. Abmeldung mit einem Klick.