Benchmarks / Langer Kontext

LongBench v2

LongBench 2

Ob Long-Context-Modelle über lange, realistische Inputs schlussfolgern können, statt nur ein großes Tokenfenster anzunehmen.

Langer KontextSolidAktivMittleres KontaminationsrisikoSeit 2025
Was dieser Benchmark nicht misst
  • Keine Retrieval-Qualität — der Benchmark testet Modellnutzung bereitgestellten Kontexts, nicht ob dein Suchsystem die richtigen Dokumente gefunden hat.
  • Nicht jede Langdokument-Aufgabe — Legal Review, Literature Review, Codebase-Navigation und Meeting-Analyse scheitern unterschiedlich.
  • Kein garantiert nutzbares Kontextfenster — beworbene Tokenlimits können bei realen Prompts schon vorher degradieren.
Analyse

Warum dieser Benchmark nützlich ist

Long Context ist heute ein Produktversprechen fast jedes Frontier-Modells. LongBench v2 trennt Fenstergröße von echter Langkontext-Schlussfolgerung.

Umfang

Abdeckung

Aufgabenfamilie
Langer Kontext
Format
Langdokument- und Langkontext-Reasoning-Aufgaben mit Leaderboard-Settings für no-CoT- und CoT-Evaluation.
Bewertung
Accuracy-artiges Aggregat je Evaluationssetting. Nur innerhalb desselben Settings vergleichen.
Verantwortliche Stelle
LongBench team
Lesehilfe

So liest du die Scores

Werte immer neben Kontextlänge, Prompt-Setting und CoT-Erlaubnis lesen. Dasselbe Modell kann sich bewegen, wenn sich das Reasoning-Setup ändert.

Blinde Flecken

Was er nicht abdeckt

  • Keine Retrieval-Qualität — der Benchmark testet Modellnutzung bereitgestellten Kontexts, nicht ob dein Suchsystem die richtigen Dokumente gefunden hat.
  • Nicht jede Langdokument-Aufgabe — Legal Review, Literature Review, Codebase-Navigation und Meeting-Analyse scheitern unterschiedlich.
  • Kein garantiert nutzbares Kontextfenster — beworbene Tokenlimits können bei realen Prompts schon vorher degradieren.
Scores

Evidenz-Ledger

19 Zeilen
1919 Zeilen
58.4%bester Score
0quellgeprüft
1Quellen
2026-04-01Quelldatum
LongBench19

official-page · manual

Verteilung

Wo die Zeilen liegen

0255075100

Auf die Skala dieses Benchmarks normalisiert (0–100). Die Tabelle zeigt die Rohwerte.

Zeitverlauf

Neueste Belege

  1. Claude Opus 4.858.4% · LongBench v2 leaderboard
  2. Llama 4 Scout57.2% · LongBench v2 leaderboard
  3. GPT 5.556.1% · LongBench v2 leaderboard
  4. Gemini 3.1 Pro55.4% · LongBench v2 leaderboard
  5. Gemini 2.0 Ultra54.8% · LongBench v2 leaderboard

Scores nutzen die eigene Einheit und Skala dieses Benchmarks, keinen universellen Qualitätswert.

#ModellVeröffentlichungScoreHerkunftBeleglage
1Claude Opus 4.8AnthropicNo-CoT setting. CoT evaluation shows different results — read both.2026-05-2858.4%
LongBench v2 leaderboard2026-04-01
Prüfung nötig
2Llama 4 ScoutMeta10M context variant — strong on retrieval-heavy document tasks.2026-04-0557.2%
LongBench v2 leaderboard2026-04-01
Prüfung nötig
3GPT 5.5OpenAI2026-04-2356.1%
LongBench v2 leaderboard2026-04-01
Prüfung nötig
4Gemini 3.1 ProGoogle2026-02-1955.4%
LongBench v2 leaderboard2026-04-01
Prüfung nötig
5Gemini 2.0 UltraGoogle2024-12-1154.8%
LongBench v2 leaderboard2026-04-01
Prüfung nötig
6GPT 5.4OpenAI2026-03-0554.2%
LongBench v2 leaderboard2026-04-01
Prüfung nötig
7Gemini 3.5 FlashGoogle2026-05-1953.8%
LongBench v2 leaderboard2026-04-01
Prüfung nötig
8Claude Sonnet 4.6Anthropic2026-02-1752.6%
LongBench v2 leaderboard2026-04-01
Prüfung nötig
9Gemini 3 Flash PreviewGoogle2025-12-1751.4%
LongBench v2 leaderboard2026-04-01
Prüfung nötig
10o3OpenAIReasoning models show mixed results on retrieval-heavy long-context tasks.2025-04-1651.2%
LongBench v2 leaderboard2026-04-01
Prüfung nötig
11Mistral Large 3Mistral2025-12-0250.8%
LongBench v2 leaderboard2026-04-01
Prüfung nötig
12Llama 4 MaverickMeta2026-04-0549.8%
LongBench v2 leaderboard2026-04-01
Prüfung nötig
13Kimi K2.6Moonshot2026-04-2049.1%
LongBench v2 leaderboard2026-04-01
Prüfung nötig
14DeepSeek V4DeepSeek2026-04-2448.6%
LongBench v2 leaderboard2026-04-01
Prüfung nötig
15Kimi K2.5Moonshot2026-01-2748.2%
LongBench v2 leaderboard2026-04-01
Prüfung nötig
16Qwen 3.7 MaxAlibaba2026-05-2047.8%
LongBench v2 leaderboard2026-04-01
Prüfung nötig
17Grok 4.3xAI2026-04-3046.2%
LongBench v2 leaderboard2026-04-01
Prüfung nötig
18MiniMax M3MiniMax2026-05-3145.6%
LongBench v2 leaderboard2026-04-01
Prüfung nötig
19Claude Haiku 4.5Anthropic2025-10-0144.8%
LongBench v2 leaderboard2026-04-01
Prüfung nötig
Methode

Was er abdeckt

Primärquelle ist das LongBench-v2-Leaderboard. VerdictPal sollte das no-CoT-/CoT-Setting in jeder Zeile erhalten.

Score-Obergrenze

Wo er an Grenzen stößt

Ein guter LongBench-Wert beweist keine Citation Fidelity, keine Quellenwahl und keinen datenschutzsicheren Dokumentenumgang.

Tools, die ihn ausweisen

Belege

Quellen und weiterführende Lektüre

The Pack · Redaktionsnewsletter

Neue Karten in dein Postfach. Kostenlos.

Eine kurze E-Mail, wenn eine Karte erscheint oder den Status wechselt. Kein Tracking, keine Drittanbieter-Analytics. Abmeldung mit einem Klick.