Benchmarks / Langer Kontext

LongBench v2

LongBench 2

Ob Long-Context-Modelle über lange, realistische Inputs schlussfolgern können, statt nur ein großes Tokenfenster anzunehmen.

Was dieser Benchmark nicht misst
  • Keine Retrieval-Qualität — der Benchmark testet Modellnutzung bereitgestellten Kontexts, nicht ob dein Suchsystem die richtigen Dokumente gefunden hat.
  • Nicht jede Langdokument-Aufgabe — Legal Review, Literature Review, Codebase-Navigation und Meeting-Analyse scheitern unterschiedlich.
  • Kein garantiert nutzbares Kontextfenster — beworbene Tokenlimits können bei realen Prompts schon vorher degradieren.
Analyse

Warum dieser Benchmark nützlich ist

Long Context ist heute ein Produktversprechen fast jedes Frontier-Modells. LongBench v2 trennt Fenstergröße von echter Langkontext-Schlussfolgerung.

Umfang

Abdeckung

Aufgabenfamilie
Langer Kontext
Format
Langdokument- und Langkontext-Reasoning-Aufgaben mit Leaderboard-Settings für no-CoT- und CoT-Evaluation.
Bewertung
Accuracy-artiges Aggregat je Evaluationssetting. Nur innerhalb desselben Settings vergleichen.
Verantwortliche Stelle
LongBench team
Lesehilfe

So liest du die Scores

Werte immer neben Kontextlänge, Prompt-Setting und CoT-Erlaubnis lesen. Dasselbe Modell kann sich bewegen, wenn sich das Reasoning-Setup ändert.

Blinde Flecken

Was er nicht abdeckt

  • Keine Retrieval-Qualität — der Benchmark testet Modellnutzung bereitgestellten Kontexts, nicht ob dein Suchsystem die richtigen Dokumente gefunden hat.
  • Nicht jede Langdokument-Aufgabe — Legal Review, Literature Review, Codebase-Navigation und Meeting-Analyse scheitern unterschiedlich.
  • Kein garantiert nutzbares Kontextfenster — beworbene Tokenlimits können bei realen Prompts schon vorher degradieren.
Scores

Evidenz-Ledger

19 Zeilen
1919 Zeilen
58.4%bester Score
0quellgeprüft
1Quellen
2026-04-01Quelldatum
LongBench19

official-page · manual

Verteilung

Wo die Zeilen liegen

0255075100

Auf die Skala dieses Benchmarks normalisiert (0–100). Die Tabelle zeigt die Rohwerte.

Zeitverlauf

Neueste Belege

  1. Claude Opus 4.858.4% · LongBench v2 leaderboard
  2. Llama 4 Scout57.2% · LongBench v2 leaderboard
  3. GPT 5.556.1% · LongBench v2 leaderboard
  4. Gemini 3.1 Pro55.4% · LongBench v2 leaderboard
  5. Gemini 2.0 Ultra54.8% · LongBench v2 leaderboard

Scores nutzen die eigene Einheit und Skala dieses Benchmarks, keinen universellen Qualitätswert.

#ModellVeröffentlichungScoreHerkunftBeleglage
1Claude Opus 4.8AnthropicNo-CoT setting. CoT evaluation shows different results — read both.2026-05-2858.4%
LongBench v2 leaderboard2026-04-01
Prüfung nötig
2Llama 4 ScoutMeta10M context variant — strong on retrieval-heavy document tasks.2026-04-0557.2%
LongBench v2 leaderboard2026-04-01
Prüfung nötig
3GPT 5.5OpenAI2026-04-2356.1%
LongBench v2 leaderboard2026-04-01
Prüfung nötig
4Gemini 3.1 ProGoogle2026-02-1955.4%
LongBench v2 leaderboard2026-04-01
Prüfung nötig
5Gemini 2.0 UltraGoogle2024-12-1154.8%
LongBench v2 leaderboard2026-04-01
Prüfung nötig
6GPT 5.4OpenAI2026-03-0554.2%
LongBench v2 leaderboard2026-04-01
Prüfung nötig
7Gemini 3.5 FlashGoogle2026-05-1953.8%
LongBench v2 leaderboard2026-04-01
Prüfung nötig
8Claude Sonnet 4.6Anthropic2026-02-1752.6%
LongBench v2 leaderboard2026-04-01
Prüfung nötig
9Gemini 3 Flash PreviewGoogle2025-12-1751.4%
LongBench v2 leaderboard2026-04-01
Prüfung nötig
10o3OpenAIReasoning models show mixed results on retrieval-heavy long-context tasks.2025-04-1651.2%
LongBench v2 leaderboard2026-04-01
Prüfung nötig
11Mistral Large 3Mistral2025-12-0250.8%
LongBench v2 leaderboard2026-04-01
Prüfung nötig
12Llama 4 MaverickMeta2026-04-0549.8%
LongBench v2 leaderboard2026-04-01
Prüfung nötig
13Kimi K2.6Moonshot2026-04-2049.1%
LongBench v2 leaderboard2026-04-01
Prüfung nötig
14DeepSeek V4DeepSeek2026-04-2448.6%
LongBench v2 leaderboard2026-04-01
Prüfung nötig
15Kimi K2.5Moonshot2026-01-2748.2%
LongBench v2 leaderboard2026-04-01
Prüfung nötig
16Qwen 3.7 MaxAlibaba2026-05-2047.8%
LongBench v2 leaderboard2026-04-01
Prüfung nötig
17Grok 4.3xAI2026-04-3046.2%
LongBench v2 leaderboard2026-04-01
Prüfung nötig
18MiniMax M3MiniMax2026-05-3145.6%
LongBench v2 leaderboard2026-04-01
Prüfung nötig
19Claude Haiku 4.5Anthropic2025-10-0144.8%
LongBench v2 leaderboard2026-04-01
Prüfung nötig
Methode

Was er abdeckt

Primärquelle ist das LongBench-v2-Leaderboard. VerdictPal sollte das no-CoT-/CoT-Setting in jeder Zeile erhalten.

Score-Obergrenze

Wo er an Grenzen stößt

Ein guter LongBench-Wert beweist keine Citation Fidelity, keine Quellenwahl und keinen datenschutzsicheren Dokumentenumgang.

Tools, die ihn ausweisen

Belege

Quellen und weiterführende Lektüre

Fragen zu diesem Benchmark

Jede Antwort unten stammt aus den datierten Feldern dieser Seite. Nichts davon ist zusätzlich für Suchmaschinen geschrieben.

Was misst LongBench v2?

Ob Long-Context-Modelle über lange, realistische Inputs schlussfolgern können, statt nur ein großes Tokenfenster anzunehmen.

Was beweist ein hoher LongBench v2-Wert nicht?

Ein starkes LongBench v2-Ergebnis sagt nichts aus über:

  • Keine Retrieval-Qualität — der Benchmark testet Modellnutzung bereitgestellten Kontexts, nicht ob dein Suchsystem die richtigen Dokumente gefunden hat.
  • Nicht jede Langdokument-Aufgabe — Legal Review, Literature Review, Codebase-Navigation und Meeting-Analyse scheitern unterschiedlich.
  • Kein garantiert nutzbares Kontextfenster — beworbene Tokenlimits können bei realen Prompts schon vorher degradieren.

Wie wird LongBench v2 bewertet?

Accuracy-artiges Aggregat je Evaluationssetting. Nur innerhalb desselben Settings vergleichen. Aufgabenformat: Langdokument- und Langkontext-Reasoning-Aufgaben mit Leaderboard-Settings für no-CoT- und CoT-Evaluation.

Ist LongBench v2 gesättigt?

LongBench v2 ist im Atlas derzeit als Aktiv markiert.

Können LongBench v2-Ergebnisse durch Trainingsdaten verunreinigt sein?

Das Kontaminationsrisiko für LongBench v2 ist als Kontamination mittel eingestuft. Behandle jede Zeile auf dieser Seite als öffentliche Angabe mit Quelle und Datum, nicht als kontrolliertes Experiment.

The Pack · Redaktionsnewsletter

Neue Tools in dein Postfach. Kostenlos.

Eine kurze E-Mail, wenn ein Tool erscheint oder den Status wechselt. Kein Tracking, keine Drittanbieter-Analytics. Abmeldung mit einem Klick.