Benchmarks / Langer Kontext

Artificial Analysis Long Context Reasoning

AA-LCR

Long-Context-Synthese und Reasoning: 100 offene Antwortfragen, die Modelle zwingen, Evidenz über lange Inputs zu integrieren. 6 % Gewicht im AA Intelligence Index v4.1.

Artificial AnalysisLanger KontextSolidAktivNiedriges KontaminationsrisikoSeit 2025
Was dieser Benchmark nicht misst
  • Retrieval aus externen Datenbanken — der Kontext liegt nur im Prompt.
  • Multimodale Langdokumente — AA-LCR ist im aktuellen AA-Harness nur Text.
  • Unendlicher Kontext — das Eval nutzt ein fixes Long-Context-Fenster, keine beliebige Dokumentlänge.
Analyse

Warum dieser Benchmark nützlich ist

Long-Context-Research scheitert, wenn Modelle den Faden über entfernte Evidenz verlieren. AA-LCR ist eine der wenigen öffentlichen Suites, die Synthese über lange Inputs bewertet — nicht nur Retrieval-Trivia.

Umfang

Abdeckung

Aufgabenfamilie
Langer Kontext
Format
100 offene Antwortfragen mit langen Kontextpassagen; Equality-Checker-LLM-Bewertung, pass@1.
Bewertung
pass@1-Genauigkeit mit 3 Wiederholungen.
Verantwortliche Stelle
Artificial Analysis
Lesehilfe

So liest du die Scores

Lies pass@1 mit drei Wiederholungen als konservative Headline. Vergleiche nur Zeilen derselben AA-Harness-Version und desselben Long-Context-Fensters.

Blinde Flecken

Was er nicht abdeckt

  • Retrieval aus externen Datenbanken — der Kontext liegt nur im Prompt.
  • Multimodale Langdokumente — AA-LCR ist im aktuellen AA-Harness nur Text.
  • Unendlicher Kontext — das Eval nutzt ein fixes Long-Context-Fenster, keine beliebige Dokumentlänge.
Scores

Evidenz-Ledger

64 Zeilen
6464 Zeilen
75%bester Score
64quellgeprüft
1Quellen
2026-07-21bis 2026-06-17
64

api · api

Verteilung

Wo die Zeilen liegen

0255075100

Auf die Skala dieses Benchmarks normalisiert (0–100). Die Tabelle zeigt die Rohwerte.

Zeitverlauf

Neueste Belege

  1. GPT-5.175% ·
  2. Kimi K374.67% ·
  3. GPT 5.474% ·
  4. GPT-5.3 Codex (xhigh)74% ·
  5. GPT-5.6 Luna74% ·

Scores nutzen die eigene Einheit und Skala dieses Benchmarks, keinen universellen Qualitätswert.

#ModellVeröffentlichungScoreHerkunftBeleglage
1GPT-5.1OpenAI2025-11-1375%
2026-07-21
Quelle geprüft
2Kimi K3Moonshot2026-07-1674.67%
2026-07-21
Quelle geprüft
3GPT 5.4OpenAI2026-03-0574%
2026-07-21
Quelle geprüft
4GPT-5.3 Codex (xhigh)OpenAI2026-02-0574%
2026-07-21
Quelle geprüft
5GPT-5.6 LunaOpenAI2026-07-0974%
2026-07-21
Quelle geprüft
6GPT-5.6 TerraOpenAI2026-07-0974%
2026-07-21
Quelle geprüft
7MiniMax M3MiniMax2026-05-3174%
2026-07-21
Quelle geprüft
8GPT-5.6 SolOpenAI2026-07-0973.67%
2026-07-21
Quelle geprüft
9GPT-5.5 (high)OpenAI2026-04-2373.33%
2026-07-21
Quelle geprüft
10MiMo-V2.5-ProXiaomi2026-04-2273.33%
2026-07-21
Quelle geprüft
11Gemini 3.1 Pro PreviewGoogle2026-02-1972.67%
2026-07-21
Quelle geprüft
12GPT-5.2OpenAI2025-12-1172.67%
2026-07-21
Quelle geprüft
13GPT-5.5 (medium)OpenAI2026-04-2372.33%
2026-07-21
Quelle geprüft
14GPT-5.5 (low)OpenAI2026-04-2372%
2026-07-21
Quelle geprüft
15GLM-5.2Zhipu2026-06-1371.33%
2026-07-21
Quelle geprüft
16Gemini 3.5 Flash (medium)Google2026-05-1971%
2026-07-21
Quelle geprüft
17Claude Opus 4.6 (Adaptive Reasoning, Max Effort)Anthropic2026-02-0570.67%
2026-07-21
Quelle geprüft
18Claude Sonnet 4.6 (Adaptive Reasoning, Max Effort)Anthropic2026-02-1770.67%
2026-07-21
Quelle geprüft
19Claude Sonnet 5Anthropic2026-06-3070.67%
2026-07-21
Quelle geprüft
20Gemini 3 ProGoogle2025-11-1870.67%
2026-07-21
Quelle geprüft
21Claude Opus 4.7Anthropic2026-04-1670.33%
2026-07-21
Quelle geprüft
22Claude Fable 5Anthropic2026-06-0970%
2026-07-21
Quelle geprüft
23Kimi K2.6Moonshot2026-04-2069.67%
2026-07-21
Quelle geprüft
24Muse SparkOther2026-01-0169.67%
2026-07-21
Quelle geprüft
25Gemini 3.5 FlashGoogle2026-05-1969.33%
2026-07-21
Quelle geprüft
26GPT-5.4 MiniOpenAI2026-03-1769.33%
2026-07-21
Quelle geprüft
27OpenAI o3OpenAI2025-04-1669.33%
2026-07-21
Quelle geprüft
28Qwen3.7 MaxAlibaba2026-05-1969%
2026-07-21
Quelle geprüft
29MiniMax M2.7MiniMax2026-04-1568.67%
2026-07-21
Quelle geprüft
30Grok 4.5xAI2026-07-0867.67%
2026-07-21
Quelle geprüft
31Claude Opus 4.7 (Non-reasoning, High Effort)Anthropic2026-04-1667%
2026-07-21
Quelle geprüft
32Nemotron 3 Ultra 550B A55B (Reasoning)NVIDIA2026-06-0467%
2026-07-21
Quelle geprüft
33DeepSeek V4 Pro (Reasoning, Max Effort)DeepSeek2026-04-2466.33%
2026-07-21
Quelle geprüft
34Kimi K2.7 CodeMoonshot2026-06-1266.33%
2026-07-21
Quelle geprüft
35GPT-5.4 NanoOpenAI2026-03-1766%
2026-07-21
Quelle geprüft
36MiniMax M2.5MiniMax2026-04-0166%
2026-07-21
Quelle geprüft
37Claude Opus 4.5Anthropic2025-11-2465.33%
2026-07-21
Quelle geprüft
38Gemini 3.1 Flash LiteGoogle2026-05-0765.33%
2026-07-21
Quelle geprüft
39Kimi K2.5Moonshot2026-01-2765.33%
2026-07-21
Quelle geprüft
40Qwen 3.7 PlusAlibaba2026-06-0265%
2026-07-21
Quelle geprüft
41Grok 4.3xAI2026-04-3064.33%
2026-07-21
Quelle geprüft
42Step 3.7 FlashStepFun2026-06-0163.67%
2026-07-21
Quelle geprüft
43Muse Spark 1.1Meta2026-07-0963.33%
2026-07-21
Quelle geprüft
44GLM-5.1Zhipu2026-04-0762.33%
2026-07-21
Quelle geprüft
45Gemma 4 31B ITGoogle2026-03-0162%
2026-07-21
Quelle geprüft
46OpenAI o1OpenAI2024-09-1259.33%
2026-07-21
Quelle geprüft
47Claude Opus 4.6Anthropic2026-02-0558.33%
2026-07-21
Quelle geprüft
1Claude Opus 4.8Anthropic2026-05-2858.3%
2026-06-17
Quelle geprüft
49Grok 4.20 ReasoningxAI2026-03-0558%
2026-07-21
Quelle geprüft
50LongCat-2.0Meituan2026-06-2958%
2026-07-21
Quelle geprüft
51Claude Sonnet 4.6Anthropic2026-02-1757.67%
2026-07-21
Quelle geprüft
52Gemma 4 12B (Reasoning)Google2026-06-0755.33%
2026-07-21
Quelle geprüft
53DeepSeek R1DeepSeek2025-01-2054.67%
2026-07-21
Quelle geprüft
2GPT 5.5OpenAI2026-04-2352.1%
2026-06-17
Quelle geprüft
55Gemini 3 Flash PreviewGoogle2025-12-1748%
2026-07-21
Quelle geprüft
56Llama 4 MaverickMeta2026-04-0546%
2026-07-21
Quelle geprüft
57Mistral Large 3Mistral2025-12-0234.67%
2026-07-21
Quelle geprüft
58North Mini CodeCohere2026-06-0932.33%
2026-07-21
Quelle geprüft
59HyperNova 60B 2605Multiverse2026-05-0631.67%
2026-07-21
Quelle geprüft
60Gemma 4 12B (Non-reasoning)Google2026-06-1030.67%
2026-07-21
Quelle geprüft
61Llama 4 ScoutMeta2026-04-0525.8%
2026-07-21
Quelle geprüft
62Command ACohere2026-03-1518%
2026-07-21
Quelle geprüft
63MiniCPM5-1B (Reasoning)OpenBMB2026-06-043.67%
2026-07-21
Quelle geprüft
64LFM2.5-8B-A1BLiquid2026-06-080%
2026-07-21
Quelle geprüft
Methode

Was er abdeckt

Dieser Benchmark gehört zur Familie langer kontext. Sein Format: 100 offene Antwortfragen mit langen Kontextpassagen; Equality-Checker-LLM-Bewertung, pass@1. Der Score sollte immer mit Aufgabenformat, Bewertungsmethode, Quelldatum und Benchmark-Version gelesen werden.

Score-Obergrenze

Wo er an Grenzen stößt

Hohe Werte bei In-Prompt-Long-Context beweisen keine verlässliche Retrieval-Qualität aus externen Korpora oder multimodalen Dokumenten.

Belege

Quellen und weiterführende Lektüre

The Pack · Redaktionsnewsletter

Neue Karten in dein Postfach. Kostenlos.

Eine kurze E-Mail, wenn eine Karte erscheint oder den Status wechselt. Kein Tracking, keine Drittanbieter-Analytics. Abmeldung mit einem Klick.