Benchmarks / Langer Kontext

Artificial Analysis Long Context Reasoning

AA-LCR

Long-Context-Synthese und Reasoning: 100 offene Antwortfragen, die Modelle zwingen, Evidenz über lange Inputs zu integrieren. 5 % Gewicht im AA Intelligence Index v4.3.

Was dieser Benchmark nicht misst
  • Retrieval aus externen Datenbanken — der Kontext liegt nur im Prompt.
  • Multimodale Langdokumente — AA-LCR ist im aktuellen AA-Harness nur Text.
  • Unendlicher Kontext — das Eval nutzt ein fixes Long-Context-Fenster, keine beliebige Dokumentlänge.
Analyse

Warum dieser Benchmark nützlich ist

Long-Context-Research scheitert, wenn Modelle den Faden über entfernte Evidenz verlieren. AA-LCR ist eine der wenigen öffentlichen Suites, die Synthese über lange Inputs bewertet — nicht nur Retrieval-Trivia.

Umfang

Abdeckung

Aufgabenfamilie
Langer Kontext
Format
100 offene Antwortfragen mit langen Kontextpassagen; Equality-Checker-LLM-Bewertung, pass@1.
Bewertung
pass@1-Genauigkeit mit 3 Wiederholungen.
Verantwortliche Stelle
Artificial Analysis
Lesehilfe

So liest du die Scores

Lies pass@1 mit drei Wiederholungen als konservative Headline. Vergleiche nur Zeilen derselben AA-Harness-Version und desselben Long-Context-Fensters.

Blinde Flecken

Was er nicht abdeckt

  • Retrieval aus externen Datenbanken — der Kontext liegt nur im Prompt.
  • Multimodale Langdokumente — AA-LCR ist im aktuellen AA-Harness nur Text.
  • Unendlicher Kontext — das Eval nutzt ein fixes Long-Context-Fenster, keine beliebige Dokumentlänge.
Scores

Evidenz-Ledger

182 Zeilen
182182 Zeilen
88.67%bester Score
182quellgeprüft
1Quellen
2026-09-10bis 2026-06-17
182

api · api

Verteilung

Wo die Zeilen liegen

0255075100

Auf die Skala dieses Benchmarks normalisiert (0–100). Die Tabelle zeigt die Rohwerte.

Zeitverlauf

Neueste Belege

  1. Kimi K388.67% ·
  2. Claude Fable 5.185.33% ·
  3. GPT-5.5 (high)84.33% ·
  4. GPT-5.6 Sol84% ·
  5. GPT-5.6 Luna83.67% ·

Scores nutzen die eigene Einheit und Skala dieses Benchmarks, keinen universellen Qualitätswert.

#ModellVeröffentlichungScoreHerkunftBeleglage
1Kimi K3Moonshot2026-07-1688.67%
2026-09-10
Quelle geprüft
2Claude Fable 5.1Anthropic2026-09-0185.33%
2026-09-10
Quelle geprüft
3GPT-5.5 (high)OpenAI2026-04-2384.33%
2026-09-10
Quelle geprüft
4GPT-5.6 SolOpenAI2026-07-0984%
2026-09-10
Quelle geprüft
5GPT-5.6 LunaOpenAI2026-07-0983.67%
2026-09-10
Quelle geprüft
6GPT-5.3 Codex (xhigh)OpenAI2026-02-0583.33%
2026-09-10
Quelle geprüft
7Muse GlimmerMeta2026-08-1083.33%
2026-09-10
Quelle geprüft
8Agnes 2.5 Pro BetaOther2026-08-2683%
2026-09-10
Quelle geprüft
9GPT-5.5 (medium)OpenAI2026-04-2383%
2026-09-10
Quelle geprüft
10GPT-5.6 TerraOpenAI2026-07-0983%
2026-09-10
Quelle geprüft
11MiniMax M3MiniMax2026-05-3183%
2026-09-10
Quelle geprüft
12Muse Spark 1.3Meta2026-09-0283%
2026-09-10
Quelle geprüft
13GPT-5.2OpenAI2025-12-1182.67%
2026-09-10
Quelle geprüft
14Claude Fable 5Anthropic2026-06-0982.33%
2026-09-10
Quelle geprüft
15GPT-5.2 Codex (xhigh)OpenAI2025-12-1182.33%
2026-09-10
Quelle geprüft
16Claude Opus 5 (Adaptive Reasoning, Medium Effort)Anthropic2026-07-2482%
2026-09-10
Quelle geprüft
17Claude Sonnet 5Anthropic2026-06-3082%
2026-09-10
Quelle geprüft
18Gemini 3.1 Pro PreviewGoogle2026-02-1982%
2026-09-10
Quelle geprüft
19GPT 5.4OpenAI2026-03-0582%
2026-09-10
Quelle geprüft
20Qwen3.8 27BAlibaba2026-08-1482%
2026-09-10
Quelle geprüft
21Gemini 3.7 FlashGoogle2026-08-1381.67%
2026-09-10
Quelle geprüft
22Nex-N2-ProOther2026-06-0281.67%
2026-09-10
Quelle geprüft
23Claude Opus 5 (Adaptive Reasoning, Low Effort)Anthropic2026-07-2481.33%
2026-09-10
Quelle geprüft
24DeepSeek V4 Flash Vision (Reasoning, Max Effort)DeepSeek2026-08-2181.33%
2026-09-10
Quelle geprüft
25Gemini 3.8 FlashGoogle2026-09-0281.33%
2026-09-10
Quelle geprüft
26GPT-5.5 (low)OpenAI2026-04-2381%
2026-09-10
Quelle geprüft
27Kimi K2.6Moonshot2026-04-2081%
2026-09-10
Quelle geprüft
28GPT-6 AstraOpenAI2026-09-0380.67%
2026-09-10
Quelle geprüft
29Qwen3.6 Max PreviewAlibaba2026-04-2080.67%
2026-09-10
Quelle geprüft
30Claude Opus 5 (Adaptive Reasoning, Xhigh Effort)Anthropic2026-07-2480.33%
2026-09-10
Quelle geprüft
31DeepSeek V4 Pro 0813 (Reasoning, Max Effort)DeepSeek2026-08-1380.33%
2026-09-10
Quelle geprüft
32Grok 4.6xAI2026-08-1280.33%
2026-09-10
Quelle geprüft
33Qwen3.8 2.4T A95BAlibaba2026-08-1280.33%
2026-09-10
Quelle geprüft
34Claude Sonnet 4.6 (Adaptive Reasoning, Max Effort)Anthropic2026-02-1780%
2026-09-10
Quelle geprüft
35Gemini 3.6 Flash (high)Google2026-07-2180%
2026-09-10
Quelle geprüft
36GLM-5.3-FlashZhipu2026-08-2680%
2026-09-10
Quelle geprüft
37GPT-5.1OpenAI2025-11-1380%
2026-09-10
Quelle geprüft
38K2 Horizon 375B A23BOther2026-09-0380%
2026-09-10
Quelle geprüft
39DeepSeek V4 Flash 0731 (Reasoning, Max Effort)DeepSeek2026-07-3179.67%
2026-09-10
Quelle geprüft
40GLM-5.3Zhipu2026-08-1479.67%
2026-09-10
Quelle geprüft
41MiMo-V2.5-ProXiaomi2026-04-2279.67%
2026-09-10
Quelle geprüft
42Qwen3.8-Flash-NextAlibaba2026-08-2679.67%
2026-09-10
Quelle geprüft
43Apodex 1.1Other2026-08-3079.33%
2026-09-10
Quelle geprüft
44Claude Opus 5 (Adaptive Reasoning, Max Effort)Anthropic2026-07-2479.33%
2026-09-10
Quelle geprüft
45Grok 4.5xAI2026-07-0879.33%
2026-09-10
Quelle geprüft
46Kimi K2.7 CodeMoonshot2026-06-1279.33%
2026-09-10
Quelle geprüft
47Kimi K3 (low)Moonshot2026-07-1679.33%
2026-09-10
Quelle geprüft
48Nemotron 3 Ultra 550B A55B (Reasoning)NVIDIA2026-06-0479.33%
2026-09-10
Quelle geprüft
49Claude Opus 5 (Adaptive Reasoning, High Effort)Anthropic2026-07-2479%
2026-09-10
Quelle geprüft
50Hy3Other2026-07-0679%
2026-09-10
Quelle geprüft
51Muse Spark 1.2Meta2026-08-0579%
2026-09-10
Quelle geprüft
52Qwen3.7 MaxAlibaba2026-05-1979%
2026-09-10
Quelle geprüft
53Claude Opus 4.7Anthropic2026-04-1678.67%
2026-09-10
Quelle geprüft
54GLM-5.2Zhipu2026-06-1378.33%
2026-09-10
Quelle geprüft
55MiniMax M2.7MiniMax2026-04-1578.33%
2026-09-10
Quelle geprüft
56Qwen3.6 PlusAlibaba2026-04-0278.33%
2026-09-10
Quelle geprüft
57Qwen3.8 MaxAlibaba2026-08-0378.33%
2026-09-10
Quelle geprüft
58GPT-5 (high)OpenAI2025-08-0778.2%
2026-09-10
Quelle geprüft
59Claude Opus 4.6 (Adaptive Reasoning, Max Effort)Anthropic2026-02-0578%
2026-09-10
Quelle geprüft
60Gemini 3 Flash Preview (Reasoning)Google2025-12-1778%
2026-09-10
Quelle geprüft
61Kimi K2.5Moonshot2026-01-2778%
2026-09-10
Quelle geprüft
62Muse SparkOther2026-01-0178%
2026-09-10
Quelle geprüft
63Muse Spark 1.1Meta2026-07-0977.67%
2026-09-10
Quelle geprüft
64Qwen3.5 27B (Reasoning)Alibaba2026-02-2477.67%
2026-09-10
Quelle geprüft
65Claude Opus 4.5 (Reasoning)Anthropic2025-11-2477.33%
2026-09-10
Quelle geprüft
66Inkling (xhigh)Other2026-07-1577.33%
2026-09-10
Quelle geprüft
67Qwen3.5 397B A17B (Reasoning)Alibaba2026-02-1677.33%
2026-09-10
Quelle geprüft
68Qwen3.6 27B (Reasoning)Alibaba2026-04-2277.33%
2026-09-10
Quelle geprüft
69GPT-5.4 MiniOpenAI2026-03-1777%
2026-09-10
Quelle geprüft
70GPT-5.4 (low)OpenAI2026-03-0576.67%
2026-09-10
Quelle geprüft
71GPT-5.4 NanoOpenAI2026-03-1776.67%
2026-09-10
Quelle geprüft
72Qwen3.5 122B A10B (Reasoning)Alibaba2026-02-2476.33%
2026-09-10
Quelle geprüft
73Claude 4.1 Opus (Reasoning)Anthropic2025-08-0576%
2026-09-10
Quelle geprüft
74Gemini 3 ProGoogle2025-11-1876%
2026-09-10
Quelle geprüft
75Gemini 3.5 Flash-LiteGoogle2026-07-2176%
2026-09-10
Quelle geprüft
76GPT-5 (medium)OpenAI2025-08-0776%
2026-09-10
Quelle geprüft
77Motif 3Other2026-08-1276%
2026-09-10
Quelle geprüft
78Agnes 2.5 Pro AlphaOther2026-07-2475.67%
2026-09-10
Quelle geprüft
79Claude Opus 4.7 (Non-reasoning, High Effort)Anthropic2026-04-1675.67%
2026-09-10
Quelle geprüft
80GLM-5 (Reasoning)Zhipu2026-02-1175.67%
2026-09-10
Quelle geprüft
81Inkling SmallOther2026-07-3075.67%
2026-09-10
Quelle geprüft
82Grok 4.3 (medium)xAI2026-04-3075%
2026-09-10
Quelle geprüft
83MiMo-V2-OmniXiaomi2026-03-1975%
2026-09-10
Quelle geprüft
84Grok Build 0.1 0616xAI2026-06-1674.67%
2026-09-10
Quelle geprüft
85Motif 3 (Beta)Other2026-07-2174.67%
2026-09-10
Quelle geprüft
86OpenAI o3OpenAI2025-04-1674.67%
2026-09-10
Quelle geprüft
87Gemini 3.1 Flash LiteGoogle2026-05-0774.33%
2026-09-10
Quelle geprüft
88Gemini 3.5 Flash (medium)Google2026-05-1974.33%
2026-09-10
Quelle geprüft
89Qwen3 Max ThinkingAlibaba2026-01-2674.33%
2026-09-10
Quelle geprüft
90Gemini 3 Pro Preview (low)Google2025-11-1874%
2026-09-10
Quelle geprüft
91Grok 4.3 (low)xAI2026-04-3074%
2026-09-10
Quelle geprüft
92Solar Pro 4Other2026-08-0674%
2026-09-10
Quelle geprüft
93GLM-5.1Zhipu2026-04-0773.67%
2026-09-10
Quelle geprüft
94Step 3.7 FlashStepFun2026-06-0173.67%
2026-09-10
Quelle geprüft
95DeepSeek V3.2 (Reasoning)DeepSeek2025-12-0173.33%
2026-09-10
Quelle geprüft
96Gemini 3.5 FlashGoogle2026-05-1973.33%
2026-09-10
Quelle geprüft
97MiMo-V2-Omni-0327Xiaomi2026-03-2773.33%
2026-09-10
Quelle geprüft
98MiniMax M2.5MiniMax2026-04-0173.33%
2026-09-10
Quelle geprüft
99Grok 4.3xAI2026-04-3073%
2026-09-10
Quelle geprüft
100KAT Coder Pro V2Other2026-03-2773%
2026-09-10
Quelle geprüft
101Ling 3.0 FlashOther2026-08-0473%
2026-09-10
Quelle geprüft
102MiMo-V2.5Xiaomi2026-04-2273%
2026-09-10
Quelle geprüft
103Qwen 3.7 PlusAlibaba2026-06-0273%
2026-09-10
Quelle geprüft
104Claude 4.5 Sonnet (Reasoning)Anthropic2025-09-2972.33%
2026-09-10
Quelle geprüft
105DeepSeek V4 Flash (Reasoning, High Effort)DeepSeek2026-04-2472%
2026-09-10
Quelle geprüft
106Kimi K2 ThinkingMoonshot2025-11-0672%
2026-09-10
Quelle geprüft
107GLM-5-TurboZhipu2026-03-1571.67%
2026-09-10
Quelle geprüft
108GPT-5 Codex (high)OpenAI2025-09-2371.67%
2026-09-10
Quelle geprüft
109Qwen3.6 35B A3B (Reasoning)Alibaba2026-04-1671.67%
2026-09-10
Quelle geprüft
110Solar Open2 250BOther2026-08-1271.67%
2026-09-10
Quelle geprüft
111JT-4.1 Flash 236B A21BOther2026-07-0971.33%
2026-09-10
Quelle geprüft
112MiMo-V2-Flash (Feb 2026)Xiaomi2025-12-1671.33%
2026-09-10
Quelle geprüft
113GLM-4.7 (Reasoning)Zhipu2025-12-2271%
2026-09-10
Quelle geprüft
114Claude Opus 4.5Anthropic2025-11-2470.67%
2026-09-10
Quelle geprüft
115MiMo-V2-Flash (Reasoning)Xiaomi2025-12-1670.67%
2026-09-10
Quelle geprüft
116DeepSeek V4 Pro (Reasoning, High Effort)DeepSeek2026-04-2470.33%
2026-09-10
Quelle geprüft
117GLM 5V Turbo (Reasoning)Zhipu2026-04-0170.33%
2026-09-10
Quelle geprüft
118GPT-5.2 (medium)OpenAI2025-12-1170.33%
2026-09-10
Quelle geprüft
119A.X-K2Other2026-08-1270%
2026-09-10
Quelle geprüft
120GPT-5.5 Instant (June 2026)OpenAI2026-06-2570%
2026-09-10
Quelle geprüft
121Ring-2.6-1TOther2026-05-0870%
2026-09-10
Quelle geprüft
122Gemma 4 31B ITGoogle2026-03-0169.67%
2026-09-10
Quelle geprüft
123Kimi K2.6 (Non-reasoning)Other2026-04-2069.67%
2026-09-10
Quelle geprüft
124Claude Sonnet 4.6 (Non-reasoning, Low Effort)Anthropic2026-02-1769.33%
2026-09-10
Quelle geprüft
125GPT-5.1 Codex (high)OpenAI2025-11-1369.33%
2026-09-10
Quelle geprüft
126Mistral Medium 3.5Mistral2026-04-2969.33%
2026-09-10
Quelle geprüft
127Grok 4.20 ReasoningxAI2026-03-0569%
2026-09-10
Quelle geprüft
128Claude Sonnet 4.6Anthropic2026-02-1768.33%
2026-09-10
Quelle geprüft
129MiMo-V2-ProXiaomi2026-03-1868.33%
2026-09-10
Quelle geprüft
130Grok 4xAI2025-07-1068%
2026-09-10
Quelle geprüft
131Grok 4.20 0309 (Reasoning)xAI2026-03-1067.67%
2026-09-10
Quelle geprüft
132MiniMax-M2.1MiniMax2025-12-2367.67%
2026-09-10
Quelle geprüft
133Claude Opus 4.6Anthropic2026-02-0567%
2026-09-10
Quelle geprüft
134Qwen3.6 27B (Non-reasoning)Alibaba2026-04-2266.67%
2026-09-10
Quelle geprüft
135GPT-5.5 Instant (May 2026)OpenAI2026-05-0566.33%
2026-09-10
Quelle geprüft
136JT-35B-FlashOther2026-05-1465.67%
2026-09-10
Quelle geprüft
137G9v3-39A5BOther2026-08-0365.33%
2026-09-10
Quelle geprüft
138LongCat-2.0Meituan2026-06-2965%
2026-09-10
Quelle geprüft
139OpenAI o1OpenAI2024-09-1265%
2026-09-10
Quelle geprüft
140Hy3-preview (Reasoning)Other2026-04-2364.67%
2026-09-10
Quelle geprüft
141Qwen3.5 397B A17B (Non-reasoning)Alibaba2026-02-1664.33%
2026-09-10
Quelle geprüft
142Qwen3.6 35B A3B (Non-reasoning)Alibaba2026-04-1664.33%
2026-09-10
Quelle geprüft
143GPT-5.5 (Non-reasoning)OpenAI2026-04-2364%
2026-09-10
Quelle geprüft
144Gemma 4 12B (Reasoning)Google2026-06-0763.67%
2026-09-10
Quelle geprüft
145Gemini 3.5 Flash (minimal)Google2026-05-1961.33%
2026-09-10
Quelle geprüft
146Ling 3.0 TinyOther2026-08-0660.33%
2026-09-10
Quelle geprüft
147Nemotron 3.5 LightningNVIDIA2026-08-1160.33%
2026-09-10
Quelle geprüft
148K-EXAONE 2.0 0803Other2026-08-1260%
2026-09-10
Quelle geprüft
149MiniCPM5-2BOpenBMB2026-09-0759.33%
2026-09-10
Quelle geprüft
1Claude Opus 4.8Anthropic2026-05-2858.3%
2026-06-17
Quelle geprüft
151DeepSeek R1DeepSeek2025-01-2055.67%
2026-09-10
Quelle geprüft
152Gemini 3 Flash PreviewGoogle2025-12-1755.33%
2026-09-10
Quelle geprüft
153EXAONE 4.5 33BOther2026-04-0954.67%
2026-09-10
Quelle geprüft
154DeepSeek V4 Pro (Non-reasoning)DeepSeek2026-04-2453%
2026-09-10
Quelle geprüft
2GPT 5.5OpenAI2026-04-2352.1%
2026-06-17
Quelle geprüft
156Llama 4 MaverickMeta2026-04-0550%
2026-09-10
Quelle geprüft
157Granite 4.2 30BOther2026-08-2549%
2026-09-10
Quelle geprüft
158Granite 4.2 8BOther2026-08-2545%
2026-09-10
Quelle geprüft
159GLM-5 (Non-reasoning)Zhipu2026-02-1143.67%
2026-09-10
Quelle geprüft
160GLM-5.2 (Non-reasoning)Zhipu2026-06-1642.33%
2026-09-10
Quelle geprüft
161Hy3-preview (Non-reasoning)Other2026-04-2342%
2026-09-10
Quelle geprüft
162DeepSeek V4 Flash (Non-reasoning)DeepSeek2026-04-2441.67%
2026-09-10
Quelle geprüft
163Ling-2.6-1TOther2026-04-2341.67%
2026-09-10
Quelle geprüft
164MiMo-V2.5-Pro (Non-reasoning)Xiaomi2026-04-2241.67%
2026-09-10
Quelle geprüft
165G9v3-3BOther2026-07-2341.33%
2026-09-10
Quelle geprüft
166Nemotron 3 Nano Omni 30B A3B ReasoningNVIDIA2026-04-2939.67%
2026-09-10
Quelle geprüft
167North Mini CodeCohere2026-06-0937.33%
2026-09-10
Quelle geprüft
168Mistral Large 3Mistral2025-12-0236%
2026-09-10
Quelle geprüft
169Gemma 4 12B (Non-reasoning)Google2026-06-1035%
2026-09-10
Quelle geprüft
170Grok 4.3 (Non-reasoning)xAI2026-04-3032.33%
2026-09-10
Quelle geprüft
171Ling 2.6 FlashOther2026-04-2131.33%
2026-09-10
Quelle geprüft
172Llama 4 ScoutMeta2026-04-0527.7%
2026-09-10
Quelle geprüft
173Granite 4.2 3BOther2026-08-2524.33%
2026-09-10
Quelle geprüft
174Granite 4.1 30BOther2026-04-2923.67%
2026-09-10
Quelle geprüft
175Grok 4.20 0309 v2 (Non-reasoning)xAI2026-04-0723.33%
2026-09-10
Quelle geprüft
176Command ACohere2026-03-1521.33%
2026-09-10
Quelle geprüft
177DiffusionGemma 26B A4BGoogle2026-06-1019.67%
2026-09-10
Quelle geprüft
178JT-MINIOther2026-04-1513%
2026-09-10
Quelle geprüft
179MiniCPM-V 4.6 1.3BOpenBMB2026-05-117%
2026-09-10
Quelle geprüft
180MiniCPM5-1B (Reasoning)OpenBMB2026-06-046%
2026-09-10
Quelle geprüft
181MiniCPM5-1B (Non-reasoning)OpenBMB2026-05-255%
2026-09-10
Quelle geprüft
182LFM2.5-8B-A1BLiquid2026-06-080%
2026-09-10
Quelle geprüft
Methode

Was er abdeckt

Dieser Benchmark gehört zur Familie langer kontext. Sein Format: 100 offene Antwortfragen mit langen Kontextpassagen; Equality-Checker-LLM-Bewertung, pass@1. Der Score sollte immer mit Aufgabenformat, Bewertungsmethode, Quelldatum und Benchmark-Version gelesen werden.

Score-Obergrenze

Wo er an Grenzen stößt

Hohe Werte bei In-Prompt-Long-Context beweisen keine verlässliche Retrieval-Qualität aus externen Korpora oder multimodalen Dokumenten.

Belege

Quellen und weiterführende Lektüre

Fragen zu diesem Benchmark

Jede Antwort unten stammt aus den datierten Feldern dieser Seite. Nichts davon ist zusätzlich für Suchmaschinen geschrieben.

Was misst AA-LCR?

Long-Context-Synthese und Reasoning: 100 offene Antwortfragen, die Modelle zwingen, Evidenz über lange Inputs zu integrieren. 5 % Gewicht im AA Intelligence Index v4.3.

Was beweist ein hoher AA-LCR-Wert nicht?

Ein starkes AA-LCR-Ergebnis sagt nichts aus über:

  • Retrieval aus externen Datenbanken — der Kontext liegt nur im Prompt.
  • Multimodale Langdokumente — AA-LCR ist im aktuellen AA-Harness nur Text.
  • Unendlicher Kontext — das Eval nutzt ein fixes Long-Context-Fenster, keine beliebige Dokumentlänge.

Wie wird AA-LCR bewertet?

pass@1-Genauigkeit mit 3 Wiederholungen. Aufgabenformat: 100 offene Antwortfragen mit langen Kontextpassagen; Equality-Checker-LLM-Bewertung, pass@1.

Ist AA-LCR gesättigt?

AA-LCR ist im Atlas derzeit als Aktiv markiert.

Können AA-LCR-Ergebnisse durch Trainingsdaten verunreinigt sein?

Das Kontaminationsrisiko für AA-LCR ist als Kontamination niedrig eingestuft. Behandle jede Zeile auf dieser Seite als öffentliche Angabe mit Quelle und Datum, nicht als kontrolliertes Experiment.

The Pack · Redaktionsnewsletter

Neue Tools in dein Postfach. Kostenlos.

Eine kurze E-Mail, wenn ein Tool erscheint oder den Status wechselt. Kein Tracking, keine Drittanbieter-Analytics. Abmeldung mit einem Klick.