Benchmarks / Coding

SciCode

Wissenschaftliche Programmieraufgaben mit Domänen-Bibliotheken und mehrstufigem numerischem Code — AA-Snapshot-Läufe.

Was dieser Benchmark nicht misst
  • Wet-Lab-Validierung — generierter Code wird nur gegen Referenztests bewertet.
  • Bibliotheksversionen in eurer Umgebung — Harness pinnt Dependency-Sets.
Analyse

Warum dieser Benchmark nützlich ist

Wenn es um wissenschaftliches Programmieren mit Domänen-Bibliotheken und mehrstufigem numerischem Code geht — nicht um allgemeines SWE-Issue-Fixing.

Umfang

Abdeckung

Aufgabenfamilie
Coding
Format
Wissenschaftliche Coding-Probleme mit Bibliotheksabhängigkeiten.
Bewertung
Gelöst-Prozent aus AA-Läufen.
Verantwortliche Stelle
SciCode authors
Lesehilfe

So liest du die Scores

Gelöst-Prozent aus AA-Snapshot-Läufen gegen Referenztests. Wet-Lab-Korrektheit und eure lokalen Bibliotheksversionen liegen außerhalb.

Blinde Flecken

Was er nicht abdeckt

  • Wet-Lab-Validierung — generierter Code wird nur gegen Referenztests bewertet.
  • Bibliotheksversionen in eurer Umgebung — Harness pinnt Dependency-Sets.
Scores

Evidenz-Ledger

180 Zeilen
180180 Zeilen
60.2%bester Score
180quellgeprüft
1Quellen
2026-09-01Quelldatum
180

api · api

Verteilung

Wo die Zeilen liegen

0255075100

Auf die Skala dieses Benchmarks normalisiert (0–100). Die Tabelle zeigt die Rohwerte.

Zeitverlauf

Neueste Belege

  1. Claude Fable 560.2% ·
  2. Gemini 3.1 Pro Preview58.9% ·
  3. Kimi K358.7% ·
  4. Muse Spark 1.158.2% ·
  5. Gemini 3.7 Flash56.8% ·

Scores nutzen die eigene Einheit und Skala dieses Benchmarks, keinen universellen Qualitätswert.

#ModellVeröffentlichungScoreHerkunftBeleglage
1Claude Fable 5Anthropic2026-06-0960.2%
2026-09-01
Quelle geprüft
2Gemini 3.1 Pro PreviewGoogle2026-02-1958.9%
2026-09-01
Quelle geprüft
3Kimi K3Moonshot2026-07-1658.7%
2026-09-01
Quelle geprüft
4Muse Spark 1.1Meta2026-07-0958.2%
2026-09-01
Quelle geprüft
5Gemini 3.7 FlashGoogle2026-08-1356.8%
2026-09-01
Quelle geprüft
6GPT 5.4OpenAI2026-03-0556.6%
2026-09-01
Quelle geprüft
7GLM-5.3Zhipu2026-08-1456.5%
2026-09-01
Quelle geprüft
8Muse Spark 1.2Meta2026-08-0556.4%
2026-09-01
Quelle geprüft
9Gemini 3 ProGoogle2025-11-1856.1%
2026-09-01
Quelle geprüft
10GPT 5.5OpenAI2026-04-2356.1%
2026-09-01
Quelle geprüft
11GPT-5.6 SolOpenAI2026-07-0956.1%
2026-09-01
Quelle geprüft
12GPT-5.5 (high)OpenAI2026-04-2355.9%
2026-09-01
Quelle geprüft
13Claude Opus 5 (Adaptive Reasoning, Max Effort)Anthropic2026-07-2455.7%
2026-09-01
Quelle geprüft
14Claude Opus 5 (Adaptive Reasoning, Xhigh Effort)Anthropic2026-07-2455%
2026-09-01
Quelle geprüft
15GPT-5.2 Codex (xhigh)OpenAI2025-12-1154.6%
2026-09-01
Quelle geprüft
16Claude Opus 4.7Anthropic2026-04-1654.5%
2026-09-01
Quelle geprüft
17Claude Opus 5 (Adaptive Reasoning, High Effort)Anthropic2026-07-2454.3%
2026-09-01
Quelle geprüft
18Grok 4.5xAI2026-07-0854.1%
2026-09-01
Quelle geprüft
19GPT-5.6 TerraOpenAI2026-07-0953.9%
2026-09-01
Quelle geprüft
20Claude Sonnet 5Anthropic2026-06-3053.6%
2026-09-01
Quelle geprüft
21Grok 4.6xAI2026-08-1253.6%
2026-09-01
Quelle geprüft
22Claude Opus 4.8Anthropic2026-05-2853.5%
2026-09-01
Quelle geprüft
23GPT-5.5 (medium)OpenAI2026-04-2353.5%
2026-09-01
Quelle geprüft
24Kimi K2.6Moonshot2026-04-2053.5%
2026-09-01
Quelle geprüft
25GPT-5.3 Codex (xhigh)OpenAI2026-02-0553.2%
2026-09-01
Quelle geprüft
26Gemini 3.5 FlashGoogle2026-05-1953.1%
2026-09-01
Quelle geprüft
27Gemini 3.5 Flash (medium)Google2026-05-1953%
2026-09-01
Quelle geprüft
28Qwen3.8 MaxAlibaba2026-08-0352.9%
2026-09-01
Quelle geprüft
29Gemini 3.6 Flash (high)Google2026-07-2152.7%
2026-09-01
Quelle geprüft
30GPT-5.6 LunaOpenAI2026-07-0952.5%
2026-09-01
Quelle geprüft
31GPT-5.2OpenAI2025-12-1152.1%
2026-09-01
Quelle geprüft
32Claude Opus 4.6 (Adaptive Reasoning, Max Effort)Anthropic2026-02-0551.9%
2026-09-01
Quelle geprüft
33GPT-5.5 (low)OpenAI2026-04-2351.6%
2026-09-01
Quelle geprüft
34Qwen3.8 2.4T A95BAlibaba2026-08-1251.6%
2026-09-01
Quelle geprüft
35Muse SparkOther2026-01-0151.5%
2026-09-01
Quelle geprüft
36Kimi K3 (low)Moonshot2026-07-1651.2%
2026-09-01
Quelle geprüft
37Claude Opus 5 (Adaptive Reasoning, Medium Effort)Anthropic2026-07-2450.7%
2026-09-01
Quelle geprüft
38Gemini 3 Flash Preview (Reasoning)Google2025-12-1750.6%
2026-09-01
Quelle geprüft
39GLM-5.2Zhipu2026-06-1350.5%
2026-09-01
Quelle geprüft
40GPT-5.4 (low)OpenAI2026-03-0550.3%
2026-09-01
Quelle geprüft
41GPT-5.5 Instant (May 2026)OpenAI2026-05-0550.3%
2026-09-01
Quelle geprüft
42Grok Build 0.1 0616xAI2026-06-1650.2%
2026-09-01
Quelle geprüft
43MiMo-V2.5-ProXiaomi2026-04-2250.2%
2026-09-01
Quelle geprüft
44Claude Opus 4.7 (Non-reasoning, High Effort)Anthropic2026-04-1650.1%
2026-09-01
Quelle geprüft
45DeepSeek V4 Flash 0731 (Reasoning, Max Effort)DeepSeek2026-07-3149.9%
2026-09-01
Quelle geprüft
46Gemini 3 Flash PreviewGoogle2025-12-1749.9%
2026-09-01
Quelle geprüft
47Gemini 3 Pro Preview (low)Google2025-11-1849.9%
2026-09-01
Quelle geprüft
48GPT-5.4 MiniOpenAI2026-03-1749.9%
2026-09-01
Quelle geprüft
49Claude Opus 4.5 (Reasoning)Anthropic2025-11-2449.5%
2026-09-01
Quelle geprüft
50DeepSeek V4 Pro 0813 (Reasoning, Max Effort)DeepSeek2026-08-1349.2%
2026-09-01
Quelle geprüft
51Kimi K2.5Moonshot2026-01-2749%
2026-09-01
Quelle geprüft
52Gemini 3.5 Flash (minimal)Google2026-05-1948.8%
2026-09-01
Quelle geprüft
53Qwen3.7 MaxAlibaba2026-05-1948.8%
2026-09-01
Quelle geprüft
54Inkling SmallOther2026-07-3048.7%
2026-09-01
Quelle geprüft
55GPT-5.5 Instant (June 2026)OpenAI2026-06-2548.6%
2026-09-01
Quelle geprüft
56Claude Opus 5 (Adaptive Reasoning, Low Effort)Anthropic2026-07-2448%
2026-09-01
Quelle geprüft
57Agnes 2.5 Pro BetaOther2026-08-2647.6%
2026-09-01
Quelle geprüft
58Hy3Other2026-07-0647.6%
2026-09-01
Quelle geprüft
59Kimi K2.7 CodeMoonshot2026-06-1247.5%
2026-09-01
Quelle geprüft
60GPT-5.5 (Non-reasoning)OpenAI2026-04-2347.3%
2026-09-01
Quelle geprüft
61Grok 4.3xAI2026-04-3047.3%
2026-09-01
Quelle geprüft
62Claude Opus 4.5Anthropic2025-11-2447%
2026-09-01
Quelle geprüft
63MiniMax M2.7MiniMax2026-04-1547%
2026-09-01
Quelle geprüft
64Claude Sonnet 4.6Anthropic2026-02-1746.9%
2026-09-01
Quelle geprüft
65GPT-5.4 NanoOpenAI2026-03-1746.9%
2026-09-01
Quelle geprüft
66Qwen3.6 Max PreviewAlibaba2026-04-2046.9%
2026-09-01
Quelle geprüft
67Qwen3.8-Flash-NextAlibaba2026-08-2646.9%
2026-09-01
Quelle geprüft
68Claude Sonnet 4.6 (Adaptive Reasoning, Max Effort)Anthropic2026-02-1746.8%
2026-09-01
Quelle geprüft
69DeepSeek V4 Flash Vision (Reasoning, Max Effort)DeepSeek2026-08-2146.6%
2026-09-01
Quelle geprüft
70DeepSeek V4 Pro (Reasoning, High Effort)DeepSeek2026-04-2446.4%
2026-09-01
Quelle geprüft
71GLM-5 (Reasoning)Zhipu2026-02-1146.2%
2026-09-01
Quelle geprüft
72GPT-5.2 (medium)OpenAI2025-12-1146.2%
2026-09-01
Quelle geprüft
73GLM-5.3-FlashZhipu2026-08-2646.1%
2026-09-01
Quelle geprüft
74Inkling (xhigh)Other2026-07-1546.1%
2026-09-01
Quelle geprüft
75Claude Opus 4.6Anthropic2026-02-0545.7%
2026-09-01
Quelle geprüft
76Grok 4xAI2025-07-1045.7%
2026-09-01
Quelle geprüft
77Grok 4.20 ReasoningxAI2026-03-0545.6%
2026-09-01
Quelle geprüft
78Solar Open2 250BOther2026-08-1245.6%
2026-09-01
Quelle geprüft
79Qwen 3.7 PlusAlibaba2026-06-0245.5%
2026-09-01
Quelle geprüft
80MiniMax M3MiniMax2026-05-3145.4%
2026-09-01
Quelle geprüft
81GLM-4.7 (Reasoning)Zhipu2025-12-2245.1%
2026-09-01
Quelle geprüft
82Claude 4.5 Sonnet (Reasoning)Anthropic2025-09-2944.7%
2026-09-01
Quelle geprüft
83Grok 4.20 0309 (Reasoning)xAI2026-03-1044.7%
2026-09-01
Quelle geprüft
84Qwen3.8 27BAlibaba2026-08-1444.7%
2026-09-01
Quelle geprüft
85Grok 4.3 (medium)xAI2026-04-3044.6%
2026-09-01
Quelle geprüft
86Motif 3 (Beta)Other2026-07-2144.3%
2026-09-01
Quelle geprüft
87Claude Sonnet 4.6 (Non-reasoning, Low Effort)Anthropic2026-02-1744.1%
2026-09-01
Quelle geprüft
88GLM-5.1Zhipu2026-04-0743.8%
2026-09-01
Quelle geprüft
89GLM-5-TurboZhipu2026-03-1543.6%
2026-09-01
Quelle geprüft
90Muse GlimmerMeta2026-08-1043.6%
2026-09-01
Quelle geprüft
91Solar Pro 4Other2026-08-0643.6%
2026-09-01
Quelle geprüft
92GLM 5V Turbo (Reasoning)Zhipu2026-04-0143.5%
2026-09-01
Quelle geprüft
93Gemma 4 31B ITGoogle2026-03-0143.4%
2026-09-01
Quelle geprüft
94GPT-5.1OpenAI2025-11-1343.3%
2026-09-01
Quelle geprüft
95MiMo-V2.5Xiaomi2026-04-2243.1%
2026-09-01
Quelle geprüft
96Qwen3 Max ThinkingAlibaba2026-01-2643.1%
2026-09-01
Quelle geprüft
97Apodex 1.1Other2026-08-3042.9%
2026-09-01
Quelle geprüft
98GPT-5 (high)OpenAI2025-08-0742.9%
2026-09-01
Quelle geprüft
99MiniMax M2.5MiniMax2026-04-0142.6%
2026-09-01
Quelle geprüft
100MiMo-V2-ProXiaomi2026-03-1842.5%
2026-09-01
Quelle geprüft
101DeepSeek V4 Pro (Non-reasoning)DeepSeek2026-04-2442.4%
2026-09-01
Quelle geprüft
102Kimi K2 ThinkingMoonshot2025-11-0642.4%
2026-09-01
Quelle geprüft
103Ring-2.6-1TOther2026-05-0842.4%
2026-09-01
Quelle geprüft
104Agnes 2.5 Pro AlphaOther2026-07-2442.2%
2026-09-01
Quelle geprüft
105DeepSeek V4 Flash (Reasoning, High Effort)DeepSeek2026-04-2442%
2026-09-01
Quelle geprüft
106Qwen3.5 122B A10B (Reasoning)Alibaba2026-02-2442%
2026-09-01
Quelle geprüft
107Qwen3.5 397B A17B (Reasoning)Alibaba2026-02-1642%
2026-09-01
Quelle geprüft
108Gemini 3.1 Flash LiteGoogle2026-05-0741.9%
2026-09-01
Quelle geprüft
109Grok 4.3 (low)xAI2026-04-3041.9%
2026-09-01
Quelle geprüft
110Nex-N2-ProOther2026-06-0241.8%
2026-09-01
Quelle geprüft
111Hy3-preview (Reasoning)Other2026-04-2341.2%
2026-09-01
Quelle geprüft
112GPT-5 (medium)OpenAI2025-08-0741.1%
2026-09-01
Quelle geprüft
113Ling 3.0 FlashOther2026-08-0441.1%
2026-09-01
Quelle geprüft
114Qwen3.5 397B A17B (Non-reasoning)Alibaba2026-02-1641.1%
2026-09-01
Quelle geprüft
115K-EXAONE 2.0 0803Other2026-08-1241%
2026-09-01
Quelle geprüft
116OpenAI o3OpenAI2025-04-1641%
2026-09-01
Quelle geprüft
117Claude 4.1 Opus (Reasoning)Anthropic2025-08-0540.9%
2026-09-01
Quelle geprüft
118Gemini 3.5 Flash-LiteGoogle2026-07-2140.9%
2026-09-01
Quelle geprüft
119GPT-5 Codex (high)OpenAI2025-09-2340.9%
2026-09-01
Quelle geprüft
120MiniMax-M2.1MiniMax2025-12-2340.7%
2026-09-01
Quelle geprüft
121Qwen3.6 PlusAlibaba2026-04-0240.7%
2026-09-01
Quelle geprüft
122Motif 3Other2026-08-1240.6%
2026-09-01
Quelle geprüft
123DeepSeek R1DeepSeek2025-01-2040.3%
2026-09-01
Quelle geprüft
124GPT-5.1 Codex (high)OpenAI2025-11-1340.2%
2026-09-01
Quelle geprüft
125Step 3.7 FlashStepFun2026-06-0140%
2026-09-01
Quelle geprüft
126Nemotron 3 Ultra 550B A55B (Reasoning)NVIDIA2026-06-0439.9%
2026-09-01
Quelle geprüft
127Claude 4 Opus (Reasoning)Anthropic2025-05-2239.8%
2026-09-01
Quelle geprüft
128Qwen3.6 27B (Reasoning)Alibaba2026-04-2239.8%
2026-09-01
Quelle geprüft
129Mistral Medium 3.5Mistral2026-04-2939.6%
2026-09-01
Quelle geprüft
130Kimi K2.6 (Non-reasoning)Other2026-04-2039.5%
2026-09-01
Quelle geprüft
131MiMo-V2-Omni-0327Xiaomi2026-03-2739.5%
2026-09-01
Quelle geprüft
132Qwen3.5 27B (Reasoning)Alibaba2026-02-2439.5%
2026-09-01
Quelle geprüft
133Hy3-preview (Non-reasoning)Other2026-04-2339.4%
2026-09-01
Quelle geprüft
134MiMo-V2-Flash (Reasoning)Xiaomi2025-12-1639.4%
2026-09-01
Quelle geprüft
135GPT-5 (low)OpenAI2025-08-0739.1%
2026-09-01
Quelle geprüft
136MiMo-V2.5-Pro (Non-reasoning)Xiaomi2026-04-2239.1%
2026-09-01
Quelle geprüft
137DeepSeek V3.2 (Reasoning)DeepSeek2025-12-0138.9%
2026-09-01
Quelle geprüft
138A.X-K2Other2026-08-1238.5%
2026-09-01
Quelle geprüft
139GLM-5 (Non-reasoning)Zhipu2026-02-1138.3%
2026-09-01
Quelle geprüft
140KAT Coder Pro V2Other2026-03-2738.3%
2026-09-01
Quelle geprüft
141MiMo-V2-Flash (Feb 2026)Xiaomi2025-12-1638.3%
2026-09-01
Quelle geprüft
142Gemma 4 12B (Reasoning)Google2026-06-0738.2%
2026-09-01
Quelle geprüft
143JT-4.1 Flash 236B A21BOther2026-07-0938.2%
2026-09-01
Quelle geprüft
144North Mini CodeCohere2026-06-0938.2%
2026-09-01
Quelle geprüft
145Command ACohere2026-03-1537.8%
2026-09-01
Quelle geprüft
146Grok 4.3 (Non-reasoning)xAI2026-04-3037.4%
2026-09-01
Quelle geprüft
147DeepSeek V4 Flash (Non-reasoning)DeepSeek2026-04-2437.3%
2026-09-01
Quelle geprüft
148Qwen3.6 27B (Non-reasoning)Alibaba2026-04-2237.3%
2026-09-01
Quelle geprüft
149Ling-2.6-1TOther2026-04-2337%
2026-09-01
Quelle geprüft
150MiMo-V2-OmniXiaomi2026-03-1936.7%
2026-09-01
Quelle geprüft
151Granite 4.2 30BOther2026-08-2536.6%
2026-09-01
Quelle geprüft
152Mistral Large 3Mistral2025-12-0236.2%
2026-09-01
Quelle geprüft
153GLM-5.2 (Non-reasoning)Zhipu2026-06-1636.1%
2026-09-01
Quelle geprüft
154OpenAI o1OpenAI2024-09-1235.8%
2026-09-01
Quelle geprüft
155Qwen3.6 35B A3B (Reasoning)Alibaba2026-04-1635.8%
2026-09-01
Quelle geprüft
156LongCat-2.0Meituan2026-06-2935.4%
2026-09-01
Quelle geprüft
157DiffusionGemma 26B A4BGoogle2026-06-1034.3%
2026-09-01
Quelle geprüft
158G9v3-39A5BOther2026-08-0334%
2026-09-01
Quelle geprüft
159Llama 4 MaverickMeta2026-04-0533.1%
2026-09-01
Quelle geprüft
160HyperNova 60B 2605Multiverse2026-05-0633%
2026-09-01
Quelle geprüft
161Grok 4.20 0309 v2 (Non-reasoning)xAI2026-04-0732.8%
2026-09-01
Quelle geprüft
162Nemotron 3.5 LightningNVIDIA2026-08-1131.6%
2026-09-01
Quelle geprüft
163Granite 4.2 8BOther2026-08-2530.4%
2026-09-01
Quelle geprüft
164Gemma 4 12B (Non-reasoning)Google2026-06-1029.7%
2026-09-01
Quelle geprüft
165JT-35B-FlashOther2026-05-1429.1%
2026-09-01
Quelle geprüft
166EXAONE 4.5 33BOther2026-04-0928%
2026-09-01
Quelle geprüft
167Nemotron 3 Nano Omni 30B A3B ReasoningNVIDIA2026-04-2927.8%
2026-09-01
Quelle geprüft
168JT-MINIOther2026-04-1527.2%
2026-09-01
Quelle geprüft
169Ling 2.6 FlashOther2026-04-2127.1%
2026-09-01
Quelle geprüft
170Granite 4.1 30BOther2026-04-2925.8%
2026-09-01
Quelle geprüft
171Granite 4.2 3BOther2026-08-2524.9%
2026-09-01
Quelle geprüft
172Ling 3.0 TinyOther2026-08-0624.2%
2026-09-01
Quelle geprüft
173Claude 3 OpusAnthropic2024-03-0423.3%
2026-09-01
Quelle geprüft
174G9v3-3BOther2026-07-2317.7%
2026-09-01
Quelle geprüft
175Llama 4 ScoutMeta2026-04-0517%
2026-09-01
Quelle geprüft
176LFM2.5-8B-A1BLiquid2026-06-087.8%
2026-09-01
Quelle geprüft
177MiniCPM5-1B (Reasoning)OpenBMB2026-06-044.4%
2026-09-01
Quelle geprüft
178MiniCPM-V 4.6 1.3BOpenBMB2026-05-112.1%
2026-09-01
Quelle geprüft
179MiniCPM5-1B (Non-reasoning)OpenBMB2026-05-251.4%
2026-09-01
Quelle geprüft
180Qwen3.6 35B A3B (Non-reasoning)Alibaba2026-04-161.3%
2026-09-01
Quelle geprüft
Methode

Was er abdeckt

Dieser Benchmark gehört zur Familie coding. Sein Format: Wissenschaftliche Coding-Probleme mit Bibliotheksabhängigkeiten. Der Score sollte immer mit Aufgabenformat, Bewertungsmethode, Quelldatum und Benchmark-Version gelesen werden.

Score-Obergrenze

Wo er an Grenzen stößt

Noch ist keine Obergrenze erfasst. Wenn sich Scores oben bündeln, kann der Benchmark Frontier-Modelle möglicherweise nicht mehr trennen.

Belege

Quellen und weiterführende Lektüre

Fragen zu diesem Benchmark

Jede Antwort unten stammt aus den datierten Feldern dieser Seite. Nichts davon ist zusätzlich für Suchmaschinen geschrieben.

Was misst SciCode?

Wissenschaftliche Programmieraufgaben mit Domänen-Bibliotheken und mehrstufigem numerischem Code — AA-Snapshot-Läufe.

Was beweist ein hoher SciCode-Wert nicht?

Ein starkes SciCode-Ergebnis sagt nichts aus über:

  • Wet-Lab-Validierung — generierter Code wird nur gegen Referenztests bewertet.
  • Bibliotheksversionen in eurer Umgebung — Harness pinnt Dependency-Sets.

Wie wird SciCode bewertet?

Gelöst-Prozent aus AA-Läufen. Aufgabenformat: Wissenschaftliche Coding-Probleme mit Bibliotheksabhängigkeiten.

Ist SciCode gesättigt?

SciCode ist im Atlas derzeit als Aktiv markiert.

Können SciCode-Ergebnisse durch Trainingsdaten verunreinigt sein?

Das Kontaminationsrisiko für SciCode ist als Kontamination mittel eingestuft. Behandle jede Zeile auf dieser Seite als öffentliche Angabe mit Quelle und Datum, nicht als kontrolliertes Experiment.

The Pack · Redaktionsnewsletter

Neue Tools in dein Postfach. Kostenlos.

Eine kurze E-Mail, wenn ein Tool erscheint oder den Status wechselt. Kein Tracking, keine Drittanbieter-Analytics. Abmeldung mit einem Klick.