Benchmarks / Coding

SciCode

Wissenschaftliche Programmieraufgaben mit Domänen-Bibliotheken und mehrstufigem numerischem Code — AA-Snapshot-Läufe.

Was dieser Benchmark nicht misst
  • Wet-Lab-Validierung — generierter Code wird nur gegen Referenztests bewertet.
  • Bibliotheksversionen in eurer Umgebung — Harness pinnt Dependency-Sets.
Analyse

Warum dieser Benchmark nützlich ist

Wenn es um wissenschaftliches Programmieren mit Domänen-Bibliotheken und mehrstufigem numerischem Code geht — nicht um allgemeines SWE-Issue-Fixing.

Umfang

Abdeckung

Aufgabenfamilie
Coding
Format
Wissenschaftliche Coding-Probleme mit Bibliotheksabhängigkeiten.
Bewertung
Gelöst-Prozent aus AA-Läufen.
Verantwortliche Stelle
SciCode authors
Lesehilfe

So liest du die Scores

Gelöst-Prozent aus AA-Snapshot-Läufen gegen Referenztests. Wet-Lab-Korrektheit und eure lokalen Bibliotheksversionen liegen außerhalb.

Blinde Flecken

Was er nicht abdeckt

  • Wet-Lab-Validierung — generierter Code wird nur gegen Referenztests bewertet.
  • Bibliotheksversionen in eurer Umgebung — Harness pinnt Dependency-Sets.
Scores

Evidenz-Ledger

93 Zeilen
9393 Zeilen
63.1%bester Score
93quellgeprüft
1Quellen
2026-09-10Quelldatum
93

api · api

Verteilung

Wo die Zeilen liegen

0255075100

Auf die Skala dieses Benchmarks normalisiert (0–100). Die Tabelle zeigt die Rohwerte.

Zeitverlauf

Neueste Belege

  1. Claude Fable 5.163.1% ·
  2. Claude Fable 561% ·
  3. Kimi K359.5% ·
  4. GLM-5.359% ·
  5. Muse Spark 1.158.8% ·

Scores nutzen die eigene Einheit und Skala dieses Benchmarks, keinen universellen Qualitätswert.

#ModellVeröffentlichungScoreHerkunftBeleglage
1Claude Fable 5.1Anthropic2026-09-0163.1%
2026-09-10
Quelle geprüft
2Claude Fable 5Anthropic2026-06-0961%
2026-09-10
Quelle geprüft
3Kimi K3Moonshot2026-07-1659.5%
2026-09-10
Quelle geprüft
4GLM-5.3Zhipu2026-08-1459%
2026-09-10
Quelle geprüft
5Muse Spark 1.1Meta2026-07-0958.8%
2026-09-10
Quelle geprüft
6Muse Spark 1.3Meta2026-09-0258.8%
2026-09-10
Quelle geprüft
7Gemini 3.1 Pro PreviewGoogle2026-02-1958.7%
2026-09-10
Quelle geprüft
8Muse Spark 1.2Meta2026-08-0557.4%
2026-09-10
Quelle geprüft
9Gemini 3.7 FlashGoogle2026-08-1357.2%
2026-09-10
Quelle geprüft
10GPT-5.6 SolOpenAI2026-07-0957.1%
2026-09-10
Quelle geprüft
11Gemini 3.8 FlashGoogle2026-09-0256.6%
2026-09-10
Quelle geprüft
12GPT-6 AstraOpenAI2026-09-0356.5%
2026-09-10
Quelle geprüft
13Grok 4.6xAI2026-08-1256.5%
2026-09-10
Quelle geprüft
14Claude Opus 5 (Adaptive Reasoning, Max Effort)Anthropic2026-07-2456.4%
2026-09-10
Quelle geprüft
15GPT-5.5 (high)OpenAI2026-04-2356.1%
2026-09-10
Quelle geprüft
16GPT 5.5OpenAI2026-04-2355.8%
2026-09-10
Quelle geprüft
17Claude Opus 5 (Adaptive Reasoning, Xhigh Effort)Anthropic2026-07-2455.7%
2026-09-10
Quelle geprüft
18Claude Opus 5 (Adaptive Reasoning, High Effort)Anthropic2026-07-2455.4%
2026-09-10
Quelle geprüft
19GPT-5.6 TerraOpenAI2026-07-0955%
2026-09-10
Quelle geprüft
20Grok 4.5xAI2026-07-0855%
2026-09-10
Quelle geprüft
21GPT-5.5 (medium)OpenAI2026-04-2354.5%
2026-09-10
Quelle geprüft
22Claude Opus 4.8Anthropic2026-05-2854.4%
2026-09-10
Quelle geprüft
23Claude Sonnet 5Anthropic2026-06-3054.3%
2026-09-10
Quelle geprüft
24Qwen3.8 2.4T A95BAlibaba2026-08-1254.1%
2026-09-10
Quelle geprüft
25Gemini 3.5 FlashGoogle2026-05-1953.9%
2026-09-10
Quelle geprüft
26GPT-5.6 LunaOpenAI2026-07-0953.6%
2026-09-10
Quelle geprüft
27Gemini 3.6 Flash (high)Google2026-07-2153.4%
2026-09-10
Quelle geprüft
28Qwen3.8 MaxAlibaba2026-08-0353.2%
2026-09-10
Quelle geprüft
29Kimi K3 (low)Moonshot2026-07-1652.7%
2026-09-10
Quelle geprüft
30GPT-5.5 Instant (June 2026)OpenAI2026-06-2552.5%
2026-09-10
Quelle geprüft
31GPT-5.4 MiniOpenAI2026-03-1752.1%
2026-09-10
Quelle geprüft
32GLM-5.3-FlashZhipu2026-08-2651.6%
2026-09-10
Quelle geprüft
33Claude Opus 5 (Adaptive Reasoning, Medium Effort)Anthropic2026-07-2451.5%
2026-09-10
Quelle geprüft
34Kimi K2.6Moonshot2026-04-2051.5%
2026-09-10
Quelle geprüft
35GLM-5.2Zhipu2026-06-1351.2%
2026-09-10
Quelle geprüft
36DeepSeek V4 Pro 0813 (Reasoning, Max Effort)DeepSeek2026-08-1351%
2026-09-10
Quelle geprüft
37MiMo-V2.5-ProXiaomi2026-04-2250.6%
2026-09-10
Quelle geprüft
38Qwen3.8-Flash-NextAlibaba2026-08-2650.6%
2026-09-10
Quelle geprüft
39DeepSeek V4 Flash 0731 (Reasoning, Max Effort)DeepSeek2026-07-3150.3%
2026-09-10
Quelle geprüft
40Claude Sonnet 4.6 (Adaptive Reasoning, Max Effort)Anthropic2026-02-1750.1%
2026-09-10
Quelle geprüft
41MiniMax M2.7MiniMax2026-04-1550.1%
2026-09-10
Quelle geprüft
42DeepSeek V4 Flash Vision (Reasoning, Max Effort)DeepSeek2026-08-2149.7%
2026-09-10
Quelle geprüft
43Inkling SmallOther2026-07-3049.7%
2026-09-10
Quelle geprüft
44Qwen3.7 MaxAlibaba2026-05-1949.5%
2026-09-10
Quelle geprüft
45Claude Opus 5 (Adaptive Reasoning, Low Effort)Anthropic2026-07-2449.2%
2026-09-10
Quelle geprüft
46Agnes 2.5 Pro BetaOther2026-08-2648.8%
2026-09-10
Quelle geprüft
47Hy3Other2026-07-0648.6%
2026-09-10
Quelle geprüft
48Grok 4.3xAI2026-04-3048.3%
2026-09-10
Quelle geprüft
49Solar Open2 250BOther2026-08-1248%
2026-09-10
Quelle geprüft
50Kimi K2.7 CodeMoonshot2026-06-1247.8%
2026-09-10
Quelle geprüft
51GPT-5.4 NanoOpenAI2026-03-1747.2%
2026-09-10
Quelle geprüft
52MiniMax M3MiniMax2026-05-3147.1%
2026-09-10
Quelle geprüft
53Inkling (xhigh)Other2026-07-1547%
2026-09-10
Quelle geprüft
54Qwen3.8 27BAlibaba2026-08-1446.6%
2026-09-10
Quelle geprüft
55Qwen 3.7 PlusAlibaba2026-06-0246.1%
2026-09-10
Quelle geprüft
56Claude 4.5 Sonnet (Reasoning)Anthropic2025-09-2945.7%
2026-09-10
Quelle geprüft
57Apodex 1.1Other2026-08-3045.5%
2026-09-10
Quelle geprüft
58Gemma 4 31B ITGoogle2026-03-0145.5%
2026-09-10
Quelle geprüft
59Ring-2.6-1TOther2026-05-0845%
2026-09-10
Quelle geprüft
60Muse GlimmerMeta2026-08-1044.9%
2026-09-10
Quelle geprüft
61GLM-5.1Zhipu2026-04-0744.8%
2026-09-10
Quelle geprüft
62Qwen3.5 397B A17B (Reasoning)Alibaba2026-02-1644.8%
2026-09-10
Quelle geprüft
63Solar Pro 4Other2026-08-0644.6%
2026-09-10
Quelle geprüft
64MiMo-V2.5Xiaomi2026-04-2243.9%
2026-09-10
Quelle geprüft
65Step 3.7 FlashStepFun2026-06-0143.9%
2026-09-10
Quelle geprüft
66Gemini 3.1 Flash LiteGoogle2026-05-0743.4%
2026-09-10
Quelle geprüft
67Nex-N2-ProOther2026-06-0243.3%
2026-09-10
Quelle geprüft
68Agnes 2.5 Pro AlphaOther2026-07-2442.9%
2026-09-10
Quelle geprüft
69K2 Horizon 375B A23BOther2026-09-0342.9%
2026-09-10
Quelle geprüft
70Qwen3.6 27B (Reasoning)Alibaba2026-04-2242.8%
2026-09-10
Quelle geprüft
71Motif 3Other2026-08-1242.2%
2026-09-10
Quelle geprüft
72K-EXAONE 2.0 0803Other2026-08-1242%
2026-09-10
Quelle geprüft
73Ling 3.0 FlashOther2026-08-0442%
2026-09-10
Quelle geprüft
74Gemini 3.5 Flash-LiteGoogle2026-07-2141.3%
2026-09-10
Quelle geprüft
75A.X-K2Other2026-08-1241%
2026-09-10
Quelle geprüft
76Nemotron 3 Ultra 550B A55B (Reasoning)NVIDIA2026-06-0440.3%
2026-09-10
Quelle geprüft
77DeepSeek V4 Flash (Reasoning, High Effort)DeepSeek2026-04-2440.2%
2026-09-10
Quelle geprüft
78Mistral Medium 3.5Mistral2026-04-2940.2%
2026-09-10
Quelle geprüft
79Qwen3.5 122B A10B (Reasoning)Alibaba2026-02-2439.7%
2026-09-10
Quelle geprüft
80Grok 4.3 (Non-reasoning)xAI2026-04-3039.4%
2026-09-10
Quelle geprüft
81North Mini CodeCohere2026-06-0938.8%
2026-09-10
Quelle geprüft
82Granite 4.2 30BOther2026-08-2537.8%
2026-09-10
Quelle geprüft
83G9v3-39A5BOther2026-08-0336.8%
2026-09-10
Quelle geprüft
84Mistral Large 3Mistral2025-12-0236.6%
2026-09-10
Quelle geprüft
85Qwen3.6 35B A3B (Reasoning)Alibaba2026-04-1636.6%
2026-09-10
Quelle geprüft
86LongCat-2.0Meituan2026-06-2936.3%
2026-09-10
Quelle geprüft
87Nemotron 3.5 LightningNVIDIA2026-08-1132.1%
2026-09-10
Quelle geprüft
88Llama 4 MaverickMeta2026-04-0531.7%
2026-09-10
Quelle geprüft
89Granite 4.2 8BOther2026-08-2531.5%
2026-09-10
Quelle geprüft
90MiniCPM5-2BOpenBMB2026-09-0726.3%
2026-09-10
Quelle geprüft
91Granite 4.2 3BOther2026-08-2525.3%
2026-09-10
Quelle geprüft
92Ling 3.0 TinyOther2026-08-0624.2%
2026-09-10
Quelle geprüft
93Llama 4 ScoutMeta2026-04-0521.3%
2026-09-10
Quelle geprüft
Methode

Was er abdeckt

Dieser Benchmark gehört zur Familie coding. Sein Format: Wissenschaftliche Coding-Probleme mit Bibliotheksabhängigkeiten. Der Score sollte immer mit Aufgabenformat, Bewertungsmethode, Quelldatum und Benchmark-Version gelesen werden.

Score-Obergrenze

Wo er an Grenzen stößt

Noch ist keine Obergrenze erfasst. Wenn sich Scores oben bündeln, kann der Benchmark Frontier-Modelle möglicherweise nicht mehr trennen.

Belege

Quellen und weiterführende Lektüre

Fragen zu diesem Benchmark

Jede Antwort unten stammt aus den datierten Feldern dieser Seite. Nichts davon ist zusätzlich für Suchmaschinen geschrieben.

Was misst SciCode?

Wissenschaftliche Programmieraufgaben mit Domänen-Bibliotheken und mehrstufigem numerischem Code — AA-Snapshot-Läufe.

Was beweist ein hoher SciCode-Wert nicht?

Ein starkes SciCode-Ergebnis sagt nichts aus über:

  • Wet-Lab-Validierung — generierter Code wird nur gegen Referenztests bewertet.
  • Bibliotheksversionen in eurer Umgebung — Harness pinnt Dependency-Sets.

Wie wird SciCode bewertet?

Gelöst-Prozent aus AA-Läufen. Aufgabenformat: Wissenschaftliche Coding-Probleme mit Bibliotheksabhängigkeiten.

Ist SciCode gesättigt?

SciCode ist im Atlas derzeit als Aktiv markiert.

Können SciCode-Ergebnisse durch Trainingsdaten verunreinigt sein?

Das Kontaminationsrisiko für SciCode ist als Kontamination mittel eingestuft. Behandle jede Zeile auf dieser Seite als öffentliche Angabe mit Quelle und Datum, nicht als kontrolliertes Experiment.

The Pack · Redaktionsnewsletter

Neue Tools in dein Postfach. Kostenlos.

Eine kurze E-Mail, wenn ein Tool erscheint oder den Status wechselt. Kein Tracking, keine Drittanbieter-Analytics. Abmeldung mit einem Klick.