Benchmarks / Coding

SciCode

Wissenschaftliche Programmieraufgaben mit Domänen-Bibliotheken und mehrstufigem numerischem Code — AA-Snapshot-Läufe.

CodingSolidAktivMittleres KontaminationsrisikoSeit 2024
Was dieser Benchmark nicht misst
  • Wet-Lab-Validierung — generierter Code wird nur gegen Referenztests bewertet.
  • Bibliotheksversionen in eurer Umgebung — Harness pinnt Dependency-Sets.
Analyse

Warum dieser Benchmark nützlich ist

Redaktionelle Einordnung ausstehendWir veröffentlichen zuerst Methodik und Ledger. Die benchmark-spezifische Analyse folgt nach der Desk-Prüfung.

Umfang

Abdeckung

Aufgabenfamilie
Coding
Format
Wissenschaftliche Coding-Probleme mit Bibliotheksabhängigkeiten.
Bewertung
Gelöst-Prozent aus AA-Läufen.
Verantwortliche Stelle
SciCode authors
Lesehilfe

So liest du die Scores

Die Lesehilfe steht noch aus. Nutze bis zur Desk-Einordnung Aufgabenformat, Bewertungsmethode und Quelldaten im Ledger.

Blinde Flecken

Was er nicht abdeckt

  • Wet-Lab-Validierung — generierter Code wird nur gegen Referenztests bewertet.
  • Bibliotheksversionen in eurer Umgebung — Harness pinnt Dependency-Sets.
Scores

Evidenz-Ledger

65 Zeilen
6565 Zeilen
60.2%bester Score
65quellgeprüft
1Quellen
2026-07-21Quelldatum
65

api · api

Verteilung

Wo die Zeilen liegen

0255075100

Auf die Skala dieses Benchmarks normalisiert (0–100). Die Tabelle zeigt die Rohwerte.

Zeitverlauf

Neueste Belege

  1. Claude Fable 560.2% ·
  2. Gemini 3.1 Pro Preview58.9% ·
  3. Kimi K358.7% ·
  4. Muse Spark 1.158.2% ·
  5. GPT 5.456.6% ·

Scores nutzen die eigene Einheit und Skala dieses Benchmarks, keinen universellen Qualitätswert.

#ModellVeröffentlichungScoreHerkunftBeleglage
1Claude Fable 5Anthropic2026-06-0960.2%
2026-07-21
Quelle geprüft
2Gemini 3.1 Pro PreviewGoogle2026-02-1958.9%
2026-07-21
Quelle geprüft
3Kimi K3Moonshot2026-07-1658.7%
2026-07-21
Quelle geprüft
4Muse Spark 1.1Meta2026-07-0958.2%
2026-07-21
Quelle geprüft
5GPT 5.4OpenAI2026-03-0556.6%
2026-07-21
Quelle geprüft
6Gemini 3 ProGoogle2025-11-1856.1%
2026-07-21
Quelle geprüft
7GPT 5.5OpenAI2026-04-2356.1%
2026-07-21
Quelle geprüft
8GPT-5.6 SolOpenAI2026-07-0956.1%
2026-07-21
Quelle geprüft
9GPT-5.5 (high)OpenAI2026-04-2355.9%
2026-07-21
Quelle geprüft
10Claude Opus 4.7Anthropic2026-04-1654.5%
2026-07-21
Quelle geprüft
11Grok 4.5xAI2026-07-0854.1%
2026-07-21
Quelle geprüft
12GPT-5.6 TerraOpenAI2026-07-0953.9%
2026-07-21
Quelle geprüft
13Claude Sonnet 5Anthropic2026-06-3053.6%
2026-07-21
Quelle geprüft
14Claude Opus 4.8Anthropic2026-05-2853.5%
2026-07-21
Quelle geprüft
15GPT-5.5 (medium)OpenAI2026-04-2353.5%
2026-07-21
Quelle geprüft
16Kimi K2.6Moonshot2026-04-2053.5%
2026-07-21
Quelle geprüft
17GPT-5.3 Codex (xhigh)OpenAI2026-02-0553.2%
2026-07-21
Quelle geprüft
18Gemini 3.5 FlashGoogle2026-05-1953.1%
2026-07-21
Quelle geprüft
19Gemini 3.5 Flash (medium)Google2026-05-1953%
2026-07-21
Quelle geprüft
20GPT-5.6 LunaOpenAI2026-07-0952.5%
2026-07-21
Quelle geprüft
21GPT-5.2OpenAI2025-12-1152.1%
2026-07-21
Quelle geprüft
22Claude Opus 4.6 (Adaptive Reasoning, Max Effort)Anthropic2026-02-0551.9%
2026-07-21
Quelle geprüft
23GPT-5.5 (low)OpenAI2026-04-2351.6%
2026-07-21
Quelle geprüft
24Muse SparkOther2026-01-0151.5%
2026-07-21
Quelle geprüft
25GLM-5.2Zhipu2026-06-1350.5%
2026-07-21
Quelle geprüft
26MiMo-V2.5-ProXiaomi2026-04-2250.2%
2026-07-21
Quelle geprüft
27Claude Opus 4.7 (Non-reasoning, High Effort)Anthropic2026-04-1650.1%
2026-07-21
Quelle geprüft
28DeepSeek V4 Pro (Reasoning, Max Effort)DeepSeek2026-04-2450%
2026-07-21
Quelle geprüft
29Gemini 3 Flash PreviewGoogle2025-12-1749.9%
2026-07-21
Quelle geprüft
30GPT-5.4 MiniOpenAI2026-03-1749.9%
2026-07-21
Quelle geprüft
31Kimi K2.5Moonshot2026-01-2749%
2026-07-21
Quelle geprüft
32Qwen3.7 MaxAlibaba2026-05-1948.8%
2026-07-21
Quelle geprüft
33Kimi K2.7 CodeMoonshot2026-06-1247.5%
2026-07-21
Quelle geprüft
34Grok 4.3xAI2026-04-3047.3%
2026-07-21
Quelle geprüft
35Claude Opus 4.5Anthropic2025-11-2447%
2026-07-21
Quelle geprüft
36MiniMax M2.7MiniMax2026-04-1547%
2026-07-21
Quelle geprüft
37Claude Sonnet 4.6Anthropic2026-02-1746.9%
2026-07-21
Quelle geprüft
38GPT-5.4 NanoOpenAI2026-03-1746.9%
2026-07-21
Quelle geprüft
39Claude Sonnet 4.6 (Adaptive Reasoning, Max Effort)Anthropic2026-02-1746.8%
2026-07-21
Quelle geprüft
40Claude Opus 4.6Anthropic2026-02-0545.7%
2026-07-21
Quelle geprüft
41Grok 4.20 ReasoningxAI2026-03-0545.6%
2026-07-21
Quelle geprüft
42Qwen 3.7 PlusAlibaba2026-06-0245.5%
2026-07-21
Quelle geprüft
43MiniMax M3MiniMax2026-05-3145.4%
2026-07-21
Quelle geprüft
44GLM-5.1Zhipu2026-04-0743.8%
2026-07-21
Quelle geprüft
45Gemma 4 31B ITGoogle2026-03-0143.4%
2026-07-21
Quelle geprüft
46GPT-5.1OpenAI2025-11-1343.3%
2026-07-21
Quelle geprüft
47MiniMax M2.5MiniMax2026-04-0142.6%
2026-07-21
Quelle geprüft
48Gemini 3.1 Flash LiteGoogle2026-05-0741.9%
2026-07-21
Quelle geprüft
49OpenAI o3OpenAI2025-04-1641%
2026-07-21
Quelle geprüft
50DeepSeek R1DeepSeek2025-01-2040.3%
2026-07-21
Quelle geprüft
51Step 3.7 FlashStepFun2026-06-0140%
2026-07-21
Quelle geprüft
52Nemotron 3 Ultra 550B A55B (Reasoning)NVIDIA2026-06-0439.9%
2026-07-21
Quelle geprüft
53Gemma 4 12B (Reasoning)Google2026-06-0738.2%
2026-07-21
Quelle geprüft
54North Mini CodeCohere2026-06-0938.2%
2026-07-21
Quelle geprüft
55Mistral Large 3Mistral2025-12-0236.2%
2026-07-21
Quelle geprüft
56OpenAI o1OpenAI2024-09-1235.8%
2026-07-21
Quelle geprüft
57LongCat-2.0Meituan2026-06-2935.4%
2026-07-21
Quelle geprüft
58Llama 4 MaverickMeta2026-04-0533.1%
2026-07-21
Quelle geprüft
59HyperNova 60B 2605Multiverse2026-05-0633%
2026-07-21
Quelle geprüft
60Gemma 4 12B (Non-reasoning)Google2026-06-1029.7%
2026-07-21
Quelle geprüft
61Command ACohere2026-03-1528.1%
2026-07-21
Quelle geprüft
62Claude 3 OpusAnthropic2024-03-0423.3%
2026-07-21
Quelle geprüft
63Llama 4 ScoutMeta2026-04-0517%
2026-07-21
Quelle geprüft
64LFM2.5-8B-A1BLiquid2026-06-087.8%
2026-07-21
Quelle geprüft
65MiniCPM5-1B (Reasoning)OpenBMB2026-06-044.4%
2026-07-21
Quelle geprüft
Methode

Was er abdeckt

Die Notiz zur Datenqualität steht aus. Jede Ledger-Zeile trägt weiterhin Quellen-URL, Quelldatum und Zeitpunkt des Einlesens.

Score-Obergrenze

Wo er an Grenzen stößt

Noch ist keine Obergrenze erfasst. Wenn sich Scores oben bündeln, kann der Benchmark Frontier-Modelle möglicherweise nicht mehr trennen.

Belege

Quellen und weiterführende Lektüre

The Pack · Redaktionsnewsletter

Neue Karten in dein Postfach. Kostenlos.

Eine kurze E-Mail, wenn eine Karte erscheint oder den Status wechselt. Kein Tracking, keine Drittanbieter-Analytics. Abmeldung mit einem Klick.