Warum dieser Benchmark nützlich ist
Wenn es um wissenschaftliches Programmieren mit Domänen-Bibliotheken und mehrstufigem numerischem Code geht — nicht um allgemeines SWE-Issue-Fixing.
Wissenschaftliche Programmieraufgaben mit Domänen-Bibliotheken und mehrstufigem numerischem Code — AA-Snapshot-Läufe.
Wenn es um wissenschaftliches Programmieren mit Domänen-Bibliotheken und mehrstufigem numerischem Code geht — nicht um allgemeines SWE-Issue-Fixing.
Gelöst-Prozent aus AA-Snapshot-Läufen gegen Referenztests. Wet-Lab-Korrektheit und eure lokalen Bibliotheksversionen liegen außerhalb.
Auf die Skala dieses Benchmarks normalisiert (0–100). Die Tabelle zeigt die Rohwerte.
Scores nutzen die eigene Einheit und Skala dieses Benchmarks, keinen universellen Qualitätswert.
| # | Modell | Veröffentlichung | Score | Herkunft | Beleglage |
|---|---|---|---|---|---|
| 1 | Claude Fable 5.1Anthropic | 2026-09-01 | 63.1% | 2026-09-10 | Quelle geprüft |
| 2 | Claude Fable 5Anthropic | 2026-06-09 | 61% | 2026-09-10 | Quelle geprüft |
| 3 | Kimi K3Moonshot | 2026-07-16 | 59.5% | 2026-09-10 | Quelle geprüft |
| 4 | GLM-5.3Zhipu | 2026-08-14 | 59% | 2026-09-10 | Quelle geprüft |
| 5 | Muse Spark 1.1Meta | 2026-07-09 | 58.8% | 2026-09-10 | Quelle geprüft |
| 6 | Muse Spark 1.3Meta | 2026-09-02 | 58.8% | 2026-09-10 | Quelle geprüft |
| 7 | Gemini 3.1 Pro PreviewGoogle | 2026-02-19 | 58.7% | 2026-09-10 | Quelle geprüft |
| 8 | Muse Spark 1.2Meta | 2026-08-05 | 57.4% | 2026-09-10 | Quelle geprüft |
| 9 | Gemini 3.7 FlashGoogle | 2026-08-13 | 57.2% | 2026-09-10 | Quelle geprüft |
| 10 | GPT-5.6 SolOpenAI | 2026-07-09 | 57.1% | 2026-09-10 | Quelle geprüft |
| 11 | Gemini 3.8 FlashGoogle | 2026-09-02 | 56.6% | 2026-09-10 | Quelle geprüft |
| 12 | GPT-6 AstraOpenAI | 2026-09-03 | 56.5% | 2026-09-10 | Quelle geprüft |
| 13 | Grok 4.6xAI | 2026-08-12 | 56.5% | 2026-09-10 | Quelle geprüft |
| 14 | Claude Opus 5 (Adaptive Reasoning, Max Effort)Anthropic | 2026-07-24 | 56.4% | 2026-09-10 | Quelle geprüft |
| 15 | GPT-5.5 (high)OpenAI | 2026-04-23 | 56.1% | 2026-09-10 | Quelle geprüft |
| 16 | GPT 5.5OpenAI | 2026-04-23 | 55.8% | 2026-09-10 | Quelle geprüft |
| 17 | Claude Opus 5 (Adaptive Reasoning, Xhigh Effort)Anthropic | 2026-07-24 | 55.7% | 2026-09-10 | Quelle geprüft |
| 18 | Claude Opus 5 (Adaptive Reasoning, High Effort)Anthropic | 2026-07-24 | 55.4% | 2026-09-10 | Quelle geprüft |
| 19 | GPT-5.6 TerraOpenAI | 2026-07-09 | 55% | 2026-09-10 | Quelle geprüft |
| 20 | Grok 4.5xAI | 2026-07-08 | 55% | 2026-09-10 | Quelle geprüft |
| 21 | GPT-5.5 (medium)OpenAI | 2026-04-23 | 54.5% | 2026-09-10 | Quelle geprüft |
| 22 | Claude Opus 4.8Anthropic | 2026-05-28 | 54.4% | 2026-09-10 | Quelle geprüft |
| 23 | Claude Sonnet 5Anthropic | 2026-06-30 | 54.3% | 2026-09-10 | Quelle geprüft |
| 24 | Qwen3.8 2.4T A95BAlibaba | 2026-08-12 | 54.1% | 2026-09-10 | Quelle geprüft |
| 25 | Gemini 3.5 FlashGoogle | 2026-05-19 | 53.9% | 2026-09-10 | Quelle geprüft |
| 26 | GPT-5.6 LunaOpenAI | 2026-07-09 | 53.6% | 2026-09-10 | Quelle geprüft |
| 27 | Gemini 3.6 Flash (high)Google | 2026-07-21 | 53.4% | 2026-09-10 | Quelle geprüft |
| 28 | Qwen3.8 MaxAlibaba | 2026-08-03 | 53.2% | 2026-09-10 | Quelle geprüft |
| 29 | Kimi K3 (low)Moonshot | 2026-07-16 | 52.7% | 2026-09-10 | Quelle geprüft |
| 30 | GPT-5.5 Instant (June 2026)OpenAI | 2026-06-25 | 52.5% | 2026-09-10 | Quelle geprüft |
| 31 | GPT-5.4 MiniOpenAI | 2026-03-17 | 52.1% | 2026-09-10 | Quelle geprüft |
| 32 | GLM-5.3-FlashZhipu | 2026-08-26 | 51.6% | 2026-09-10 | Quelle geprüft |
| 33 | Claude Opus 5 (Adaptive Reasoning, Medium Effort)Anthropic | 2026-07-24 | 51.5% | 2026-09-10 | Quelle geprüft |
| 34 | Kimi K2.6Moonshot | 2026-04-20 | 51.5% | 2026-09-10 | Quelle geprüft |
| 35 | GLM-5.2Zhipu | 2026-06-13 | 51.2% | 2026-09-10 | Quelle geprüft |
| 36 | DeepSeek V4 Pro 0813 (Reasoning, Max Effort)DeepSeek | 2026-08-13 | 51% | 2026-09-10 | Quelle geprüft |
| 37 | MiMo-V2.5-ProXiaomi | 2026-04-22 | 50.6% | 2026-09-10 | Quelle geprüft |
| 38 | Qwen3.8-Flash-NextAlibaba | 2026-08-26 | 50.6% | 2026-09-10 | Quelle geprüft |
| 39 | DeepSeek V4 Flash 0731 (Reasoning, Max Effort)DeepSeek | 2026-07-31 | 50.3% | 2026-09-10 | Quelle geprüft |
| 40 | Claude Sonnet 4.6 (Adaptive Reasoning, Max Effort)Anthropic | 2026-02-17 | 50.1% | 2026-09-10 | Quelle geprüft |
| 41 | MiniMax M2.7MiniMax | 2026-04-15 | 50.1% | 2026-09-10 | Quelle geprüft |
| 42 | DeepSeek V4 Flash Vision (Reasoning, Max Effort)DeepSeek | 2026-08-21 | 49.7% | 2026-09-10 | Quelle geprüft |
| 43 | Inkling SmallOther | 2026-07-30 | 49.7% | 2026-09-10 | Quelle geprüft |
| 44 | Qwen3.7 MaxAlibaba | 2026-05-19 | 49.5% | 2026-09-10 | Quelle geprüft |
| 45 | Claude Opus 5 (Adaptive Reasoning, Low Effort)Anthropic | 2026-07-24 | 49.2% | 2026-09-10 | Quelle geprüft |
| 46 | Agnes 2.5 Pro BetaOther | 2026-08-26 | 48.8% | 2026-09-10 | Quelle geprüft |
| 47 | Hy3Other | 2026-07-06 | 48.6% | 2026-09-10 | Quelle geprüft |
| 48 | Grok 4.3xAI | 2026-04-30 | 48.3% | 2026-09-10 | Quelle geprüft |
| 49 | Solar Open2 250BOther | 2026-08-12 | 48% | 2026-09-10 | Quelle geprüft |
| 50 | Kimi K2.7 CodeMoonshot | 2026-06-12 | 47.8% | 2026-09-10 | Quelle geprüft |
| 51 | GPT-5.4 NanoOpenAI | 2026-03-17 | 47.2% | 2026-09-10 | Quelle geprüft |
| 52 | MiniMax M3MiniMax | 2026-05-31 | 47.1% | 2026-09-10 | Quelle geprüft |
| 53 | Inkling (xhigh)Other | 2026-07-15 | 47% | 2026-09-10 | Quelle geprüft |
| 54 | Qwen3.8 27BAlibaba | 2026-08-14 | 46.6% | 2026-09-10 | Quelle geprüft |
| 55 | Qwen 3.7 PlusAlibaba | 2026-06-02 | 46.1% | 2026-09-10 | Quelle geprüft |
| 56 | Claude 4.5 Sonnet (Reasoning)Anthropic | 2025-09-29 | 45.7% | 2026-09-10 | Quelle geprüft |
| 57 | Apodex 1.1Other | 2026-08-30 | 45.5% | 2026-09-10 | Quelle geprüft |
| 58 | Gemma 4 31B ITGoogle | 2026-03-01 | 45.5% | 2026-09-10 | Quelle geprüft |
| 59 | Ring-2.6-1TOther | 2026-05-08 | 45% | 2026-09-10 | Quelle geprüft |
| 60 | Muse GlimmerMeta | 2026-08-10 | 44.9% | 2026-09-10 | Quelle geprüft |
| 61 | GLM-5.1Zhipu | 2026-04-07 | 44.8% | 2026-09-10 | Quelle geprüft |
| 62 | Qwen3.5 397B A17B (Reasoning)Alibaba | 2026-02-16 | 44.8% | 2026-09-10 | Quelle geprüft |
| 63 | Solar Pro 4Other | 2026-08-06 | 44.6% | 2026-09-10 | Quelle geprüft |
| 64 | MiMo-V2.5Xiaomi | 2026-04-22 | 43.9% | 2026-09-10 | Quelle geprüft |
| 65 | Step 3.7 FlashStepFun | 2026-06-01 | 43.9% | 2026-09-10 | Quelle geprüft |
| 66 | Gemini 3.1 Flash LiteGoogle | 2026-05-07 | 43.4% | 2026-09-10 | Quelle geprüft |
| 67 | Nex-N2-ProOther | 2026-06-02 | 43.3% | 2026-09-10 | Quelle geprüft |
| 68 | Agnes 2.5 Pro AlphaOther | 2026-07-24 | 42.9% | 2026-09-10 | Quelle geprüft |
| 69 | K2 Horizon 375B A23BOther | 2026-09-03 | 42.9% | 2026-09-10 | Quelle geprüft |
| 70 | Qwen3.6 27B (Reasoning)Alibaba | 2026-04-22 | 42.8% | 2026-09-10 | Quelle geprüft |
| 71 | Motif 3Other | 2026-08-12 | 42.2% | 2026-09-10 | Quelle geprüft |
| 72 | K-EXAONE 2.0 0803Other | 2026-08-12 | 42% | 2026-09-10 | Quelle geprüft |
| 73 | Ling 3.0 FlashOther | 2026-08-04 | 42% | 2026-09-10 | Quelle geprüft |
| 74 | Gemini 3.5 Flash-LiteGoogle | 2026-07-21 | 41.3% | 2026-09-10 | Quelle geprüft |
| 75 | A.X-K2Other | 2026-08-12 | 41% | 2026-09-10 | Quelle geprüft |
| 76 | Nemotron 3 Ultra 550B A55B (Reasoning)NVIDIA | 2026-06-04 | 40.3% | 2026-09-10 | Quelle geprüft |
| 77 | DeepSeek V4 Flash (Reasoning, High Effort)DeepSeek | 2026-04-24 | 40.2% | 2026-09-10 | Quelle geprüft |
| 78 | Mistral Medium 3.5Mistral | 2026-04-29 | 40.2% | 2026-09-10 | Quelle geprüft |
| 79 | Qwen3.5 122B A10B (Reasoning)Alibaba | 2026-02-24 | 39.7% | 2026-09-10 | Quelle geprüft |
| 80 | Grok 4.3 (Non-reasoning)xAI | 2026-04-30 | 39.4% | 2026-09-10 | Quelle geprüft |
| 81 | North Mini CodeCohere | 2026-06-09 | 38.8% | 2026-09-10 | Quelle geprüft |
| 82 | Granite 4.2 30BOther | 2026-08-25 | 37.8% | 2026-09-10 | Quelle geprüft |
| 83 | G9v3-39A5BOther | 2026-08-03 | 36.8% | 2026-09-10 | Quelle geprüft |
| 84 | Mistral Large 3Mistral | 2025-12-02 | 36.6% | 2026-09-10 | Quelle geprüft |
| 85 | Qwen3.6 35B A3B (Reasoning)Alibaba | 2026-04-16 | 36.6% | 2026-09-10 | Quelle geprüft |
| 86 | LongCat-2.0Meituan | 2026-06-29 | 36.3% | 2026-09-10 | Quelle geprüft |
| 87 | Nemotron 3.5 LightningNVIDIA | 2026-08-11 | 32.1% | 2026-09-10 | Quelle geprüft |
| 88 | Llama 4 MaverickMeta | 2026-04-05 | 31.7% | 2026-09-10 | Quelle geprüft |
| 89 | Granite 4.2 8BOther | 2026-08-25 | 31.5% | 2026-09-10 | Quelle geprüft |
| 90 | MiniCPM5-2BOpenBMB | 2026-09-07 | 26.3% | 2026-09-10 | Quelle geprüft |
| 91 | Granite 4.2 3BOther | 2026-08-25 | 25.3% | 2026-09-10 | Quelle geprüft |
| 92 | Ling 3.0 TinyOther | 2026-08-06 | 24.2% | 2026-09-10 | Quelle geprüft |
| 93 | Llama 4 ScoutMeta | 2026-04-05 | 21.3% | 2026-09-10 | Quelle geprüft |
Dieser Benchmark gehört zur Familie coding. Sein Format: Wissenschaftliche Coding-Probleme mit Bibliotheksabhängigkeiten. Der Score sollte immer mit Aufgabenformat, Bewertungsmethode, Quelldatum und Benchmark-Version gelesen werden.
Noch ist keine Obergrenze erfasst. Wenn sich Scores oben bündeln, kann der Benchmark Frontier-Modelle möglicherweise nicht mehr trennen.
Jede Antwort unten stammt aus den datierten Feldern dieser Seite. Nichts davon ist zusätzlich für Suchmaschinen geschrieben.
Wissenschaftliche Programmieraufgaben mit Domänen-Bibliotheken und mehrstufigem numerischem Code — AA-Snapshot-Läufe.
Ein starkes SciCode-Ergebnis sagt nichts aus über:
Gelöst-Prozent aus AA-Läufen. Aufgabenformat: Wissenschaftliche Coding-Probleme mit Bibliotheksabhängigkeiten.
SciCode ist im Atlas derzeit als Aktiv markiert.
Das Kontaminationsrisiko für SciCode ist als Kontamination mittel eingestuft. Behandle jede Zeile auf dieser Seite als öffentliche Angabe mit Quelle und Datum, nicht als kontrolliertes Experiment.
The Pack · Redaktionsnewsletter
Eine kurze E-Mail, wenn ein Tool erscheint oder den Status wechselt. Kein Tracking, keine Drittanbieter-Analytics. Abmeldung mit einem Klick.