Benchmarks / Coding

SciCode

Scientific programming tasks requiring domain libraries and multi-step numerical code — AA snapshot runs.

CodingSolidActiveMedium contamination riskSince 2024
What this does not measure
  • Wet-lab validation — generated code is graded against reference tests only.
  • Library versions in your environment — harness pins dependency sets.
Analysis

Why this benchmark is useful

Editorial brief pendingWe publish the methodology and ledger first; benchmark-specific analysis ships after desk review.

Scope

Coverage map

Task family
Coding
Format
Scientific coding problems with library dependencies.
Scoring
Percentage solved from AA runs.
Maintainer
SciCode authors
Reading guide

How to read the scores

Reading guide pending. Use task format, scoring method, and source dates in the ledger until the desk brief ships.

Blind spots

What it does not cover

  • Wet-lab validation — generated code is graded against reference tests only.
  • Library versions in your environment — harness pins dependency sets.
Scores

Evidence ledger

65 rows
6565 rows
60.2%best score
65source-checked
1sources
2026-07-21source date
65

api · api

Distribution

Where the rows land

0255075100

Normalized to this benchmark's axis (0–100). Open the table for raw units.

Timeline

Newest receipts

  1. Claude Fable 560.2% ·
  2. Gemini 3.1 Pro Preview58.9% ·
  3. Kimi K358.7% ·
  4. Muse Spark 1.158.2% ·
  5. GPT 5.456.6% ·

Scores use this benchmark's own unit and axis, not a universal quality score.

#ModelRelease dateScoreProvenanceTrust
1Claude Fable 5Anthropic2026-06-0960.2%
2026-07-21
Source-checked
2Gemini 3.1 Pro PreviewGoogle2026-02-1958.9%
2026-07-21
Source-checked
3Kimi K3Moonshot2026-07-1658.7%
2026-07-21
Source-checked
4Muse Spark 1.1Meta2026-07-0958.2%
2026-07-21
Source-checked
5GPT 5.4OpenAI2026-03-0556.6%
2026-07-21
Source-checked
6Gemini 3 ProGoogle2025-11-1856.1%
2026-07-21
Source-checked
7GPT 5.5OpenAI2026-04-2356.1%
2026-07-21
Source-checked
8GPT-5.6 SolOpenAI2026-07-0956.1%
2026-07-21
Source-checked
9GPT-5.5 (high)OpenAI2026-04-2355.9%
2026-07-21
Source-checked
10Claude Opus 4.7Anthropic2026-04-1654.5%
2026-07-21
Source-checked
11Grok 4.5xAI2026-07-0854.1%
2026-07-21
Source-checked
12GPT-5.6 TerraOpenAI2026-07-0953.9%
2026-07-21
Source-checked
13Claude Sonnet 5Anthropic2026-06-3053.6%
2026-07-21
Source-checked
14Claude Opus 4.8Anthropic2026-05-2853.5%
2026-07-21
Source-checked
15GPT-5.5 (medium)OpenAI2026-04-2353.5%
2026-07-21
Source-checked
16Kimi K2.6Moonshot2026-04-2053.5%
2026-07-21
Source-checked
17GPT-5.3 Codex (xhigh)OpenAI2026-02-0553.2%
2026-07-21
Source-checked
18Gemini 3.5 FlashGoogle2026-05-1953.1%
2026-07-21
Source-checked
19Gemini 3.5 Flash (medium)Google2026-05-1953%
2026-07-21
Source-checked
20GPT-5.6 LunaOpenAI2026-07-0952.5%
2026-07-21
Source-checked
21GPT-5.2OpenAI2025-12-1152.1%
2026-07-21
Source-checked
22Claude Opus 4.6 (Adaptive Reasoning, Max Effort)Anthropic2026-02-0551.9%
2026-07-21
Source-checked
23GPT-5.5 (low)OpenAI2026-04-2351.6%
2026-07-21
Source-checked
24Muse SparkOther2026-01-0151.5%
2026-07-21
Source-checked
25GLM-5.2Zhipu2026-06-1350.5%
2026-07-21
Source-checked
26MiMo-V2.5-ProXiaomi2026-04-2250.2%
2026-07-21
Source-checked
27Claude Opus 4.7 (Non-reasoning, High Effort)Anthropic2026-04-1650.1%
2026-07-21
Source-checked
28DeepSeek V4 Pro (Reasoning, Max Effort)DeepSeek2026-04-2450%
2026-07-21
Source-checked
29Gemini 3 Flash PreviewGoogle2025-12-1749.9%
2026-07-21
Source-checked
30GPT-5.4 MiniOpenAI2026-03-1749.9%
2026-07-21
Source-checked
31Kimi K2.5Moonshot2026-01-2749%
2026-07-21
Source-checked
32Qwen3.7 MaxAlibaba2026-05-1948.8%
2026-07-21
Source-checked
33Kimi K2.7 CodeMoonshot2026-06-1247.5%
2026-07-21
Source-checked
34Grok 4.3xAI2026-04-3047.3%
2026-07-21
Source-checked
35Claude Opus 4.5Anthropic2025-11-2447%
2026-07-21
Source-checked
36MiniMax M2.7MiniMax2026-04-1547%
2026-07-21
Source-checked
37Claude Sonnet 4.6Anthropic2026-02-1746.9%
2026-07-21
Source-checked
38GPT-5.4 NanoOpenAI2026-03-1746.9%
2026-07-21
Source-checked
39Claude Sonnet 4.6 (Adaptive Reasoning, Max Effort)Anthropic2026-02-1746.8%
2026-07-21
Source-checked
40Claude Opus 4.6Anthropic2026-02-0545.7%
2026-07-21
Source-checked
41Grok 4.20 ReasoningxAI2026-03-0545.6%
2026-07-21
Source-checked
42Qwen 3.7 PlusAlibaba2026-06-0245.5%
2026-07-21
Source-checked
43MiniMax M3MiniMax2026-05-3145.4%
2026-07-21
Source-checked
44GLM-5.1Zhipu2026-04-0743.8%
2026-07-21
Source-checked
45Gemma 4 31B ITGoogle2026-03-0143.4%
2026-07-21
Source-checked
46GPT-5.1OpenAI2025-11-1343.3%
2026-07-21
Source-checked
47MiniMax M2.5MiniMax2026-04-0142.6%
2026-07-21
Source-checked
48Gemini 3.1 Flash LiteGoogle2026-05-0741.9%
2026-07-21
Source-checked
49OpenAI o3OpenAI2025-04-1641%
2026-07-21
Source-checked
50DeepSeek R1DeepSeek2025-01-2040.3%
2026-07-21
Source-checked
51Step 3.7 FlashStepFun2026-06-0140%
2026-07-21
Source-checked
52Nemotron 3 Ultra 550B A55B (Reasoning)NVIDIA2026-06-0439.9%
2026-07-21
Source-checked
53Gemma 4 12B (Reasoning)Google2026-06-0738.2%
2026-07-21
Source-checked
54North Mini CodeCohere2026-06-0938.2%
2026-07-21
Source-checked
55Mistral Large 3Mistral2025-12-0236.2%
2026-07-21
Source-checked
56OpenAI o1OpenAI2024-09-1235.8%
2026-07-21
Source-checked
57LongCat-2.0Meituan2026-06-2935.4%
2026-07-21
Source-checked
58Llama 4 MaverickMeta2026-04-0533.1%
2026-07-21
Source-checked
59HyperNova 60B 2605Multiverse2026-05-0633%
2026-07-21
Source-checked
60Gemma 4 12B (Non-reasoning)Google2026-06-1029.7%
2026-07-21
Source-checked
61Command ACohere2026-03-1528.1%
2026-07-21
Source-checked
62Claude 3 OpusAnthropic2024-03-0423.3%
2026-07-21
Source-checked
63Llama 4 ScoutMeta2026-04-0517%
2026-07-21
Source-checked
64LFM2.5-8B-A1BLiquid2026-06-087.8%
2026-07-21
Source-checked
65MiniCPM5-1B (Reasoning)OpenBMB2026-06-044.4%
2026-07-21
Source-checked
Method

What it covers

Data-quality note pending. Every ledger row still carries source URL, source date, and ingest timestamp.

Score ceiling

Where it breaks down

No ceiling note is recorded yet. Treat clustering near the top as a warning that the benchmark may no longer separate frontier models.

Receipts

Sources and further reading

The Pack · Editorial newsletter

New cards in your inbox. Free.

One short email when a card ships or changes status. No tracking, no third-party analytics. Unsubscribe in one click.