Why this benchmark is useful
When you care about scientific programming with domain libraries and multi-step numerical code — not general SWE issue fixing.
Scientific programming tasks requiring domain libraries and multi-step numerical code — AA snapshot runs.
When you care about scientific programming with domain libraries and multi-step numerical code — not general SWE issue fixing.
Percentage solved from AA snapshot runs against reference tests. Wet-lab correctness and your local library versions are out of scope.
Normalized to this benchmark's axis (0–100). Open the table for raw units.
Scores use this benchmark's own unit and axis, not a universal quality score.
| # | Model | Release date | Score | Provenance | Trust |
|---|---|---|---|---|---|
| 1 | Claude Fable 5Anthropic | 2026-06-09 | 60.2% | 2026-09-01 | Source-checked |
| 2 | Gemini 3.1 Pro PreviewGoogle | 2026-02-19 | 58.9% | 2026-09-01 | Source-checked |
| 3 | Kimi K3Moonshot | 2026-07-16 | 58.7% | 2026-09-01 | Source-checked |
| 4 | Muse Spark 1.1Meta | 2026-07-09 | 58.2% | 2026-09-01 | Source-checked |
| 5 | Gemini 3.7 FlashGoogle | 2026-08-13 | 56.8% | 2026-09-01 | Source-checked |
| 6 | GPT 5.4OpenAI | 2026-03-05 | 56.6% | 2026-09-01 | Source-checked |
| 7 | GLM-5.3Zhipu | 2026-08-14 | 56.5% | 2026-09-01 | Source-checked |
| 8 | Muse Spark 1.2Meta | 2026-08-05 | 56.4% | 2026-09-01 | Source-checked |
| 9 | Gemini 3 ProGoogle | 2025-11-18 | 56.1% | 2026-09-01 | Source-checked |
| 10 | GPT 5.5OpenAI | 2026-04-23 | 56.1% | 2026-09-01 | Source-checked |
| 11 | GPT-5.6 SolOpenAI | 2026-07-09 | 56.1% | 2026-09-01 | Source-checked |
| 12 | GPT-5.5 (high)OpenAI | 2026-04-23 | 55.9% | 2026-09-01 | Source-checked |
| 13 | Claude Opus 5 (Adaptive Reasoning, Max Effort)Anthropic | 2026-07-24 | 55.7% | 2026-09-01 | Source-checked |
| 14 | Claude Opus 5 (Adaptive Reasoning, Xhigh Effort)Anthropic | 2026-07-24 | 55% | 2026-09-01 | Source-checked |
| 15 | GPT-5.2 Codex (xhigh)OpenAI | 2025-12-11 | 54.6% | 2026-09-01 | Source-checked |
| 16 | Claude Opus 4.7Anthropic | 2026-04-16 | 54.5% | 2026-09-01 | Source-checked |
| 17 | Claude Opus 5 (Adaptive Reasoning, High Effort)Anthropic | 2026-07-24 | 54.3% | 2026-09-01 | Source-checked |
| 18 | Grok 4.5xAI | 2026-07-08 | 54.1% | 2026-09-01 | Source-checked |
| 19 | GPT-5.6 TerraOpenAI | 2026-07-09 | 53.9% | 2026-09-01 | Source-checked |
| 20 | Claude Sonnet 5Anthropic | 2026-06-30 | 53.6% | 2026-09-01 | Source-checked |
| 21 | Grok 4.6xAI | 2026-08-12 | 53.6% | 2026-09-01 | Source-checked |
| 22 | Claude Opus 4.8Anthropic | 2026-05-28 | 53.5% | 2026-09-01 | Source-checked |
| 23 | GPT-5.5 (medium)OpenAI | 2026-04-23 | 53.5% | 2026-09-01 | Source-checked |
| 24 | Kimi K2.6Moonshot | 2026-04-20 | 53.5% | 2026-09-01 | Source-checked |
| 25 | GPT-5.3 Codex (xhigh)OpenAI | 2026-02-05 | 53.2% | 2026-09-01 | Source-checked |
| 26 | Gemini 3.5 FlashGoogle | 2026-05-19 | 53.1% | 2026-09-01 | Source-checked |
| 27 | Gemini 3.5 Flash (medium)Google | 2026-05-19 | 53% | 2026-09-01 | Source-checked |
| 28 | Qwen3.8 MaxAlibaba | 2026-08-03 | 52.9% | 2026-09-01 | Source-checked |
| 29 | Gemini 3.6 Flash (high)Google | 2026-07-21 | 52.7% | 2026-09-01 | Source-checked |
| 30 | GPT-5.6 LunaOpenAI | 2026-07-09 | 52.5% | 2026-09-01 | Source-checked |
| 31 | GPT-5.2OpenAI | 2025-12-11 | 52.1% | 2026-09-01 | Source-checked |
| 32 | Claude Opus 4.6 (Adaptive Reasoning, Max Effort)Anthropic | 2026-02-05 | 51.9% | 2026-09-01 | Source-checked |
| 33 | GPT-5.5 (low)OpenAI | 2026-04-23 | 51.6% | 2026-09-01 | Source-checked |
| 34 | Qwen3.8 2.4T A95BAlibaba | 2026-08-12 | 51.6% | 2026-09-01 | Source-checked |
| 35 | Muse SparkOther | 2026-01-01 | 51.5% | 2026-09-01 | Source-checked |
| 36 | Kimi K3 (low)Moonshot | 2026-07-16 | 51.2% | 2026-09-01 | Source-checked |
| 37 | Claude Opus 5 (Adaptive Reasoning, Medium Effort)Anthropic | 2026-07-24 | 50.7% | 2026-09-01 | Source-checked |
| 38 | Gemini 3 Flash Preview (Reasoning)Google | 2025-12-17 | 50.6% | 2026-09-01 | Source-checked |
| 39 | GLM-5.2Zhipu | 2026-06-13 | 50.5% | 2026-09-01 | Source-checked |
| 40 | GPT-5.4 (low)OpenAI | 2026-03-05 | 50.3% | 2026-09-01 | Source-checked |
| 41 | GPT-5.5 Instant (May 2026)OpenAI | 2026-05-05 | 50.3% | 2026-09-01 | Source-checked |
| 42 | Grok Build 0.1 0616xAI | 2026-06-16 | 50.2% | 2026-09-01 | Source-checked |
| 43 | MiMo-V2.5-ProXiaomi | 2026-04-22 | 50.2% | 2026-09-01 | Source-checked |
| 44 | Claude Opus 4.7 (Non-reasoning, High Effort)Anthropic | 2026-04-16 | 50.1% | 2026-09-01 | Source-checked |
| 45 | DeepSeek V4 Flash 0731 (Reasoning, Max Effort)DeepSeek | 2026-07-31 | 49.9% | 2026-09-01 | Source-checked |
| 46 | Gemini 3 Flash PreviewGoogle | 2025-12-17 | 49.9% | 2026-09-01 | Source-checked |
| 47 | Gemini 3 Pro Preview (low)Google | 2025-11-18 | 49.9% | 2026-09-01 | Source-checked |
| 48 | GPT-5.4 MiniOpenAI | 2026-03-17 | 49.9% | 2026-09-01 | Source-checked |
| 49 | Claude Opus 4.5 (Reasoning)Anthropic | 2025-11-24 | 49.5% | 2026-09-01 | Source-checked |
| 50 | DeepSeek V4 Pro 0813 (Reasoning, Max Effort)DeepSeek | 2026-08-13 | 49.2% | 2026-09-01 | Source-checked |
| 51 | Kimi K2.5Moonshot | 2026-01-27 | 49% | 2026-09-01 | Source-checked |
| 52 | Gemini 3.5 Flash (minimal)Google | 2026-05-19 | 48.8% | 2026-09-01 | Source-checked |
| 53 | Qwen3.7 MaxAlibaba | 2026-05-19 | 48.8% | 2026-09-01 | Source-checked |
| 54 | Inkling SmallOther | 2026-07-30 | 48.7% | 2026-09-01 | Source-checked |
| 55 | GPT-5.5 Instant (June 2026)OpenAI | 2026-06-25 | 48.6% | 2026-09-01 | Source-checked |
| 56 | Claude Opus 5 (Adaptive Reasoning, Low Effort)Anthropic | 2026-07-24 | 48% | 2026-09-01 | Source-checked |
| 57 | Agnes 2.5 Pro BetaOther | 2026-08-26 | 47.6% | 2026-09-01 | Source-checked |
| 58 | Hy3Other | 2026-07-06 | 47.6% | 2026-09-01 | Source-checked |
| 59 | Kimi K2.7 CodeMoonshot | 2026-06-12 | 47.5% | 2026-09-01 | Source-checked |
| 60 | GPT-5.5 (Non-reasoning)OpenAI | 2026-04-23 | 47.3% | 2026-09-01 | Source-checked |
| 61 | Grok 4.3xAI | 2026-04-30 | 47.3% | 2026-09-01 | Source-checked |
| 62 | Claude Opus 4.5Anthropic | 2025-11-24 | 47% | 2026-09-01 | Source-checked |
| 63 | MiniMax M2.7MiniMax | 2026-04-15 | 47% | 2026-09-01 | Source-checked |
| 64 | Claude Sonnet 4.6Anthropic | 2026-02-17 | 46.9% | 2026-09-01 | Source-checked |
| 65 | GPT-5.4 NanoOpenAI | 2026-03-17 | 46.9% | 2026-09-01 | Source-checked |
| 66 | Qwen3.6 Max PreviewAlibaba | 2026-04-20 | 46.9% | 2026-09-01 | Source-checked |
| 67 | Qwen3.8-Flash-NextAlibaba | 2026-08-26 | 46.9% | 2026-09-01 | Source-checked |
| 68 | Claude Sonnet 4.6 (Adaptive Reasoning, Max Effort)Anthropic | 2026-02-17 | 46.8% | 2026-09-01 | Source-checked |
| 69 | DeepSeek V4 Flash Vision (Reasoning, Max Effort)DeepSeek | 2026-08-21 | 46.6% | 2026-09-01 | Source-checked |
| 70 | DeepSeek V4 Pro (Reasoning, High Effort)DeepSeek | 2026-04-24 | 46.4% | 2026-09-01 | Source-checked |
| 71 | GLM-5 (Reasoning)Zhipu | 2026-02-11 | 46.2% | 2026-09-01 | Source-checked |
| 72 | GPT-5.2 (medium)OpenAI | 2025-12-11 | 46.2% | 2026-09-01 | Source-checked |
| 73 | GLM-5.3-FlashZhipu | 2026-08-26 | 46.1% | 2026-09-01 | Source-checked |
| 74 | Inkling (xhigh)Other | 2026-07-15 | 46.1% | 2026-09-01 | Source-checked |
| 75 | Claude Opus 4.6Anthropic | 2026-02-05 | 45.7% | 2026-09-01 | Source-checked |
| 76 | Grok 4xAI | 2025-07-10 | 45.7% | 2026-09-01 | Source-checked |
| 77 | Grok 4.20 ReasoningxAI | 2026-03-05 | 45.6% | 2026-09-01 | Source-checked |
| 78 | Solar Open2 250BOther | 2026-08-12 | 45.6% | 2026-09-01 | Source-checked |
| 79 | Qwen 3.7 PlusAlibaba | 2026-06-02 | 45.5% | 2026-09-01 | Source-checked |
| 80 | MiniMax M3MiniMax | 2026-05-31 | 45.4% | 2026-09-01 | Source-checked |
| 81 | GLM-4.7 (Reasoning)Zhipu | 2025-12-22 | 45.1% | 2026-09-01 | Source-checked |
| 82 | Claude 4.5 Sonnet (Reasoning)Anthropic | 2025-09-29 | 44.7% | 2026-09-01 | Source-checked |
| 83 | Grok 4.20 0309 (Reasoning)xAI | 2026-03-10 | 44.7% | 2026-09-01 | Source-checked |
| 84 | Qwen3.8 27BAlibaba | 2026-08-14 | 44.7% | 2026-09-01 | Source-checked |
| 85 | Grok 4.3 (medium)xAI | 2026-04-30 | 44.6% | 2026-09-01 | Source-checked |
| 86 | Motif 3 (Beta)Other | 2026-07-21 | 44.3% | 2026-09-01 | Source-checked |
| 87 | Claude Sonnet 4.6 (Non-reasoning, Low Effort)Anthropic | 2026-02-17 | 44.1% | 2026-09-01 | Source-checked |
| 88 | GLM-5.1Zhipu | 2026-04-07 | 43.8% | 2026-09-01 | Source-checked |
| 89 | GLM-5-TurboZhipu | 2026-03-15 | 43.6% | 2026-09-01 | Source-checked |
| 90 | Muse GlimmerMeta | 2026-08-10 | 43.6% | 2026-09-01 | Source-checked |
| 91 | Solar Pro 4Other | 2026-08-06 | 43.6% | 2026-09-01 | Source-checked |
| 92 | GLM 5V Turbo (Reasoning)Zhipu | 2026-04-01 | 43.5% | 2026-09-01 | Source-checked |
| 93 | Gemma 4 31B ITGoogle | 2026-03-01 | 43.4% | 2026-09-01 | Source-checked |
| 94 | GPT-5.1OpenAI | 2025-11-13 | 43.3% | 2026-09-01 | Source-checked |
| 95 | MiMo-V2.5Xiaomi | 2026-04-22 | 43.1% | 2026-09-01 | Source-checked |
| 96 | Qwen3 Max ThinkingAlibaba | 2026-01-26 | 43.1% | 2026-09-01 | Source-checked |
| 97 | Apodex 1.1Other | 2026-08-30 | 42.9% | 2026-09-01 | Source-checked |
| 98 | GPT-5 (high)OpenAI | 2025-08-07 | 42.9% | 2026-09-01 | Source-checked |
| 99 | MiniMax M2.5MiniMax | 2026-04-01 | 42.6% | 2026-09-01 | Source-checked |
| 100 | MiMo-V2-ProXiaomi | 2026-03-18 | 42.5% | 2026-09-01 | Source-checked |
| 101 | DeepSeek V4 Pro (Non-reasoning)DeepSeek | 2026-04-24 | 42.4% | 2026-09-01 | Source-checked |
| 102 | Kimi K2 ThinkingMoonshot | 2025-11-06 | 42.4% | 2026-09-01 | Source-checked |
| 103 | Ring-2.6-1TOther | 2026-05-08 | 42.4% | 2026-09-01 | Source-checked |
| 104 | Agnes 2.5 Pro AlphaOther | 2026-07-24 | 42.2% | 2026-09-01 | Source-checked |
| 105 | DeepSeek V4 Flash (Reasoning, High Effort)DeepSeek | 2026-04-24 | 42% | 2026-09-01 | Source-checked |
| 106 | Qwen3.5 122B A10B (Reasoning)Alibaba | 2026-02-24 | 42% | 2026-09-01 | Source-checked |
| 107 | Qwen3.5 397B A17B (Reasoning)Alibaba | 2026-02-16 | 42% | 2026-09-01 | Source-checked |
| 108 | Gemini 3.1 Flash LiteGoogle | 2026-05-07 | 41.9% | 2026-09-01 | Source-checked |
| 109 | Grok 4.3 (low)xAI | 2026-04-30 | 41.9% | 2026-09-01 | Source-checked |
| 110 | Nex-N2-ProOther | 2026-06-02 | 41.8% | 2026-09-01 | Source-checked |
| 111 | Hy3-preview (Reasoning)Other | 2026-04-23 | 41.2% | 2026-09-01 | Source-checked |
| 112 | GPT-5 (medium)OpenAI | 2025-08-07 | 41.1% | 2026-09-01 | Source-checked |
| 113 | Ling 3.0 FlashOther | 2026-08-04 | 41.1% | 2026-09-01 | Source-checked |
| 114 | Qwen3.5 397B A17B (Non-reasoning)Alibaba | 2026-02-16 | 41.1% | 2026-09-01 | Source-checked |
| 115 | K-EXAONE 2.0 0803Other | 2026-08-12 | 41% | 2026-09-01 | Source-checked |
| 116 | OpenAI o3OpenAI | 2025-04-16 | 41% | 2026-09-01 | Source-checked |
| 117 | Claude 4.1 Opus (Reasoning)Anthropic | 2025-08-05 | 40.9% | 2026-09-01 | Source-checked |
| 118 | Gemini 3.5 Flash-LiteGoogle | 2026-07-21 | 40.9% | 2026-09-01 | Source-checked |
| 119 | GPT-5 Codex (high)OpenAI | 2025-09-23 | 40.9% | 2026-09-01 | Source-checked |
| 120 | MiniMax-M2.1MiniMax | 2025-12-23 | 40.7% | 2026-09-01 | Source-checked |
| 121 | Qwen3.6 PlusAlibaba | 2026-04-02 | 40.7% | 2026-09-01 | Source-checked |
| 122 | Motif 3Other | 2026-08-12 | 40.6% | 2026-09-01 | Source-checked |
| 123 | DeepSeek R1DeepSeek | 2025-01-20 | 40.3% | 2026-09-01 | Source-checked |
| 124 | GPT-5.1 Codex (high)OpenAI | 2025-11-13 | 40.2% | 2026-09-01 | Source-checked |
| 125 | Step 3.7 FlashStepFun | 2026-06-01 | 40% | 2026-09-01 | Source-checked |
| 126 | Nemotron 3 Ultra 550B A55B (Reasoning)NVIDIA | 2026-06-04 | 39.9% | 2026-09-01 | Source-checked |
| 127 | Claude 4 Opus (Reasoning)Anthropic | 2025-05-22 | 39.8% | 2026-09-01 | Source-checked |
| 128 | Qwen3.6 27B (Reasoning)Alibaba | 2026-04-22 | 39.8% | 2026-09-01 | Source-checked |
| 129 | Mistral Medium 3.5Mistral | 2026-04-29 | 39.6% | 2026-09-01 | Source-checked |
| 130 | Kimi K2.6 (Non-reasoning)Other | 2026-04-20 | 39.5% | 2026-09-01 | Source-checked |
| 131 | MiMo-V2-Omni-0327Xiaomi | 2026-03-27 | 39.5% | 2026-09-01 | Source-checked |
| 132 | Qwen3.5 27B (Reasoning)Alibaba | 2026-02-24 | 39.5% | 2026-09-01 | Source-checked |
| 133 | Hy3-preview (Non-reasoning)Other | 2026-04-23 | 39.4% | 2026-09-01 | Source-checked |
| 134 | MiMo-V2-Flash (Reasoning)Xiaomi | 2025-12-16 | 39.4% | 2026-09-01 | Source-checked |
| 135 | GPT-5 (low)OpenAI | 2025-08-07 | 39.1% | 2026-09-01 | Source-checked |
| 136 | MiMo-V2.5-Pro (Non-reasoning)Xiaomi | 2026-04-22 | 39.1% | 2026-09-01 | Source-checked |
| 137 | DeepSeek V3.2 (Reasoning)DeepSeek | 2025-12-01 | 38.9% | 2026-09-01 | Source-checked |
| 138 | A.X-K2Other | 2026-08-12 | 38.5% | 2026-09-01 | Source-checked |
| 139 | GLM-5 (Non-reasoning)Zhipu | 2026-02-11 | 38.3% | 2026-09-01 | Source-checked |
| 140 | KAT Coder Pro V2Other | 2026-03-27 | 38.3% | 2026-09-01 | Source-checked |
| 141 | MiMo-V2-Flash (Feb 2026)Xiaomi | 2025-12-16 | 38.3% | 2026-09-01 | Source-checked |
| 142 | Gemma 4 12B (Reasoning)Google | 2026-06-07 | 38.2% | 2026-09-01 | Source-checked |
| 143 | JT-4.1 Flash 236B A21BOther | 2026-07-09 | 38.2% | 2026-09-01 | Source-checked |
| 144 | North Mini CodeCohere | 2026-06-09 | 38.2% | 2026-09-01 | Source-checked |
| 145 | Command ACohere | 2026-03-15 | 37.8% | 2026-09-01 | Source-checked |
| 146 | Grok 4.3 (Non-reasoning)xAI | 2026-04-30 | 37.4% | 2026-09-01 | Source-checked |
| 147 | DeepSeek V4 Flash (Non-reasoning)DeepSeek | 2026-04-24 | 37.3% | 2026-09-01 | Source-checked |
| 148 | Qwen3.6 27B (Non-reasoning)Alibaba | 2026-04-22 | 37.3% | 2026-09-01 | Source-checked |
| 149 | Ling-2.6-1TOther | 2026-04-23 | 37% | 2026-09-01 | Source-checked |
| 150 | MiMo-V2-OmniXiaomi | 2026-03-19 | 36.7% | 2026-09-01 | Source-checked |
| 151 | Granite 4.2 30BOther | 2026-08-25 | 36.6% | 2026-09-01 | Source-checked |
| 152 | Mistral Large 3Mistral | 2025-12-02 | 36.2% | 2026-09-01 | Source-checked |
| 153 | GLM-5.2 (Non-reasoning)Zhipu | 2026-06-16 | 36.1% | 2026-09-01 | Source-checked |
| 154 | OpenAI o1OpenAI | 2024-09-12 | 35.8% | 2026-09-01 | Source-checked |
| 155 | Qwen3.6 35B A3B (Reasoning)Alibaba | 2026-04-16 | 35.8% | 2026-09-01 | Source-checked |
| 156 | LongCat-2.0Meituan | 2026-06-29 | 35.4% | 2026-09-01 | Source-checked |
| 157 | DiffusionGemma 26B A4BGoogle | 2026-06-10 | 34.3% | 2026-09-01 | Source-checked |
| 158 | G9v3-39A5BOther | 2026-08-03 | 34% | 2026-09-01 | Source-checked |
| 159 | Llama 4 MaverickMeta | 2026-04-05 | 33.1% | 2026-09-01 | Source-checked |
| 160 | HyperNova 60B 2605Multiverse | 2026-05-06 | 33% | 2026-09-01 | Source-checked |
| 161 | Grok 4.20 0309 v2 (Non-reasoning)xAI | 2026-04-07 | 32.8% | 2026-09-01 | Source-checked |
| 162 | Nemotron 3.5 LightningNVIDIA | 2026-08-11 | 31.6% | 2026-09-01 | Source-checked |
| 163 | Granite 4.2 8BOther | 2026-08-25 | 30.4% | 2026-09-01 | Source-checked |
| 164 | Gemma 4 12B (Non-reasoning)Google | 2026-06-10 | 29.7% | 2026-09-01 | Source-checked |
| 165 | JT-35B-FlashOther | 2026-05-14 | 29.1% | 2026-09-01 | Source-checked |
| 166 | EXAONE 4.5 33BOther | 2026-04-09 | 28% | 2026-09-01 | Source-checked |
| 167 | Nemotron 3 Nano Omni 30B A3B ReasoningNVIDIA | 2026-04-29 | 27.8% | 2026-09-01 | Source-checked |
| 168 | JT-MINIOther | 2026-04-15 | 27.2% | 2026-09-01 | Source-checked |
| 169 | Ling 2.6 FlashOther | 2026-04-21 | 27.1% | 2026-09-01 | Source-checked |
| 170 | Granite 4.1 30BOther | 2026-04-29 | 25.8% | 2026-09-01 | Source-checked |
| 171 | Granite 4.2 3BOther | 2026-08-25 | 24.9% | 2026-09-01 | Source-checked |
| 172 | Ling 3.0 TinyOther | 2026-08-06 | 24.2% | 2026-09-01 | Source-checked |
| 173 | Claude 3 OpusAnthropic | 2024-03-04 | 23.3% | 2026-09-01 | Source-checked |
| 174 | G9v3-3BOther | 2026-07-23 | 17.7% | 2026-09-01 | Source-checked |
| 175 | Llama 4 ScoutMeta | 2026-04-05 | 17% | 2026-09-01 | Source-checked |
| 176 | LFM2.5-8B-A1BLiquid | 2026-06-08 | 7.8% | 2026-09-01 | Source-checked |
| 177 | MiniCPM5-1B (Reasoning)OpenBMB | 2026-06-04 | 4.4% | 2026-09-01 | Source-checked |
| 178 | MiniCPM-V 4.6 1.3BOpenBMB | 2026-05-11 | 2.1% | 2026-09-01 | Source-checked |
| 179 | MiniCPM5-1B (Non-reasoning)OpenBMB | 2026-05-25 | 1.4% | 2026-09-01 | Source-checked |
| 180 | Qwen3.6 35B A3B (Non-reasoning)Alibaba | 2026-04-16 | 1.3% | 2026-09-01 | Source-checked |
This benchmark sits in the coding family. It uses Scientific coding problems with library dependencies. The score should travel with its task format, scoring method, source date, and benchmark version.
No ceiling note is recorded yet. Treat clustering near the top as a warning that the benchmark may no longer separate frontier models.
Every answer below is assembled from the dated fields on this page. Nothing is written separately for search.
Scientific programming tasks requiring domain libraries and multi-step numerical code — AA snapshot runs.
A strong SciCode result says nothing about:
Percentage solved from AA runs. Task format: Scientific coding problems with library dependencies.
SciCode is currently marked Active in the atlas.
Contamination risk for SciCode is graded Medium contamination. Treat every row on this page as a public claim with a source and a date, not as a controlled experiment.
The Pack · Editorial newsletter
One short email when a tool ships or changes status. No tracking, no third-party analytics. Unsubscribe in one click.