Warum dieser Benchmark nützlich ist
Er übersetzt Programmierfähigkeit in überprüfbare Patches oder Erfolgsquoten. Damit lassen sich Agenten-Testumgebungen vergleichen, nicht nur Basismodelle.
Benchmarks / Coding
Ob ein Modell echte GitHub-Issues aus populären Python-Repos lösen kann — es muss einen Patch erzeugen, der die versteckte Testsuite besteht. 'Verified' ist eine 500-Issue-Teilmenge, von Menschen validiert.
Er übersetzt Programmierfähigkeit in überprüfbare Patches oder Erfolgsquoten. Damit lassen sich Agenten-Testumgebungen vergleichen, nicht nur Basismodelle.
Lies SWE-bench Verified als gesättigt Signal mit mittleres kontaminationsrisiko. Vergleiche Modelle nur, wenn Quelle, Testumgebung, Prompting, Sampling und Score-Einheit übereinstimmen.
Auf die Skala dieses Benchmarks normalisiert (0–100). Die Tabelle zeigt die Rohwerte.
Scores nutzen die eigene Einheit und Skala dieses Benchmarks, keinen universellen Qualitätswert.
| # | Modell | Veröffentlichung | Score | Herkunft | Beleglage |
|---|---|---|---|---|---|
| 1 | Claude Mythos PreviewAnthropicBest-of-3-Agent-Harness; vor Schlussfolgerungen mit Single-Attempt-Läufen auf demselben Leaderboard vergleichen. | 2026-06-01 | 93.9% | SWE-bench official leaderboard2026-06-02 | Quelle geprüft |
| 2 | Claude Opus 4.8Anthropic | 2026-05-28 | 88.6% | SWE-bench official leaderboard2026-05-30 | Quelle geprüft |
| 3 | Claude Opus 4.7 (Adaptive)Anthropic | 2026-04-16 | 87.6% | SWE-bench official leaderboard2026-05-30 | Quelle geprüft |
| 4 | GPT 5.5OpenAIDesk-attribuiert aus GPT-5.5-Karte — reproduzierbarer Harness-Score, keine Vendor-Slide. | 2026-04-23 | 82.5% | SWE-bench Verified leaderboard2026-06-01 | Quelle geprüft |
| 4 | Claude Opus 4.5 (SEAL)Anthropic | 2025-11-01 | 80.9% | SWE-bench SEAL leaderboard2026-05-30 | Quelle geprüft |
| 5 | Claude Opus 4.6Anthropic | 2026-02-01 | 80.8% | SWE-bench official leaderboard2026-05-30 | Quelle geprüft |
| 6 | DeepSeek V4 Pro MaxDeepSeek | 2026-04-24 | 80.6% | SWE-bench official leaderboard2026-05-30 | Quelle geprüft |
| 6 | Gemini 3.1 ProGoogle | 2026-02-19 | 80.6% | SWE-bench official leaderboard2026-05-30 | Quelle geprüft |
| 8 | Kimi K2.6Moonshot | 2026-04-20 | 80.2% | SWE-bench official leaderboard2026-05-30 | Quelle geprüft |
| 8 | MiniMax M2.5MiniMax | 2026-04-01 | 80.2% | SWE-bench official leaderboard2026-05-30 | Quelle geprüft |
| 10 | GPT 5.2OpenAI | 2025-12-11 | 80% | SWE-bench official leaderboard2026-05-30 | Quelle geprüft |
| 10 | GPT 5.4OpenAI | 2026-03-05 | 80% | SWE-bench official leaderboard2026-05-30 | Quelle geprüft |
| 12 | Claude Sonnet 4.6Anthropic | 2026-02-17 | 79.6% | SWE-bench official leaderboard2026-05-30 | Quelle geprüft |
| 14 | Qwen 3.7 MaxAlibaba | 2026-05-20 | 79.4% | SWE-bench Verified leaderboard2026-06-09 | Quelle geprüft |
| 13 | DeepSeek V4 Flash MaxDeepSeek | 2026-05-10 | 79% | SWE-bench official leaderboard2026-05-30 | Quelle geprüft |
| 14 | Qwen 3.6 PlusAlibaba | 2026-04-01 | 78.8% | SWE-bench official leaderboard2026-05-30 | Quelle geprüft |
| 17 | MiniMax M3MiniMax | 2026-05-31 | 78.4% | SWE-bench Verified leaderboard2026-06-09 | Quelle geprüft |
| 15 | Gemini 3 FlashGoogle | 2025-12-17 | 78% | SWE-bench official leaderboard2026-05-30 | Quelle geprüft |
| 19 | Grok 4.3xAI | 2026-04-30 | 77.6% | SWE-bench Verified leaderboard2026-06-09 | Quelle geprüft |
| 20 | Gemini 3.5 FlashGoogle | 2026-05-19 | 77.2% | SWE-bench Verified leaderboard2026-06-09 | Quelle geprüft |
| 21 | Mistral Large 3Mistral | 2025-12-02 | 76.2% | SWE-bench Verified leaderboard2026-06-09 | Quelle geprüft |
| 22 | Llama 4 MaverickMeta | 2026-04-05 | 74.8% | SWE-bench Verified leaderboard2026-06-09 | Quelle geprüft |
| 23 | LongCat-2.0MeituanVendor-gemeldeter SWE-bench-Pro-Wert, in Meituans Release-Berichterstattung knapp über GPT-5.5 eingeordnet. Nicht die kanonische SWE-bench-Verified-Zeile. | 2026-06-29 | 59.5% | Meituan LongCat-2.0 release materials2026-06-29 | Prüfung nötig |
Frontier-Modelle clustern jetzt ~78–87 % auf Verified; Kontamination und Harness-Varianz begrenzen die Trennschärfe. Für aktuelles Coding-Agent-Signal DeepSWE oder SWE-Lancer bevorzugen.
Noch ist keine Obergrenze erfasst. Wenn sich Scores oben bündeln, kann der Benchmark Frontier-Modelle möglicherweise nicht mehr trennen.
The Pack · Redaktionsnewsletter
Eine kurze E-Mail, wenn eine Karte erscheint oder den Status wechselt. Kein Tracking, keine Drittanbieter-Analytics. Abmeldung mit einem Klick.