Benchmarks / Coding

SWE-bench Verified

Ob ein Modell echte GitHub-Issues aus populären Python-Repos lösen kann — es muss einen Patch erzeugen, der die versteckte Testsuite besteht. 'Verified' ist eine 500-Issue-Teilmenge, von Menschen validiert.

CodingFlagshipGesättigtMittleres KontaminationsrisikoSeit 2024
Was dieser Benchmark nicht misst
  • Nichts außer Python — die Suite ist Python-only und sagt wenig über andere Sprachen oder Frontend aus.
  • Codequalität oder Wartbarkeit — ein bestandener Patch kann hässlich oder fragil sein.
  • Das Scaffolding zählt so viel wie das Modell: Agent-Harness, Retries und Tool-Zugriff verschieben Werte um zig Punkte.
Analyse

Warum dieser Benchmark nützlich ist

Er übersetzt Programmierfähigkeit in überprüfbare Patches oder Erfolgsquoten. Damit lassen sich Agenten-Testumgebungen vergleichen, nicht nur Basismodelle.

Umfang

Abdeckung

Aufgabenfamilie
Coding
Format
500 von Menschen validierte GitHub-Issues; Erfolg = die Gold-Testsuite besteht nach dem Patch.
Bewertung
% gelöster Issues (Tests bestehen).
Verantwortliche Stelle
Princeton / OpenAI (Verified subset)
Lesehilfe

So liest du die Scores

Lies SWE-bench Verified als gesättigt Signal mit mittleres kontaminationsrisiko. Vergleiche Modelle nur, wenn Quelle, Testumgebung, Prompting, Sampling und Score-Einheit übereinstimmen.

Blinde Flecken

Was er nicht abdeckt

  • Nichts außer Python — die Suite ist Python-only und sagt wenig über andere Sprachen oder Frontend aus.
  • Codequalität oder Wartbarkeit — ein bestandener Patch kann hässlich oder fragil sein.
  • Das Scaffolding zählt so viel wie das Modell: Agent-Harness, Retries und Tool-Zugriff verschieben Werte um zig Punkte.
Scores

Evidenz-Ledger

23 Zeilen
2323 Zeilen
93.9%bester Score
22quellgeprüft
2Quellen
2026-06-29bis 2026-05-30
SWE-bench22

official-json · scheduled

Vendor claims1

manual-snapshot · manual

Verteilung

Wo die Zeilen liegen

0255075100

Auf die Skala dieses Benchmarks normalisiert (0–100). Die Tabelle zeigt die Rohwerte.

Zeitverlauf

Neueste Belege

  1. LongCat-2.059.5% · Meituan LongCat-2.0 release materials
  2. Qwen 3.7 Max79.4% · SWE-bench Verified leaderboard
  3. MiniMax M378.4% · SWE-bench Verified leaderboard
  4. Grok 4.377.6% · SWE-bench Verified leaderboard
  5. Gemini 3.5 Flash77.2% · SWE-bench Verified leaderboard

Scores nutzen die eigene Einheit und Skala dieses Benchmarks, keinen universellen Qualitätswert.

#ModellVeröffentlichungScoreHerkunftBeleglage
1Claude Mythos PreviewAnthropicBest-of-3-Agent-Harness; vor Schlussfolgerungen mit Single-Attempt-Läufen auf demselben Leaderboard vergleichen.2026-06-0193.9%
SWE-bench official leaderboard2026-06-02
Quelle geprüft
2Claude Opus 4.8Anthropic2026-05-2888.6%
SWE-bench official leaderboard2026-05-30
Quelle geprüft
3Claude Opus 4.7 (Adaptive)Anthropic2026-04-1687.6%
SWE-bench official leaderboard2026-05-30
Quelle geprüft
4GPT 5.5OpenAIDesk-attribuiert aus GPT-5.5-Karte — reproduzierbarer Harness-Score, keine Vendor-Slide.2026-04-2382.5%
SWE-bench Verified leaderboard2026-06-01
Quelle geprüft
4Claude Opus 4.5 (SEAL)Anthropic2025-11-0180.9%
SWE-bench SEAL leaderboard2026-05-30
Quelle geprüft
5Claude Opus 4.6Anthropic2026-02-0180.8%
SWE-bench official leaderboard2026-05-30
Quelle geprüft
6DeepSeek V4 Pro MaxDeepSeek2026-04-2480.6%
SWE-bench official leaderboard2026-05-30
Quelle geprüft
6Gemini 3.1 ProGoogle2026-02-1980.6%
SWE-bench official leaderboard2026-05-30
Quelle geprüft
8Kimi K2.6Moonshot2026-04-2080.2%
SWE-bench official leaderboard2026-05-30
Quelle geprüft
8MiniMax M2.5MiniMax2026-04-0180.2%
SWE-bench official leaderboard2026-05-30
Quelle geprüft
10GPT 5.2OpenAI2025-12-1180%
SWE-bench official leaderboard2026-05-30
Quelle geprüft
10GPT 5.4OpenAI2026-03-0580%
SWE-bench official leaderboard2026-05-30
Quelle geprüft
12Claude Sonnet 4.6Anthropic2026-02-1779.6%
SWE-bench official leaderboard2026-05-30
Quelle geprüft
14Qwen 3.7 MaxAlibaba2026-05-2079.4%
SWE-bench Verified leaderboard2026-06-09
Quelle geprüft
13DeepSeek V4 Flash MaxDeepSeek2026-05-1079%
SWE-bench official leaderboard2026-05-30
Quelle geprüft
14Qwen 3.6 PlusAlibaba2026-04-0178.8%
SWE-bench official leaderboard2026-05-30
Quelle geprüft
17MiniMax M3MiniMax2026-05-3178.4%
SWE-bench Verified leaderboard2026-06-09
Quelle geprüft
15Gemini 3 FlashGoogle2025-12-1778%
SWE-bench official leaderboard2026-05-30
Quelle geprüft
19Grok 4.3xAI2026-04-3077.6%
SWE-bench Verified leaderboard2026-06-09
Quelle geprüft
20Gemini 3.5 FlashGoogle2026-05-1977.2%
SWE-bench Verified leaderboard2026-06-09
Quelle geprüft
21Mistral Large 3Mistral2025-12-0276.2%
SWE-bench Verified leaderboard2026-06-09
Quelle geprüft
22Llama 4 MaverickMeta2026-04-0574.8%
SWE-bench Verified leaderboard2026-06-09
Quelle geprüft
23LongCat-2.0MeituanVendor-gemeldeter SWE-bench-Pro-Wert, in Meituans Release-Berichterstattung knapp über GPT-5.5 eingeordnet. Nicht die kanonische SWE-bench-Verified-Zeile.2026-06-2959.5%
Meituan LongCat-2.0 release materials2026-06-29
Prüfung nötig
Methode

Was er abdeckt

Frontier-Modelle clustern jetzt ~78–87 % auf Verified; Kontamination und Harness-Varianz begrenzen die Trennschärfe. Für aktuelles Coding-Agent-Signal DeepSWE oder SWE-Lancer bevorzugen.

Score-Obergrenze

Wo er an Grenzen stößt

Noch ist keine Obergrenze erfasst. Wenn sich Scores oben bündeln, kann der Benchmark Frontier-Modelle möglicherweise nicht mehr trennen.

Tools, die ihn ausweisen

Belege

Quellen und weiterführende Lektüre

The Pack · Redaktionsnewsletter

Neue Karten in dein Postfach. Kostenlos.

Eine kurze E-Mail, wenn eine Karte erscheint oder den Status wechselt. Kein Tracking, keine Drittanbieter-Analytics. Abmeldung mit einem Klick.