Benchmarks / Coding

SWE-bench Verified

Ob ein Modell echte GitHub-Issues aus populären Python-Repos lösen kann — es muss einen Patch erzeugen, der die versteckte Testsuite besteht. 'Verified' ist eine 500-Issue-Teilmenge, von Menschen validiert.

Was dieser Benchmark nicht misst
  • Nichts außer Python — die Suite ist Python-only und sagt wenig über andere Sprachen oder Frontend aus.
  • Codequalität oder Wartbarkeit — ein bestandener Patch kann hässlich oder fragil sein.
  • Das Scaffolding zählt so viel wie das Modell: Agent-Harness, Retries und Tool-Zugriff verschieben Werte um zig Punkte.
Analyse

Warum dieser Benchmark nützlich ist

Einst der Flagship-Test für echte Python-Issues — weiter nützliche Herkunft. Frontier-Scores clustern jetzt eng; für aktuelles Agent-Signal DeepSWE oder SWE-Lancer bevorzugen.

Umfang

Abdeckung

Aufgabenfamilie
Coding
Format
500 von Menschen validierte GitHub-Issues; Erfolg = die Gold-Testsuite besteht nach dem Patch.
Bewertung
% gelöster Issues (Tests bestehen).
Verantwortliche Stelle
Princeton / OpenAI (Verified subset)
Lesehilfe

So liest du die Scores

% gelöster Verified-Issues (versteckte Tests bestehen). Harness, Retries und Tools verschieben Werte um zig Punkte — Agent-Setup immer mitlesen. Clustering ~78–87 % bedeutet heute schwache Frontier-Trennung.

Blinde Flecken

Was er nicht abdeckt

  • Nichts außer Python — die Suite ist Python-only und sagt wenig über andere Sprachen oder Frontend aus.
  • Codequalität oder Wartbarkeit — ein bestandener Patch kann hässlich oder fragil sein.
  • Das Scaffolding zählt so viel wie das Modell: Agent-Harness, Retries und Tool-Zugriff verschieben Werte um zig Punkte.
Scores

Evidenz-Ledger

23 Zeilen
2323 Zeilen
93.9%bester Score
22quellgeprüft
2Quellen
2026-06-29bis 2026-05-30
SWE-bench22

official-json · scheduled

Vendor claims1

manual-snapshot · manual

Verteilung

Wo die Zeilen liegen

0255075100

Auf die Skala dieses Benchmarks normalisiert (0–100). Die Tabelle zeigt die Rohwerte.

Zeitverlauf

Neueste Belege

  1. LongCat-2.059.5% · Meituan LongCat-2.0 release materials
  2. Qwen 3.7 Max79.4% · SWE-bench Verified leaderboard
  3. MiniMax M378.4% · SWE-bench Verified leaderboard
  4. Grok 4.377.6% · SWE-bench Verified leaderboard
  5. Gemini 3.5 Flash77.2% · SWE-bench Verified leaderboard

Scores nutzen die eigene Einheit und Skala dieses Benchmarks, keinen universellen Qualitätswert.

#ModellVeröffentlichungScoreHerkunftBeleglage
1Claude Mythos PreviewAnthropicBest-of-3-Agent-Harness; vor Schlussfolgerungen mit Single-Attempt-Läufen auf demselben Leaderboard vergleichen.2026-06-0193.9%
SWE-bench official leaderboard2026-06-02
Quelle geprüft
2Claude Opus 4.8Anthropic2026-05-2888.6%
SWE-bench official leaderboard2026-05-30
Quelle geprüft
3Claude Opus 4.7 (Adaptive)Anthropic2026-04-1687.6%
SWE-bench official leaderboard2026-05-30
Quelle geprüft
4GPT 5.5OpenAIDesk-attribuiert aus GPT-5.5-Karte — reproduzierbarer Harness-Score, keine Vendor-Slide.2026-04-2382.5%
SWE-bench Verified leaderboard2026-06-01
Quelle geprüft
4Claude Opus 4.5 (SEAL)Anthropic2025-11-0180.9%
SWE-bench SEAL leaderboard2026-05-30
Quelle geprüft
5Claude Opus 4.6Anthropic2026-02-0180.8%
SWE-bench official leaderboard2026-05-30
Quelle geprüft
6DeepSeek V4 Pro MaxDeepSeek2026-04-2480.6%
SWE-bench official leaderboard2026-05-30
Quelle geprüft
6Gemini 3.1 ProGoogle2026-02-1980.6%
SWE-bench official leaderboard2026-05-30
Quelle geprüft
8Kimi K2.6Moonshot2026-04-2080.2%
SWE-bench official leaderboard2026-05-30
Quelle geprüft
8MiniMax M2.5MiniMax2026-04-0180.2%
SWE-bench official leaderboard2026-05-30
Quelle geprüft
10GPT 5.2OpenAI2025-12-1180%
SWE-bench official leaderboard2026-05-30
Quelle geprüft
10GPT 5.4OpenAI2026-03-0580%
SWE-bench official leaderboard2026-05-30
Quelle geprüft
12Claude Sonnet 4.6Anthropic2026-02-1779.6%
SWE-bench official leaderboard2026-05-30
Quelle geprüft
14Qwen 3.7 MaxAlibaba2026-05-2079.4%
SWE-bench Verified leaderboard2026-06-09
Quelle geprüft
13DeepSeek V4 Flash MaxDeepSeek2026-05-1079%
SWE-bench official leaderboard2026-05-30
Quelle geprüft
14Qwen 3.6 PlusAlibaba2026-04-0178.8%
SWE-bench official leaderboard2026-05-30
Quelle geprüft
17MiniMax M3MiniMax2026-05-3178.4%
SWE-bench Verified leaderboard2026-06-09
Quelle geprüft
15Gemini 3 FlashGoogle2025-12-1778%
SWE-bench official leaderboard2026-05-30
Quelle geprüft
19Grok 4.3xAI2026-04-3077.6%
SWE-bench Verified leaderboard2026-06-09
Quelle geprüft
20Gemini 3.5 FlashGoogle2026-05-1977.2%
SWE-bench Verified leaderboard2026-06-09
Quelle geprüft
21Mistral Large 3Mistral2025-12-0276.2%
SWE-bench Verified leaderboard2026-06-09
Quelle geprüft
22Llama 4 MaverickMeta2026-04-0574.8%
SWE-bench Verified leaderboard2026-06-09
Quelle geprüft
23LongCat-2.0MeituanVendor-gemeldeter SWE-bench-Pro-Wert, in Meituans Release-Berichterstattung knapp über GPT-5.5 eingeordnet. Nicht die kanonische SWE-bench-Verified-Zeile.2026-06-2959.5%
Meituan LongCat-2.0 release materials2026-06-29
Prüfung nötig
Methode

Was er abdeckt

Frontier-Modelle clustern jetzt ~78–87 % auf Verified; Kontamination und Harness-Varianz begrenzen die Trennschärfe. Für aktuelles Coding-Agent-Signal DeepSWE oder SWE-Lancer bevorzugen.

Score-Obergrenze

Wo er an Grenzen stößt

Noch ist keine Obergrenze erfasst. Wenn sich Scores oben bündeln, kann der Benchmark Frontier-Modelle möglicherweise nicht mehr trennen.

Tools, die ihn ausweisen

Belege

Quellen und weiterführende Lektüre

Fragen zu diesem Benchmark

Jede Antwort unten stammt aus den datierten Feldern dieser Seite. Nichts davon ist zusätzlich für Suchmaschinen geschrieben.

Was misst SWE-bench Verified?

Ob ein Modell echte GitHub-Issues aus populären Python-Repos lösen kann — es muss einen Patch erzeugen, der die versteckte Testsuite besteht. 'Verified' ist eine 500-Issue-Teilmenge, von Menschen validiert.

Was beweist ein hoher SWE-bench Verified-Wert nicht?

Ein starkes SWE-bench Verified-Ergebnis sagt nichts aus über:

  • Nichts außer Python — die Suite ist Python-only und sagt wenig über andere Sprachen oder Frontend aus.
  • Codequalität oder Wartbarkeit — ein bestandener Patch kann hässlich oder fragil sein.
  • Das Scaffolding zählt so viel wie das Modell: Agent-Harness, Retries und Tool-Zugriff verschieben Werte um zig Punkte.

Wie wird SWE-bench Verified bewertet?

% gelöster Issues (Tests bestehen). Aufgabenformat: 500 von Menschen validierte GitHub-Issues; Erfolg = die Gold-Testsuite besteht nach dem Patch.

Ist SWE-bench Verified gesättigt?

SWE-bench Verified ist im Atlas derzeit als Gesättigt markiert.

Können SWE-bench Verified-Ergebnisse durch Trainingsdaten verunreinigt sein?

Das Kontaminationsrisiko für SWE-bench Verified ist als Kontamination mittel eingestuft. Behandle jede Zeile auf dieser Seite als öffentliche Angabe mit Quelle und Datum, nicht als kontrolliertes Experiment.

The Pack · Redaktionsnewsletter

Neue Tools in dein Postfach. Kostenlos.

Eine kurze E-Mail, wenn ein Tool erscheint oder den Status wechselt. Kein Tracking, keine Drittanbieter-Analytics. Abmeldung mit einem Klick.