Benchmarks / Coding

DeepSWE

Langhorizont-Software-Engineering auf 113 kontaminationsfreien Aufgaben über 91 Repos und fünf Sprachen — Patches müssen handgeschriebene Verhaltens-Verifier bestehen, keine String-Diffs.

CodingFlagshipAktivNiedriges KontaminationsrisikoSeit 2026
Was dieser Benchmark nicht misst
  • Kein Python-only-Issue-Fixing wie SWE-bench Verified — DeepSWE umfasst Go, Rust, TypeScript und mehr.
  • Keine billigen Läufe — Frontier-Agenten verbrennen sechsstellige Output-Tokens pro Aufgabe im öffentlichen Harness.
  • Keine Vendor-Marketing-Slides — Scores stammen aus einem festen mini-swe-agent-Harness für Vergleichbarkeit.
Analyse

Warum dieser Benchmark nützlich ist

Redaktionelle Einordnung ausstehendWir veröffentlichen zuerst Methodik und Ledger. Die benchmark-spezifische Analyse folgt nach der Desk-Prüfung.

Umfang

Abdeckung

Aufgabenfamilie
Coding
Format
113 Aufgaben from scratch (keine geminten PRs); pass@1 über Verhaltens-Verifier; mini-swe-agent-Harness.
Bewertung
pass@1 (% gelöst).
Verantwortliche Stelle
Datacurve
Lesehilfe

So liest du die Scores

Die Lesehilfe steht noch aus. Nutze bis zur Desk-Einordnung Aufgabenformat, Bewertungsmethode und Quelldaten im Ledger.

Blinde Flecken

Was er nicht abdeckt

  • Kein Python-only-Issue-Fixing wie SWE-bench Verified — DeepSWE umfasst Go, Rust, TypeScript und mehr.
  • Keine billigen Läufe — Frontier-Agenten verbrennen sechsstellige Output-Tokens pro Aufgabe im öffentlichen Harness.
  • Keine Vendor-Marketing-Slides — Scores stammen aus einem festen mini-swe-agent-Harness für Vergleichbarkeit.
Scores

Evidenz-Ledger

6 Zeilen
66 Zeilen
70%bester Score
6quellgeprüft
1Quellen
2026-06-20Quelldatum
DeepSWE6

official-page · manual

Verteilung

Wo die Zeilen liegen

0255075100

Auf die Skala dieses Benchmarks normalisiert (0–100). Die Tabelle zeigt die Rohwerte.

Zeitverlauf

Neueste Belege

  1. Claude Fable 5 (max)70% · DeepSWE leaderboard v1.1
  2. GPT 5.5 (xhigh)67% · DeepSWE leaderboard v1.1
  3. Claude Opus 4.8 (max)59% · DeepSWE leaderboard v1.1
  4. GPT 5.4 (xhigh)52% · DeepSWE leaderboard v1.1
  5. GLM 5.2 (max)44% · DeepSWE leaderboard v1.1

Scores nutzen die eigene Einheit und Skala dieses Benchmarks, keinen universellen Qualitätswert.

#ModellVeröffentlichungScoreHerkunftBeleglage
1Claude Fable 5 (max)Anthropic2026-06-0970%
DeepSWE leaderboard v1.12026-06-20
Quelle geprüft
2GPT 5.5 (xhigh)OpenAI2026-04-2367%
DeepSWE leaderboard v1.12026-06-20
Quelle geprüft
3Claude Opus 4.8 (max)Anthropic2026-05-2859%
DeepSWE leaderboard v1.12026-06-20
Quelle geprüft
4GPT 5.4 (xhigh)OpenAI2026-03-1552%
DeepSWE leaderboard v1.12026-06-20
Quelle geprüft
5GLM 5.2 (max)Zhipu2026-05-1544%
DeepSWE leaderboard v1.12026-06-20
Quelle geprüft
6Gemini 3.5 Flash (medium)Google2026-04-1037%
DeepSWE leaderboard v1.12026-06-20
Quelle geprüft
Methode

Was er abdeckt

Die Notiz zur Datenqualität steht aus. Jede Ledger-Zeile trägt weiterhin Quellen-URL, Quelldatum und Zeitpunkt des Einlesens.

Score-Obergrenze

Wo er an Grenzen stößt

Noch ist keine Obergrenze erfasst. Wenn sich Scores oben bündeln, kann der Benchmark Frontier-Modelle möglicherweise nicht mehr trennen.

Tools, die ihn ausweisen

Belege

Quellen und weiterführende Lektüre

The Pack · Redaktionsnewsletter

Neue Karten in dein Postfach. Kostenlos.

Eine kurze E-Mail, wenn eine Karte erscheint oder den Status wechselt. Kein Tracking, keine Drittanbieter-Analytics. Abmeldung mit einem Klick.