Benchmarks / Coding

DeepSWE

Langhorizont-Software-Engineering auf 113 kontaminationsfreien Aufgaben über 91 Repos und fünf Sprachen — Patches müssen handgeschriebene Verhaltens-Verifier bestehen, keine String-Diffs.

Was dieser Benchmark nicht misst
  • Kein Python-only-Issue-Fixing wie SWE-bench Verified — DeepSWE umfasst Go, Rust, TypeScript und mehr.
  • Keine billigen Läufe — Frontier-Agenten verbrennen sechsstellige Output-Tokens pro Aufgabe im öffentlichen Harness.
  • Keine Vendor-Marketing-Slides — Scores stammen aus einem festen mini-swe-agent-Harness für Vergleichbarkeit.
Analyse

Warum dieser Benchmark nützlich ist

Wenn du Langhorizont-Softwarearbeit über mehrere Sprachen mit Verhaltens-Verifiers brauchst — härtere Kontaminationslage als klassisches SWE-bench Verified.

Umfang

Abdeckung

Aufgabenfamilie
Coding
Format
113 Aufgaben from scratch (keine geminten PRs); pass@1 über Verhaltens-Verifier; mini-swe-agent-Harness.
Bewertung
pass@1 (% gelöst).
Verantwortliche Stelle
Datacurve
Lesehilfe

So liest du die Scores

pass@1 (% gelöst) auf festem mini-swe-agent-Harness. Nur Harness-gleiche Läufe vergleichen; Token-Verbrauch pro Aufgabe ist hoch — Kosten gehören zur Lesart.

Blinde Flecken

Was er nicht abdeckt

  • Kein Python-only-Issue-Fixing wie SWE-bench Verified — DeepSWE umfasst Go, Rust, TypeScript und mehr.
  • Keine billigen Läufe — Frontier-Agenten verbrennen sechsstellige Output-Tokens pro Aufgabe im öffentlichen Harness.
  • Keine Vendor-Marketing-Slides — Scores stammen aus einem festen mini-swe-agent-Harness für Vergleichbarkeit.
Scores

Evidenz-Ledger

8 Zeilen
88 Zeilen
74%bester Score
8quellgeprüft
1Quellen
2026-08-04bis 2026-06-20
DeepSWE8

official-page · manual

Verteilung

Wo die Zeilen liegen

0255075100

Auf die Skala dieses Benchmarks normalisiert (0–100). Die Tabelle zeigt die Rohwerte.

Zeitverlauf

Neueste Belege

  1. Claude Opus 5 (max)74% · DeepSWE leaderboard
  2. GPT-5.6 Sol (max)73% · DeepSWE leaderboard
  3. Claude Fable 5 (max)70% · DeepSWE leaderboard
  4. GPT 5.5 (xhigh)67% · DeepSWE leaderboard v1.1
  5. Claude Opus 4.8 (max)59% · DeepSWE leaderboard v1.1

Scores nutzen die eigene Einheit und Skala dieses Benchmarks, keinen universellen Qualitätswert.

#ModellVeröffentlichungScoreHerkunftBeleglage
1Claude Opus 5 (max)Anthropic2026-07-2474%
DeepSWE leaderboard2026-08-04
Quelle geprüft
2GPT-5.6 Sol (max)OpenAI2026-07-0973%
DeepSWE leaderboard2026-08-04
Quelle geprüft
2GPT 5.5 (xhigh)OpenAI2026-04-2367%
DeepSWE leaderboard v1.12026-06-20
Quelle geprüft
3Claude Fable 5 (max)Anthropic2026-06-0970%
DeepSWE leaderboard2026-08-04
Quelle geprüft
3Claude Opus 4.8 (max)Anthropic2026-05-2859%
DeepSWE leaderboard v1.12026-06-20
Quelle geprüft
4GPT 5.4 (xhigh)OpenAI2026-03-1552%
DeepSWE leaderboard v1.12026-06-20
Quelle geprüft
5GLM 5.2 (max)Zhipu2026-05-1544%
DeepSWE leaderboard v1.12026-06-20
Quelle geprüft
6Gemini 3.5 Flash (medium)Google2026-04-1037%
DeepSWE leaderboard v1.12026-06-20
Quelle geprüft
Methode

Was er abdeckt

Dieser Benchmark gehört zur Familie coding. Sein Format: 113 Aufgaben from scratch (keine geminten PRs); pass@1 über Verhaltens-Verifier; mini-swe-agent-Harness. Der Score sollte immer mit Aufgabenformat, Bewertungsmethode, Quelldatum und Benchmark-Version gelesen werden.

Score-Obergrenze

Wo er an Grenzen stößt

Noch ist keine Obergrenze erfasst. Wenn sich Scores oben bündeln, kann der Benchmark Frontier-Modelle möglicherweise nicht mehr trennen.

Tools, die ihn ausweisen

Belege

Quellen und weiterführende Lektüre

Fragen zu diesem Benchmark

Jede Antwort unten stammt aus den datierten Feldern dieser Seite. Nichts davon ist zusätzlich für Suchmaschinen geschrieben.

Was misst DeepSWE?

Langhorizont-Software-Engineering auf 113 kontaminationsfreien Aufgaben über 91 Repos und fünf Sprachen — Patches müssen handgeschriebene Verhaltens-Verifier bestehen, keine String-Diffs.

Was beweist ein hoher DeepSWE-Wert nicht?

Ein starkes DeepSWE-Ergebnis sagt nichts aus über:

  • Kein Python-only-Issue-Fixing wie SWE-bench Verified — DeepSWE umfasst Go, Rust, TypeScript und mehr.
  • Keine billigen Läufe — Frontier-Agenten verbrennen sechsstellige Output-Tokens pro Aufgabe im öffentlichen Harness.
  • Keine Vendor-Marketing-Slides — Scores stammen aus einem festen mini-swe-agent-Harness für Vergleichbarkeit.

Wie wird DeepSWE bewertet?

pass@1 (% gelöst). Aufgabenformat: 113 Aufgaben from scratch (keine geminten PRs); pass@1 über Verhaltens-Verifier; mini-swe-agent-Harness.

Ist DeepSWE gesättigt?

DeepSWE ist im Atlas derzeit als Aktiv markiert.

Können DeepSWE-Ergebnisse durch Trainingsdaten verunreinigt sein?

Das Kontaminationsrisiko für DeepSWE ist als Kontamination niedrig eingestuft. Behandle jede Zeile auf dieser Seite als öffentliche Angabe mit Quelle und Datum, nicht als kontrolliertes Experiment.

The Pack · Redaktionsnewsletter

Neue Tools in dein Postfach. Kostenlos.

Eine kurze E-Mail, wenn ein Tool erscheint oder den Status wechselt. Kein Tracking, keine Drittanbieter-Analytics. Abmeldung mit einem Klick.