Warum dieser Benchmark nützlich ist
Wenn du Langhorizont-Softwarearbeit über mehrere Sprachen mit Verhaltens-Verifiers brauchst — härtere Kontaminationslage als klassisches SWE-bench Verified.
Langhorizont-Software-Engineering auf 113 kontaminationsfreien Aufgaben über 91 Repos und fünf Sprachen — Patches müssen handgeschriebene Verhaltens-Verifier bestehen, keine String-Diffs.
Wenn du Langhorizont-Softwarearbeit über mehrere Sprachen mit Verhaltens-Verifiers brauchst — härtere Kontaminationslage als klassisches SWE-bench Verified.
pass@1 (% gelöst) auf festem mini-swe-agent-Harness. Nur Harness-gleiche Läufe vergleichen; Token-Verbrauch pro Aufgabe ist hoch — Kosten gehören zur Lesart.
Auf die Skala dieses Benchmarks normalisiert (0–100). Die Tabelle zeigt die Rohwerte.
Scores nutzen die eigene Einheit und Skala dieses Benchmarks, keinen universellen Qualitätswert.
| # | Modell | Veröffentlichung | Score | Herkunft | Beleglage |
|---|---|---|---|---|---|
| 1 | Claude Opus 5 (max)Anthropic | 2026-07-24 | 74% | DeepSWE leaderboard2026-08-04 | Quelle geprüft |
| 2 | GPT-5.6 Sol (max)OpenAI | 2026-07-09 | 73% | DeepSWE leaderboard2026-08-04 | Quelle geprüft |
| 2 | GPT 5.5 (xhigh)OpenAI | 2026-04-23 | 67% | DeepSWE leaderboard v1.12026-06-20 | Quelle geprüft |
| 3 | Claude Fable 5 (max)Anthropic | 2026-06-09 | 70% | DeepSWE leaderboard2026-08-04 | Quelle geprüft |
| 3 | Claude Opus 4.8 (max)Anthropic | 2026-05-28 | 59% | DeepSWE leaderboard v1.12026-06-20 | Quelle geprüft |
| 4 | GPT 5.4 (xhigh)OpenAI | 2026-03-15 | 52% | DeepSWE leaderboard v1.12026-06-20 | Quelle geprüft |
| 5 | GLM 5.2 (max)Zhipu | 2026-05-15 | 44% | DeepSWE leaderboard v1.12026-06-20 | Quelle geprüft |
| 6 | Gemini 3.5 Flash (medium)Google | 2026-04-10 | 37% | DeepSWE leaderboard v1.12026-06-20 | Quelle geprüft |
Dieser Benchmark gehört zur Familie coding. Sein Format: 113 Aufgaben from scratch (keine geminten PRs); pass@1 über Verhaltens-Verifier; mini-swe-agent-Harness. Der Score sollte immer mit Aufgabenformat, Bewertungsmethode, Quelldatum und Benchmark-Version gelesen werden.
Noch ist keine Obergrenze erfasst. Wenn sich Scores oben bündeln, kann der Benchmark Frontier-Modelle möglicherweise nicht mehr trennen.
Jede Antwort unten stammt aus den datierten Feldern dieser Seite. Nichts davon ist zusätzlich für Suchmaschinen geschrieben.
Langhorizont-Software-Engineering auf 113 kontaminationsfreien Aufgaben über 91 Repos und fünf Sprachen — Patches müssen handgeschriebene Verhaltens-Verifier bestehen, keine String-Diffs.
Ein starkes DeepSWE-Ergebnis sagt nichts aus über:
pass@1 (% gelöst). Aufgabenformat: 113 Aufgaben from scratch (keine geminten PRs); pass@1 über Verhaltens-Verifier; mini-swe-agent-Harness.
DeepSWE ist im Atlas derzeit als Aktiv markiert.
Das Kontaminationsrisiko für DeepSWE ist als Kontamination niedrig eingestuft. Behandle jede Zeile auf dieser Seite als öffentliche Angabe mit Quelle und Datum, nicht als kontrolliertes Experiment.
The Pack · Redaktionsnewsletter
Eine kurze E-Mail, wenn ein Tool erscheint oder den Status wechselt. Kein Tracking, keine Drittanbieter-Analytics. Abmeldung mit einem Klick.