Warum dieser Benchmark nützlich ist
Redaktionelle Einordnung ausstehendWir veröffentlichen zuerst Methodik und Ledger. Die benchmark-spezifische Analyse folgt nach der Desk-Prüfung.
Benchmarks / Coding
Langhorizont-Software-Engineering auf 113 kontaminationsfreien Aufgaben über 91 Repos und fünf Sprachen — Patches müssen handgeschriebene Verhaltens-Verifier bestehen, keine String-Diffs.
Redaktionelle Einordnung ausstehendWir veröffentlichen zuerst Methodik und Ledger. Die benchmark-spezifische Analyse folgt nach der Desk-Prüfung.
Die Lesehilfe steht noch aus. Nutze bis zur Desk-Einordnung Aufgabenformat, Bewertungsmethode und Quelldaten im Ledger.
Auf die Skala dieses Benchmarks normalisiert (0–100). Die Tabelle zeigt die Rohwerte.
Scores nutzen die eigene Einheit und Skala dieses Benchmarks, keinen universellen Qualitätswert.
| # | Modell | Veröffentlichung | Score | Herkunft | Beleglage |
|---|---|---|---|---|---|
| 1 | Claude Fable 5 (max)Anthropic | 2026-06-09 | 70% | DeepSWE leaderboard v1.12026-06-20 | Quelle geprüft |
| 2 | GPT 5.5 (xhigh)OpenAI | 2026-04-23 | 67% | DeepSWE leaderboard v1.12026-06-20 | Quelle geprüft |
| 3 | Claude Opus 4.8 (max)Anthropic | 2026-05-28 | 59% | DeepSWE leaderboard v1.12026-06-20 | Quelle geprüft |
| 4 | GPT 5.4 (xhigh)OpenAI | 2026-03-15 | 52% | DeepSWE leaderboard v1.12026-06-20 | Quelle geprüft |
| 5 | GLM 5.2 (max)Zhipu | 2026-05-15 | 44% | DeepSWE leaderboard v1.12026-06-20 | Quelle geprüft |
| 6 | Gemini 3.5 Flash (medium)Google | 2026-04-10 | 37% | DeepSWE leaderboard v1.12026-06-20 | Quelle geprüft |
Die Notiz zur Datenqualität steht aus. Jede Ledger-Zeile trägt weiterhin Quellen-URL, Quelldatum und Zeitpunkt des Einlesens.
Noch ist keine Obergrenze erfasst. Wenn sich Scores oben bündeln, kann der Benchmark Frontier-Modelle möglicherweise nicht mehr trennen.
The Pack · Redaktionsnewsletter
Eine kurze E-Mail, wenn eine Karte erscheint oder den Status wechselt. Kein Tracking, keine Drittanbieter-Analytics. Abmeldung mit einem Klick.