Warum dieser Benchmark nützlich ist
Er übersetzt Programmierfähigkeit in überprüfbare Patches oder Erfolgsquoten. Damit lassen sich Agenten-Testumgebungen vergleichen, nicht nur Basismodelle.
Benchmarks / Coding
Ob ein Modell aus einem Docstring eine kurze Python-Funktion schreibt, die einige Unit-Tests besteht — der ursprüngliche Code-Generierungs-Benchmark.
Er übersetzt Programmierfähigkeit in überprüfbare Patches oder Erfolgsquoten. Damit lassen sich Agenten-Testumgebungen vergleichen, nicht nur Basismodelle.
Lies HumanEval als ausgedient Signal mit hohes kontaminationsrisiko. Vergleiche Modelle nur, wenn Quelle, Testumgebung, Prompting, Sampling und Score-Einheit übereinstimmen.
Auf die Skala dieses Benchmarks normalisiert (0–100). Die Tabelle zeigt die Rohwerte.
Scores nutzen die eigene Einheit und Skala dieses Benchmarks, keinen universellen Qualitätswert.
| # | Modell | Veröffentlichung | Score | Herkunft | Beleglage |
|---|---|---|---|---|---|
| 1 | Claude Opus 4.6Anthropic | 2026-02-05 | 96.3% pass@1 | Anthropic Claude 3.7/4.6 model card2026-01-01 | Quelle geprüft |
| 2 | GPT 5.5OpenAI | 2026-04-23 | 96.2% pass@1 | CodeSOTA HumanEval leaderboard2026-04-23 | Prüfung nötig |
| 3 | Claude Opus 4.8Anthropic | 2026-05-28 | 95.8% pass@1 | Anthropic Claude 4 family2026-05-28 | Prüfung nötig |
| 4 | GPT-5OpenAICross-reference with official releases before treating as ground truth. | 2025-12-11 | 95.1% pass@1 | CodeSOTA HumanEval leaderboard2025-12-01 | Prüfung nötig |
| 5 | o3OpenAI | 2025-04-16 | 94.8% pass@1 | CodeSOTA HumanEval leaderboard2025-04-01 | Prüfung nötig |
| 6 | Gemini 3.5 FlashGoogle | 2026-05-19 | 94.6% pass@1 | CodeSOTA HumanEval leaderboard2026-05-19 | Prüfung nötig |
| 7 | Claude Sonnet 4.6Anthropic | 2026-02-17 | 94.1% pass@1 | Anthropic Claude 3.7/4.6 model card2026-01-01 | Quelle geprüft |
| 8 | Kimi K2.6Moonshot | 2026-04-20 | 93.8% pass@1 | CodeSOTA HumanEval leaderboard2026-04-20 | Prüfung nötig |
| 9 | DeepSeek V4 Pro MaxDeepSeek | 2026-04-24 | 93.4% pass@1 | DeepSeek V4 release2026-04-24 | Prüfung nötig |
| 10 | Qwen 3.7 MaxAlibaba | 2026-05-20 | 93.1% pass@1 | CodeSOTA HumanEval leaderboard2026-05-20 | Prüfung nötig |
| 11 | DeepSeek Coder V2DeepSeekOpen-weight model; treat as third-party result. | 2024-05-15 | 92.7% pass@1 | DeepSeek Coder V2 repository2024-05-15 | Prüfung nötig |
| 12 | Mistral Large 3Mistral | 2025-12-02 | 92.4% pass@1 | Mistral Large 3 model card2025-12-02 | Prüfung nötig |
| 13 | Claude 3.5 Sonnet (2024-06)Anthropic | 2024-06-20 | 92% pass@1 | Anthropic Claude 3.5 Sonnet2024-06-20 | Quelle geprüft |
| 14 | Llama 4 MaverickMeta | 2026-04-05 | 91.8% pass@1 | Meta Llama 4 model card2026-04-05 | Prüfung nötig |
| 15 | GPT-4 (2023)OpenAI | 2023-03-14 | 67% pass@1 | GPT-4 Technical Report2023-03-15 | Quelle geprüft |
Archiviert — mehrere Frontier-Modelle überschreiten 95 % pass@1. Für Coding-Trennung SWE-bench Verified oder Terminal-Bench nutzen.
Spitzenmodelle überschreiten 90 % pass@1, der Benchmark trennt sie nicht mehr — hohe Werte sind Grundvoraussetzung.
The Pack · Redaktionsnewsletter
Eine kurze E-Mail, wenn eine Karte erscheint oder den Status wechselt. Kein Tracking, keine Drittanbieter-Analytics. Abmeldung mit einem Klick.