Warum dieser Benchmark nützlich ist
Historische Code-Generierungs-Baseline — kurze Python-Funktionen aus Docstrings. Gelöst und stark kontaminiert; für Herkunft behalten, nicht für Frontier-Coding-Rang.
Ob ein Modell aus einem Docstring eine kurze Python-Funktion schreibt, die einige Unit-Tests besteht — der ursprüngliche Code-Generierungs-Benchmark.
Historische Code-Generierungs-Baseline — kurze Python-Funktionen aus Docstrings. Gelöst und stark kontaminiert; für Herkunft behalten, nicht für Frontier-Coding-Rang.
pass@k auf 164 Spielfunktionen. Werte über ~90–95 % pass@1 trennen Frontier-Modelle nicht mehr — für Trennung SWE-bench Verified, Terminal-Bench oder DeepSWE bevorzugen.
Auf die Skala dieses Benchmarks normalisiert (0–100). Die Tabelle zeigt die Rohwerte.
Scores nutzen die eigene Einheit und Skala dieses Benchmarks, keinen universellen Qualitätswert.
| # | Modell | Veröffentlichung | Score | Herkunft | Beleglage |
|---|---|---|---|---|---|
| 1 | Claude Opus 4.6Anthropic | 2026-02-05 | 96.3% pass@1 | Anthropic Claude 3.7/4.6 model card2026-01-01 | Quelle geprüft |
| 2 | GPT 5.5OpenAI | 2026-04-23 | 96.2% pass@1 | CodeSOTA HumanEval leaderboard2026-04-23 | Prüfung nötig |
| 3 | Claude Opus 4.8Anthropic | 2026-05-28 | 95.8% pass@1 | Anthropic Claude 4 family2026-05-28 | Prüfung nötig |
| 4 | GPT-5OpenAICross-reference with official releases before treating as ground truth. | 2025-12-11 | 95.1% pass@1 | CodeSOTA HumanEval leaderboard2025-12-01 | Prüfung nötig |
| 5 | o3OpenAI | 2025-04-16 | 94.8% pass@1 | CodeSOTA HumanEval leaderboard2025-04-01 | Prüfung nötig |
| 6 | Gemini 3.5 FlashGoogle | 2026-05-19 | 94.6% pass@1 | CodeSOTA HumanEval leaderboard2026-05-19 | Prüfung nötig |
| 7 | Claude Sonnet 4.6Anthropic | 2026-02-17 | 94.1% pass@1 | Anthropic Claude 3.7/4.6 model card2026-01-01 | Quelle geprüft |
| 8 | Kimi K2.6Moonshot | 2026-04-20 | 93.8% pass@1 | CodeSOTA HumanEval leaderboard2026-04-20 | Prüfung nötig |
| 9 | DeepSeek V4 Pro MaxDeepSeek | 2026-04-24 | 93.4% pass@1 | DeepSeek V4 release2026-04-24 | Prüfung nötig |
| 10 | Qwen 3.7 MaxAlibaba | 2026-05-20 | 93.1% pass@1 | CodeSOTA HumanEval leaderboard2026-05-20 | Prüfung nötig |
| 11 | DeepSeek Coder V2DeepSeekOpen-weight model; treat as third-party result. | 2024-05-15 | 92.7% pass@1 | DeepSeek Coder V2 repository2024-05-15 | Prüfung nötig |
| 12 | Mistral Large 3Mistral | 2025-12-02 | 92.4% pass@1 | Mistral Large 3 model card2025-12-02 | Prüfung nötig |
| 13 | Claude 3.5 Sonnet (2024-06)Anthropic | 2024-06-20 | 92% pass@1 | Anthropic Claude 3.5 Sonnet2024-06-20 | Quelle geprüft |
| 14 | Llama 4 MaverickMeta | 2026-04-05 | 91.8% pass@1 | Meta Llama 4 model card2026-04-05 | Prüfung nötig |
| 15 | GPT-4 (2023)OpenAI | 2023-03-14 | 67% pass@1 | GPT-4 Technical Report2023-03-15 | Quelle geprüft |
Archiviert — mehrere Frontier-Modelle überschreiten 95 % pass@1. Für Coding-Trennung SWE-bench Verified oder Terminal-Bench nutzen.
Spitzenmodelle überschreiten 90 % pass@1, der Benchmark trennt sie nicht mehr — hohe Werte sind Grundvoraussetzung.
Jede Antwort unten stammt aus den datierten Feldern dieser Seite. Nichts davon ist zusätzlich für Suchmaschinen geschrieben.
Ob ein Modell aus einem Docstring eine kurze Python-Funktion schreibt, die einige Unit-Tests besteht — der ursprüngliche Code-Generierungs-Benchmark.
Ein starkes HumanEval-Ergebnis sagt nichts aus über:
pass@k — Anteil innerhalb von k Versuchen gelöst. Aufgabenformat: 164 handgeschriebene Programmieraufgaben; Metrik ist pass@1 (erster Versuch besteht alle Tests).
HumanEval ist im Atlas derzeit als Ausgedient markiert. Kontext zur Obergrenze: Spitzenmodelle überschreiten 90 % pass@1, der Benchmark trennt sie nicht mehr — hohe Werte sind Grundvoraussetzung.
Das Kontaminationsrisiko für HumanEval ist als Kontamination hoch eingestuft. Behandle jede Zeile auf dieser Seite als öffentliche Angabe mit Quelle und Datum, nicht als kontrolliertes Experiment.
The Pack · Redaktionsnewsletter
Eine kurze E-Mail, wenn ein Tool erscheint oder den Status wechselt. Kein Tracking, keine Drittanbieter-Analytics. Abmeldung mit einem Klick.