Benchmarks / Coding

HumanEval

Ob ein Modell aus einem Docstring eine kurze Python-Funktion schreibt, die einige Unit-Tests besteht — der ursprüngliche Code-Generierungs-Benchmark.

CodingSolidAusgedientHohes KontaminationsrisikoSeit 2021
Was dieser Benchmark nicht misst
  • Echte Softwarearbeit — 164 eigenständige Spielfunktionen sind weit von einer Produktions-Codebasis entfernt.
  • Stark kontaminiert: Die Aufgaben kursieren seit Jahren online und stecken fast sicher in Trainingsdaten.
  • Debugging, Mehrdatei-Änderungen oder das Lesen vorhandenen Codes — nichts davon wird hier getestet.
Analyse

Warum dieser Benchmark nützlich ist

Er übersetzt Programmierfähigkeit in überprüfbare Patches oder Erfolgsquoten. Damit lassen sich Agenten-Testumgebungen vergleichen, nicht nur Basismodelle.

Umfang

Abdeckung

Aufgabenfamilie
Coding
Format
164 handgeschriebene Programmieraufgaben; Metrik ist pass@1 (erster Versuch besteht alle Tests).
Bewertung
pass@k — Anteil innerhalb von k Versuchen gelöst.
Verantwortliche Stelle
OpenAI (Chen et al.)
Lesehilfe

So liest du die Scores

Lies HumanEval als ausgedient Signal mit hohes kontaminationsrisiko. Vergleiche Modelle nur, wenn Quelle, Testumgebung, Prompting, Sampling und Score-Einheit übereinstimmen.

Blinde Flecken

Was er nicht abdeckt

  • Echte Softwarearbeit — 164 eigenständige Spielfunktionen sind weit von einer Produktions-Codebasis entfernt.
  • Stark kontaminiert: Die Aufgaben kursieren seit Jahren online und stecken fast sicher in Trainingsdaten.
  • Debugging, Mehrdatei-Änderungen oder das Lesen vorhandenen Codes — nichts davon wird hier getestet.
Scores

Evidenz-Ledger

15 Zeilen
1515 Zeilen
96.3% pass@1bester Score
4quellgeprüft
3Quellen
2026-05-28bis 2023-03-15
CodeSOTA6

manual-snapshot · manual

Papers / model cards3

manual-snapshot · manual

Vendor claims6

manual-snapshot · manual

Verteilung

Wo die Zeilen liegen

0255075100

Auf die Skala dieses Benchmarks normalisiert (0–100). Die Tabelle zeigt die Rohwerte.

Zeitverlauf

Neueste Belege

  1. Claude Opus 4.895.8% pass@1 · Anthropic Claude 4 family
  2. Qwen 3.7 Max93.1% pass@1 · CodeSOTA HumanEval leaderboard
  3. Gemini 3.5 Flash94.6% pass@1 · CodeSOTA HumanEval leaderboard
  4. DeepSeek V4 Pro Max93.4% pass@1 · DeepSeek V4 release
  5. GPT 5.596.2% pass@1 · CodeSOTA HumanEval leaderboard

Scores nutzen die eigene Einheit und Skala dieses Benchmarks, keinen universellen Qualitätswert.

#ModellVeröffentlichungScoreHerkunftBeleglage
1Claude Opus 4.6Anthropic2026-02-0596.3% pass@1
Anthropic Claude 3.7/4.6 model card2026-01-01
Quelle geprüft
2GPT 5.5OpenAI2026-04-2396.2% pass@1
CodeSOTA HumanEval leaderboard2026-04-23
Prüfung nötig
3Claude Opus 4.8Anthropic2026-05-2895.8% pass@1
Anthropic Claude 4 family2026-05-28
Prüfung nötig
4GPT-5OpenAICross-reference with official releases before treating as ground truth.2025-12-1195.1% pass@1
CodeSOTA HumanEval leaderboard2025-12-01
Prüfung nötig
5o3OpenAI2025-04-1694.8% pass@1
CodeSOTA HumanEval leaderboard2025-04-01
Prüfung nötig
6Gemini 3.5 FlashGoogle2026-05-1994.6% pass@1
CodeSOTA HumanEval leaderboard2026-05-19
Prüfung nötig
7Claude Sonnet 4.6Anthropic2026-02-1794.1% pass@1
Anthropic Claude 3.7/4.6 model card2026-01-01
Quelle geprüft
8Kimi K2.6Moonshot2026-04-2093.8% pass@1
CodeSOTA HumanEval leaderboard2026-04-20
Prüfung nötig
9DeepSeek V4 Pro MaxDeepSeek2026-04-2493.4% pass@1
DeepSeek V4 release2026-04-24
Prüfung nötig
10Qwen 3.7 MaxAlibaba2026-05-2093.1% pass@1
CodeSOTA HumanEval leaderboard2026-05-20
Prüfung nötig
11DeepSeek Coder V2DeepSeekOpen-weight model; treat as third-party result.2024-05-1592.7% pass@1
DeepSeek Coder V2 repository2024-05-15
Prüfung nötig
12Mistral Large 3Mistral2025-12-0292.4% pass@1
Mistral Large 3 model card2025-12-02
Prüfung nötig
13Claude 3.5 Sonnet (2024-06)Anthropic2024-06-2092% pass@1
Anthropic Claude 3.5 Sonnet2024-06-20
Quelle geprüft
14Llama 4 MaverickMeta2026-04-0591.8% pass@1
Meta Llama 4 model card2026-04-05
Prüfung nötig
15GPT-4 (2023)OpenAI2023-03-1467% pass@1
GPT-4 Technical Report2023-03-15
Quelle geprüft
Methode

Was er abdeckt

Archiviert — mehrere Frontier-Modelle überschreiten 95 % pass@1. Für Coding-Trennung SWE-bench Verified oder Terminal-Bench nutzen.

Score-Obergrenze

Wo er an Grenzen stößt

Spitzenmodelle überschreiten 90 % pass@1, der Benchmark trennt sie nicht mehr — hohe Werte sind Grundvoraussetzung.

Tools, die ihn ausweisen

Belege

Quellen und weiterführende Lektüre

The Pack · Redaktionsnewsletter

Neue Karten in dein Postfach. Kostenlos.

Eine kurze E-Mail, wenn eine Karte erscheint oder den Status wechselt. Kein Tracking, keine Drittanbieter-Analytics. Abmeldung mit einem Klick.