Warum dieser Benchmark nützlich ist
Sicherheitsevidenz ist oft Marketingtext oder Red-Team-Anekdote. HELM gibt Lesern einen öffentlichen, wiederholbaren Ort für mehrere Sicherheitsmetriken nebeneinander.
Benchmarks / Sicherheit
Holistic Evaluation of Language Models
Eine multimetrische Sicherheits-Evaluationssuite von Stanford CRFM, die Modellverhalten über sicherheitsbezogene Szenarien ausweist, statt alles in einen einzigen Headline-Wert zu pressen.
Sicherheitsevidenz ist oft Marketingtext oder Red-Team-Anekdote. HELM gibt Lesern einen öffentlichen, wiederholbaren Ort für mehrere Sicherheitsmetriken nebeneinander.
HELM als Dashboard lesen. Die Metriken nicht zu einem VerdictPal-Sieger mitteln; suche die konkrete Fehlerklasse, die dein Workflow nicht tolerieren kann.
Auf die Skala dieses Benchmarks normalisiert (0–100). Die Tabelle zeigt die Rohwerte.
Scores nutzen die eigene Einheit und Skala dieses Benchmarks, keinen universellen Qualitätswert.
| # | Modell | Veröffentlichung | Score | Herkunft | Beleglage |
|---|---|---|---|---|---|
| 1 | Claude Opus 4 (2024-07)AnthropicHELM safety scenario accuracy; composite across harmlessness and helpfulness metrics. | 2024-07-01 | 92.1% | Stanford HELM leaderboard2024-08-15 | Prüfung nötig |
| 2 | Claude Opus 4.8AnthropicHELM safety scenario accuracy; composite across harmlessness and helpfulness metrics. | 2026-05-28 | 91.8% | Stanford HELM leaderboard2026-05-28 | Prüfung nötig |
| 3 | GPT 5.5OpenAIHELM safety scenario accuracy. | 2026-04-23 | 90.6% | Stanford HELM leaderboard2026-04-23 | Prüfung nötig |
| 4 | GPT-4o (2024-05)OpenAIHELM safety scenario accuracy. | 2024-05-13 | 89.4% | Stanford HELM leaderboard2024-08-15 | Prüfung nötig |
| 5 | Claude Sonnet 4.6AnthropicHELM safety scenario accuracy. | 2026-02-17 | 89.2% | Stanford HELM leaderboard2026-02-17 | Prüfung nötig |
| 6 | Gemini 3.1 ProGoogleHELM safety scenario accuracy. | 2026-02-19 | 88.9% | Stanford HELM leaderboard2026-02-19 | Prüfung nötig |
| 7 | Gemini 1.5 Pro (2024-06)GoogleHELM safety scenario accuracy. | 2024-06-01 | 88.7% | Stanford HELM leaderboard2024-08-15 | Prüfung nötig |
| 8 | DeepSeek V4 Pro MaxDeepSeekHELM safety scenario accuracy. | 2026-04-24 | 86.4% | Stanford HELM leaderboard2026-04-24 | Prüfung nötig |
| 9 | Mistral Large 2 (2024-07)MistralHELM safety scenario accuracy. | 2024-07-24 | 84.3% | Stanford HELM leaderboard2024-08-15 | Prüfung nötig |
Primärquelle ist die Stanford-CRFM-HELM-Seite. VerdictPal sollte Zeilen nur ergänzen, wenn Szenario, Metrik, Modell und HELM-Release exakt erhalten bleiben.
Ein starker HELM-Sicherheitsausschnitt beweist keine sichere Tool-Nutzung, keine sichere Retrieval-Praxis und kein sicheres institutionelles Deployment.
The Pack · Redaktionsnewsletter
Eine kurze E-Mail, wenn eine Karte erscheint oder den Status wechselt. Kein Tracking, keine Drittanbieter-Analytics. Abmeldung mit einem Klick.