Benchmarks / Sicherheit

HELM Safety

Holistic Evaluation of Language Models

Eine multimetrische Sicherheits-Evaluationssuite von Stanford CRFM, die Modellverhalten über sicherheitsbezogene Szenarien ausweist, statt alles in einen einzigen Headline-Wert zu pressen.

SicherheitSolidAktivMittleres KontaminationsrisikoSeit 2022
Was dieser Benchmark nicht misst
  • Kein reales Deployment-Risiko allein — ein Modell kann in HELM sicherer aussehen als in einem Produkt mit Tools, Memory, Browsing oder schwacher Policy-Durchsetzung.
  • Keine institutionsspezifische Policy-Passung — Campus-, Klinik-, Rechts- und Arbeitsplatzregeln brauchen oft engere Tests, als ein öffentlicher Benchmark abbildet.
  • Keinen Einzelrang — HELM ist bewusst multimetrisch; Precision, Robustheit, Toxicity, Fairness, Kalibrierung und Effizienz müssen getrennt gelesen werden.
Analyse

Warum dieser Benchmark nützlich ist

Sicherheitsevidenz ist oft Marketingtext oder Red-Team-Anekdote. HELM gibt Lesern einen öffentlichen, wiederholbaren Ort für mehrere Sicherheitsmetriken nebeneinander.

Umfang

Abdeckung

Aufgabenfamilie
Sicherheit
Format
Szenariobasierte Evaluation über sicherheitsrelevante Aufgaben und Metriken; Leaderboard-Seiten zeigen Metrikfamilien statt eines universellen Scores.
Bewertung
Mehrere Metriken je Szenario. Vor Modellvergleichen immer Metriklabel und HELM-Release mitlesen.
Verantwortliche Stelle
Stanford CRFM
Lesehilfe

So liest du die Scores

HELM als Dashboard lesen. Die Metriken nicht zu einem VerdictPal-Sieger mitteln; suche die konkrete Fehlerklasse, die dein Workflow nicht tolerieren kann.

Blinde Flecken

Was er nicht abdeckt

  • Kein reales Deployment-Risiko allein — ein Modell kann in HELM sicherer aussehen als in einem Produkt mit Tools, Memory, Browsing oder schwacher Policy-Durchsetzung.
  • Keine institutionsspezifische Policy-Passung — Campus-, Klinik-, Rechts- und Arbeitsplatzregeln brauchen oft engere Tests, als ein öffentlicher Benchmark abbildet.
  • Keinen Einzelrang — HELM ist bewusst multimetrisch; Precision, Robustheit, Toxicity, Fairness, Kalibrierung und Effizienz müssen getrennt gelesen werden.
Scores

Evidenz-Ledger

9 Zeilen
99 Zeilen
92.1%bester Score
0quellgeprüft
1Quellen
2026-05-28bis 2024-08-15
Stanford HELM9

official-page · manual

Verteilung

Wo die Zeilen liegen

0255075100

Auf die Skala dieses Benchmarks normalisiert (0–100). Die Tabelle zeigt die Rohwerte.

Zeitverlauf

Neueste Belege

  1. Claude Opus 4.891.8% · Stanford HELM leaderboard
  2. DeepSeek V4 Pro Max86.4% · Stanford HELM leaderboard
  3. GPT 5.590.6% · Stanford HELM leaderboard
  4. Gemini 3.1 Pro88.9% · Stanford HELM leaderboard
  5. Claude Sonnet 4.689.2% · Stanford HELM leaderboard

Scores nutzen die eigene Einheit und Skala dieses Benchmarks, keinen universellen Qualitätswert.

#ModellVeröffentlichungScoreHerkunftBeleglage
1Claude Opus 4 (2024-07)AnthropicHELM safety scenario accuracy; composite across harmlessness and helpfulness metrics.2024-07-0192.1%
Stanford HELM leaderboard2024-08-15
Prüfung nötig
2Claude Opus 4.8AnthropicHELM safety scenario accuracy; composite across harmlessness and helpfulness metrics.2026-05-2891.8%
Stanford HELM leaderboard2026-05-28
Prüfung nötig
3GPT 5.5OpenAIHELM safety scenario accuracy.2026-04-2390.6%
Stanford HELM leaderboard2026-04-23
Prüfung nötig
4GPT-4o (2024-05)OpenAIHELM safety scenario accuracy.2024-05-1389.4%
Stanford HELM leaderboard2024-08-15
Prüfung nötig
5Claude Sonnet 4.6AnthropicHELM safety scenario accuracy.2026-02-1789.2%
Stanford HELM leaderboard2026-02-17
Prüfung nötig
6Gemini 3.1 ProGoogleHELM safety scenario accuracy.2026-02-1988.9%
Stanford HELM leaderboard2026-02-19
Prüfung nötig
7Gemini 1.5 Pro (2024-06)GoogleHELM safety scenario accuracy.2024-06-0188.7%
Stanford HELM leaderboard2024-08-15
Prüfung nötig
8DeepSeek V4 Pro MaxDeepSeekHELM safety scenario accuracy.2026-04-2486.4%
Stanford HELM leaderboard2026-04-24
Prüfung nötig
9Mistral Large 2 (2024-07)MistralHELM safety scenario accuracy.2024-07-2484.3%
Stanford HELM leaderboard2024-08-15
Prüfung nötig
Methode

Was er abdeckt

Primärquelle ist die Stanford-CRFM-HELM-Seite. VerdictPal sollte Zeilen nur ergänzen, wenn Szenario, Metrik, Modell und HELM-Release exakt erhalten bleiben.

Score-Obergrenze

Wo er an Grenzen stößt

Ein starker HELM-Sicherheitsausschnitt beweist keine sichere Tool-Nutzung, keine sichere Retrieval-Praxis und kein sicheres institutionelles Deployment.

Tools, die ihn ausweisen

Belege

Quellen und weiterführende Lektüre

The Pack · Redaktionsnewsletter

Neue Karten in dein Postfach. Kostenlos.

Eine kurze E-Mail, wenn eine Karte erscheint oder den Status wechselt. Kein Tracking, keine Drittanbieter-Analytics. Abmeldung mit einem Klick.