Benchmarks / Sicherheit

HELM Safety

Holistic Evaluation of Language Models

Eine multimetrische Sicherheits-Evaluationssuite von Stanford CRFM, die Modellverhalten über sicherheitsbezogene Szenarien ausweist, statt alles in einen einzigen Headline-Wert zu pressen.

Was dieser Benchmark nicht misst
  • Kein reales Deployment-Risiko allein — ein Modell kann in HELM sicherer aussehen als in einem Produkt mit Tools, Memory, Browsing oder schwacher Policy-Durchsetzung.
  • Keine institutionsspezifische Policy-Passung — Campus-, Klinik-, Rechts- und Arbeitsplatzregeln brauchen oft engere Tests, als ein öffentlicher Benchmark abbildet.
  • Keinen Einzelrang — HELM ist bewusst multimetrisch; Precision, Robustheit, Toxicity, Fairness, Kalibrierung und Effizienz müssen getrennt gelesen werden.
Analyse

Warum dieser Benchmark nützlich ist

Sicherheitsevidenz ist oft Marketingtext oder Red-Team-Anekdote. HELM gibt Lesern einen öffentlichen, wiederholbaren Ort für mehrere Sicherheitsmetriken nebeneinander.

Umfang

Abdeckung

Aufgabenfamilie
Sicherheit
Format
Szenariobasierte Evaluation über sicherheitsrelevante Aufgaben und Metriken; Leaderboard-Seiten zeigen Metrikfamilien statt eines universellen Scores.
Bewertung
Mehrere Metriken je Szenario. Vor Modellvergleichen immer Metriklabel und HELM-Release mitlesen.
Verantwortliche Stelle
Stanford CRFM
Lesehilfe

So liest du die Scores

HELM als Dashboard lesen. Die Metriken nicht zu einem VerdictPal-Sieger mitteln; suche die konkrete Fehlerklasse, die dein Workflow nicht tolerieren kann.

Blinde Flecken

Was er nicht abdeckt

  • Kein reales Deployment-Risiko allein — ein Modell kann in HELM sicherer aussehen als in einem Produkt mit Tools, Memory, Browsing oder schwacher Policy-Durchsetzung.
  • Keine institutionsspezifische Policy-Passung — Campus-, Klinik-, Rechts- und Arbeitsplatzregeln brauchen oft engere Tests, als ein öffentlicher Benchmark abbildet.
  • Keinen Einzelrang — HELM ist bewusst multimetrisch; Precision, Robustheit, Toxicity, Fairness, Kalibrierung und Effizienz müssen getrennt gelesen werden.
Scores

Evidenz-Ledger

9 Zeilen
99 Zeilen
92.1%bester Score
0quellgeprüft
1Quellen
2026-05-28bis 2024-08-15
Stanford HELM9

official-page · manual

Verteilung

Wo die Zeilen liegen

0255075100

Auf die Skala dieses Benchmarks normalisiert (0–100). Die Tabelle zeigt die Rohwerte.

Zeitverlauf

Neueste Belege

  1. Claude Opus 4.891.8% · Stanford HELM leaderboard
  2. DeepSeek V4 Pro Max86.4% · Stanford HELM leaderboard
  3. GPT 5.590.6% · Stanford HELM leaderboard
  4. Gemini 3.1 Pro88.9% · Stanford HELM leaderboard
  5. Claude Sonnet 4.689.2% · Stanford HELM leaderboard

Scores nutzen die eigene Einheit und Skala dieses Benchmarks, keinen universellen Qualitätswert.

#ModellVeröffentlichungScoreHerkunftBeleglage
1Claude Opus 4 (2024-07)AnthropicHELM safety scenario accuracy; composite across harmlessness and helpfulness metrics.2024-07-0192.1%
Stanford HELM leaderboard2024-08-15
Prüfung nötig
2Claude Opus 4.8AnthropicHELM safety scenario accuracy; composite across harmlessness and helpfulness metrics.2026-05-2891.8%
Stanford HELM leaderboard2026-05-28
Prüfung nötig
3GPT 5.5OpenAIHELM safety scenario accuracy.2026-04-2390.6%
Stanford HELM leaderboard2026-04-23
Prüfung nötig
4GPT-4o (2024-05)OpenAIHELM safety scenario accuracy.2024-05-1389.4%
Stanford HELM leaderboard2024-08-15
Prüfung nötig
5Claude Sonnet 4.6AnthropicHELM safety scenario accuracy.2026-02-1789.2%
Stanford HELM leaderboard2026-02-17
Prüfung nötig
6Gemini 3.1 ProGoogleHELM safety scenario accuracy.2026-02-1988.9%
Stanford HELM leaderboard2026-02-19
Prüfung nötig
7Gemini 1.5 Pro (2024-06)GoogleHELM safety scenario accuracy.2024-06-0188.7%
Stanford HELM leaderboard2024-08-15
Prüfung nötig
8DeepSeek V4 Pro MaxDeepSeekHELM safety scenario accuracy.2026-04-2486.4%
Stanford HELM leaderboard2026-04-24
Prüfung nötig
9Mistral Large 2 (2024-07)MistralHELM safety scenario accuracy.2024-07-2484.3%
Stanford HELM leaderboard2024-08-15
Prüfung nötig
Methode

Was er abdeckt

Primärquelle ist die Stanford-CRFM-HELM-Seite. VerdictPal sollte Zeilen nur ergänzen, wenn Szenario, Metrik, Modell und HELM-Release exakt erhalten bleiben.

Score-Obergrenze

Wo er an Grenzen stößt

Ein starker HELM-Sicherheitsausschnitt beweist keine sichere Tool-Nutzung, keine sichere Retrieval-Praxis und kein sicheres institutionelles Deployment.

Tools, die ihn ausweisen

Belege

Quellen und weiterführende Lektüre

Fragen zu diesem Benchmark

Jede Antwort unten stammt aus den datierten Feldern dieser Seite. Nichts davon ist zusätzlich für Suchmaschinen geschrieben.

Was misst HELM Safety?

Eine multimetrische Sicherheits-Evaluationssuite von Stanford CRFM, die Modellverhalten über sicherheitsbezogene Szenarien ausweist, statt alles in einen einzigen Headline-Wert zu pressen.

Was beweist ein hoher HELM Safety-Wert nicht?

Ein starkes HELM Safety-Ergebnis sagt nichts aus über:

  • Kein reales Deployment-Risiko allein — ein Modell kann in HELM sicherer aussehen als in einem Produkt mit Tools, Memory, Browsing oder schwacher Policy-Durchsetzung.
  • Keine institutionsspezifische Policy-Passung — Campus-, Klinik-, Rechts- und Arbeitsplatzregeln brauchen oft engere Tests, als ein öffentlicher Benchmark abbildet.
  • Keinen Einzelrang — HELM ist bewusst multimetrisch; Precision, Robustheit, Toxicity, Fairness, Kalibrierung und Effizienz müssen getrennt gelesen werden.

Wie wird HELM Safety bewertet?

Mehrere Metriken je Szenario. Vor Modellvergleichen immer Metriklabel und HELM-Release mitlesen. Aufgabenformat: Szenariobasierte Evaluation über sicherheitsrelevante Aufgaben und Metriken; Leaderboard-Seiten zeigen Metrikfamilien statt eines universellen Scores.

Ist HELM Safety gesättigt?

HELM Safety ist im Atlas derzeit als Aktiv markiert.

Können HELM Safety-Ergebnisse durch Trainingsdaten verunreinigt sein?

Das Kontaminationsrisiko für HELM Safety ist als Kontamination mittel eingestuft. Behandle jede Zeile auf dieser Seite als öffentliche Angabe mit Quelle und Datum, nicht als kontrolliertes Experiment.

The Pack · Redaktionsnewsletter

Neue Tools in dein Postfach. Kostenlos.

Eine kurze E-Mail, wenn ein Tool erscheint oder den Status wechselt. Kein Tracking, keine Drittanbieter-Analytics. Abmeldung mit einem Klick.