Warum dieser Benchmark nützlich ist
Sicherheitsevidenz ist oft Marketingtext oder Red-Team-Anekdote. HELM gibt Lesern einen öffentlichen, wiederholbaren Ort für mehrere Sicherheitsmetriken nebeneinander.
Holistic Evaluation of Language Models
Eine multimetrische Sicherheits-Evaluationssuite von Stanford CRFM, die Modellverhalten über sicherheitsbezogene Szenarien ausweist, statt alles in einen einzigen Headline-Wert zu pressen.
Sicherheitsevidenz ist oft Marketingtext oder Red-Team-Anekdote. HELM gibt Lesern einen öffentlichen, wiederholbaren Ort für mehrere Sicherheitsmetriken nebeneinander.
HELM als Dashboard lesen. Die Metriken nicht zu einem VerdictPal-Sieger mitteln; suche die konkrete Fehlerklasse, die dein Workflow nicht tolerieren kann.
Auf die Skala dieses Benchmarks normalisiert (0–100). Die Tabelle zeigt die Rohwerte.
Scores nutzen die eigene Einheit und Skala dieses Benchmarks, keinen universellen Qualitätswert.
| # | Modell | Veröffentlichung | Score | Herkunft | Beleglage |
|---|---|---|---|---|---|
| 1 | Claude Opus 4 (2024-07)AnthropicHELM safety scenario accuracy; composite across harmlessness and helpfulness metrics. | 2024-07-01 | 92.1% | Stanford HELM leaderboard2024-08-15 | Prüfung nötig |
| 2 | Claude Opus 4.8AnthropicHELM safety scenario accuracy; composite across harmlessness and helpfulness metrics. | 2026-05-28 | 91.8% | Stanford HELM leaderboard2026-05-28 | Prüfung nötig |
| 3 | GPT 5.5OpenAIHELM safety scenario accuracy. | 2026-04-23 | 90.6% | Stanford HELM leaderboard2026-04-23 | Prüfung nötig |
| 4 | GPT-4o (2024-05)OpenAIHELM safety scenario accuracy. | 2024-05-13 | 89.4% | Stanford HELM leaderboard2024-08-15 | Prüfung nötig |
| 5 | Claude Sonnet 4.6AnthropicHELM safety scenario accuracy. | 2026-02-17 | 89.2% | Stanford HELM leaderboard2026-02-17 | Prüfung nötig |
| 6 | Gemini 3.1 ProGoogleHELM safety scenario accuracy. | 2026-02-19 | 88.9% | Stanford HELM leaderboard2026-02-19 | Prüfung nötig |
| 7 | Gemini 1.5 Pro (2024-06)GoogleHELM safety scenario accuracy. | 2024-06-01 | 88.7% | Stanford HELM leaderboard2024-08-15 | Prüfung nötig |
| 8 | DeepSeek V4 Pro MaxDeepSeekHELM safety scenario accuracy. | 2026-04-24 | 86.4% | Stanford HELM leaderboard2026-04-24 | Prüfung nötig |
| 9 | Mistral Large 2 (2024-07)MistralHELM safety scenario accuracy. | 2024-07-24 | 84.3% | Stanford HELM leaderboard2024-08-15 | Prüfung nötig |
Primärquelle ist die Stanford-CRFM-HELM-Seite. VerdictPal sollte Zeilen nur ergänzen, wenn Szenario, Metrik, Modell und HELM-Release exakt erhalten bleiben.
Ein starker HELM-Sicherheitsausschnitt beweist keine sichere Tool-Nutzung, keine sichere Retrieval-Praxis und kein sicheres institutionelles Deployment.
Jede Antwort unten stammt aus den datierten Feldern dieser Seite. Nichts davon ist zusätzlich für Suchmaschinen geschrieben.
Eine multimetrische Sicherheits-Evaluationssuite von Stanford CRFM, die Modellverhalten über sicherheitsbezogene Szenarien ausweist, statt alles in einen einzigen Headline-Wert zu pressen.
Ein starkes HELM Safety-Ergebnis sagt nichts aus über:
Mehrere Metriken je Szenario. Vor Modellvergleichen immer Metriklabel und HELM-Release mitlesen. Aufgabenformat: Szenariobasierte Evaluation über sicherheitsrelevante Aufgaben und Metriken; Leaderboard-Seiten zeigen Metrikfamilien statt eines universellen Scores.
HELM Safety ist im Atlas derzeit als Aktiv markiert.
Das Kontaminationsrisiko für HELM Safety ist als Kontamination mittel eingestuft. Behandle jede Zeile auf dieser Seite als öffentliche Angabe mit Quelle und Datum, nicht als kontrolliertes Experiment.
The Pack · Redaktionsnewsletter
Eine kurze E-Mail, wenn ein Tool erscheint oder den Status wechselt. Kein Tracking, keine Drittanbieter-Analytics. Abmeldung mit einem Klick.