VerdictPal · Redaktions-Desk · Stand 1. Sept. 2026VerdictPal
Glossar

Die Wörter, die die Benches nutzen.

Kontamination, Sättigung, pass@1, Elo, Ledger — der Jargon auf den Benchmark-Seiten, auf Studierenden-Deutsch. Benannte Tests stehen hier auch und führen ins volle Dossier.
Kein Leaderboard, kein Wortsalat
Ein Score ist ein Beleg aus einem Test, keine Krone. Bleibt ein Wort auf einer Benchmark-Seite undurchsichtig, gehört es hierher.

Wie diese Site spricht

Dossier

tool page · model page

Eine endliche Seite für ein Tool oder Modell: datierte Preise, Datenschutz, Fehlermodi und ein nachvollziehbarer Score. Wir nennen das im Lesetext nie Karten.

Verlinke diesen Begriff über die Überschrift.

Status-Labels

Flagship · Solid · Lightweight · Draft

Wie fertig eine öffentliche Seite ist. Flagship hat das volle Gate bestanden. Solid ist zuverlässig, mit Caveats. Lightweight ist ein Ersteindruck. Draft ist Gerüst, keine Empfehlung.

Verlinke diesen Begriff über die Überschrift.

Evidenzstufe

self-run · hands-on · synthesized · vendor claim

Wie nah der Desk an der Behauptung war. Self-run: wir haben die Aufgabe ausgeführt. Hands-on: jemand vom Desk hat das Tool genutzt. Synthesized: unabhängige Berichte. Vendor claim: unverifiziertes Marketing.

Verlinke diesen Begriff über die Überschrift.

Desk

editorial desk · Redaktion

Das kleine Schweizer Studierenden-Team, das Seiten schreibt, Daten prüft und öffentliche Seiten freigibt. Hat der Desk ein Tool nicht genutzt, bleibt das Dossier so gekennzeichnet.

Verlinke diesen Begriff über die Überschrift.

The Pack

newsletter · drop

Der Redaktionsnewsletter. Ein Drop erscheint, wenn ein Tool, Modell oder die Methode sich ändert — nie mit versprochenem Wochenrhythmus.

Verlinke diesen Begriff über die Überschrift.

Fehlermodus

pitfall · what breaks

Ein dokumentierter Weg, wie das Tool oder der Workflow in echter Studien- oder Forschungsarbeit bricht. Die bleiben absichtlich sichtbar, auch wenn Anbieter sie lieber verstecken.

Verlinke diesen Begriff über die Überschrift.

Caveat

blind spot · what it does not measure

Die ehrliche Grenze einer Behauptung. Auf Benchmark-Seiten ist das die Liste dessen, was ein hoher Score nicht beweist.

Verlinke diesen Begriff über die Überschrift.

VerdictPal Lab

first-party · The Lab

Benchmarks, die wir selbst laufen, mit eingefrorenem Protokoll, Fragenbank und veröffentlichter Methode. Lab-Scores bleiben unveröffentlicht, bis ein Mensch sie bewertet und freigibt.

Verlinke diesen Begriff über die Überschrift.

Frontier-Modell

frontier

Ein aktuelles Spitzenmodell, kein GPT-4-Rest von letztem Jahr. Der Modellvergleich auf dieser Site listet nur Frontier-Optionen.

Verlinke diesen Begriff über die Überschrift.

Grounding

source-grounded · cited answer

Eine Behauptung an eine Quelle binden, die die Leserin öffnen kann. Ein flüssiger Absatz ohne Spur ist nicht geerdet, auch wenn er akademisch klingt.

Verlinke diesen Begriff über die Überschrift.

Halluzination

made-up source · fabricated citation

Eine selbstsichere Behauptung oder ein Zitat, das nicht in der Quelle steht. Flüssigkeit ist keine Evidenz. Prüfe das PDF, bevor du die Fußnote einfügst.

Verlinke diesen Begriff über die Überschrift.

Open-Weight

open weights · open model

Die Modellgewichte lassen sich herunterladen und außerhalb der Vendor-Chatbox laufen. Open-Weight ist nicht dasselbe wie offene Daten, offenes Training oder eine Datenschutzgarantie.

Verlinke diesen Begriff über die Überschrift.

Wie Scores funktionieren

Benchmark

eval · suite · test

Ein konkreter Test einer konkreten Fähigkeit: harte Wissenschaftsfragen, Coding-Bugs, lange Dokumente, Agenten-Workflows. Keine Krone für das beste Modell.

Verlinke diesen Begriff über die Überschrift.

Leaderboard

ranking · scoreboard

Eine einzige geordnete Modellliste. VerdictPal lehnt diesen Rahmen ab. Verschiedene Tests messen verschiedene Jobs — Elo, pass@1 und Genauigkeit werden hier nie zu einem Fake-Ranking vermischt.

Verlinke diesen Begriff über die Überschrift.

Ledger

score row · score database · evidence ledger

Die datierte Tabelle belegter Scores hinter einer Benchmark-Seite. Eine Zeile ist ein Modell in einem Test, mit Quellen-URL und Datum. Unterschiedliche Metriken bleiben in eigenen Spalten.

Verlinke diesen Begriff über die Überschrift.

Quellgeprüft

verified · receipt

VerdictPal hat die zitierte Primärquelle geöffnet und die Zahl bestätigt. Eine belegte Zeile ohne diesen Stempel bleibt öffentlich, wird aber vorsichtiger gelesen.

Verlinke diesen Begriff über die Überschrift.

Selbst berichtet

vendor score · announcement score

Die Zahl stammt aus der eigenen Ankündigung des Modell-Anbieters. Nützlich als Claim, schwach als Beweis. Besser ein unabhängiger Maintainer oder eine quellgeprüfte Zeile.

Verlinke diesen Begriff über die Überschrift.

Snapshot

static snapshot · ingested

Eine eingefrorene lokale Kopie öffentlicher Scores. Die Live-Site scrapt nicht und ruft beim Lesen keine Benchmark-APIs auf. Die Daten auf der Zeile sagen, wann diese Kopie entstand.

Verlinke diesen Begriff über die Überschrift.

Provenienz

source date · ingested at

Die Spur einer Zahl: wer sie veröffentlicht hat, die URL, das Quelldatum und wann VerdictPal sie übernommen hat. Keine Zahl ohne diese Spur.

Verlinke diesen Begriff über die Überschrift.

Maintainer

official source

Die Gruppe, der der Test gehört: ein Paper-Team, Artificial Analysis, Vals, LMArena oder VerdictPal Lab. Zeilen des offiziellen Maintainers schlagen einen Drittanbieter-Relauf derselben Suite.

Verlinke diesen Begriff über die Überschrift.

Modellschlüssel

alias · model slug

Die stabile ID, die VerdictPal für ein Modell über Quellen hinweg nutzt. Anbieter benennen Anzeigenamen um; Schlüssel und Aliasse verhindern, dass GPT-5.5 als drei Modelle erscheint.

Verlinke diesen Begriff über die Überschrift.

Version / Variante

edition · ARC-AGI 2

Eine gepflegte Ausgabe desselben Benchmarks, etwa ARC-AGI-1 gegen ARC-AGI-2. Scores aus verschiedenen Ausgaben sind nicht austauschbar.

Verlinke diesen Begriff über die Überschrift.

pass@1

pass at 1 · pass@k

Der Anteil der Aufgaben, die das Modell im ersten Versuch löst. pass@k würde k Versuche erlauben. Coding-Benches nutzen das, weil ein sauberer Patch mehr zählt als zehn Glücksversuche.

Verlinke diesen Begriff über die Überschrift.

Elo

arena elo · rating

Ein relatives Rating aus paarweisen Menschenstimmen, genutzt von Chatbot Arena. 1200 gegen 1300 ist ein Präferenzabstand, keine 100-Prozent-Genauigkeit. Elo nie neben einen Prozent-Score legen.

Verlinke diesen Begriff über die Überschrift.

Genauigkeit / Prozent

pct · % · score

Anteil korrekt gelöster Items, meist 0–100. Hohe Genauigkeit auf einem gesättigten Test kann heißen, dass die Suite zu leicht ist — nicht, dass das Modell den Job erledigt hat.

Verlinke diesen Begriff über die Überschrift.

Human Ceiling

expert ceiling · perfect score

Der Score, den eine sorgfältige Person oder ein Expertengremium im selben Test erreicht. Treffen Modelle diese Linie, trennt die Suite die Frontier nicht mehr.

Verlinke diesen Begriff über die Überschrift.

Headroom

gap to ceiling

Die Punkte zwischen dem besten belegten Modell und dem Human Ceiling. Wenig Headroom heißt: der Test ist fast aufgebraucht.

Verlinke diesen Begriff über die Überschrift.

Composite-Index

intelligence index · Vals Index · AA Index

Eine gewichtete Mischung mehrerer Tests eines Maintainers. Praktisch als Blick, undurchsichtig als Behauptung. Öffne immer die darunterliegenden Suites, bevor du den Index zitierst.

Verlinke diesen Begriff über die Überschrift.

Closed-Book

no tools · no search

Das Modell muss allein aus seinen Gewichten antworten: kein Web, kein Rechner, keine Dateien. Ein Closed-Book-Score beschreibt nicht eine Studentin, die nachschlagen darf.

Verlinke diesen Begriff über die Überschrift.

Tool-augmentiert

open-book · with tools · agent harness

Das Modell darf während des Tests Browser, Code-Runner oder andere Tools nutzen. Vergleiche diese Zeilen nur mit anderen tool-augmentierten Zeilen.

Verlinke diesen Begriff über die Überschrift.

Public-/Private-Split

held-out set · hidden test

Manche Prüfungen halten einen versteckten Fragensatz zurück, damit Modelle die öffentliche Liste nicht auswendig lernen. Ein Score nur auf dem öffentlichen Slice ist leichter zu spielen.

Verlinke diesen Begriff über die Überschrift.

Harness

agent harness · eval harness

Die Hülle, die das Modell laufen lässt: Prompts, Tools, Retries, Zeitlimits. Dasselbe Modell kann unter zwei Harnesses glänzen oder holpern. Lies das Harness, bevor du einem Coding- oder Agent-Score vertraust.

Verlinke diesen Begriff über die Überschrift.

Vendor-Claim

Eine Zahl oder Fähigkeitsaussage der Firma, die das Produkt verkauft. Veröffentlicht, gekennzeichnet und als unverifiziert behandelt, bis der Desk oder eine unabhängige Quelle sie prüft.

Verlinke diesen Begriff über die Überschrift.

Artificial Analysis

AA · AA Index

Ein unabhängiger Evaluator, der viele öffentliche Suites neu laufen lässt und einen eigenen Intelligence-Index veröffentlicht. VerdictPal speichert einen datierten Snapshot; beim Laden der Seite rufen wir AA nicht auf.

Verlinke diesen Begriff über die Überschrift.

Vals AI

Vals Index

Ein weiterer unabhängiger Score-Host. Wenn Vals und der offizielle Maintainer dieselbe akademische Suite veröffentlichen, gewinnt auf VerdictPal die offizielle Zeile.

Verlinke diesen Begriff über die Überschrift.

LMArena

Chatbot Arena · LMSYS

Die öffentliche Human-Preference-Arena hinter den Elo-Scores. Menschen stimmen über anonyme Antworten nebeneinander ab. Das misst Geschmack, keine Zitationsqualität.

Verlinke diesen Begriff über die Überschrift.

Token

Das Stück, das ein Modell liest und schreibt — grob ein kurzes Wort oder Wortteil. Preise gelten meist pro Million Tokens. Kontextfenster zählt man in Tokens, nicht in Seiten.

Verlinke diesen Begriff über die Überschrift.

Kontextfenster

context length

Wie viel Text das Modell in einem Prompt halten kann, gemessen in Tokens. Ein riesiges Fenster garantiert nicht, dass es den Satz auf Seite 40 noch nutzt.

Verlinke diesen Begriff über die Überschrift.

Retrieval

RAG · search step

Die richtige Passage finden, bevor geantwortet wird. Long-Context-Tests legen die Passage in den Prompt; Such-Tools müssen sie erst holen. Das sind verschiedene Fähigkeiten.

Verlinke diesen Begriff über die Überschrift.

Wie Tests altern

Gesättigt

used up

Spitzenmodelle kleben an der Decke. Die Suite bleibt als Geschichte und Methode nützlich, aber ein neuer Highscore sagt kaum noch, wer vorn liegt.

Verlinke diesen Begriff über die Überschrift.

Gelöst / defunct

defunct · ~100%

Verifizierte Top-Scores liegen bei oder nahe 100 Prozent. Wir behalten den Explainer, damit du alte Paper entschlüsseln kannst — als aktuelle Evidenz gilt er nicht.

Verlinke diesen Begriff über die Überschrift.

Eingestellt

retired

Der Maintainer hat die Suite beendet, oder die öffentliche Seite ist weg. Bleibt nur, damit alte Zitate noch auflösen.

Verlinke diesen Begriff über die Überschrift.

Kontamination

data leak · train/test leak · memorization

Risiko, dass Testfragen in die Trainingsdaten geleakt sind. Ein hoher Score auf einer kontaminierten Suite kann heißen, dass das Modell die Antworten gesehen hat — nicht, dass es die Fähigkeit gelernt hat.

Verlinke diesen Begriff über die Überschrift.

Primär-Benchmark

start here · discriminator

Der eine lebendige Test, den wir in einer Familie zuerst öffnen. Primär in Mathe ist FrontierMath; ältere MATH- und AIME-Seiten bleiben gelöstes Glossar, keine aktuelle Evidenz.

Verlinke diesen Begriff über die Überschrift.

Aufgabenfamilien

Familie

task family

Der Job, den ein Benchmark zu messen behauptet: Wissen, Reasoning, Mathe, Coding, Agenten und so weiter. Familien verhindern, dass ungleichartige Scores in ein Chart gestapelt werden.

Verlinke diesen Begriff über die Überschrift.

Wissen

MMLU

Closed-Book-Abruf über Schul- und Berufsfächer. Ein hoher Wissens-Score beweist nicht, dass das Modell eine Literaturrecherche führen kann.

Verlinke diesen Begriff über die Überschrift.

Reasoning

HLE · GPQA

Harte, mehrschrittige Fragen, die sich nicht allein durch Nachschlagen lösen lassen sollten. Trotzdem eine Prüfung, kein Maß für unordentliche Forschungsproduktivität.

Verlinke diesen Begriff über die Überschrift.

Mathe

FrontierMath · AIME

Wettbewerbs- oder Forschungsmathematik. Ältere öffentliche Suites sind weitgehend gelöst; FrontierMath ist hier der lebendige Diskriminator.

Verlinke diesen Begriff über die Überschrift.

Coding

SWE-bench · HumanEval

Programme schreiben oder reparieren. Lies das Harness: ein pass@1 auf einem versteckten Unit-Test ist nicht dasselbe wie ein reviewed Pull Request.

Verlinke diesen Begriff über die Überschrift.

Agentisch

agent · Terminal-Bench

Mehrschrittige Arbeit, bei der das Modell Tools, ein Terminal oder einen Workflow nutzen muss — statt eine Prompt-Antwort zu liefern. Das Harness ist die Hälfte des Ergebnisses.

Verlinke diesen Begriff über die Überschrift.

Multimodal

MMMU · vision

Aufgaben, die Text mit Bildern oder anderen Medien mischen. Ein starkes Nur-Text-Modell kann an einer Abbildung, einem Chart oder einer Folie scheitern.

Verlinke diesen Begriff über die Überschrift.

Langer Kontext

AA-LCR · needle in a haystack

Evidenz nutzen, die weit auseinander in einem sehr langen Prompt sitzt. Das ist nicht dasselbe wie die Live-Websuche.

Verlinke diesen Begriff über die Überschrift.

Tool-Nutzung

function calling · BFCL

Ob das Modell die richtige Funktion, API oder Browser-Aktion zur richtigen Zeit aufruft. Getrennt davon, guten Text über das Tool zu schreiben.

Verlinke diesen Begriff über die Überschrift.

Sicherheit

HELM Safety

Ob das Modell schädliche Anfragen ablehnt oder Dinge leakt, die es nicht soll. Ein Safety-Score ist keine Datenschutzerklärung und keine Forschungsnote.

Verlinke diesen Begriff über die Überschrift.

Menschliche Präferenz

arena · vibe check

Blinde Menschenstimmen dazu, welche Antwort sich besser anfühlt. Hilfreich für Ton und Nützlichkeit. Still zu Zitaten, Kontamination und Prüfungsfähigkeit.

Verlinke diesen Begriff über die Überschrift.

Benannte Tests

Jeder öffentliche Test auf VerdictPal, in einem Alphabet. Öffne das Dossier für Scores, Caveats und Quellen.

AA output speed

Performance

Output tokens per second · Median output speed

Medianer Output-Tokens pro Sekunde nach dem ersten Chunk, gemessen am Default-API-Provider jedes Modells mit ~1k Input-Tokens (AA-Medium-Workload).

Abstraction and Reasoning Corpus

Reasoning

ARC Prize · ARC-AGI

Flüssiges, dateneffizientes Schließen über die ARC-Prize-Benchmark-Serie — von statischen Gitter-Rätseln (ARC-AGI-1/2) bis zu interaktiven agentischen Umgebungen (ARC-AGI-3). Gegen Auswendiglernen gebaut, belohnt echte Generalisierung.

Artificial Analysis Intelligence Index

Reasoning

AA Intelligence Index · AA Index v4.1 · AA Index v4.1.1

AA Intelligence Index v4.1 — gewichteter Composite mit Fokus auf agentische Workloads: GDPval-AA v2 (20 %), Terminal-Bench 2.1 (16 %), τ³-Bench Banking (14 %), Humanity's Last Exam (12 %), AA-Omniscience (12 %), SciCode (8 %), GPQA Diamond (6 %), AA-LCR (6 %), CritPt (6 %). IFBench wegen Sättigung entfernt.

CritPt

Reasoning

Critical Physics Tasks · Complex Research using Integrated Thinking - Physics Test

Unveröffentlichte Forschungsphysik: 71 zusammengesetzte Challenges (70 Test + 1 Beispiel) von 50+ aktiven Physiker:innen über 11 Teilgebiete, plus 190 einfachere Checkpoint-Aufgaben. 6 % Gewicht im AA Intelligence Index v4.1.

DeepSWE

Coding

Langhorizont-Software-Engineering auf 113 kontaminationsfreien Aufgaben über 91 Repos und fünf Sprachen — Patches müssen handgeschriebene Verhaltens-Verifier bestehen, keine String-Diffs.

FrontierMath

Mathe

FrontierMath Tiers 1-3 · FrontierMath v2

Harte unveröffentlichte Mathematik: 295 private Tiers-1-3-Aufgaben (v2), bei denen das Modell nach iterativem Reasoning und Code-Ausführung eine Python-answer()-Funktion abgibt.

GDPval

Agentisch

Real-work deliverables vs experts · GDPval-AA v2

GDPval-AA v2 — echte Wissensarbeits-Lieferungen über 44 Berufe, blind paarweise gegen menschliche Experten bewertet (Elo bei 1000 verankert). 20 % Gewicht im AA Intelligence Index v4.1.

GPQA Diamond

Reasoning

Graduate-Level Google-Proof Q&A

Schwere Wissenschaftsfragen auf Graduiertenniveau (Biologie, Physik, Chemie), so geschrieben, dass Laien sie auch mit Websuche nicht lösen — die 'Diamond'-Teilmenge ist der hochwertigste, von Experten geprüfte Anteil.

HELM Safety

Sicherheit

Holistic Evaluation of Language Models · Stanford HELM

Eine multimetrische Sicherheits-Evaluationssuite von Stanford CRFM, die Modellverhalten über sicherheitsbezogene Szenarien ausweist, statt alles in einen einzigen Headline-Wert zu pressen.

HumanEval

Coding

Ob ein Modell aus einem Docstring eine kurze Python-Funktion schreibt, die einige Unit-Tests besteht — der ursprüngliche Code-Generierungs-Benchmark.

Humanity's Last Exam

Reasoning

HLE

Fachübergreifende Fragen auf Expertenniveau — Mathematik, Naturwissenschaften, Geisteswissenschaften, professionelles Recht und Medizin — entworfen als die härteste öffentliche Prüfung, die ein Frontier-Modell ablegen kann.

IFBench

Reasoning

Instruction-Following Benchmark

Präzises Instruction-Following bei neuen Constraints — testet, ob Modelle komplexe, ungesehene Formatregeln ohne Abdriften befolgen.

LiveBench

Reasoning

Ein kontaminationsarmer Benchmark, der Fragen über Zeit erneuert und Reasoning, Coding, Mathe, Datenanalyse, Sprache und Instruction Following abdeckt.

LiveCodeBench

Coding

Kontaminationsresistente Coding-Probleme aus aktuellen Contest-Releases — AA führt Modelle im öffentlichen Harness erneut aus.

LMArena (Chatbot Arena)

Menschliche Präferenz

Chatbot Arena · LMSYS Arena

Menschliche Präferenz im großen Maßstab: Menschen chatten mit zwei anonymen Modellen nebeneinander und stimmen für die bessere Antwort. Stimmen werden zu einem Elo-Ranking.

LongBench v2

Langer Kontext

LongBench 2

Ob Long-Context-Modelle über lange, realistische Inputs schlussfolgern können, statt nur ein großes Tokenfenster anzunehmen.

MATH

Mathe

Schritt-für-Schritt-Lösungen zu 12.500 Wettbewerbs-Mathematikaufgaben (AMC/AIME-Stil), bewertet an der finalen Antwort.

MCP Atlas

Tool-Nutzung

Wie zuverlässig ein Modell über das Model Context Protocol bereitgestellte Werkzeuge auswählt, sequenziert und wiederherstellt — inklusive Schema-Treue, Fehlerbehandlung und Werkzeug-Ketten-Schlussfolgern.

MMLU-Pro

Wissen

Ein schwererer MMLU-Nachfolger: zehn statt vier Optionen, schlussfolgerungslastige Fragen und ein bereinigter Satz, der schwerer zu erraten ist.

MMMU-Pro

Multimodal

MMMU Pro · Massive Multi-discipline Multimodal Understanding Pro

Härtere multimodale Hochschulprüfung: originale MMMU-Items ohne Text-only-Shortcuts, zehn statt vier Optionen, und ein Vision-only-Setting, in dem die Frage im Bild steckt. 3.460 Fragen über 30 Fächer.

Omniscience Accuracy

Wissen

AA-Omniscience Index · AA-Omniscience

Faktenabruf und Wissenskalibrierung über 6.000 Fragen in 42 wirtschaftlich relevanten Themen und sechs Domänen. Accuracy ist 8 % des AA Intelligence Index v4.1; der Non-Hallucination-Anteil weitere 4 %.

SciCode

Coding

Wissenschaftliche Programmieraufgaben mit Domänen-Bibliotheken und mehrstufigem numerischem Code — AA-Snapshot-Läufe.

SWE-bench Verified

Coding

Ob ein Modell echte GitHub-Issues aus populären Python-Repos lösen kann — es muss einen Patch erzeugen, der die versteckte Testsuite besteht. 'Verified' ist eine 500-Issue-Teilmenge, von Menschen validiert.

Terminal-Bench

Agentisch

Terminal-Bench 2.1 · [email protected]

Ob ein Agent realistische, containerisierte Terminal-Aufgaben (Terminal-Bench 2.1) erledigen kann: Code debuggen, Dateien bearbeiten, Befehle ausführen und das Artefakt liefern, das der versteckte Checker erwartet. 16 % Gewicht im AA Intelligence Index v4.1.

Terminal-Bench-Science

Agentisch

TB-Science · Terminal-Bench-Science 0.1

Ob ein Agent echte wissenschaftliche Research-Workflows im Terminal zu Ende bringt: 70 von Expert:innen kuratierte Aufgaben über Life, Physical, Earth, Mathematical und Engineering Sciences, bewertet an konkreten Artefakten (Analysen, Simulationen, Beweise, Code, Datenprodukte).

Vals Index

Agentisch

Vals AI Index

Ein Vals-Kompositwert über branchennähere Aufgaben wie Finance und Coding, gedacht als Näherung für praktische Modellnützlichkeit bei wirtschaftlich relevanter Arbeit.

Vending-Bench 2

Agentisch

Langhorizont-Business-Kohärenz: Ein Modell führt 365 Tage ein simuliertes Automaten-Unternehmen — Inventar, Lieferanten-Mail, Preise, Refunds — bewertet nach Endkontostand (USD).

τ³-Bench Banking

Agentisch

tau3-bench-banking · τ³-Banking

Dual-Control-Agent-User-Simulation für Banking-Aufgaben: 97 Szenarien mit Wissens-Retrieval, Backend-Datenbank-Zustandsbewertung, pass@1. 14 % Gewicht im AA Intelligence Index v4.1.

The Pack · Redaktionsnewsletter

Neue Tools in dein Postfach. Kostenlos.

Eine kurze E-Mail, wenn ein Tool erscheint oder den Status wechselt. Kein Tracking, keine Drittanbieter-Analytics. Abmeldung mit einem Klick.