Warum dieser Benchmark nützlich ist
Er liefert ein kompaktes Signal für eine bestimmte Fähigkeit. Nutze ihn als datierten Beleg neben Preisen, Datenschutz und eigener Nutzung.
Benchmarks / Wissen
Wenn eine Antwortmaschine eine Quelle zitiert: Sagt die Quelle wirklich, was behauptet wird? Wir bewerten echte Forschungsfragen daraufhin, ob jede zitierte Aussage durch die verlinkte Seite gedeckt ist — der Fehler, der Studierende am meisten kostet.
Er liefert ein kompaktes Signal für eine bestimmte Fähigkeit. Nutze ihn als datierten Beleg neben Preisen, Datenschutz und eigener Nutzung.
Lies Citation Fidelity (VerdictPal Lab) als aktiv Signal mit niedriges kontaminationsrisiko. Vergleiche Modelle nur, wenn Quelle, Testumgebung, Prompting, Sampling und Score-Einheit übereinstimmen.
Noch keine Ergebnisse veröffentlicht.
Das Protokoll ist vor dem Lauf öffentlich.
Protokoll v0.1 eingefroren. Desk-Lauf Juli 2026: 156/156 Capture-Slots über 12 Fragen und 13 Engines befüllt — menschliche Bewertung und Sign-off stehen aus, bevor ein Score im Atlas erscheint.
Noch ist keine Obergrenze erfasst. Wenn sich Scores oben bündeln, kann der Benchmark Frontier-Modelle möglicherweise nicht mehr trennen.
Eingefrorenes Protokoll v0.1 (2026-07-06). Zwölf Fragen (Q01–Q12): drei Policy Brief, drei Produktvergleich, drei akademisch angrenzend, drei lokal/aktuell. Jede Engine erhält denselben Prompt und Standard-Einstellungen; zwei Reviewer bewerten jede zitierte Aussage unabhängig (gestützt / ungestützt / defekter Link); Unstimmigkeiten werden dokumentiert gelöst. Vollständiges Runbook: docs/lab/citation-fidelity-v0.1.md.
Citation Fidelity ist das Lab-Protokoll, das prüft, ob zitierte Aussagen zu den Quellen passen. Kombiniere es mit dem Quellenbriefing, bevor du abgibst.
The Pack · Redaktionsnewsletter
Eine kurze E-Mail, wenn eine Karte erscheint oder den Status wechselt. Kein Tracking, keine Drittanbieter-Analytics. Abmeldung mit einem Klick.