Warum dieser Benchmark nützlich ist
Er liefert ein kompaktes Signal für eine bestimmte Fähigkeit. Nutze ihn als datierten Beleg neben Preisen, Datenschutz und eigener Nutzung.
Wenn eine Antwortmaschine eine Quelle zitiert: Sagt die Quelle wirklich, was behauptet wird? Wir bewerten echte Forschungsfragen daraufhin, ob jede zitierte Aussage durch die verlinkte Seite gedeckt ist — der Fehler, der Studierende am meisten kostet.
Er liefert ein kompaktes Signal für eine bestimmte Fähigkeit. Nutze ihn als datierten Beleg neben Preisen, Datenschutz und eigener Nutzung.
Lies Citation Fidelity (VerdictPal Lab) als aktiv Signal mit kontamination niedrig. Vergleiche Modelle nur, wenn Quelle, Testumgebung, Prompting, Sampling und Score-Einheit übereinstimmen.
Noch keine Ergebnisse veröffentlicht.
Das Protokoll ist vor dem Lauf öffentlich.
Protokoll v0.1 eingefroren. Desk-Lauf Juli 2026: 156/156 Capture-Slots über 12 Fragen und 13 Engines befüllt — menschliche Bewertung und Sign-off stehen aus, bevor ein Score im Atlas erscheint.
Noch ist keine Obergrenze erfasst. Wenn sich Scores oben bündeln, kann der Benchmark Frontier-Modelle möglicherweise nicht mehr trennen.
Eingefrorenes Protokoll v0.1 (2026-07-06). Zwölf Fragen (Q01–Q12): drei Policy Brief, drei Produktvergleich, drei akademisch angrenzend, drei lokal/aktuell. Jede Engine erhält denselben Prompt und Standard-Einstellungen; zwei Reviewer bewerten jede zitierte Aussage unabhängig (gestützt / ungestützt / defekter Link); Unstimmigkeiten werden dokumentiert gelöst. Vollständiges Runbook: docs/lab/citation-fidelity-v0.1.md.
Jede Antwort unten stammt aus den datierten Feldern dieser Seite. Nichts davon ist zusätzlich für Suchmaschinen geschrieben.
Wenn eine Antwortmaschine eine Quelle zitiert: Sagt die Quelle wirklich, was behauptet wird? Wir bewerten echte Forschungsfragen daraufhin, ob jede zitierte Aussage durch die verlinkte Seite gedeckt ist — der Fehler, der Studierende am meisten kostet.
Ein starkes Citation Fidelity (VerdictPal Lab)-Ergebnis sagt nichts aus über:
Quellengestützte Rate = gestützte zitierte Aussagen / alle zitierten Aussagen, plus Zähler für ungestützte und defekte Links. Aufgabenformat: Eine feste Bank von 12 echten Studierenden-/Forschungsfragen (Policy Brief, Produktvergleich, akademisch angrenzend, lokal/aktuell), durch jede Antwortmaschine geführt; jede zitierte Aussage wird von zwei Reviewern gegen die verlinkte Quelle geprüft.
Citation Fidelity (VerdictPal Lab) ist im Atlas derzeit als Aktiv markiert.
Das Kontaminationsrisiko für Citation Fidelity (VerdictPal Lab) ist als Kontamination niedrig eingestuft. Behandle jede Zeile auf dieser Seite als öffentliche Angabe mit Quelle und Datum, nicht als kontrolliertes Experiment.
Citation Fidelity ist das Lab-Protokoll, das prüft, ob zitierte Aussagen zu den Quellen passen. Kombiniere es mit dem Quellenbriefing, bevor du abgibst.
The Pack · Redaktionsnewsletter
Eine kurze E-Mail, wenn ein Tool erscheint oder den Status wechselt. Kein Tracking, keine Drittanbieter-Analytics. Abmeldung mit einem Klick.