Benchmarks / Wissen

Citation Fidelity (VerdictPal Lab)

Wenn eine Antwortmaschine eine Quelle zitiert: Sagt die Quelle wirklich, was behauptet wird? Wir bewerten echte Forschungsfragen daraufhin, ob jede zitierte Aussage durch die verlinkte Seite gedeckt ist — der Fehler, der Studierende am meisten kostet.

WissenEntwurfAktivNiedriges KontaminationsrisikoVerdictPal LabSeit 2026
Was dieser Benchmark nicht misst
  • Antwortqualität oder Flüssigkeit — eine schön geschriebene Antwort mit erfundener Quelle fällt hier bewusst durch.
  • Vollständigkeit — wir prüfen, ob das Zitierte stimmt, nicht ob jede relevante Quelle gefunden wurde.
  • Es ist ein kleiner, handbewerteter Satz — frühe Zahlen sind richtungsweisend, nicht endgültig.
Analyse

Warum dieser Benchmark nützlich ist

Er liefert ein kompaktes Signal für eine bestimmte Fähigkeit. Nutze ihn als datierten Beleg neben Preisen, Datenschutz und eigener Nutzung.

Umfang

Abdeckung

Aufgabenfamilie
Wissen
Format
Eine feste Bank von 12 echten Studierenden-/Forschungsfragen (Policy Brief, Produktvergleich, akademisch angrenzend, lokal/aktuell), durch jede Antwortmaschine geführt; jede zitierte Aussage wird von zwei Reviewern gegen die verlinkte Quelle geprüft.
Bewertung
Quellengestützte Rate = gestützte zitierte Aussagen / alle zitierten Aussagen, plus Zähler für ungestützte und defekte Links.
Verantwortliche Stelle
VerdictPal desk
Lesehilfe

So liest du die Scores

Lies Citation Fidelity (VerdictPal Lab) als aktiv Signal mit niedriges kontaminationsrisiko. Vergleiche Modelle nur, wenn Quelle, Testumgebung, Prompting, Sampling und Score-Einheit übereinstimmen.

Blinde Flecken

Was er nicht abdeckt

  • Antwortqualität oder Flüssigkeit — eine schön geschriebene Antwort mit erfundener Quelle fällt hier bewusst durch.
  • Vollständigkeit — wir prüfen, ob das Zitierte stimmt, nicht ob jede relevante Quelle gefunden wurde.
  • Es ist ein kleiner, handbewerteter Satz — frühe Zahlen sind richtungsweisend, nicht endgültig.
Scores

Evidenz-Ledger

0 Zeilen

Noch keine Ergebnisse veröffentlicht.

Das Protokoll ist vor dem Lauf öffentlich.

Methode

Was er abdeckt

Protokoll v0.1 eingefroren. Desk-Lauf Juli 2026: 156/156 Capture-Slots über 12 Fragen und 13 Engines befüllt — menschliche Bewertung und Sign-off stehen aus, bevor ein Score im Atlas erscheint.

Score-Obergrenze

Wo er an Grenzen stößt

Noch ist keine Obergrenze erfasst. Wenn sich Scores oben bündeln, kann der Benchmark Frontier-Modelle möglicherweise nicht mehr trennen.

So führen wir ihn aus

Eingefrorenes Protokoll v0.1 (2026-07-06). Zwölf Fragen (Q01–Q12): drei Policy Brief, drei Produktvergleich, drei akademisch angrenzend, drei lokal/aktuell. Jede Engine erhält denselben Prompt und Standard-Einstellungen; zwei Reviewer bewerten jede zitierte Aussage unabhängig (gestützt / ungestützt / defekter Link); Unstimmigkeiten werden dokumentiert gelöst. Vollständiges Runbook: docs/lab/citation-fidelity-v0.1.md.

Reproduzierbarkeit
Fragenbank v0.1 (Q01–Q12), Laufdatum, Engine-Version, Prompt und Einstellungen werden festgehalten, damit Dritte den Lauf wiederholen können. Consumer-Panel (13 Engines): Perplexity, Scira, Kagi, NotebookLM, Gemini, ChatGPT, Claude, Microsoft Copilot, DeepSeek, Le Chat, Consensus, Elicit, Manus. API-only-Tools separat dokumentiert.
Belege

Quellen und weiterführende Lektüre

Studierenden-Workflow

Citation Fidelity ist das Lab-Protokoll, das prüft, ob zitierte Aussagen zu den Quellen passen. Kombiniere es mit dem Quellenbriefing, bevor du abgibst.

The Pack · Redaktionsnewsletter

Neue Karten in dein Postfach. Kostenlos.

Eine kurze E-Mail, wenn eine Karte erscheint oder den Status wechselt. Kein Tracking, keine Drittanbieter-Analytics. Abmeldung mit einem Klick.