VerdictPal · Redaktions-Desk · 2026VerdictPal
The Lab

Benchmarks, die wir selbst laufen.

Anbieter-Scores sind marketingnah. Im Lab testet der Desk selbst — auf den Fehlermodi, die Studierende und Forschende wirklich verbrennen — und veröffentlicht Methode, Prompts und Rohbeispiele zum Nachvollziehen.

Ehrlich als Standard

Ein Lab-Benchmark liefert erst einen Score nach menschlicher Bewertung und Sign-off. Bis dahin siehst du Protokoll und Lauf-Fortschritt — kein aufgefülltes Leaderboard.

Citation Fidelity v0.1: 156/156 Captures vollständig. Menschliche Bewertung und Sign-off stehen vor Scores noch aus — Desk-Runbook

Agent Diff Review (VerdictPal Lab)

EntwurfProtokoll v0.17 Fragen
Volles Protokoll →

Wenn ein Coding-Agent (Cursor Agent, Factory Droid) ein kleines Repo-Fixture patcht: Bleibt der Diff im Scope, bestehen Tests, werden Projektregeln eingehalten und ist der Patch vor dem Merge reviewbar? Wir bewerten sieben eingefrorene Aufgaben mit einer Diff-Review-Rubrik — der Fehler, bei dem Agenten Extra-Dateien anfassen oder grüne Tests mit unsicheren Patches liefern.

Ergebnisse ausstehend

Protokoll ist eingefroren und veröffentlicht. Score-Zeilen erscheinen erst nach einem vollständigen Desk-Lauf — bis dahin kein aufgefülltes Leaderboard.

Was er dir nicht sagt

  • Langhorizont-SWE-bench-Issue-Resolution — Aufgaben sind bewusst klein (Single-Session-Fixes auf einem Snapshot-Repo), keine stundenlange Repo-Archäologie.
  • Modellintelligenz isoliert — Harness, Default-Routing, Auto-Run-Einstellungen und Quota-Drosselung können Werte genauso verschieben wie das Modell selbst.
  • Tab-Completion oder Chat-Qualität — nur agent-erzeugte Diffs auf der eingefrorenen Aufgabenbank zählen; Vibe-Prosa wird ignoriert.
  • Es ist ein kleiner, handbewerteter Satz — frühe Zahlen sind richtungsweisend, nicht endgültig.
Methode
Eingefrorenes Protokoll v0.1 (2026-07-06). Sieben Aufgaben (T01–T07) auf Fixture-Repo v0.1. Vor dem Lauf: Privacy Mode AN (Cursor) oder dokumentierte No-Training-Datennutzung (Factory) verifizieren; Screenshot der Einstellungen. Pro Aufgabe: Agent erzeugt einen Diff; zwei Reviewer bewerten unabhängig test-pass, scope, safety, rules, reviewability; Unstimmigkeiten werden dokumentiert gelöst. Nach dem Lauf: angefasste Dateien, `npm test` / `npm run lint` und Quota-Verbrauch protokollieren. Vollständiges Runbook: docs/lab/agent-diff-review-v0.1.md.

Agent-Diff-Review-v0.1-Runbook · Desk-Runbook (Repo) · Methodik: /methodology

AI Builder Design Test (VerdictPal Lab)

EntwurfProtokoll v0.1
Volles Protokoll →

Vier KI-Website-Builder erhalten dieselben Multi-Turn-Design-Prompts — und wir sehen, wie weit die Ergebnisse auseinanderliegen und was es kostet. Wir spielen identische Prompts durch Lovable, v0, Replit und Bolt und bewerten Streuung, Designqualität und Verbrauch.

Ergebnisse ausstehend

Protokoll ist eingefroren und veröffentlicht. Score-Zeilen erscheinen erst nach einem vollständigen Desk-Lauf — bis dahin kein aufgefülltes Leaderboard.

Was er dir nicht sagt

  • Modellqualität isoliert — jeder Builder bündelt Modell, Gerüst und Tooling. Das Ergebnis ist das Produkt, nicht das Modell.
  • Allgemeine Coding-Fähigkeit — das ist eine visuelle Design-Aufgabe, kein Korrektheits- oder Refactor-Benchmark.
  • Reproduzierbarkeit über Konten und Tiers — jeder Lauf nutzte den eigenen Plan und Defaults; Anbieter leiten auf anderen Tiers eventuell andere Modelle oder Gerüste.
  • Statistische Signifikanz — eine Testperson, ein Durchlauf pro Builder. Die Rangfolge ist richtungsweisend, nicht endgültig.
Methode
Eingefrorene Vier-Turn-Prompts (T1–T4), identisch über alle Builder, Default-Einstellungen, keine manuellen Edits. Lauf-01-Ergebnisse — Turn-1-Rangfolge: Lovable (beste) → v0 → Replit → Bolt. Verbrauch nach vier Turns: Replit ca. 13 $, Bolt ca. 3 Mio. Tokens, Lovable ca. 14,2 Credits, v0 ca. 14 $. Die vier Outputs drifteten auf Turn 2–4 trotz identischer Prompts stark auseinander; Screenshots liegen im Runbook und, sobald beigebracht, auf der Atlas-Karte. Formale Score-Zeilen warten auf ein wiederholbares Rubric und einen zweiten Reviewer. Vollständiges Runbook: docs/lab/ai-builder-design-test-v0.1.md.

AI-Builder-Design-Test-v0.1-Runbook · Desk-Runbook (Repo) · Methodik: /methodology

Citation Fidelity (VerdictPal Lab)

EntwurfProtokoll v0.112 Fragen
Volles Protokoll →

Wenn eine Antwortmaschine eine Quelle zitiert: Sagt die Quelle wirklich, was behauptet wird? Wir bewerten echte Forschungsfragen daraufhin, ob jede zitierte Aussage durch die verlinkte Seite gedeckt ist — der Fehler, der Studierende am meisten kostet.

Captures vollständig — Bewertung ausstehend

Alle Capture-Slots sind gefüllt. Score-Zeilen erscheinen erst nach unabhängiger menschlicher Bewertung und Desk-Lead-Sign-off. Bis dahin kein aufgefülltes Leaderboard.

Was er dir nicht sagt

  • Antwortqualität oder Flüssigkeit — eine schön geschriebene Antwort mit erfundener Quelle fällt hier bewusst durch.
  • Vollständigkeit — wir prüfen, ob das Zitierte stimmt, nicht ob jede relevante Quelle gefunden wurde.
  • Es ist ein kleiner, handbewerteter Satz — frühe Zahlen sind richtungsweisend, nicht endgültig.
Methode
Eingefrorenes Protokoll v0.1 (2026-07-06). Zwölf Fragen (Q01–Q12): drei Policy Brief, drei Produktvergleich, drei akademisch angrenzend, drei lokal/aktuell. Jede Engine erhält denselben Prompt und Standard-Einstellungen; zwei Reviewer bewerten jede zitierte Aussage unabhängig (gestützt / ungestützt / defekter Link); Unstimmigkeiten werden dokumentiert gelöst. Vollständiges Runbook: docs/lab/citation-fidelity-v0.1.md.

Citation-Fidelity-v0.1-Runbook · Desk-Runbook (Repo) · Methodik: /methodology

← Alle Benchmarks