Benchmarks / Coding

Agent Diff Review (VerdictPal Lab)

Wenn ein Coding-Agent (Cursor Agent, Factory Droid) ein kleines Repo-Fixture patcht: Bleibt der Diff im Scope, bestehen Tests, werden Projektregeln eingehalten und ist der Patch vor dem Merge reviewbar? Wir bewerten sieben eingefrorene Aufgaben mit einer Diff-Review-Rubrik — der Fehler, bei dem Agenten Extra-Dateien anfassen oder grüne Tests mit unsicheren Patches liefern.

CodingEntwurfAktivNiedriges KontaminationsrisikoVerdictPal LabSeit 2026
Was dieser Benchmark nicht misst
  • Langhorizont-SWE-bench-Issue-Resolution — Aufgaben sind bewusst klein (Single-Session-Fixes auf einem Snapshot-Repo), keine stundenlange Repo-Archäologie.
  • Modellintelligenz isoliert — Harness, Default-Routing, Auto-Run-Einstellungen und Quota-Drosselung können Werte genauso verschieben wie das Modell selbst.
  • Tab-Completion oder Chat-Qualität — nur agent-erzeugte Diffs auf der eingefrorenen Aufgabenbank zählen; Vibe-Prosa wird ignoriert.
Analyse

Warum dieser Benchmark nützlich ist

Er übersetzt Programmierfähigkeit in überprüfbare Patches oder Erfolgsquoten. Damit lassen sich Agenten-Testumgebungen vergleichen, nicht nur Basismodelle.

Umfang

Abdeckung

Aufgabenfamilie
Coding
Format
Ein eingefrorenes TypeScript-Snapshot-Repo (Fixture v0.1) mit sieben kleinen Aufgaben (T01–T07): zwei Bugfixes, ein Refactoring, ein Test-Add, ein Lint-Autofix, ein Rules-Compliance-Pass, eine Integrations-Verdrahtung. Jedes Tool erhält denselben Prompt auf einem sauberen Checkout; Agenten nur mit Standard-Einstellungen. Privacy Mode (Cursor) oder gleichwertige No-Training-Datennutzung (Factory) muss vor der ersten Aufgabe verifiziert und per Screenshot dokumentiert werden.
Bewertung
Safe-Pass-Rate = Aufgaben, die alle fünf Rubrik-Dimensionen bestehen / 7, plus Fehlerzähler pro Dimension (test-pass, scope, safety, rules, reviewability). Eine Aufgabe fällt durch, wenn eine Dimension durchfällt.
Verantwortliche Stelle
VerdictPal desk
Lesehilfe

So liest du die Scores

Lies Agent Diff Review (VerdictPal Lab) als aktiv Signal mit niedriges kontaminationsrisiko. Vergleiche Modelle nur, wenn Quelle, Testumgebung, Prompting, Sampling und Score-Einheit übereinstimmen.

Blinde Flecken

Was er nicht abdeckt

  • Langhorizont-SWE-bench-Issue-Resolution — Aufgaben sind bewusst klein (Single-Session-Fixes auf einem Snapshot-Repo), keine stundenlange Repo-Archäologie.
  • Modellintelligenz isoliert — Harness, Default-Routing, Auto-Run-Einstellungen und Quota-Drosselung können Werte genauso verschieben wie das Modell selbst.
  • Tab-Completion oder Chat-Qualität — nur agent-erzeugte Diffs auf der eingefrorenen Aufgabenbank zählen; Vibe-Prosa wird ignoriert.
  • Es ist ein kleiner, handbewerteter Satz — frühe Zahlen sind richtungsweisend, nicht endgültig.
Scores

Evidenz-Ledger

0 Zeilen

Noch keine Ergebnisse veröffentlicht.

Das Protokoll ist vor dem Lauf öffentlich.

Methode

Was er abdeckt

Protokoll v0.1 ist eingefroren; Ergebnisse stehen aus dem ersten VerdictPal-Lab-Desk-Lauf — die Atlas-Karte ist das Protokoll, kein aufgefülltes Leaderboard.

Score-Obergrenze

Wo er an Grenzen stößt

Noch ist keine Obergrenze erfasst. Wenn sich Scores oben bündeln, kann der Benchmark Frontier-Modelle möglicherweise nicht mehr trennen.

So führen wir ihn aus

Eingefrorenes Protokoll v0.1 (2026-07-06). Sieben Aufgaben (T01–T07) auf Fixture-Repo v0.1. Vor dem Lauf: Privacy Mode AN (Cursor) oder dokumentierte No-Training-Datennutzung (Factory) verifizieren; Screenshot der Einstellungen. Pro Aufgabe: Agent erzeugt einen Diff; zwei Reviewer bewerten unabhängig test-pass, scope, safety, rules, reviewability; Unstimmigkeiten werden dokumentiert gelöst. Nach dem Lauf: angefasste Dateien, `npm test` / `npm run lint` und Quota-Verbrauch protokollieren. Vollständiges Runbook: docs/lab/agent-diff-review-v0.1.md.

Reproduzierbarkeit
Fixture-Repo v0.1 (Commit-Hash festgehalten), Aufgabenprompts (T01–T07), Laufdatum, Tool-Version, Modell-Routing, Privacy-Mode-Screenshot und Einstellungen werden protokolliert, damit Dritte den Lauf wiederholen können. Tools: Cursor (Agent, Privacy Mode an), Factory (Droid CLI oder Desktop, Auto-Run standardmäßig aus sofern nicht anders vermerkt).

Tools, die ihn ausweisen

Belege

Quellen und weiterführende Lektüre

The Pack · Redaktionsnewsletter

Neue Karten in dein Postfach. Kostenlos.

Eine kurze E-Mail, wenn eine Karte erscheint oder den Status wechselt. Kein Tracking, keine Drittanbieter-Analytics. Abmeldung mit einem Klick.