Warum dieser Benchmark nützlich ist
Er übersetzt Programmierfähigkeit in überprüfbare Patches oder Erfolgsquoten. Damit lassen sich Agenten-Testumgebungen vergleichen, nicht nur Basismodelle.
Benchmarks / Coding
Wenn ein Coding-Agent (Cursor Agent, Factory Droid) ein kleines Repo-Fixture patcht: Bleibt der Diff im Scope, bestehen Tests, werden Projektregeln eingehalten und ist der Patch vor dem Merge reviewbar? Wir bewerten sieben eingefrorene Aufgaben mit einer Diff-Review-Rubrik — der Fehler, bei dem Agenten Extra-Dateien anfassen oder grüne Tests mit unsicheren Patches liefern.
Er übersetzt Programmierfähigkeit in überprüfbare Patches oder Erfolgsquoten. Damit lassen sich Agenten-Testumgebungen vergleichen, nicht nur Basismodelle.
Lies Agent Diff Review (VerdictPal Lab) als aktiv Signal mit niedriges kontaminationsrisiko. Vergleiche Modelle nur, wenn Quelle, Testumgebung, Prompting, Sampling und Score-Einheit übereinstimmen.
Noch keine Ergebnisse veröffentlicht.
Das Protokoll ist vor dem Lauf öffentlich.
Protokoll v0.1 ist eingefroren; Ergebnisse stehen aus dem ersten VerdictPal-Lab-Desk-Lauf — die Atlas-Karte ist das Protokoll, kein aufgefülltes Leaderboard.
Noch ist keine Obergrenze erfasst. Wenn sich Scores oben bündeln, kann der Benchmark Frontier-Modelle möglicherweise nicht mehr trennen.
Eingefrorenes Protokoll v0.1 (2026-07-06). Sieben Aufgaben (T01–T07) auf Fixture-Repo v0.1. Vor dem Lauf: Privacy Mode AN (Cursor) oder dokumentierte No-Training-Datennutzung (Factory) verifizieren; Screenshot der Einstellungen. Pro Aufgabe: Agent erzeugt einen Diff; zwei Reviewer bewerten unabhängig test-pass, scope, safety, rules, reviewability; Unstimmigkeiten werden dokumentiert gelöst. Nach dem Lauf: angefasste Dateien, `npm test` / `npm run lint` und Quota-Verbrauch protokollieren. Vollständiges Runbook: docs/lab/agent-diff-review-v0.1.md.
The Pack · Redaktionsnewsletter
Eine kurze E-Mail, wenn eine Karte erscheint oder den Status wechselt. Kein Tracking, keine Drittanbieter-Analytics. Abmeldung mit einem Klick.