Warum dieser Benchmark nützlich ist
Er übersetzt Programmierfähigkeit in überprüfbare Patches oder Erfolgsquoten. Damit lassen sich Agenten-Testumgebungen vergleichen, nicht nur Basismodelle.
Wenn ein Coding-Agent (Cursor Agent, Factory Droid) ein kleines Repo-Fixture patcht: Bleibt der Diff im Scope, bestehen Tests, werden Projektregeln eingehalten und ist der Patch vor dem Merge reviewbar? Wir bewerten sieben eingefrorene Aufgaben mit einer Diff-Review-Rubrik — der Fehler, bei dem Agenten Extra-Dateien anfassen oder grüne Tests mit unsicheren Patches liefern.
Er übersetzt Programmierfähigkeit in überprüfbare Patches oder Erfolgsquoten. Damit lassen sich Agenten-Testumgebungen vergleichen, nicht nur Basismodelle.
Lies Agent Diff Review (VerdictPal Lab) als aktiv Signal mit kontamination niedrig. Vergleiche Modelle nur, wenn Quelle, Testumgebung, Prompting, Sampling und Score-Einheit übereinstimmen.
Noch keine Ergebnisse veröffentlicht.
Das Protokoll ist vor dem Lauf öffentlich.
Protokoll v0.1 ist eingefroren; Ergebnisse stehen aus dem ersten VerdictPal-Lab-Desk-Lauf — die Atlas-Karte ist das Protokoll, kein aufgefülltes Leaderboard.
Noch ist keine Obergrenze erfasst. Wenn sich Scores oben bündeln, kann der Benchmark Frontier-Modelle möglicherweise nicht mehr trennen.
Eingefrorenes Protokoll v0.1 (2026-07-06). Sieben Aufgaben (T01–T07) auf Fixture-Repo v0.1. Vor dem Lauf: Privacy Mode AN (Cursor) oder dokumentierte No-Training-Datennutzung (Factory) verifizieren; Screenshot der Einstellungen. Pro Aufgabe: Agent erzeugt einen Diff; zwei Reviewer bewerten unabhängig test-pass, scope, safety, rules, reviewability; Unstimmigkeiten werden dokumentiert gelöst. Nach dem Lauf: angefasste Dateien, `npm test` / `npm run lint` und Quota-Verbrauch protokollieren. Vollständiges Runbook: docs/lab/agent-diff-review-v0.1.md.
Jede Antwort unten stammt aus den datierten Feldern dieser Seite. Nichts davon ist zusätzlich für Suchmaschinen geschrieben.
Wenn ein Coding-Agent (Cursor Agent, Factory Droid) ein kleines Repo-Fixture patcht: Bleibt der Diff im Scope, bestehen Tests, werden Projektregeln eingehalten und ist der Patch vor dem Merge reviewbar? Wir bewerten sieben eingefrorene Aufgaben mit einer Diff-Review-Rubrik — der Fehler, bei dem Agenten Extra-Dateien anfassen oder grüne Tests mit unsicheren Patches liefern.
Ein starkes Agent Diff Review (VerdictPal Lab)-Ergebnis sagt nichts aus über:
Safe-Pass-Rate = Aufgaben, die alle fünf Rubrik-Dimensionen bestehen / 7, plus Fehlerzähler pro Dimension (test-pass, scope, safety, rules, reviewability). Eine Aufgabe fällt durch, wenn eine Dimension durchfällt. Aufgabenformat: Ein eingefrorenes TypeScript-Snapshot-Repo (Fixture v0.1) mit sieben kleinen Aufgaben (T01–T07): zwei Bugfixes, ein Refactoring, ein Test-Add, ein Lint-Autofix, ein Rules-Compliance-Pass, eine Integrations-Verdrahtung. Jedes Tool erhält denselben Prompt auf einem sauberen Checkout; Agenten nur mit Standard-Einstellungen. Privacy Mode (Cursor) oder gleichwertige No-Training-Datennutzung (Factory) muss vor der ersten Aufgabe verifiziert und per Screenshot dokumentiert werden.
Agent Diff Review (VerdictPal Lab) ist im Atlas derzeit als Aktiv markiert.
Das Kontaminationsrisiko für Agent Diff Review (VerdictPal Lab) ist als Kontamination niedrig eingestuft. Behandle jede Zeile auf dieser Seite als öffentliche Angabe mit Quelle und Datum, nicht als kontrolliertes Experiment.
The Pack · Redaktionsnewsletter
Eine kurze E-Mail, wenn ein Tool erscheint oder den Status wechselt. Kein Tracking, keine Drittanbieter-Analytics. Abmeldung mit einem Klick.