Benchmarks / Agentisch

AI Builder Design Test (VerdictPal Lab)

Vibecoder Design Test

Vier KI-Website-Builder erhalten dieselben Multi-Turn-Design-Prompts — und wir sehen, wie weit die Ergebnisse auseinanderliegen und was es kostet. Wir spielen identische Prompts durch Lovable, v0, Replit und Bolt und bewerten Streuung, Designqualität und Verbrauch.

AgentischEntwurfAktivNiedriges KontaminationsrisikoVerdictPal LabSeit 2026
Was dieser Benchmark nicht misst
  • Modellqualität isoliert — jeder Builder bündelt Modell, Gerüst und Tooling. Das Ergebnis ist das Produkt, nicht das Modell.
  • Allgemeine Coding-Fähigkeit — das ist eine visuelle Design-Aufgabe, kein Korrektheits- oder Refactor-Benchmark.
  • Reproduzierbarkeit über Konten und Tiers — jeder Lauf nutzte den eigenen Plan und Defaults; Anbieter leiten auf anderen Tiers eventuell andere Modelle oder Gerüste.
Analyse

Warum dieser Benchmark nützlich ist

Ein Wert auf einem Coding-Benchmark zeigt, was ein Modell im Harness kann. Er zeigt nicht, was entsteht, wenn ein Mensch ein vagues Design-Briefing in ein Produkt tippt. Dieser Test hält den Prompt konstant und lässt das Produkt variieren — die Variable, vor der Leser bei der Wahl eines Builders wirklich stehen.

Umfang

Abdeckung

Aufgabenfamilie
Agentisch
Format
Vier identische Prompts, nacheinander an jeden Builder mit Default-Einstellungen und ohne manuelle Code-Edits. Jeder Turn steigert sich: Design-Meisterwerk im Stil einer Referenz-Pflanzen-Website → Geheimnis, Paper-Gradienten, Motion → Verfeinerung zu Wettbewerbsqualität bei fehlerfreier Funktion und lesbarer Typo → vollanimierte Markenerfahrung ohne Ballast. Einzige Variable: welcher Builder den Prompt erhält. Vollständiger Prompt-Text im Runbook.
Bewertung
Redaktionell. Nach jedem Turn stuft die Testperson die vier Outputs nach visuellem Design 1–4 ein und notiert den vom Builder gemeldeten Verbrauch (Credits, Tokens oder USD, je nach Plan). Aus einem einzelnen Lauf wird kein normierter 0–100-Wert veröffentlicht; der Datensatz trägt die richtungsweisende Rangfolge und den Rohverbrauch.
Verantwortliche Stelle
VerdictPal desk
Lesehilfe

So liest du die Scores

Lies die Turn-1-Rangfolge als Design-Erstdruck und den Endverbrauch als Signal für die Kosten bis zum Ergebnis — nicht als Qualitätsgrad. Die vier Outputs drifteten auf späteren Turns trotz identischer Prompts stark auseinander; diese Streuung ist der Befund, nicht die Reihenfolge.

Blinde Flecken

Was er nicht abdeckt

  • Modellqualität isoliert — jeder Builder bündelt Modell, Gerüst und Tooling. Das Ergebnis ist das Produkt, nicht das Modell.
  • Allgemeine Coding-Fähigkeit — das ist eine visuelle Design-Aufgabe, kein Korrektheits- oder Refactor-Benchmark.
  • Reproduzierbarkeit über Konten und Tiers — jeder Lauf nutzte den eigenen Plan und Defaults; Anbieter leiten auf anderen Tiers eventuell andere Modelle oder Gerüste.
  • Statistische Signifikanz — eine Testperson, ein Durchlauf pro Builder. Die Rangfolge ist richtungsweisend, nicht endgültig.
Scores

Evidenz-Ledger

0 Zeilen

Noch keine Ergebnisse veröffentlicht.

Das Protokoll ist vor dem Lauf öffentlich.

Methode

Was er abdeckt

Lauf 01 (2026-07-12) ist ein einzelner redaktioneller Durchlauf mit vier Buildern. Der Verbrauch wird in der jeweiligen Hersteller-Einheit erfasst — Lovable in Credits, Bolt in Tokens, Replit und v0 in USD — und nicht normiert, da Pläne und Tiers abweichen. Ein Turn-1-Plan-Detail war bei Erfassung unklar und im Runbook markiert. Rangfolgen sind richtungsweisend, nicht endgültig; ein wiederholbares Rubric und ein zweiter Reviewer sind das Tor zu formalen Score-Zeilen.

Score-Obergrenze

Wo er an Grenzen stößt

Es gibt keinen normierten 0–100-Wert. Die Rangfolge ist die redaktionelle Reihenfolge einer Person nach Turn 1; der Verbrauch wird in der jeweiligen Hersteller-Einheit erfasst (Credits, Tokens oder USD) und nicht umgerechnet, weil Pläne und Tiers nicht eins-zu-eins vergleichbar sind.

So führen wir ihn aus

Eingefrorene Vier-Turn-Prompts (T1–T4), identisch über alle Builder, Default-Einstellungen, keine manuellen Edits. Lauf-01-Ergebnisse — Turn-1-Rangfolge: Lovable (beste) → v0 → Replit → Bolt. Verbrauch nach vier Turns: Replit ca. 13 $, Bolt ca. 3 Mio. Tokens, Lovable ca. 14,2 Credits, v0 ca. 14 $. Die vier Outputs drifteten auf Turn 2–4 trotz identischer Prompts stark auseinander; Screenshots liegen im Runbook und, sobald beigebracht, auf der Atlas-Karte. Formale Score-Zeilen warten auf ein wiederholbares Rubric und einen zweiten Reviewer. Vollständiges Runbook: docs/lab/ai-builder-design-test-v0.1.md.

Reproduzierbarkeit
Wiederholung mit denselben vier Prompts (T1–T4 wörtlich aus dem Runbook), Default-Einstellungen, keine manuellen Edits; notiere Builder-Version, Account-Tier, Zeitstempel, Verbrauch pro Turn und einen Screenshot pro Turn. Die Prompt-Bank ist eingefroren, damit Dritte den Lauf wiederholen und Streuung sowie Kosten mit Lauf 01 vergleichen können.

Tools, die ihn ausweisen

Belege

Quellen und weiterführende Lektüre

The Pack · Redaktionsnewsletter

Neue Karten in dein Postfach. Kostenlos.

Eine kurze E-Mail, wenn eine Karte erscheint oder den Status wechselt. Kein Tracking, keine Drittanbieter-Analytics. Abmeldung mit einem Klick.