Warum dieser Benchmark nützlich ist
Redaktionelle Einordnung ausstehendWir veröffentlichen zuerst Methodik und Ledger. Die benchmark-spezifische Analyse folgt nach der Desk-Prüfung.
Benchmarks / Agentisch
Langhorizont-Business-Kohärenz: Ein Modell führt 365 Tage ein simuliertes Automaten-Unternehmen — Inventar, Lieferanten-Mail, Preise, Refunds — bewertet nach Endkontostand (USD).
Redaktionelle Einordnung ausstehendWir veröffentlichen zuerst Methodik und Ledger. Die benchmark-spezifische Analyse folgt nach der Desk-Prüfung.
Die Lesehilfe steht noch aus. Nutze bis zur Desk-Einordnung Aufgabenformat, Bewertungsmethode und Quelldaten im Ledger.
Auf die Skala dieses Benchmarks normalisiert (0–100). Die Tabelle zeigt die Rohwerte.
Scores nutzen die eigene Einheit und Skala dieses Benchmarks, keinen universellen Qualitätswert.
| # | Modell | Veröffentlichung | Score | Herkunft | Beleglage |
|---|---|---|---|---|---|
| 1 | Claude Opus 4.7Anthropic | 2026-05-01 | 10936.76 | Andon Labs Vending-Bench 22026-06-01 | Quelle geprüft |
| 2 | GLM 5.2Zhipu | 2026-05-15 | 8313.78 | Andon Labs Vending-Bench 22026-06-01 | Quelle geprüft |
| 3 | Claude Opus 4.6Anthropic | 2026-03-09 | 8017.59 | Andon Labs Vending-Bench 22026-06-01 | Quelle geprüft |
| 4 | GPT 5.5OpenAI | 2026-04-23 | 7523.84 | Andon Labs Vending-Bench 22026-06-01 | Quelle geprüft |
| 10 | Claude Fable 5 (high)Anthropic | 2026-06-09 | 5680.26 | Andon Labs Vending-Bench 22026-06-01 | Quelle geprüft |
Die Notiz zur Datenqualität steht aus. Jede Ledger-Zeile trägt weiterhin Quellen-URL, Quelldatum und Zeitpunkt des Einlesens.
Noch ist keine Obergrenze erfasst. Wenn sich Scores oben bündeln, kann der Benchmark Frontier-Modelle möglicherweise nicht mehr trennen.
The Pack · Redaktionsnewsletter
Eine kurze E-Mail, wenn eine Karte erscheint oder den Status wechselt. Kein Tracking, keine Drittanbieter-Analytics. Abmeldung mit einem Klick.