Benchmarks / Agentisch

Vending-Bench 2

Langhorizont-Business-Kohärenz: Ein Modell führt 365 Tage ein simuliertes Automaten-Unternehmen — Inventar, Lieferanten-Mail, Preise, Refunds — bewertet nach Endkontostand (USD).

AgentischSolidAktivNiedriges KontaminationsrisikoSeit 2026
Was dieser Benchmark nicht misst
  • Keine Single-Shot-Tool-Calls — Läufe überschreiten 20 Mio. Output-Tokens; der Test ist anhaltendes Urteil.
  • Keine physische Robotik — alles ist E-Mail- und Ledger-Simulation.
  • Kein menschliches Ceiling — Andon schätzt ~63.000 $/Jahr für einen starken Menschen; Modelle erreichen einen Bruchteil.
Analyse

Warum dieser Benchmark nützlich ist

Redaktionelle Einordnung ausstehendWir veröffentlichen zuerst Methodik und Ledger. Die benchmark-spezifische Analyse folgt nach der Desk-Prüfung.

Umfang

Abdeckung

Aufgabenfamilie
Agentisch
Format
Start 500 $; 2 $/Tag Standgebühr; 365 simulierte Tage; mittlerer Endsaldo über 5 Läufe.
Bewertung
Endkontostand in USD (höher ist besser).
Verantwortliche Stelle
Andon Labs
Lesehilfe

So liest du die Scores

Die Lesehilfe steht noch aus. Nutze bis zur Desk-Einordnung Aufgabenformat, Bewertungsmethode und Quelldaten im Ledger.

Blinde Flecken

Was er nicht abdeckt

  • Keine Single-Shot-Tool-Calls — Läufe überschreiten 20 Mio. Output-Tokens; der Test ist anhaltendes Urteil.
  • Keine physische Robotik — alles ist E-Mail- und Ledger-Simulation.
  • Kein menschliches Ceiling — Andon schätzt ~63.000 $/Jahr für einen starken Menschen; Modelle erreichen einen Bruchteil.
Scores

Evidenz-Ledger

5 Zeilen
55 Zeilen
10936.76bester Score
5quellgeprüft
1Quellen
2026-06-01Quelldatum
Vending-Bench5

official-page · manual

Verteilung

Wo die Zeilen liegen

0255075100

Auf die Skala dieses Benchmarks normalisiert (0–100). Die Tabelle zeigt die Rohwerte.

Zeitverlauf

Neueste Belege

  1. Claude Opus 4.710936.76 · Andon Labs Vending-Bench 2
  2. GLM 5.28313.78 · Andon Labs Vending-Bench 2
  3. Claude Opus 4.68017.59 · Andon Labs Vending-Bench 2
  4. GPT 5.57523.84 · Andon Labs Vending-Bench 2
  5. Claude Fable 5 (high)5680.26 · Andon Labs Vending-Bench 2

Scores nutzen die eigene Einheit und Skala dieses Benchmarks, keinen universellen Qualitätswert.

#ModellVeröffentlichungScoreHerkunftBeleglage
1Claude Opus 4.7Anthropic2026-05-0110936.76
Andon Labs Vending-Bench 22026-06-01
Quelle geprüft
2GLM 5.2Zhipu2026-05-158313.78
Andon Labs Vending-Bench 22026-06-01
Quelle geprüft
3Claude Opus 4.6Anthropic2026-03-098017.59
Andon Labs Vending-Bench 22026-06-01
Quelle geprüft
4GPT 5.5OpenAI2026-04-237523.84
Andon Labs Vending-Bench 22026-06-01
Quelle geprüft
10Claude Fable 5 (high)Anthropic2026-06-095680.26
Andon Labs Vending-Bench 22026-06-01
Quelle geprüft
Methode

Was er abdeckt

Die Notiz zur Datenqualität steht aus. Jede Ledger-Zeile trägt weiterhin Quellen-URL, Quelldatum und Zeitpunkt des Einlesens.

Score-Obergrenze

Wo er an Grenzen stößt

Noch ist keine Obergrenze erfasst. Wenn sich Scores oben bündeln, kann der Benchmark Frontier-Modelle möglicherweise nicht mehr trennen.

Belege

Quellen und weiterführende Lektüre

The Pack · Redaktionsnewsletter

Neue Karten in dein Postfach. Kostenlos.

Eine kurze E-Mail, wenn eine Karte erscheint oder den Status wechselt. Kein Tracking, keine Drittanbieter-Analytics. Abmeldung mit einem Klick.