Warum dieser Benchmark nützlich ist
Er prüft, ob ein System über mehrere Schritte mit Tools handeln kann. Nutze ihn, wenn Ausführung, Erholung nach Fehlern und Aufgabenabschluss wichtiger sind als flüssiger Chat.
Benchmarks / Agentisch
Vals AI Index
Ein Vals-Kompositwert über branchennähere Aufgaben wie Finance und Coding, gedacht als Näherung für praktische Modellnützlichkeit bei wirtschaftlich relevanter Arbeit.
Er prüft, ob ein System über mehrere Schritte mit Tools handeln kann. Nutze ihn, wenn Ausführung, Erholung nach Fehlern und Aufgabenabschluss wichtiger sind als flüssiger Chat.
Lies Vals Index als aktiv Signal mit unbekanntes kontaminationsrisiko. Vergleiche Modelle nur, wenn Quelle, Testumgebung, Prompting, Sampling und Score-Einheit übereinstimmen.
Auf die Skala dieses Benchmarks normalisiert (0–100). Die Tabelle zeigt die Rohwerte.
Scores nutzen die eigene Einheit und Skala dieses Benchmarks, keinen universellen Qualitätswert.
| # | Modell | Veröffentlichung | Score | Herkunft | Beleglage |
|---|---|---|---|---|---|
| 1 | Claude Fable 5AnthropicVals meldet 75,14 % ± 0,64 auf der öffentlichen Modellseite; der Index-Text rundet auf 75,1. Snapshot am 19. Juli 2026 aktualisiert. | 2026-06-09 | 75.1% | Vals AI — Vals Index2026-07-16 | Quelle geprüft |
| 2 | Kimi K3Moonshot | 2026-07-16 | 74.7% | Vals AI — Vals Index2026-07-16 | Quelle geprüft |
| 3 | Claude Mythos PreviewAnthropicResearch-Preview-Zeile abgelöst durch Claude Fable 5 (GA, 75,15 % Vals-Index, 2026-06-09). Mythos 5 nur für Glasswing-Partner. | 2026-06-01 | 73.42% | Vals AI — Vals Index2026-06-04 | Quelle geprüft |
| 4 | GPT-5.6 SolOpenAI | 2026-07-09 | 73.1% | Vals AI — Vals Index2026-07-16 | Quelle geprüft |
| 5 | Claude Opus 4.8Anthropic | 2026-05-28 | 70.4% | Vals AI — Vals Index2026-06-04 | Quelle geprüft |
| 6 | GPT 5.5OpenAI | 2026-04-23 | 68% | Vals AI — Vals Index2026-06-04 | Quelle geprüft |
| 7 | Claude Opus 4.7Anthropic | 2026-04-16 | 66.1% | Vals AI — Vals Index2026-06-04 | Quelle geprüft |
| 8 | Claude Sonnet 4.6Anthropic | 2026-02-17 | 60.3% | Vals AI — Vals Index2026-06-04 | Quelle geprüft |
| 9 | DeepSeek V4 ProDeepSeek | 2026-04-24 | 56.23% | Vals AI — Vals Index2026-06-04 | Quelle geprüft |
| 10 | Kimi K2.6 ThinkingMoonshot | 2026-04-20 | 55.55% | Vals AI — Vals Index2026-06-04 | Quelle geprüft |
| 11 | Gemini 3.1 Pro PreviewGoogle | 2026-02-19 | 53.42% | Vals AI — Vals Index2026-06-04 | Quelle geprüft |
| 12 | GPT-5.4 MiniOpenAI | 2026-03-17 | 51.42% | Vals AI — Vals Index2026-06-04 | Quelle geprüft |
| 13 | Gemini 3 Flash PreviewGoogle | 2025-12-17 | 49.31% | Vals AI — Vals Index2026-06-04 | Quelle geprüft |
| 14 | Qwen 3.7 MaxAlibaba | 2026-05-20 | 48.04% | Vals AI — Vals Index2026-06-04 | Quelle geprüft |
| 15 | Grok 4.3xAI | 2026-04-30 | 46.63% | Vals AI — Vals Index2026-06-04 | Quelle geprüft |
| 16 | GPT-5.4 NanoOpenAI | 2026-03-17 | 46.46% | Vals AI — Vals Index2026-06-04 | Quelle geprüft |
| 17 | MiniMax M2.7MiniMax | 2026-04-15 | 41.41% | Vals AI — Vals Index2026-06-04 | Quelle geprüft |
| 18 | Claude Haiku 4.5 ThinkingAnthropic | 2025-10-01 | 40.33% | Vals AI — Vals Index2026-06-04 | Quelle geprüft |
| 19 | Grok 4.20 0309 ReasoningxAI | 2026-03-05 | 39.11% | Vals AI — Vals Index2026-06-04 | Quelle geprüft |
| 20 | Gemini 3.1 Flash Lite PreviewGoogle | 2026-05-07 | 35.24% | Vals AI — Vals Index2026-06-04 | Quelle geprüft |
Top-Zeilen wurden am 19.07.2026 aus dem öffentlichen Vals-Index aktualisiert. Akademische Überschneidungen (SWE-bench, GPQA usw.) bleiben auf offiziellen Slugs; Vals-Läufe werden dort nur querverlinkt.
Noch ist keine Obergrenze erfasst. Wenn sich Scores oben bündeln, kann der Benchmark Frontier-Modelle möglicherweise nicht mehr trennen.
The Pack · Redaktionsnewsletter
Eine kurze E-Mail, wenn eine Karte erscheint oder den Status wechselt. Kein Tracking, keine Drittanbieter-Analytics. Abmeldung mit einem Klick.