Benchmarks / Agentisch

Vals Index

Vals AI Index

Ein Vals-Kompositwert über branchennähere Aufgaben wie Finance und Coding, gedacht als Näherung für praktische Modellnützlichkeit bei wirtschaftlich relevanter Arbeit.

AgentischSolidAktivUnbekanntes KontaminationsrisikoSeit 2026
Was dieser Benchmark nicht misst
  • Offene Reproduzierbarkeit — Teile des Benchmarks nutzen proprietäre, nicht öffentliche Datensätze; Leser können die Suite nicht vollständig nachlaufen lassen.
  • Keine Einzelfähigkeit — der Index mischt Domänen; ein hoher Wert kann ungleichmäßige Stärken über Finance, Coding, Bildung oder Multimodalität verdecken.
  • Keine VerdictPal-Empfehlung — Vals ist nützliche Evidenz, bleibt aber eine Quellenzeile mit eigener Methodik und Gewichtung.
Analyse

Warum dieser Benchmark nützlich ist

Er prüft, ob ein System über mehrere Schritte mit Tools handeln kann. Nutze ihn, wenn Ausführung, Erholung nach Fehlern und Aufgabenabschluss wichtiger sind als flüssiger Chat.

Umfang

Abdeckung

Aufgabenfamilie
Agentisch
Format
Komposit-Index aus der Vals-Branchensuite; öffentliche Seiten zeigen Modellwert, Rang und Aktualisierungsdatum.
Bewertung
Prozentähnlicher Kompositwert. Die aktuelle Aufgabenmischung und Gewichtung stehen auf der Quellseite.
Verantwortliche Stelle
Vals AI
Lesehilfe

So liest du die Scores

Lies Vals Index als aktiv Signal mit unbekanntes kontaminationsrisiko. Vergleiche Modelle nur, wenn Quelle, Testumgebung, Prompting, Sampling und Score-Einheit übereinstimmen.

Blinde Flecken

Was er nicht abdeckt

  • Offene Reproduzierbarkeit — Teile des Benchmarks nutzen proprietäre, nicht öffentliche Datensätze; Leser können die Suite nicht vollständig nachlaufen lassen.
  • Keine Einzelfähigkeit — der Index mischt Domänen; ein hoher Wert kann ungleichmäßige Stärken über Finance, Coding, Bildung oder Multimodalität verdecken.
  • Keine VerdictPal-Empfehlung — Vals ist nützliche Evidenz, bleibt aber eine Quellenzeile mit eigener Methodik und Gewichtung.
Scores

Evidenz-Ledger

20 Zeilen
2020 Zeilen
75.1%bester Score
20quellgeprüft
1Quellen
2026-07-16bis 2026-06-04
Vals AI20

manual-snapshot · manual

Verteilung

Wo die Zeilen liegen

0255075100

Auf die Skala dieses Benchmarks normalisiert (0–100). Die Tabelle zeigt die Rohwerte.

Zeitverlauf

Neueste Belege

  1. Claude Fable 575.1% · Vals AI — Vals Index
  2. Kimi K374.7% · Vals AI — Vals Index
  3. GPT-5.6 Sol73.1% · Vals AI — Vals Index
  4. Claude Mythos Preview73.42% · Vals AI — Vals Index
  5. Claude Opus 4.870.4% · Vals AI — Vals Index

Scores nutzen die eigene Einheit und Skala dieses Benchmarks, keinen universellen Qualitätswert.

#ModellVeröffentlichungScoreHerkunftBeleglage
1Claude Fable 5AnthropicVals meldet 75,14 % ± 0,64 auf der öffentlichen Modellseite; der Index-Text rundet auf 75,1. Snapshot am 19. Juli 2026 aktualisiert.2026-06-0975.1%
Vals AI — Vals Index2026-07-16
Quelle geprüft
2Kimi K3Moonshot2026-07-1674.7%
Vals AI — Vals Index2026-07-16
Quelle geprüft
3Claude Mythos PreviewAnthropicResearch-Preview-Zeile abgelöst durch Claude Fable 5 (GA, 75,15 % Vals-Index, 2026-06-09). Mythos 5 nur für Glasswing-Partner.2026-06-0173.42%
Vals AI — Vals Index2026-06-04
Quelle geprüft
4GPT-5.6 SolOpenAI2026-07-0973.1%
Vals AI — Vals Index2026-07-16
Quelle geprüft
5Claude Opus 4.8Anthropic2026-05-2870.4%
Vals AI — Vals Index2026-06-04
Quelle geprüft
6GPT 5.5OpenAI2026-04-2368%
Vals AI — Vals Index2026-06-04
Quelle geprüft
7Claude Opus 4.7Anthropic2026-04-1666.1%
Vals AI — Vals Index2026-06-04
Quelle geprüft
8Claude Sonnet 4.6Anthropic2026-02-1760.3%
Vals AI — Vals Index2026-06-04
Quelle geprüft
9DeepSeek V4 ProDeepSeek2026-04-2456.23%
Vals AI — Vals Index2026-06-04
Quelle geprüft
10Kimi K2.6 ThinkingMoonshot2026-04-2055.55%
Vals AI — Vals Index2026-06-04
Quelle geprüft
11Gemini 3.1 Pro PreviewGoogle2026-02-1953.42%
Vals AI — Vals Index2026-06-04
Quelle geprüft
12GPT-5.4 MiniOpenAI2026-03-1751.42%
Vals AI — Vals Index2026-06-04
Quelle geprüft
13Gemini 3 Flash PreviewGoogle2025-12-1749.31%
Vals AI — Vals Index2026-06-04
Quelle geprüft
14Qwen 3.7 MaxAlibaba2026-05-2048.04%
Vals AI — Vals Index2026-06-04
Quelle geprüft
15Grok 4.3xAI2026-04-3046.63%
Vals AI — Vals Index2026-06-04
Quelle geprüft
16GPT-5.4 NanoOpenAI2026-03-1746.46%
Vals AI — Vals Index2026-06-04
Quelle geprüft
17MiniMax M2.7MiniMax2026-04-1541.41%
Vals AI — Vals Index2026-06-04
Quelle geprüft
18Claude Haiku 4.5 ThinkingAnthropic2025-10-0140.33%
Vals AI — Vals Index2026-06-04
Quelle geprüft
19Grok 4.20 0309 ReasoningxAI2026-03-0539.11%
Vals AI — Vals Index2026-06-04
Quelle geprüft
20Gemini 3.1 Flash Lite PreviewGoogle2026-05-0735.24%
Vals AI — Vals Index2026-06-04
Quelle geprüft
Methode

Was er abdeckt

Top-Zeilen wurden am 19.07.2026 aus dem öffentlichen Vals-Index aktualisiert. Akademische Überschneidungen (SWE-bench, GPQA usw.) bleiben auf offiziellen Slugs; Vals-Läufe werden dort nur querverlinkt.

Score-Obergrenze

Wo er an Grenzen stößt

Noch ist keine Obergrenze erfasst. Wenn sich Scores oben bündeln, kann der Benchmark Frontier-Modelle möglicherweise nicht mehr trennen.

Tools, die ihn ausweisen

Belege

Quellen und weiterführende Lektüre

The Pack · Redaktionsnewsletter

Neue Karten in dein Postfach. Kostenlos.

Eine kurze E-Mail, wenn eine Karte erscheint oder den Status wechselt. Kein Tracking, keine Drittanbieter-Analytics. Abmeldung mit einem Klick.