Benchmarks / Agentisch

Vals Index

Vals AI Index

Ein Vals-Kompositwert über branchennähere Aufgaben wie Finance und Coding, gedacht als Näherung für praktische Modellnützlichkeit bei wirtschaftlich relevanter Arbeit.

Was dieser Benchmark nicht misst
  • Offene Reproduzierbarkeit — Teile des Benchmarks nutzen proprietäre, nicht öffentliche Datensätze; Leser können die Suite nicht vollständig nachlaufen lassen.
  • Keine Einzelfähigkeit — der Index mischt Domänen; ein hoher Wert kann ungleichmäßige Stärken über Finance, Coding, Bildung oder Multimodalität verdecken.
  • Keine VerdictPal-Empfehlung — Vals ist nützliche Evidenz, bleibt aber eine Quellenzeile mit eigener Methodik und Gewichtung.
Analyse

Warum dieser Benchmark nützlich ist

Wenn du einen praxisnahen, branchennahen Kompositwert willst — Finance, Coding und verwandte Arbeit — als eine Vals-Evidenzzeile, keine VerdictPal-Empfehlung.

Umfang

Abdeckung

Aufgabenfamilie
Agentisch
Format
Komposit-Index aus der Vals-Branchensuite; öffentliche Seiten zeigen Modellwert, Rang und Aktualisierungsdatum.
Bewertung
Prozentähnlicher Kompositwert. Die aktuelle Aufgabenmischung und Gewichtung stehen auf der Quellseite.
Verantwortliche Stelle
Vals AI
Lesehilfe

So liest du die Scores

Prozentähnlicher Kompositwert. Teile der Suite sind proprietär — vollständiges Nachlaufen ist nicht möglich. Ein hoher Index kann ungleichmäßige Domänenstärken verdecken; aktuelle Aufgabenmischung auf der Quellseite prüfen.

Blinde Flecken

Was er nicht abdeckt

  • Offene Reproduzierbarkeit — Teile des Benchmarks nutzen proprietäre, nicht öffentliche Datensätze; Leser können die Suite nicht vollständig nachlaufen lassen.
  • Keine Einzelfähigkeit — der Index mischt Domänen; ein hoher Wert kann ungleichmäßige Stärken über Finance, Coding, Bildung oder Multimodalität verdecken.
  • Keine VerdictPal-Empfehlung — Vals ist nützliche Evidenz, bleibt aber eine Quellenzeile mit eigener Methodik und Gewichtung.
Scores

Evidenz-Ledger

23 Zeilen
2323 Zeilen
74.7%bester Score
23quellgeprüft
1Quellen
2026-09-05bis 2026-06-04
Vals AI23

manual-snapshot · manual

Verteilung

Wo die Zeilen liegen

0255075100

Auf die Skala dieses Benchmarks normalisiert (0–100). Die Tabelle zeigt die Rohwerte.

Zeitverlauf

Neueste Belege

  1. Claude Fable 5.168.83% · Vals AI — Vals Index
  2. GPT-6 Astra66.61% · Vals AI — Vals Index
  3. Claude Opus 567.21% · Vals AI — Vals Index
  4. Claude Fable 566.04% · Vals AI — Vals Index
  5. Kimi K374.7% · Vals AI — Vals Index

Scores nutzen die eigene Einheit und Skala dieses Benchmarks, keinen universellen Qualitätswert.

#ModellVeröffentlichungScoreHerkunftBeleglage
1Kimi K3Moonshot2026-07-1674.7%
Vals AI — Vals Index2026-07-16
Quelle geprüft
2Claude Mythos PreviewAnthropicResearch-Preview-Zeile abgelöst durch Claude Fable 5 (GA, 75,15 % Vals-Index, 2026-06-09). Mythos 5 nur für Glasswing-Partner.2026-06-0173.42%
Vals AI — Vals Index2026-06-04
Quelle geprüft
3GPT-5.6 SolOpenAI2026-07-0973.1%
Vals AI — Vals Index2026-07-16
Quelle geprüft
4Claude Opus 4.8Anthropic2026-05-2870.4%
Vals AI — Vals Index2026-06-04
Quelle geprüft
5Claude Fable 5.1AnthropicVals-Index-Key-Takeaway am 5. Sep. 2026: Claude Fable 5.1 führt mit 68,83 %. Der Snapshot vom 1. Sep. war 67,866 %.2026-09-0168.83%
Vals AI — Vals Index2026-09-05
Quelle geprüft
6GPT 5.5OpenAI2026-04-2368%
Vals AI — Vals Index2026-06-04
Quelle geprüft
7Claude Opus 5AnthropicVals-Index 67,213 % im Snapshot vom 1. Sep. 2026; gerundet 67,21. Am 5. Sep. 2026 weiter #2 hinter Fable 5.1.2026-07-2467.21%
Vals AI — Vals Index2026-09-01
Quelle geprüft
8GPT-6 AstraOpenAIVals-Index 66,61 % auf dem Board vom 5. Sep. 2026 — #3 hinter Fable 5.1 (68,83) und Opus 5 (67,21). Vals schreibt, Astra führt Terminal-Bench und Code Migration auf diesem Index.2026-09-0366.61%
Vals AI — Vals Index2026-09-05
Quelle geprüft
9Claude Opus 4.7Anthropic2026-04-1666.1%
Vals AI — Vals Index2026-06-04
Quelle geprüft
10Claude Fable 5AnthropicVals-Index 66,036 % im Snapshot vom 1. Sep. 2026 (gerundet 66,04). Hinter Fable 5.1 (67,87) und Opus 5 (67,21). Die frühere 75,1 stammte vom Board Juli 2026.2026-06-0966.04%
Vals AI — Vals Index2026-09-01
Quelle geprüft
11Claude Sonnet 4.6Anthropic2026-02-1760.3%
Vals AI — Vals Index2026-06-04
Quelle geprüft
12DeepSeek V4 ProDeepSeek2026-04-2456.23%
Vals AI — Vals Index2026-06-04
Quelle geprüft
13Kimi K2.6 ThinkingMoonshot2026-04-2055.55%
Vals AI — Vals Index2026-06-04
Quelle geprüft
14Gemini 3.1 Pro PreviewGoogle2026-02-1953.42%
Vals AI — Vals Index2026-06-04
Quelle geprüft
15GPT-5.4 MiniOpenAI2026-03-1751.42%
Vals AI — Vals Index2026-06-04
Quelle geprüft
16Gemini 3 Flash PreviewGoogle2025-12-1749.31%
Vals AI — Vals Index2026-06-04
Quelle geprüft
17Qwen 3.7 MaxAlibaba2026-05-2048.04%
Vals AI — Vals Index2026-06-04
Quelle geprüft
18Grok 4.3xAI2026-04-3046.63%
Vals AI — Vals Index2026-06-04
Quelle geprüft
19GPT-5.4 NanoOpenAI2026-03-1746.46%
Vals AI — Vals Index2026-06-04
Quelle geprüft
20MiniMax M2.7MiniMax2026-04-1541.41%
Vals AI — Vals Index2026-06-04
Quelle geprüft
21Claude Haiku 4.5 ThinkingAnthropic2025-10-0140.33%
Vals AI — Vals Index2026-06-04
Quelle geprüft
22Grok 4.20 0309 ReasoningxAI2026-03-0539.11%
Vals AI — Vals Index2026-06-04
Quelle geprüft
23Gemini 3.1 Flash Lite PreviewGoogle2026-05-0735.24%
Vals AI — Vals Index2026-06-04
Quelle geprüft
Methode

Was er abdeckt

Top-Zeilen wurden am 19.07.2026 aus dem öffentlichen Vals-Index aktualisiert. Akademische Überschneidungen (SWE-bench, GPQA usw.) bleiben auf offiziellen Slugs; Vals-Läufe werden dort nur querverlinkt.

Score-Obergrenze

Wo er an Grenzen stößt

Noch ist keine Obergrenze erfasst. Wenn sich Scores oben bündeln, kann der Benchmark Frontier-Modelle möglicherweise nicht mehr trennen.

Tools, die ihn ausweisen

Belege

Quellen und weiterführende Lektüre

Fragen zu diesem Benchmark

Jede Antwort unten stammt aus den datierten Feldern dieser Seite. Nichts davon ist zusätzlich für Suchmaschinen geschrieben.

Was misst Vals Index?

Ein Vals-Kompositwert über branchennähere Aufgaben wie Finance und Coding, gedacht als Näherung für praktische Modellnützlichkeit bei wirtschaftlich relevanter Arbeit.

Was beweist ein hoher Vals Index-Wert nicht?

Ein starkes Vals Index-Ergebnis sagt nichts aus über:

  • Offene Reproduzierbarkeit — Teile des Benchmarks nutzen proprietäre, nicht öffentliche Datensätze; Leser können die Suite nicht vollständig nachlaufen lassen.
  • Keine Einzelfähigkeit — der Index mischt Domänen; ein hoher Wert kann ungleichmäßige Stärken über Finance, Coding, Bildung oder Multimodalität verdecken.
  • Keine VerdictPal-Empfehlung — Vals ist nützliche Evidenz, bleibt aber eine Quellenzeile mit eigener Methodik und Gewichtung.

Wie wird Vals Index bewertet?

Prozentähnlicher Kompositwert. Die aktuelle Aufgabenmischung und Gewichtung stehen auf der Quellseite. Aufgabenformat: Komposit-Index aus der Vals-Branchensuite; öffentliche Seiten zeigen Modellwert, Rang und Aktualisierungsdatum.

Ist Vals Index gesättigt?

Vals Index ist im Atlas derzeit als Aktiv markiert.

Können Vals Index-Ergebnisse durch Trainingsdaten verunreinigt sein?

Das Kontaminationsrisiko für Vals Index ist als Kontamination unbekannt eingestuft. Behandle jede Zeile auf dieser Seite als öffentliche Angabe mit Quelle und Datum, nicht als kontrolliertes Experiment.

The Pack · Redaktionsnewsletter

Neue Tools in dein Postfach. Kostenlos.

Eine kurze E-Mail, wenn ein Tool erscheint oder den Status wechselt. Kein Tracking, keine Drittanbieter-Analytics. Abmeldung mit einem Klick.