Warum dieser Benchmark nützlich ist
Wenn du einen praxisnahen, branchennahen Kompositwert willst — Finance, Coding und verwandte Arbeit — als eine Vals-Evidenzzeile, keine VerdictPal-Empfehlung.
Vals AI Index
Ein Vals-Kompositwert über branchennähere Aufgaben wie Finance und Coding, gedacht als Näherung für praktische Modellnützlichkeit bei wirtschaftlich relevanter Arbeit.
Wenn du einen praxisnahen, branchennahen Kompositwert willst — Finance, Coding und verwandte Arbeit — als eine Vals-Evidenzzeile, keine VerdictPal-Empfehlung.
Prozentähnlicher Kompositwert. Teile der Suite sind proprietär — vollständiges Nachlaufen ist nicht möglich. Ein hoher Index kann ungleichmäßige Domänenstärken verdecken; aktuelle Aufgabenmischung auf der Quellseite prüfen.
Auf die Skala dieses Benchmarks normalisiert (0–100). Die Tabelle zeigt die Rohwerte.
Scores nutzen die eigene Einheit und Skala dieses Benchmarks, keinen universellen Qualitätswert.
| # | Modell | Veröffentlichung | Score | Herkunft | Beleglage |
|---|---|---|---|---|---|
| 1 | Kimi K3Moonshot | 2026-07-16 | 74.7% | Vals AI — Vals Index2026-07-16 | Quelle geprüft |
| 2 | Claude Mythos PreviewAnthropicResearch-Preview-Zeile abgelöst durch Claude Fable 5 (GA, 75,15 % Vals-Index, 2026-06-09). Mythos 5 nur für Glasswing-Partner. | 2026-06-01 | 73.42% | Vals AI — Vals Index2026-06-04 | Quelle geprüft |
| 3 | GPT-5.6 SolOpenAI | 2026-07-09 | 73.1% | Vals AI — Vals Index2026-07-16 | Quelle geprüft |
| 4 | Claude Opus 4.8Anthropic | 2026-05-28 | 70.4% | Vals AI — Vals Index2026-06-04 | Quelle geprüft |
| 5 | Claude Fable 5.1AnthropicVals-Index-Key-Takeaway am 5. Sep. 2026: Claude Fable 5.1 führt mit 68,83 %. Der Snapshot vom 1. Sep. war 67,866 %. | 2026-09-01 | 68.83% | Vals AI — Vals Index2026-09-05 | Quelle geprüft |
| 6 | GPT 5.5OpenAI | 2026-04-23 | 68% | Vals AI — Vals Index2026-06-04 | Quelle geprüft |
| 7 | Claude Opus 5AnthropicVals-Index 67,213 % im Snapshot vom 1. Sep. 2026; gerundet 67,21. Am 5. Sep. 2026 weiter #2 hinter Fable 5.1. | 2026-07-24 | 67.21% | Vals AI — Vals Index2026-09-01 | Quelle geprüft |
| 8 | GPT-6 AstraOpenAIVals-Index 66,61 % auf dem Board vom 5. Sep. 2026 — #3 hinter Fable 5.1 (68,83) und Opus 5 (67,21). Vals schreibt, Astra führt Terminal-Bench und Code Migration auf diesem Index. | 2026-09-03 | 66.61% | Vals AI — Vals Index2026-09-05 | Quelle geprüft |
| 9 | Claude Opus 4.7Anthropic | 2026-04-16 | 66.1% | Vals AI — Vals Index2026-06-04 | Quelle geprüft |
| 10 | Claude Fable 5AnthropicVals-Index 66,036 % im Snapshot vom 1. Sep. 2026 (gerundet 66,04). Hinter Fable 5.1 (67,87) und Opus 5 (67,21). Die frühere 75,1 stammte vom Board Juli 2026. | 2026-06-09 | 66.04% | Vals AI — Vals Index2026-09-01 | Quelle geprüft |
| 11 | Claude Sonnet 4.6Anthropic | 2026-02-17 | 60.3% | Vals AI — Vals Index2026-06-04 | Quelle geprüft |
| 12 | DeepSeek V4 ProDeepSeek | 2026-04-24 | 56.23% | Vals AI — Vals Index2026-06-04 | Quelle geprüft |
| 13 | Kimi K2.6 ThinkingMoonshot | 2026-04-20 | 55.55% | Vals AI — Vals Index2026-06-04 | Quelle geprüft |
| 14 | Gemini 3.1 Pro PreviewGoogle | 2026-02-19 | 53.42% | Vals AI — Vals Index2026-06-04 | Quelle geprüft |
| 15 | GPT-5.4 MiniOpenAI | 2026-03-17 | 51.42% | Vals AI — Vals Index2026-06-04 | Quelle geprüft |
| 16 | Gemini 3 Flash PreviewGoogle | 2025-12-17 | 49.31% | Vals AI — Vals Index2026-06-04 | Quelle geprüft |
| 17 | Qwen 3.7 MaxAlibaba | 2026-05-20 | 48.04% | Vals AI — Vals Index2026-06-04 | Quelle geprüft |
| 18 | Grok 4.3xAI | 2026-04-30 | 46.63% | Vals AI — Vals Index2026-06-04 | Quelle geprüft |
| 19 | GPT-5.4 NanoOpenAI | 2026-03-17 | 46.46% | Vals AI — Vals Index2026-06-04 | Quelle geprüft |
| 20 | MiniMax M2.7MiniMax | 2026-04-15 | 41.41% | Vals AI — Vals Index2026-06-04 | Quelle geprüft |
| 21 | Claude Haiku 4.5 ThinkingAnthropic | 2025-10-01 | 40.33% | Vals AI — Vals Index2026-06-04 | Quelle geprüft |
| 22 | Grok 4.20 0309 ReasoningxAI | 2026-03-05 | 39.11% | Vals AI — Vals Index2026-06-04 | Quelle geprüft |
| 23 | Gemini 3.1 Flash Lite PreviewGoogle | 2026-05-07 | 35.24% | Vals AI — Vals Index2026-06-04 | Quelle geprüft |
Top-Zeilen wurden am 19.07.2026 aus dem öffentlichen Vals-Index aktualisiert. Akademische Überschneidungen (SWE-bench, GPQA usw.) bleiben auf offiziellen Slugs; Vals-Läufe werden dort nur querverlinkt.
Noch ist keine Obergrenze erfasst. Wenn sich Scores oben bündeln, kann der Benchmark Frontier-Modelle möglicherweise nicht mehr trennen.
Jede Antwort unten stammt aus den datierten Feldern dieser Seite. Nichts davon ist zusätzlich für Suchmaschinen geschrieben.
Ein Vals-Kompositwert über branchennähere Aufgaben wie Finance und Coding, gedacht als Näherung für praktische Modellnützlichkeit bei wirtschaftlich relevanter Arbeit.
Ein starkes Vals Index-Ergebnis sagt nichts aus über:
Prozentähnlicher Kompositwert. Die aktuelle Aufgabenmischung und Gewichtung stehen auf der Quellseite. Aufgabenformat: Komposit-Index aus der Vals-Branchensuite; öffentliche Seiten zeigen Modellwert, Rang und Aktualisierungsdatum.
Vals Index ist im Atlas derzeit als Aktiv markiert.
Das Kontaminationsrisiko für Vals Index ist als Kontamination unbekannt eingestuft. Behandle jede Zeile auf dieser Seite als öffentliche Angabe mit Quelle und Datum, nicht als kontrolliertes Experiment.
The Pack · Redaktionsnewsletter
Eine kurze E-Mail, wenn ein Tool erscheint oder den Status wechselt. Kein Tracking, keine Drittanbieter-Analytics. Abmeldung mit einem Klick.