VerdictPal · Redaktions-Desk · Stand 14. Sept. 2026VerdictPal
Modelle

Modellzentrierter Evidenz Atlas.

Wir bewerten Modelle, nicht Anbieter. Unten: jedes kartierte Modell mit öffentlichen Benchmark-Belegen, sortiert nach Intelligence-Receipts (Vals Index zuerst, dann Artificial Analysis). Jede Zeile hat Datum und URL, kein universelles Urteil.
Aktueller Vals-Evidenz-Anker · Vals Index
Claude Fable 5.1Anthropic · Claude Fable · 69 im Vals Intelligence-Index
219
Modelle mit Seite
21
Anbieter
172
Preis in USD/1M
8
Nur im Score-Ledger

Vals-Index-Zeilen zuerst. Modelle ohne Vals-Zeile fallen auf Artificial Analysis zurück. Quellen-Badges zeigen Einzel- vs. bestätigte Quelle — kein Cross-Benchmark-Sieger.

  1. 1
    Claude Fable 5.1Anthropic · Claude Fable · Vals + AA stimmen überein
    69Vals
  2. 2
    GPT-6 AstraOpenAI · GPT-6 · Vals + AA stimmen überein
    67Vals
  3. 3
    Claude Opus 5 (Adaptive Reasoning, Max Effort)Anthropic · Claude Opus · Vals + AA stimmen überein
    67Vals
  4. 4
    Claude Fable 5Anthropic · Claude Fable · Vals + AA stimmen überein
    66Vals
  5. 5
    Claude Opus 5 (Adaptive Reasoning, Xhigh Effort)Anthropic · Claude Opus · Nur AA
    50AA
  6. 6
    Muse Spark 1.3Meta · Muse Spark · Nur AA
    48AA
  7. 7
    Claude Opus 5 (Adaptive Reasoning, High Effort)Anthropic · Claude Opus · Nur AA
    48AA
  8. 8
    GPT-5.6 SolOpenAI · GPT-5.6 · Nur AA
    47AA
  9. 9
    Claude Opus 5 (Adaptive Reasoning, Medium Effort)Anthropic · Claude Opus · Nur AA
    45AA
  10. 10
    GLM-5.3Zhipu · GLM · Nur AA
    45AA
Top 10 von 188

Gemischte Kosten pro Million Tokens (Input + 3× Output) auf der X-Achse, log-Skala. Intelligence-Index auf der Y-Achse — Vals wenn vorhanden, sonst Artificial Analysis. Punkte nach Kontextfenster skaliert, verbunden durch die Pareto-Frontier (beste Intelligence pro Kostenstufe).

Pareto-Frontier · kuratierte Modelle160 scored · log scale
$0.10$1$10$1000255075100Mischkosten $/1M (log)IntelligenzQwen 3.6 Plus
Alle 160 Modelle in diesem Diagramm
ModellIntelligenzMischkosten $/1MFrontier
Qwen 3.6 Plus79$1.63Ja
DeepSeek V4 Flash Max78$0.25Ja
Qwen 3.7 Max73$1.00
DeepSeek V4 Pro Max73$1.30
Gemini 3.1 Pro73$17.50
Claude Mythos Preview73$243.75
Claude Fable 5.169$40.00
Claude Opus 5 (Adaptive Reasoning, Max Effort)67$20.00
GPT-6 Astra67$40.00
Claude Fable 566$40.00
Claude Haiku 4.561$4.00
GPT-5.4 Pro55$142.50
GPT-5.5 Pro54$142.50
Claude Opus 5 (Adaptive Reasoning, Xhigh Effort)50$20.00
Muse Spark 1.348$3.50
Claude Opus 5 (Adaptive Reasoning, High Effort)48$20.00
GPT-5.6 Sol47$16.00
GLM-5.345$3.65
Claude Opus 5 (Adaptive Reasoning, Medium Effort)45$20.00
Grok 4.644$5.00
Kimi K344$12.00
Qwen3.8-Flash-Next42$0.39
GLM-5.3-Flash42$0.41
GPT-5.6 Terra42$11.88
Claude Opus 4.842$60.00
Gemini 3.8 Flash41$3.00
Claude Opus 4.741$20.00
Muse Spark 1.240$3.50
Qwen3.8 2.4T A95B40$5.00
Qwen3.8 Max40$5.00
Claude Opus 5 (Adaptive Reasoning, Low Effort)40$20.00
Gemini 3.7 Flash39$3.00
GLM-5.239$3.65
Grok 4.539$5.00
GPT 5.439$22.75
GPT 5.539$40.63
GPT-5.6 Luna38$4.75
Claude Sonnet 538$8.00
GPT-5.5 (high)37$23.75
DeepSeek V4 Pro 0813 (Reasoning, Max Effort)36$3.30
Agnes 2.5 Pro Beta35$0.25
DeepSeek V4 Flash 0731 (Reasoning, Max Effort)35$1.10
DeepSeek V4 Flash Vision (Reasoning, Max Effort)35$1.10
Kimi K3 (low)35$12.00
K2 Horizon 375B A23B34$0.00Ja
Motif 334$0.00
Qwen3.8 27B34$2.38
Gemini 3.6 Flash (high)34$3.00
Muse Spark 1.134$3.50
Gemini 3.5 Flash (medium)34$7.13
GPT-5.5 (medium)34$23.75
Gemini 3.5 Flash33$0.97
GPT-5.3 Codex (xhigh)33$10.94
Claude Opus 4.6 (Adaptive Reasoning, Max Effort)32$20.00
Kimi K2.631$2.02
Claude Sonnet 4.6 (Adaptive Reasoning, Max Effort)31$12.00
Claude Opus 4.7 (Non-reasoning, High Effort)31$20.00
GPT-5.5 (low)31$23.75
DeepSeek V4 Pro (Reasoning, High Effort)30$0.76
MiniMax M330$1.60
Apodex 1.130$2.33
Qwen3.7 Max30$6.25
Gemini 3.1 Pro Preview30$9.50
GPT-5.230$10.94
MiMo-V2-Pro29$0.00
GPT-5.2 Codex (xhigh)29$10.94
Claude Opus 4.5 (Reasoning)29$20.00
Solar Pro 428$0.97
Nex-N2-Pro28$2.00
GLM-5 (Reasoning)28$2.65
Qwen3.6 Max Preview28$6.17
GPT-5.4 (low)28$11.88
GLM-5-Turbo27$0.00
JT-4.1 Flash 236B A21B27$0.00
Agnes 2.5 Pro Alpha27$0.79
Grok Build 0.1 061627$1.75
Qwen3.6 Plus27$2.38
GPT-5.2 (medium)27$10.94
GPT-5.5 Instant (June 2026)27$23.75
Hy326$0.00
MiMo-V2.5-Pro26$0.76
Inkling Small26$0.97
Gemini 3 Flash Preview (Reasoning)26$2.38
Kimi K2.7 Code26$3.24
Inkling (xhigh)26$3.98
Claude Opus 4.626$20.00
MiMo-V2-Omni-032725$0.00
Solar Open2 250B25$0.00
DeepSeek V4 Flash (Reasoning, High Effort)25$0.25
Grok 4.3 (medium)25$2.19
GPT-5.4 Mini25$3.56
Grok 4.20 0309 (Reasoning)25$5.00
GPT-5 Codex (high)25$7.81
Claude Sonnet 4.625$12.00
Grok 4.325$20.00
GLM 5V Turbo (Reasoning)24$0.00
MiMo-V2-Omni24$0.00
Grok 4.3 (low)24$2.19
Kimi K2.524$2.40
Kimi K2.6 (Non-reasoning)24$3.24
Gemini 3.5 Flash (minimal)24$7.13
GPT-5.1 Codex (high)24$7.81
Claude Opus 4.524$20.00
A.X-K223$0.00
Hy3-preview (Reasoning)23$0.19
MiniMax M2.523$0.97
MiniMax M2.723$1.21
Qwen3.5 27B (Reasoning)23$1.87
Gemini 3.5 Flash-Lite23$1.95
GPT-5 (high)23$7.81
GPT-5 (medium)23$7.81
Claude Sonnet 4.6 (Non-reasoning, Low Effort)23$12.00
Grok 423$12.00
GPT-5.5 (Non-reasoning)23$23.75
GPT-5.5 Instant (May 2026)23$23.75
Claude 4.1 Opus (Reasoning)23$60.00
MiMo-V2-Flash (Feb 2026)22$0.00
MiMo-V2.522$0.25
KAT Coder Pro V222$0.97
Qwen3.6 35B A3B (Reasoning)22$1.18
GLM-4.7 (Reasoning)22$1.80
Kimi K2 Thinking22$2.02
Qwen3.6 27B (Reasoning)22$2.85
GLM-5.2 (Non-reasoning)22$3.53
Gemini 3 Pro Preview (low)22$9.50
DeepSeek V4 Pro (Non-reasoning)21$0.76
GPT-5.4 Nano21$0.99
Claude 4.5 Sonnet (Reasoning)21$12.00
K-EXAONE 2.0 080320$0.00
LongCat-2.020$2.40
Qwen3.6 27B (Non-reasoning)20$2.85
JT-35B-Flash19$0.00
DeepSeek V4 Flash (Non-reasoning)19$0.25
Qwen3.5 397B A17B (Reasoning)19$2.85
MiMo-V2.5-Pro (Non-reasoning)18$0.76
Muse Glimmer18$1.09
Gemini 3 Flash Preview18$2.38
Hy3-preview (Non-reasoning)17$0.19
Ling-2.6-1T17$1.95
Ring-2.6-1T17$1.95
Gemini 3.1 Flash Lite16$1.19
Granite 4.2 30B15$0.53
Qwen3.6 35B A3B (Non-reasoning)15$1.78
Grok 4.3 (Non-reasoning)15$2.19
Mistral Medium 3.515$6.00
Nemotron 3.5 Lightning14$0.16
Grok 4.20 0309 v2 (Non-reasoning)14$5.00
EXAONE 4.5 33B13$0.00
JT-MINI12$0.00
Granite 4.2 8B12$0.20
G9v3-3B11$0.00
DiffusionGemma 26B A4B10$0.00
Nemotron 3 Nano Omni 30B A3B Reasoning10$0.24
Ling 2.6 Flash10$0.25
Mistral Large 310$1.25
MiniCPM5-1B (Non-reasoning)9$0.00
Granite 4.2 3B9$0.10
Granite 4.1 30B7$0.00
Command A7$8.13
MiniCPM-V 4.6 1.3B6$0.00

Der frühere Schnitt nur mit Input-Kosten. Nützlich bei input-lastiger Arbeit (RAG, Dokument-Q&A) statt output-lastig.

0255075100$0.10$0.30$1$3$10$30Input-USD / 1M Tokens · log-Skala →← Intelligenz

Hover auf einen Punkt zeigt Name, Score und Input-Preis. Per Tastatur: die zwölf besten mit Tab durchgehen oder die Rangliste unten nutzen.

AnthropicOpenAIMistralAlibabaDeepSeekGoogleMoonshotMetaxAIMiniMaxZhipuXiaomiOtherMeituanCohereNVIDIA

Der höchste Intelligence-Receipt pro Family-Slice. Sanity-Check, dass eine einzelne Zahl keine Schwachstelle versteckt.

Claude Fable 5.169

Anthropic · Claude Fable

Familienprofil

Bester veröffentlichter Score je abgedeckter Benchmark-Familie.

80/100 Ø
Wissen
67
Reasoning
94
Coding
63
Agentisch
91
Langer Kontext
85

5 getestete Benchmark-Familien

GPT-6 Astra67

OpenAI · GPT-6

Familienprofil

Bester veröffentlichter Score je abgedeckter Benchmark-Familie.

81/100 Ø
Reasoning
96
Coding
57
Agentisch
88
Langer Kontext
81

4 getestete Benchmark-Familien

Claude Opus 5 (Adaptive Reasoning, Max Effort)67

Anthropic · Claude Opus

Familienprofil

Bester veröffentlichter Score je abgedeckter Benchmark-Familie.

80/100 Ø
Wissen
61
Reasoning
93
Coding
74
Agentisch
89
Multimodal
85
Langer Kontext
79

6 getestete Benchmark-Familien

Ein Modell ohne Zeile in einer Family wurde dort öffentlich nicht getestet. Das zeigen wir — statt Schwäche zu simulieren.

Benchmark-Atlas öffnen
Knowledge57Modelle abgedeckt
Reasoning196Modelle abgedeckt
Math51Modelle abgedeckt
Coding134Modelle abgedeckt
Agentic191Modelle abgedeckt
Multimodal15Modelle abgedeckt
Long context187Modelle abgedeckt
Tool use20Modelle abgedeckt
Performance0Modelle abgedeckt
Safety9Modelle abgedeckt
Human preference13Modelle abgedeckt

The Pack · Redaktionsnewsletter

Neue Tools in dein Postfach. Kostenlos.

Eine kurze E-Mail, wenn ein Tool erscheint oder den Status wechselt. Kein Tracking, keine Drittanbieter-Analytics. Abmeldung mit einem Klick.