VerdictPal · Redaktions-Desk · 2026VerdictPal
Modelle

Modellzentrierter Evidenz Atlas.

Wir bewerten Modelle, nicht Anbieter. Unten: jedes kartierte Modell mit öffentlichen Benchmark-Belegen, sortiert nach Intelligence-Receipts (Vals Index zuerst, dann Artificial Analysis). Jede Zeile hat Datum und URL, kein universelles Urteil.
Aktueller Vals-Evidenz-Anker · Vals Index
Claude Fable 5Anthropic · Claude Fable · 75 im Vals Intelligence-Index
111
Kartierte Modelle
21
Anbieter
85
Preis in USD/1M
5
Nur im Score-Ledger

Vals-Index-Zeilen zuerst. Modelle ohne Vals-Zeile fallen auf Artificial Analysis zurück. Quellen-Badges zeigen Einzel- vs. bestätigte Quelle — kein Cross-Benchmark-Sieger.

  1. 1
    Claude Fable 5Anthropic · Claude Fable · Vals + AA stimmen überein
    75Vals
  2. 2
    Kimi K3Moonshot · Kimi K3 · Vals + AA stimmen überein
    75Vals
  3. 3
    Claude Mythos PreviewAnthropic · Claude Opus · Nur Vals
    73Vals
  4. 4
    GPT-5.6 SolOpenAI · GPT-5.6 · Vals + AA stimmen überein
    73Vals
  5. 5
    Claude Opus 4.8Anthropic · Claude Opus · Vals + AA stimmen überein
    70Vals
  6. 6
    GPT 5.5OpenAI · GPT 5 · Vals + AA stimmen überein
    68Vals
  7. 7
    Claude Opus 4.7Anthropic · Claude Opus · Vals + AA stimmen überein
    66Vals
  8. 8
    Claude Sonnet 4.6Anthropic · Claude Sonnet · Vals + AA stimmen überein
    60Vals
  9. 9
    DeepSeek V4 Pro MaxDeepSeek · DeepSeek · Nur Vals
    56Vals
  10. 10
    Kimi K2.6Moonshot · Kimi · Vals + AA stimmen überein
    56Vals
  11. 11
    Gemini 3.1 ProGoogle · Gemini · Nur Vals
    53Vals
  12. 12
    GPT-5.4 MiniOpenAI · GPT-5.4 · Vals + AA stimmen überein
    51Vals
  13. 13
    Gemini 3.5 FlashGoogle · Gemini · Vals + AA stimmen überein
    49Vals
  14. 14
    Gemini 3 Flash PreviewGoogle · Gemini 3 · Vals + AA stimmen überein
    49Vals
  15. 15
    Qwen 3.7 MaxAlibaba · Qwen · Nur Vals
    48Vals
  16. 16
    Grok 4.3xAI · Grok · Vals + AA stimmen überein
    47Vals
  17. 17
    GPT-5.4 NanoOpenAI · GPT-5.4 · Vals + AA stimmen überein
    46Vals
  18. 18
    MiniMax M2.7MiniMax · MiniMax · Vals + AA stimmen überein
    41Vals
  19. 19
    Claude Haiku 4.5Anthropic · Claude Haiku · Nur Vals
    40Vals
  20. 20
    Grok 4.20 ReasoningxAI · Grok 4 · Vals + AA stimmen überein
    39Vals
  21. 21
    Gemini 3.1 Flash LiteGoogle · Gemini 3.1 · Vals + AA stimmen überein
    35Vals
  22. 22
    GPT-5.6 TerraOpenAI · GPT-5.6 · Nur AA
    55AA
  23. 23
    Grok 4.5xAI · Grok · Nur AA
    54AA
  24. 24
    GPT-5.5 (high)OpenAI · GPT-5.5 (high) · Nur AA
    53AA
  25. 25
    Claude Sonnet 5Anthropic · Claude Sonnet · Nur AA
    53AA
  26. 26
    GPT 5.4OpenAI · GPT 5 · Nur AA
    51AA
  27. 27
    GPT-5.6 LunaOpenAI · GPT-5.6 · Nur AA
    51AA
  28. 28
    Muse Spark 1.1Meta · Muse Spark · Nur AA
    51AA
  29. 29
    GLM-5.2Zhipu · GLM · Nur AA
    51AA
  30. 30
    GPT-5.5 (medium)OpenAI · GPT-5.5 (medium) · Nur AA
    50AA
  31. 31
    Gemini 3.1 Pro PreviewGoogle · Gemini 3.1 · Nur AA
    47AA
  32. 32
    Claude Sonnet 4.6 (Adaptive Reasoning, Max Effort)Anthropic · Claude Sonnet · Nur AA
    47AA
  33. 33
    Qwen3.7 MaxAlibaba · Qwen3.7 Max · Nur AA
    46AA
  34. 34
    Gemini 3.5 Flash (medium)Google · Gemini 3.5 · Nur AA
    45AA
  35. 35
    GPT-5.3 Codex (xhigh)OpenAI · GPT-5.3 Codex · Nur AA
    44AA
  36. 36
    MiniMax M3MiniMax · MiniMax · Nur AA
    44AA
  37. 37
    Claude Opus 4.6 (Adaptive Reasoning, Max Effort)Anthropic · Claude Opus · Nur AA
    44AA
  38. 38
    DeepSeek V4 Pro (Reasoning, Max Effort)DeepSeek · DeepSeek V4 · Nur AA
    44AA
  39. 39
    GPT-5.5 (low)OpenAI · GPT-5.5 (low) · Nur AA
    44AA
  40. 40
    Muse SparkOther · Muse · Nur AA
    43AA
  41. 41
    Claude Opus 4.7 (Non-reasoning, High Effort)Anthropic · Claude Opus · Nur AA
    43AA
  42. 42
    GPT-5.2OpenAI · GPT-5 · Nur AA
    42AA
  43. 43
    MiMo-V2.5-ProXiaomi · Xiaomi · Nur AA
    42AA
  44. 44
    Kimi K2.7 CodeMoonshot · Kimi · Nur AA
    42AA
  45. 45
    Gemini 3 ProGoogle · Gemini 3 · Nur AA
    40AA
  46. 46
    GLM-5.1Zhipu · GLM · Nur AA
    40AA
  47. 47
    Qwen 3.7 PlusAlibaba · Qwen · Nur AA
    39AA
  48. 48
    Claude Opus 4.6Anthropic · Claude Opus · Nur AA
    38AA
  49. 49
    Nemotron 3 Ultra 550B A55B (Reasoning)NVIDIA · Nemotron · Nur AA
    38AA
  50. 50
    GPT-5.1OpenAI · GPT-5 · Nur AA
    37AA
  51. 51
    Claude Opus 4.5Anthropic · Claude Opus · Nur AA
    35AA
  52. 52
    Kimi K2.5Moonshot · Kimi · Nur AA
    35AA
  53. 53
    MiniMax M2.5MiniMax · MiniMax · Nur AA
    34AA
  54. 54
    LongCat-2.0Meituan · LongCat · Nur AA
    34AA
  55. 55
    OpenAI o3OpenAI · OpenAI o · Nur AA
    30AA
  56. 56
    Step 3.7 FlashStepFun · Step · Nur AA
    30AA
  57. 57
    Gemma 4 31B ITGoogle · Gemma · Nur AA
    29AA
  58. 58
    OpenAI o1OpenAI · OpenAI o · Nur AA
    23AA
  59. 59
    Gemma 4 12B (Reasoning)Google · Gemma · Nur AA
    22AA
  60. 60
    DeepSeek R1DeepSeek · DeepSeek R1 · Nur AA
    20AA
  61. 61
    North Mini CodeCohere · North · Nur AA
    20AA
  62. 62
    HyperNova 60B 2605Multiverse · HyperNova · Nur AA
    18AA
  63. 63
    Mistral Large 3Mistral · Mistral Large · Nur AA
    16AA
  64. 64
    Llama 4 MaverickMeta · Llama 4 · Nur AA
    14AA
  65. 65
    Gemma 4 12B (Non-reasoning)Google · Gemma · Nur AA
    13AA
  66. 66
    Claude 3 OpusAnthropic · Claude Opus · Nur AA
    12AA
  67. 67
    MiniCPM5-1B (Reasoning)OpenBMB · MiniCPM · Nur AA
    12AA
  68. 68
    Llama 4 ScoutMeta · Llama 4 · Nur AA
    10AA
  69. 69
    Command ACohere · Command · Nur AA
    8AA
  70. 70
    LFM2.5-8B-A1BLiquid · LFM · Nur AA
    8AA
  71. 71
    DeepSeek Coder V2DeepSeek · DeepSeek Coder · Nur AA
    5AA
  72. 72
    Gemini 1.0 UltraGoogle · Gemini 1 · Nur AA
    5AA

Gemischte Kosten pro Million Tokens (Input + 3× Output) auf der X-Achse, log-Skala. Intelligence-Index auf der Y-Achse — Vals wenn vorhanden, sonst Artificial Analysis. Punkte nach Kontextfenster skaliert, verbunden durch die Pareto-Frontier (beste Intelligence pro Kostenstufe).

Pareto-Frontier · kuratierte Modelle53 scored · log scale
$0.10$1$10$1000255075100Blended $/1M (log)IntelligenceQwen 3.6 Plus
All 53 models in this chart
ModelIntelligenceBlended $/1MFrontier
GPT-5.4 Pro83$142.50Yes
GPT-5.5 Pro82$142.50
Qwen 3.6 Plus79$1.63Yes
DeepSeek V4 Flash Max78$0.25Yes
Kimi K375$12.00
Claude Fable 575$40.00
GPT-5.6 Sol73$23.75
Claude Mythos Preview73$243.75
Claude Opus 4.870$60.00
GPT 5.568$40.63
Claude Opus 4.766$20.00
Claude Sonnet 4.660$12.00
DeepSeek V4 Pro Max56$1.30
Kimi K2.656$2.02
GPT-5.6 Terra55$11.88
Grok 4.554$5.00
Claude Sonnet 553$8.00
Gemini 3.1 Pro53$17.50
GPT-5.5 (high)53$23.75
Muse Spark 1.151$3.50
GPT-5.4 Mini51$3.56
GLM-5.251$3.65
GPT-5.6 Luna51$4.75
GPT 5.451$22.75
GPT-5.5 (medium)50$23.75
Gemini 3.5 Flash49$0.97
Gemini 3 Flash Preview49$2.38
Qwen 3.7 Max48$1.00
Gemini 3.1 Pro Preview47$9.50
Claude Sonnet 4.6 (Adaptive Reasoning, Max Effort)47$12.00
Grok 4.347$20.00
GPT-5.4 Nano46$0.99
Qwen3.7 Max46$6.25
Gemini 3.5 Flash (medium)45$7.13
DeepSeek V4 Pro (Reasoning, Max Effort)44$0.76
MiniMax M344$1.60
GPT-5.3 Codex (xhigh)44$10.94
Claude Opus 4.6 (Adaptive Reasoning, Max Effort)44$20.00
GPT-5.5 (low)44$23.75
Claude Opus 4.7 (Non-reasoning, High Effort)43$20.00
MiMo-V2.5-Pro42$0.76
Kimi K2.7 Code42$3.24
GPT-5.242$10.94
MiniMax M2.741$1.21
Claude Haiku 4.540$4.00
Claude Opus 4.638$20.00
Gemini 3.1 Flash Lite35$1.19
Kimi K2.535$2.40
Claude Opus 4.535$20.00
MiniMax M2.534$0.97
LongCat-2.034$2.40
Mistral Large 316$1.25
Command A8$8.13

Der frühere Schnitt nur mit Input-Kosten. Nützlich bei input-lastiger Arbeit (RAG, Dokument-Q&A) statt output-lastig.

0255075100$0.10$0.30$1$3$10$30input USD / 1M tokens · log scale →← intelligence

Hover or tab any dot for name, score, and input price.

AnthropicOpenAIMistralAlibabaDeepSeekGoogleMoonshotMiniMaxxAIMetaZhipuXiaomiMeituanCohere

Ältere Releases, Spezialkonfigurationen (Codex CLI, ForgeCode) und Ad-hoc-Aggregationen. Wir zeigen ihre Quell-Scores, promoten sie aber erst mit voller Modellkarte in den Atlas.

Der höchste Intelligence-Receipt pro Family-Slice. Sanity-Check, dass eine einzelne Zahl keine Schwachstelle versteckt.

Claude Fable 575

Anthropic · Claude Fable

ReasoningCodingAgenticLong context
Reasoning
93
Coding
70
Agentic
100
Long context
70

83average across 4 tested families

Kimi K375

Moonshot · Kimi K3

ReasoningCodingAgenticLong context
Reasoning
94
Coding
59
Agentic
85
Long context
75

78average across 4 tested families

Claude Mythos Preview73

Anthropic · Claude Opus

ReasoningCodingAgentic
Reasoning
95
Coding
94
Agentic
84

91average across 3 tested families

Ein Modell ohne Zeile in einer Family wurde dort öffentlich nicht getestet. Das zeigen wir — statt Schwäche zu simulieren.

Benchmark-Atlas öffnen
Knowledge30Modelle abgedeckt
Reasoning74Modelle abgedeckt
Math25Modelle abgedeckt
Coding74Modelle abgedeckt
Agentic71Modelle abgedeckt
Multimodal8Modelle abgedeckt
Long context69Modelle abgedeckt
Tool use20Modelle abgedeckt
Performance0Modelle abgedeckt
Safety9Modelle abgedeckt
Human preference13Modelle abgedeckt