Modelle / DeepSeek

DeepSeek V4 Pro Max

DeepSeek · Release 2026-04-24

DeepSeeks Frontier-Open-Weights-Modell April 2026, führend im Open-Weights-Segment bei SWE-bench Verified (80,6 %) und Terminal-Bench 2.0 (67,9 %) zu $0,40 / $1,60 pro 1M Tokens. Günstigster Frontier-Preis auf dem öffentlichen Markt.

Default-Modell für selbstgehostete Agent-Infrastruktur, kostenkritische Deployments und Teams, die Open Weights mit Frontier-Coding-Scores brauchen.

#12 von 24 im Vals Index · aktueller Snapshot
56 Vals Index · 15 Benchmark-Zeilen · 11 QuellenPosition ist benchmark-spezifisch — kein Cross-Family- oder Cross-Source-Ranking.
Composite73
Kontext256K
Input / 1M$0.40
Output / 1M$1.6
Wissensstichtag2026-02-01
Statusflagship

Familienprofil

Bester veröffentlichter Score je abgedeckter Benchmark-Familie.

78/100 Ø
Wissen
90
Reasoning
76
Mathe
84
Coding
93
Agentisch
68
Langer Kontext
49
Tool-Nutzung
75
Sicherheit
86
Menschliche Präferenz
84

9 getestete Benchmark-Familien

Redaktionsnotiz
V4 Pro Max ist das Modell, das wir für selbstgehostete Agent-Infrastruktur nutzen, wo Compute und Data-Residency wichtiger sind als absolutes Best-in-Class-Reasoning. Die Preislücke zu Opus 4.8 beträgt etwa 37× beim Input und 47× beim Output — und die Open-Weights-Lizenz erlaubt den Betrieb auf eigener Hardware.
Benchmark-Platzierungen

Wo DeepSeek V4 Pro Max auf jeder öffentlichen Benchmark-Quelle mit Zeile steht. Rang zählt jedes Modell mit neuester Zeile im selben Test — kein universeller Qualitätsscore.

BenchmarkFamilyRangScoreQuelleDatum
LMArena (Chatbot Arena)Human preference#5/ 1384LMArena leaderboard2026-05-25
MCP AtlasTool use#6/ 1073MCP Atlas leaderboard2026-06-09
SWE-bench VerifiedCoding#7/ 2381SWE-bench official leaderboard2026-05-30
HELM SafetySafety#8/ 986Stanford HELM leaderboard2026-04-24
MMLUKnowledge#8/ 2290DeepSeek V4 release2026-04-24
HumanEvalCoding#9/ 1593DeepSeek V4 release2026-04-24
Vals IndexAgentic#12/ 2356Vals AI — Vals Index2026-06-04
LiveBenchReasoning#14/ 2162LiveBench leaderboard2026-04-15
LongBench v2Long context#14/ 1949LongBench v2 leaderboard2026-04-01
BFCLTool use#16/ 2075Berkeley Function Calling Leaderboard V42026-04-15
MATHMath#17/ 2584DeepSeek V4 release2026-04-24
MMLU-ProKnowledge#32/ 3976MMLU-Pro HuggingFace leaderboard2026-04-24
Terminal-BenchAgentic#49/ 18468Terminal-Bench 2.0 leaderboard2026-05-20
GPQA DiamondReasoning#152/ 18576Artificial Analysis GPQA Diamond evaluation2026-06-09
Family-Kontext

Die drei höchstscorierenden kartierten Modelle pro Capability-Family. Wo DeepSeek V4 Pro Max auftaucht, ist es hervorgehoben.

KnowledgeDeepSeek V4 Pro Max · 90
  1. 1
    91
  2. 2
    91
  3. 3
    91
ReasoningDeepSeek V4 Pro Max · 76
  1. 1
    95
  2. 2
    95
  3. 3
    95
MathDeepSeek V4 Pro Max · 84
  1. 1
    99
  2. 2
    99
  3. 3
    99
CodingDeepSeek V4 Pro Max · 93
  1. 1
    96
  2. 2
    96
  3. 3
    96
AgenticDeepSeek V4 Pro Max · 68
  1. 1
    100
  2. 2
    100
  3. 3
    100
Long contextDeepSeek V4 Pro Max · 49
  1. 1
    83
  2. 2
    83
  3. 3
    81
Tool useDeepSeek V4 Pro Max · 75
  1. 1
    89
  2. 2
    87
  3. 3
    87
SafetyDeepSeek V4 Pro Max · 86
  1. 1
    92
  2. 2
    92
  3. 3
    91
Human preferenceDeepSeek V4 Pro Max · 84
  1. 1
    95
  2. 2
    92
  3. 3
    91
Neueste Belege

Benchmark-Zeilen im öffentlichen Ledger für DeepSeek V4 Pro Max in den letzten 120 Tagen. Ältere Zeilen stehen in der vollen Tabelle unten.

7 neu
Family-Abdeckung

Ein hoher Composite, der eine schwache Family versteckt, ist eine Falle. Diese Balken zeigen Families ohne öffentlichen Test — und wo das Modell führt.

Wissen90
Reasoning76
Mathe84
Coding93
Agentisch68
Langer Kontext49
Tool-Nutzung75
Sicherheit86
Menschliche Präferenz84
Preis vs. Performance
0255075100$0.10$0.30$1$3$10$30Input-USD / 1M Tokens · log-Skala →← Intelligenz

Hover auf einen Punkt zeigt Name, Score und Input-Preis. Per Tastatur: die zwölf besten mit Tab durchgehen oder die Rangliste unten nutzen.

AnthropicOpenAIMistralAlibabaDeepSeekGoogleMoonshotMetaMiniMaxxAIZhipuXiaomiOtherMeituanCohereNVIDIA

Volles Benchmark-Ledger

Jeder Katalog-Benchmark für DeepSeek V4 Pro Max. Scores verlinken zur Originalquelle; Lücken heißen: noch keine öffentliche Zeile.

15 Quell-Zeilen

14 von 37 Katalog-Benchmarks haben eine belegte Zeile für DeepSeek V4 Pro Max.

Knowledge

Reasoning

Math

Coding

Agentic

Long context

Tool use

Safety

Human preference

Changelog
  1. DeepSeek V4 Pro Max mit Open Weights und Frontier-Coding-Scores veröffentlicht.
  2. DeepSeek V3.2 als Flaggschiff-Open-Weights-Modell ausgemustert.
Quellen