Modelle / DeepSeek

DeepSeek R1

DeepSeek R1 · Release 2025-01-20

DeepSeeks Reasoning-Modell Januar 2025. Open Weights, Chain-of-Thought-Stil. MATH 79,8 %, starke AIME-Werte mit Extended Thinking.

Self-Hosting-Reasoning-Route vor V4. Weiter relevant für reproduzierbare CoT-Forschung und lokale Inference-Stacks.

#147 von 168 im AA Index · aktueller Snapshot
20 AA Index · 16 Benchmark-Zeilen · 4 QuellenPosition ist benchmark-spezifisch — kein Cross-Family- oder Cross-Source-Ranking.
Composite57
Kontext128K
Input / 1M$0.55
Output / 1M$2.2
Wissensstichtagopen
Statuslightweight

Familienprofil

Bester veröffentlichter Score je abgedeckter Benchmark-Familie.

68/100 Ø
Wissen
87
Reasoning
81
Mathe
88
Coding
77
Agentisch
16
Langer Kontext
57
Tool-Nutzung
72

7 getestete Benchmark-Familien

Benchmark-Platzierungen

Wo DeepSeek R1 auf jeder öffentlichen Benchmark-Quelle mit Zeile steht. Rang zählt jedes Modell mit neuester Zeile im selben Test — kein universeller Qualitätsscore.

BenchmarkFamilyRangScoreQuelleDatum
LiveBenchReasoning#9/ 2164LiveBench leaderboard2026-04-15
MMLUKnowledge#14/ 2287DeepSeek R1 model card2025-01-20
BFCLTool use#18/ 2072Berkeley Function Calling Leaderboard V42026-04-15
AIMEMath#19/ 3788DeepSeek R1 model card2025-01-20
LiveCodeBenchCoding#19/ 3177Artificial Analysis2026-09-01
MATHMath#21/ 2580DeepSeek R1 model card2025-01-20
MMLU-ProKnowledge#23/ 3985Artificial Analysis2026-09-01
AA time to first tokenPerformance#102/ 186Artificial Analysis2026-09-01
AA output speedPerformance#103/ 187Artificial Analysis2026-09-01
IFBenchReasoning#121/ 12740Artificial Analysis2026-09-01
SciCodeCoding#123/ 18040Artificial Analysis2026-09-01
GPQA DiamondReasoning#130/ 18581Artificial Analysis2026-09-01
Humanity's Last ExamReasoning#136/ 18016Artificial Analysis2026-09-01
AA-LCRLong context#145/ 17957Artificial Analysis2026-09-01
Artificial Analysis Intelligence IndexReasoning#166/ 18720Artificial Analysis2026-09-01
Terminal-BenchAgentic#171/ 18416Artificial Analysis2026-09-01
Family-Kontext

Die drei höchstscorierenden kartierten Modelle pro Capability-Family. Wo DeepSeek R1 auftaucht, ist es hervorgehoben.

KnowledgeDeepSeek R1 · 87
  1. 1
    91
  2. 2
    91
  3. 3
    91
ReasoningDeepSeek R1 · 81
  1. 1
    95
  2. 2
    95
  3. 3
    95
MathDeepSeek R1 · 88
  1. 1
    99
  2. 2
    99
  3. 3
    99
CodingDeepSeek R1 · 77
  1. 1
    96
  2. 2
    96
  3. 3
    96
AgenticDeepSeek R1 · 16
  1. 1
    100
  2. 2
    100
  3. 3
    100
Long contextDeepSeek R1 · 57
  1. 1
    83
  2. 2
    83
  3. 3
    81
Tool useDeepSeek R1 · 72
  1. 1
    89
  2. 2
    87
  3. 3
    87
Neueste Belege

Benchmark-Zeilen im öffentlichen Ledger für DeepSeek R1 in den letzten 120 Tagen. Ältere Zeilen stehen in der vollen Tabelle unten.

11 neu
Family-Abdeckung

Ein hoher Composite, der eine schwache Family versteckt, ist eine Falle. Diese Balken zeigen Families ohne öffentlichen Test — und wo das Modell führt.

Wissen87
Reasoning81
Mathe88
Coding77
Agentisch16
Langer Kontext57
Tool-Nutzung72
Preis vs. Performance
0255075100$0.10$0.30$1$3$10$30Input-USD / 1M Tokens · log-Skala →← Intelligenz

Hover auf einen Punkt zeigt Name, Score und Input-Preis. Per Tastatur: die zwölf besten mit Tab durchgehen oder die Rangliste unten nutzen.

AnthropicOpenAIMistralAlibabaDeepSeekGoogleMoonshotMetaMiniMaxxAIZhipuXiaomiOtherMeituanCohereNVIDIA

Volles Benchmark-Ledger

Jeder Katalog-Benchmark für DeepSeek R1. Scores verlinken zur Originalquelle; Lücken heißen: noch keine öffentliche Zeile.

16 Quell-Zeilen

16 von 37 Katalog-Benchmarks haben eine belegte Zeile für DeepSeek R1.

Knowledge

Reasoning

Math

Coding

Agentic

Long context

Tool use

Performance

Quellen