Modelle / DeepSeek

DeepSeek R1

DeepSeek R1 · Release 2025-01-20

DeepSeeks Reasoning-Modell Januar 2025. Open Weights, Chain-of-Thought-Stil. MATH 79,8 %, starke AIME-Werte mit Extended Thinking.

Self-Hosting-Reasoning-Route vor V4. Weiter relevant für reproduzierbare CoT-Forschung und lokale Inference-Stacks.

#161 von 184 im AA Index · aktueller Snapshot
13 AA Index · 15 Benchmark-Zeilen · 4 QuellenPosition ist benchmark-spezifisch — kein Cross-Family- oder Cross-Source-Ranking.
Composite57
Kontext128K
Input / 1M$0.55
Output / 1M$2.2
Wissensstichtagopen
Statuslightweight

Familienprofil

Bester veröffentlichter Score je abgedeckter Benchmark-Familie.

68/100 Ø
Wissen
87
Reasoning
81
Mathe
88
Coding
77
Agentisch
16
Langer Kontext
56
Tool-Nutzung
72

7 getestete Benchmark-Familien

Benchmark-Platzierungen

Wo DeepSeek R1 auf jeder öffentlichen Benchmark-Quelle mit Zeile steht. Rang zählt jedes Modell mit neuester Zeile im selben Test — kein universeller Qualitätsscore.

BenchmarkFamilyRangScoreQuelleDatum
LiveBenchReasoning#9/ 2164LiveBench leaderboard2026-04-15
MMLUKnowledge#14/ 2287DeepSeek R1 model card2025-01-20
BFCLTool use#18/ 2072Berkeley Function Calling Leaderboard V42026-04-15
AIMEMath#19/ 3788DeepSeek R1 model card2025-01-20
LiveCodeBenchCoding#19/ 3177Artificial Analysis2026-09-10
MATHMath#21/ 2580DeepSeek R1 model card2025-01-20
MMLU-ProKnowledge#23/ 3985Artificial Analysis2026-09-10
AA output speedPerformance#102/ 190Artificial Analysis2026-09-10
AA time to first tokenPerformance#102/ 190Artificial Analysis2026-09-10
IFBenchReasoning#120/ 12740Artificial Analysis2026-09-10
GPQA DiamondReasoning#135/ 19081Artificial Analysis2026-09-10
Humanity's Last ExamReasoning#140/ 18516Artificial Analysis2026-09-10
AA-LCRLong context#151/ 18256Artificial Analysis2026-09-10
Artificial Analysis Intelligence IndexReasoning#166/ 18813Artificial Analysis2026-09-10
Terminal-BenchAgentic#174/ 18916Artificial Analysis2026-09-10
Family-Kontext

Die drei höchstscorierenden kartierten Modelle pro Capability-Family. Wo DeepSeek R1 auftaucht, ist es hervorgehoben.

KnowledgeDeepSeek R1 · 87
  1. 1
    91
  2. 2
    91
  3. 3
    91
ReasoningDeepSeek R1 · 81
  1. 1
    96
  2. 2
    95
  3. 3
    95
MathDeepSeek R1 · 88
  1. 1
    99
  2. 2
    99
  3. 3
    99
CodingDeepSeek R1 · 77
  1. 1
    96
  2. 2
    96
  3. 3
    96
AgenticDeepSeek R1 · 16
  1. 1
    100
  2. 2
    100
  3. 3
    100
Long contextDeepSeek R1 · 56
  1. 1
    89
  2. 2
    85
  3. 3
    84
Tool useDeepSeek R1 · 72
  1. 1
    89
  2. 2
    87
  3. 3
    87
Neueste Belege

Benchmark-Zeilen im öffentlichen Ledger für DeepSeek R1 in den letzten 120 Tagen. Ältere Zeilen stehen in der vollen Tabelle unten.

10 neu
Family-Abdeckung

Ein hoher Composite, der eine schwache Family versteckt, ist eine Falle. Diese Balken zeigen Families ohne öffentlichen Test — und wo das Modell führt.

Wissen87
Reasoning81
Mathe88
Coding77
Agentisch16
Langer Kontext56
Tool-Nutzung72
Preis vs. Performance
0255075100$0.10$0.30$1$3$10$30Input-USD / 1M Tokens · log-Skala →← Intelligenz

Hover auf einen Punkt zeigt Name, Score und Input-Preis. Per Tastatur: die zwölf besten mit Tab durchgehen oder die Rangliste unten nutzen.

AnthropicOpenAIMistralAlibabaDeepSeekGoogleMoonshotMetaxAIMiniMaxZhipuXiaomiOtherMeituanCohereNVIDIA

Volles Benchmark-Ledger

Jeder Katalog-Benchmark für DeepSeek R1. Scores verlinken zur Originalquelle; Lücken heißen: noch keine öffentliche Zeile.

15 Quell-Zeilen

15 von 37 Katalog-Benchmarks haben eine belegte Zeile für DeepSeek R1.

Knowledge

Reasoning

Math

Coding

Agentic

Long context

Tool use

Performance

Quellen

The Pack · Redaktionsnewsletter

Neue Tools in dein Postfach. Kostenlos.

Eine kurze E-Mail, wenn ein Tool erscheint oder den Status wechselt. Kein Tracking, keine Drittanbieter-Analytics. Abmeldung mit einem Klick.