Benchmarks / Performance

AA output speed

Output tokens per second

Medianer Output-Tokens pro Sekunde nach dem ersten Chunk, gemessen am Default-API-Provider jedes Modells mit ~1k Input-Tokens (AA-Medium-Workload).

Artificial AnalysisPerformanceFlagshipAktivUnbekanntes KontaminationsrisikoSeit 2026
Was dieser Benchmark nicht misst
  • IDE- oder Chat-App-Latenz — nur First-Party-API-Routen, die AA als Default-Provider trackt.
  • Qualität oder Reasoning-Tiefe — nur Speed. Ein schnelles Modell kann schwere Aufgaben trotzdem verfehlen.
Analyse

Warum dieser Benchmark nützlich ist

Redaktionelle Einordnung ausstehendWir veröffentlichen zuerst Methodik und Ledger. Die benchmark-spezifische Analyse folgt nach der Desk-Prüfung.

Umfang

Abdeckung

Aufgabenfamilie
Performance
Format
Streaming-Generierung nach erstem Token; Median der letzten 72 Stunden im AA-Harness.
Bewertung
Mehr Tokens/s ist schneller. AA nutzt OpenAI tiktoken o200k_base für Token-Zählung.
Verantwortliche Stelle
Artificial Analysis
Lesehilfe

So liest du die Scores

Die Lesehilfe steht noch aus. Nutze bis zur Desk-Einordnung Aufgabenformat, Bewertungsmethode und Quelldaten im Ledger.

Blinde Flecken

Was er nicht abdeckt

  • IDE- oder Chat-App-Latenz — nur First-Party-API-Routen, die AA als Default-Provider trackt.
  • Qualität oder Reasoning-Tiefe — nur Speed. Ein schnelles Modell kann schwere Aufgaben trotzdem verfehlen.
Scores

Evidenz-Ledger

69 Zeilen
6969 Zeilen
401 t/sbester Score
69quellgeprüft
1Quellen
2026-07-21Quelldatum
69

api · api

Verteilung

Wo die Zeilen liegen

0255075100

Auf die Skala dieses Benchmarks normalisiert (0–100). Die Tabelle zeigt die Rohwerte.

Zeitverlauf

Neueste Belege

  1. Step 3.7 Flash401 t/s ·
  2. HyperNova 60B 2605381 t/s ·
  3. LFM2.5-8B-A1B343 t/s ·
  4. Gemini 3.1 Flash Lite315 t/s ·
  5. Gemini 3.5 Flash (medium)299 t/s ·

Scores nutzen die eigene Einheit und Skala dieses Benchmarks, keinen universellen Qualitätswert.

#ModellVeröffentlichungScoreHerkunftBeleglage
1Step 3.7 FlashStepFun2026-06-01401 t/s
2026-07-21
Quelle geprüft
2HyperNova 60B 2605Multiverse2026-05-06381 t/s
2026-07-21
Quelle geprüft
3LFM2.5-8B-A1BLiquid2026-06-08343 t/s
2026-07-21
Quelle geprüft
4Gemini 3.1 Flash LiteGoogle2026-05-07315 t/s
2026-07-21
Quelle geprüft
5Gemini 3.5 Flash (medium)Google2026-05-19299 t/s
2026-07-21
Quelle geprüft
6Gemini 3.5 FlashGoogle2026-05-19287 t/s
2026-07-21
Quelle geprüft
7Grok 4.20 ReasoningxAI2026-03-05227 t/s
2026-07-21
Quelle geprüft
8Gemini 3 Flash PreviewGoogle2025-12-17218 t/s
2026-07-21
Quelle geprüft
9Nemotron 3 Ultra 550B A55B (Reasoning)NVIDIA2026-06-04215 t/s
2026-07-21
Quelle geprüft
10Qwen3.7 MaxAlibaba2026-05-19207 t/s
2026-07-21
Quelle geprüft
11GPT-5.6 LunaOpenAI2026-07-09203 t/s
2026-07-21
Quelle geprüft
12GLM-5.2Zhipu2026-06-13196 t/s
2026-07-21
Quelle geprüft
13GPT-5.4 MiniOpenAI2026-03-17180 t/s
2026-07-21
Quelle geprüft
14GPT-5.4 NanoOpenAI2026-03-17163 t/s
2026-07-21
Quelle geprüft
15GPT-5.6 TerraOpenAI2026-07-09157 t/s
2026-07-21
Quelle geprüft
16OpenAI o3OpenAI2025-04-16155 t/s
2026-07-21
Quelle geprüft
17GPT 5.4OpenAI2026-03-05152 t/s
2026-07-21
Quelle geprüft
18Gemini 3.1 Pro PreviewGoogle2026-02-19136 t/s
2026-07-21
Quelle geprüft
19Gemma 4 12B (Reasoning)Google2026-06-07129 t/s
2026-07-21
Quelle geprüft
20GPT-5.3 Codex (xhigh)OpenAI2026-02-05127 t/s
2026-07-21
Quelle geprüft
21Grok 4.3xAI2026-04-30124 t/s
2026-07-21
Quelle geprüft
22Muse Spark 1.1Meta2026-07-09122 t/s
2026-07-21
Quelle geprüft
23Gemma 4 12B (Non-reasoning)Google2026-06-10119 t/s
2026-07-21
Quelle geprüft
24Llama 4 MaverickMeta2026-04-05110 t/s
2026-07-21
Quelle geprüft
25GPT-5.1OpenAI2025-11-13110 t/s
2026-07-21
Quelle geprüft
26MiniMax M3MiniMax2026-05-3197 t/s
2026-07-21
Quelle geprüft
27North Mini CodeCohere2026-06-0996 t/s
2026-07-21
Quelle geprüft
28GPT 5.5OpenAI2026-04-2390 t/s
2026-07-21
Quelle geprüft
29Claude Sonnet 5Anthropic2026-06-3088 t/s
2026-07-21
Quelle geprüft
30GPT-5.2OpenAI2025-12-1187 t/s
2026-07-21
Quelle geprüft
31MiniMax M2.5MiniMax2026-04-0187 t/s
2026-07-21
Quelle geprüft
32GLM-5.1Zhipu2026-04-0785 t/s
2026-07-21
Quelle geprüft
33Grok 4.5xAI2026-07-0877 t/s
2026-07-21
Quelle geprüft
34GPT-5.5 (high)OpenAI2026-04-2377 t/s
2026-07-21
Quelle geprüft
35Llama 4 ScoutMeta2026-04-0576 t/s
2026-07-21
Quelle geprüft
36GPT-5.5 (medium)OpenAI2026-04-2376 t/s
2026-07-21
Quelle geprüft
37GPT-5.5 (low)OpenAI2026-04-2376 t/s
2026-07-21
Quelle geprüft
38DeepSeek V4 Pro (Reasoning, Max Effort)DeepSeek2026-04-2473 t/s
2026-07-21
Quelle geprüft
39Claude Sonnet 4.6 (Adaptive Reasoning, Max Effort)Anthropic2026-02-1772 t/s
2026-07-21
Quelle geprüft
40Claude Fable 5Anthropic2026-06-0970 t/s
2026-07-21
Quelle geprüft
41Claude Opus 4.5Anthropic2025-11-2468 t/s
2026-07-21
Quelle geprüft
42GPT-5.6 SolOpenAI2026-07-0967 t/s
2026-07-21
Quelle geprüft
43Claude Opus 4.6 (Adaptive Reasoning, Max Effort)Anthropic2026-02-0564 t/s
2026-07-21
Quelle geprüft
44Mistral Large 3Mistral2025-12-0264 t/s
2026-07-21
Quelle geprüft
45Claude Opus 4.8Anthropic2026-05-2863 t/s
2026-07-21
Quelle geprüft
46Claude Opus 4.7Anthropic2026-04-1661 t/s
2026-07-21
Quelle geprüft
47Command ACohere2026-03-1561 t/s
2026-07-21
Quelle geprüft
48Claude Sonnet 4.6Anthropic2026-02-1760 t/s
2026-07-21
Quelle geprüft
49MiniMax M2.7MiniMax2026-04-1559 t/s
2026-07-21
Quelle geprüft
50MiMo-V2.5-ProXiaomi2026-04-2258 t/s
2026-07-21
Quelle geprüft
51Claude Opus 4.6Anthropic2026-02-0557 t/s
2026-07-21
Quelle geprüft
52Kimi K2.6Moonshot2026-04-2056 t/s
2026-07-21
Quelle geprüft
53Qwen 3.7 PlusAlibaba2026-06-0253 t/s
2026-07-21
Quelle geprüft
54Claude Opus 4.7 (Non-reasoning, High Effort)Anthropic2026-04-1650 t/s
2026-07-21
Quelle geprüft
55Kimi K2.5Moonshot2026-01-2750 t/s
2026-07-21
Quelle geprüft
56Kimi K2.7 CodeMoonshot2026-06-1247 t/s
2026-07-21
Quelle geprüft
57Kimi K3Moonshot2026-07-1638 t/s
2026-07-21
Quelle geprüft
58Gemma 4 31B ITGoogle2026-03-0136 t/s
2026-07-21
Quelle geprüft
59Claude 3 OpusAnthropic2024-03-040 t/s
2026-07-21
Quelle geprüft
60DeepSeek Coder V2DeepSeek2024-05-150 t/s
2026-07-21
Quelle geprüft
61DeepSeek R1DeepSeek2025-01-200 t/s
2026-07-21
Quelle geprüft
62Gemini 1.0 UltraGoogle2024-02-080 t/s
2026-07-21
Quelle geprüft
63Gemini 3 ProGoogle2025-11-180 t/s
2026-07-21
Quelle geprüft
64GPT-5.4 ProOpenAI2026-03-050 t/s
2026-07-21
Quelle geprüft
65GPT-5.5 ProOpenAI2026-04-230 t/s
2026-07-21
Quelle geprüft
66LongCat-2.0Meituan2026-06-290 t/s
2026-07-21
Quelle geprüft
67MiniCPM5-1B (Reasoning)OpenBMB2026-06-040 t/s
2026-07-21
Quelle geprüft
68Muse SparkOther2026-01-010 t/s
2026-07-21
Quelle geprüft
69OpenAI o1OpenAI2024-09-120 t/s
2026-07-21
Quelle geprüft
Methode

Was er abdeckt

Die Notiz zur Datenqualität steht aus. Jede Ledger-Zeile trägt weiterhin Quellen-URL, Quelldatum und Zeitpunkt des Einlesens.

Score-Obergrenze

Wo er an Grenzen stößt

Noch ist keine Obergrenze erfasst. Wenn sich Scores oben bündeln, kann der Benchmark Frontier-Modelle möglicherweise nicht mehr trennen.

Tools, die ihn ausweisen

Belege

Quellen und weiterführende Lektüre

The Pack · Redaktionsnewsletter

Neue Karten in dein Postfach. Kostenlos.

Eine kurze E-Mail, wenn eine Karte erscheint oder den Status wechselt. Kein Tracking, keine Drittanbieter-Analytics. Abmeldung mit einem Klick.