VerdictPal · Redaktions-Desk · 2026VerdictPal
Benchmarks

Jeder Benchmark, ehrlich gelesen.

Wähle ein Modell und sieh die öffentlichen Benchmark-Belege, die VerdictPal dafür hat. Jede Zeile ist datiert, belegt und mit Caveats versehen. Die Seite liest sich wie Evidenz, nicht wie ein Scoreboard. Für die modellzentrierte Ansicht (Ränge, Familien, Quellen-Ledger) öffne den modellzentrierten Atlas.
Das ist kein Leaderboard
Scores wandern, Anbieter cherry-picken, alte Benchmarks lecken in Trainingsdaten. Jede Zahl ist datiert, belegt und mit Kontaminationsrisiko markiert. Lies es wie Evidenz, nicht wie ein Scoreboard.
22
Öffentliche Benchmarks
944
Ledger-Zeilen
797/944
Quellgeprüfte Scores
14
Belegte Quellen

Der Atlas ist nach dem gruppiert, was der Benchmark messen will. Score-Zeilen sitzen unter jedem Test, damit unvergleichbare Metriken nicht in ein Fake-Ranking kollabieren.

AktivGesättigtGelöst
Archiv · 7 EinträgeGesättigt, gelöst oder eingestellt
Papers / model cardsMassive Multitask Language UnderstandingMMLU
WissenGesättigtHohes Kontaminationsrisiko

Breites Multiple-Choice-Wissen über 57 Fächer — von US-Geschichte über Hochschulphysik bis Jura — im Vier-Optionen-Prüfungsformat.

Sagt dir nicht · Schlussfolgern unter Unsicherheit — ein Modell kann den richtigen Buchstaben erraten, ohne die Frage zu verstehen.

22 Score-Zeilen · 2 Quellen · aktualisiert 2026-06-09

SWE-benchSWE-bench Verified
CodingGesättigtMittleres Kontaminationsrisiko

Ob ein Modell echte GitHub-Issues aus populären Python-Repos lösen kann — es muss einen Patch erzeugen, der die versteckte Testsuite besteht. 'Verified' ist eine 500-Issue-Teilmenge, von Menschen validiert.

Sagt dir nicht · Nichts außer Python — die Suite ist Python-only und sagt wenig über andere Sprachen oder Frontend aus.

23 Score-Zeilen · 2 Quellen · aktualisiert 2026-07-01

American Invitational Mathematics ExaminationAIME
MatheAusgedientMittleres Kontaminationsrisiko

Schwere Schulwettbewerbs-Mathematik: 15 Aufgaben mit Ganzzahl-Antwort pro Prüfung. Als Reasoning-Eval genutzt, weil jedes neue Paper anfangs kontaminationsresistent ist — bis es durchsickert.

Sagt dir nicht · Winzige Stichprobe (15 Aufgaben/Jahr) — eine Aufgabe ist ~6,7 %, Einzelläufe sind verrauscht; pass@k oder mehrere Seeds verlangen.

19 Score-Zeilen · 3 Quellen · aktualisiert 2026-07-21

Vendor claimsHumanEval
CodingAusgedientHohes Kontaminationsrisiko

Ob ein Modell aus einem Docstring eine kurze Python-Funktion schreibt, die einige Unit-Tests besteht — der ursprüngliche Code-Generierungs-Benchmark.

Sagt dir nicht · Echte Softwarearbeit — 164 eigenständige Spielfunktionen sind weit von einer Produktions-Codebasis entfernt.

15 Score-Zeilen · 3 Quellen · aktualisiert 2026-06-09

IFBenchInstruction-Following Benchmark
ReasoningAusgedientMittleres Kontaminationsrisiko

Präzises Instruction-Following bei neuen Constraints — testet, ob Modelle komplexe, ungesehene Formatregeln ohne Abdriften befolgen.

Sagt dir nicht · Frontier-Trennung heute — Artificial Analysis entfernte IFBench aus dem Intelligence Index v4.1, weil Frontier-Modelle ihn sättigten.

57 Score-Zeilen · 1 Quelle · aktualisiert 2026-07-21

Vendor claimsMATH
MatheAusgedientHohes Kontaminationsrisiko

Schritt-für-Schritt-Lösungen zu 12.500 Wettbewerbs-Mathematikaufgaben (AMC/AIME-Stil), bewertet an der finalen Antwort.

Sagt dir nicht · Ob die Herleitung korrekt ist — nur die Endantwort zählt, eine richtige Antwort aus falschem Weg wird gewertet.

20 Score-Zeilen · 3 Quellen · aktualisiert 2026-07-21

τ³-Bench Bankingtau3-bench-banking
AgentischAusgedientNiedriges Kontaminationsrisiko

Dual-Control-Agent-User-Simulation für Banking-Aufgaben: 97 Szenarien mit Wissens-Retrieval, Backend-Datenbank-Zustandsbewertung, pass@1. 14 % Gewicht im AA Intelligence Index v4.1.

Sagt dir nicht · Echte Bank-Integrationen — simulierte Umgebung mit kontrollierten APIs, keine Produktions-Kernbankensysteme.

64 Score-Zeilen · 1 Quelle · aktualisiert 2026-07-21

Evidenz-Konsole — Modell-Lookup (14 Quellen)

Modell-Belege nachschlagen

Wähle ein oder zwei Modelle aus dem Ledger. Scores bleiben nach Benchmark gruppiert, damit Arena-Elo nie gegen MMLU-Genauigkeit gerankt wird.

Letzte Ledger-Aktualisierung: 2026-07-21Statischer Snapshot; Quellen unten verlinkt2 / 2 Modellplätzen belegt
Modell-Evidenz — 54 Zeilen
54 Zeilen gefunden
OpenAI

GPT 5.5

Veröffentlicht 2026-04-23

28 Zeilen
Wissen
MMLU-Pro

MMLU-Pro

81.6%
MMLU-Pro HuggingFace leaderboardAudit nötigRang 2

Quelle· Quelle vom 2026-04-23· eingelesen 2026-06-09

Reasoning
GPQA Diamond

GPQA Diamond accuracy (CoT)

81.2%
GPQA Diamond paper leaderboardQuelle geprüftRang 3

Quelle· Quelle vom 2026-05-15· eingelesen 2026-06-05

IFBench

IFBench (AA run)

75.85%
Artificial AnalysisQuelle geprüft

Quelle· Quelle vom 2026-07-21· eingelesen 2026-07-21

LiveBench

LiveBench

69.8%
LiveBench leaderboardAudit nötigRang 3

Quelle· Quelle vom 2026-04-15· eingelesen 2026-06-09

Mathe
MATH

MATH

89.6%
OpenAI model release notesAudit nötigRang 2

Quelle· Quelle vom 2026-04-23· eingelesen 2026-06-09

Coding
DeepSWE

DeepSWE pass@1 (xhigh effort)

67%
DeepSWE leaderboard v1.1Quelle geprüftRang 2

Quelle· Quelle vom 2026-06-20· eingelesen 2026-06-22

HumanEval

HumanEval

96.2% pass@1
CodeSOTA HumanEval leaderboardAudit nötigRang 2

Quelle· Quelle vom 2026-04-23· eingelesen 2026-06-09

SciCode

SciCode (AA run)

56.1%
Artificial AnalysisQuelle geprüft

Quelle· Quelle vom 2026-07-21· eingelesen 2026-07-21

SWE-bench Verified

SWE-bench Verified

82.5%
SWE-bench Verified leaderboardQuelle geprüft

Quelle· Quelle vom 2026-06-01· eingelesen 2026-06-09

Agentisch
GDPval

GDPval-AA v2

1531
Artificial Analysis — GDPval-AA v2Quelle geprüftRang 3

Quelle· Quelle vom 2026-06-17· eingelesen 2026-06-22

τ³-Bench Banking

τ³-Bench Banking pass@1

54.8%
Artificial Analysis — τ³-Bench BankingQuelle geprüftRang 2

Quelle· Quelle vom 2026-06-17· eingelesen 2026-06-22

Terminal-Bench

Terminal-Bench 2.0 (audited harness)

82%
Terminal-Bench 2.0 leaderboardQuelle geprüftRang 2

Quelle· Quelle vom 2026-05-20· eingelesen 2026-06-05

Vals Index

Vals Index

68%
Vals AI — Vals IndexQuelle geprüft

Quelle· Quelle vom 2026-06-04· eingelesen 2026-06-09

Vending-Bench 2

Final bank balance (USD)

7523.84
Andon Labs Vending-Bench 2Quelle geprüftRang 4

Quelle· Quelle vom 2026-06-01· eingelesen 2026-06-22

Multimodal
Langer Kontext
LongBench v2

LongBench v2

56.1%
LongBench v2 leaderboardAudit nötigRang 3

Quelle· Quelle vom 2026-04-01· eingelesen 2026-06-09

Tool-Nutzung
MCP Atlas

MCP Atlas

77.8%
MCP Atlas leaderboardAudit nötigRang 3

Quelle· Quelle vom 2026-06-09· eingelesen 2026-06-09

Performance
AA output speed

Median output tokens/s (1k prompt, default provider)

90 t/s
Artificial AnalysisQuelle geprüft

Quelle· Quelle vom 2026-07-21· eingelesen 2026-07-21

AA time to first token

Median time to first token (1k prompt, default provider)

31.38s
Artificial AnalysisQuelle geprüft

Quelle· Quelle vom 2026-07-21· eingelesen 2026-07-21

Sicherheit
HELM Safety

HELM Safety

90.6%
Stanford HELM leaderboardAudit nötigRang 3

Quelle· Quelle vom 2026-04-23· eingelesen 2026-06-09

Menschliche Präferenz
LMArena (Chatbot Arena)

LMArena Elo (Style Controlled)

1473
LMArena leaderboardQuelle geprüftRang 1

Quelle· Quelle vom 2026-05-25· eingelesen 2026-06-05

Anthropic

Claude Opus 4.8

Veröffentlicht 2026-05-28

26 Zeilen
Wissen
MMLU-Pro

MMLU-Pro

82.4%
MMLU-Pro HuggingFace leaderboardAudit nötigRang 1

Quelle· Quelle vom 2026-05-28· eingelesen 2026-06-09

Reasoning
GPQA Diamond

GPQA Diamond accuracy (CoT)

79.8%
GPQA Diamond paper leaderboardQuelle geprüftRang 4

Quelle· Quelle vom 2026-05-15· eingelesen 2026-06-05

IFBench

IFBench (AA run)

62.24%
Artificial AnalysisQuelle geprüft

Quelle· Quelle vom 2026-07-21· eingelesen 2026-07-21

LiveBench

LiveBench

70.8%
LiveBench leaderboardAudit nötigRang 2

Quelle· Quelle vom 2026-04-15· eingelesen 2026-06-09

Mathe
MATH

MATH

88.4%
Anthropic Claude 4 familyAudit nötigRang 3

Quelle· Quelle vom 2026-05-28· eingelesen 2026-06-09

Coding
DeepSWE

DeepSWE pass@1 (max effort)

59%
DeepSWE leaderboard v1.1Quelle geprüftRang 3

Quelle· Quelle vom 2026-06-20· eingelesen 2026-06-22

HumanEval

HumanEval

95.8% pass@1
Anthropic Claude 4 familyAudit nötigRang 3

Quelle· Quelle vom 2026-05-28· eingelesen 2026-06-09

SciCode

SciCode (AA run)

53.5%
Artificial AnalysisQuelle geprüft

Quelle· Quelle vom 2026-07-21· eingelesen 2026-07-21

SWE-bench Verified

SWE-bench Verified

88.6%
SWE-bench official leaderboardQuelle geprüftRang 2

Quelle· Quelle vom 2026-05-30· eingelesen 2026-06-05

Agentisch
GDPval

GDPval-AA v2

1638
Artificial Analysis — GDPval-AA v2Quelle geprüftRang 2

Quelle· Quelle vom 2026-06-17· eingelesen 2026-06-22

τ³-Bench Banking

τ³-Bench Banking (AA run)

27.63%
Artificial AnalysisQuelle geprüft

Quelle· Quelle vom 2026-07-21· eingelesen 2026-07-21

Terminal-Bench

Terminal-Bench 2.0 (audited harness)

74.6%
Terminal-Bench 2.0 leaderboardQuelle geprüftRang 5

Quelle· Quelle vom 2026-05-20· eingelesen 2026-06-05

Vals Index

Vals Index

70.4%
Vals AI — Vals IndexQuelle geprüft

Quelle· Quelle vom 2026-06-04· eingelesen 2026-06-09

Multimodal
Langer Kontext
LongBench v2

LongBench v2

58.4%
LongBench v2 leaderboardAudit nötigRang 1

Quelle· Quelle vom 2026-04-01· eingelesen 2026-06-09

Tool-Nutzung
MCP Atlas

MCP Atlas

79.2%
MCP Atlas leaderboardAudit nötigRang 2

Quelle· Quelle vom 2026-06-09· eingelesen 2026-06-09

Performance
AA output speed

Median output tokens/s (1k prompt, default provider)

63 t/s
Artificial AnalysisQuelle geprüft

Quelle· Quelle vom 2026-07-21· eingelesen 2026-07-21

AA time to first token

Median time to first token (1k prompt, default provider)

30.13s
Artificial AnalysisQuelle geprüft

Quelle· Quelle vom 2026-07-21· eingelesen 2026-07-21

Sicherheit
HELM Safety

HELM Safety

91.8%
Stanford HELM leaderboardAudit nötigRang 2

Quelle· Quelle vom 2026-05-28· eingelesen 2026-06-09

Menschliche Präferenz
LMArena (Chatbot Arena)

LMArena Elo (Style Controlled)

1462
LMArena leaderboardQuelle geprüftRang 2

Quelle· Quelle vom 2026-05-25· eingelesen 2026-06-05

Score-Datenbank — 944 Ledger-Zeilen

Diese Datenbank trägt den Evidenz-Überblick. Sie enthält den geprüften Snapshot und ältere Score-Zeilen aus Benchmark-Seiten.

673

api · api

Vals AI20

manual-snapshot · manual

SWE-bench22

official-json · scheduled

Terminal-Bench16

official-page · manual

LMArena13

official-page · manual

CodeSOTA6

manual-snapshot · manual

Stanford HELM9

official-page · manual

Berkeley BFCL20

official-page · manual

LongBench19

official-page · manual

LiveBench21

official-page · manual

Papers / model cards80

manual-snapshot · manual

Vendor claims34

manual-snapshot · manual

DeepSWE6

official-page · manual

Vending-Bench5

official-page · manual

ModellVeröffentlichungBenchmarkScoreSkala innerhalb des BenchmarksQuelleDatum
Claude 3 OpusAnthropic2024-03-04AA output speedPerformance · Aktiv0 t/sArtificial Analysis2026-07-21
Claude Fable 5Anthropic2026-06-09AA output speedPerformance · Aktiv70 t/sArtificial Analysis2026-07-21
Claude Opus 4.5Anthropic2025-11-24AA output speedPerformance · Aktiv68 t/sArtificial Analysis2026-07-21
Claude Opus 4.6Anthropic2026-02-05AA output speedPerformance · Aktiv57 t/sArtificial Analysis2026-07-21
Claude Opus 4.6 (Adaptive Reasoning, Max Effort)Anthropic2026-02-05AA output speedPerformance · Aktiv64 t/sArtificial Analysis2026-07-21
Claude Opus 4.7Anthropic2026-04-16AA output speedPerformance · Aktiv61 t/sArtificial Analysis2026-07-21
Claude Opus 4.7 (Non-reasoning, High Effort)Anthropic2026-04-16AA output speedPerformance · Aktiv50 t/sArtificial Analysis2026-07-21
Claude Opus 4.8Anthropic2026-05-28AA output speedPerformance · Aktiv63 t/sArtificial Analysis2026-07-21
Claude Sonnet 4.6Anthropic2026-02-17AA output speedPerformance · Aktiv60 t/sArtificial Analysis2026-07-21
Claude Sonnet 4.6 (Adaptive Reasoning, Max Effort)Anthropic2026-02-17AA output speedPerformance · Aktiv72 t/sArtificial Analysis2026-07-21
Claude Sonnet 5Anthropic2026-06-30AA output speedPerformance · Aktiv88 t/sArtificial Analysis2026-07-21
Command ACohere2026-03-15AA output speedPerformance · Aktiv61 t/sArtificial Analysis2026-07-21
DeepSeek Coder V2DeepSeek2024-05-15AA output speedPerformance · Aktiv0 t/sArtificial Analysis2026-07-21
DeepSeek R1DeepSeek2025-01-20AA output speedPerformance · Aktiv0 t/sArtificial Analysis2026-07-21
DeepSeek V4 Pro (Reasoning, Max Effort)DeepSeek2026-04-24AA output speedPerformance · Aktiv73 t/sArtificial Analysis2026-07-21
Gemini 1.0 UltraGoogle2024-02-08AA output speedPerformance · Aktiv0 t/sArtificial Analysis2026-07-21
Gemini 3 Flash PreviewGoogle2025-12-17AA output speedPerformance · Aktiv218 t/sArtificial Analysis2026-07-21
Gemini 3 ProGoogle2025-11-18AA output speedPerformance · Aktiv0 t/sArtificial Analysis2026-07-21
Gemini 3.1 Flash LiteGoogle2026-05-07AA output speedPerformance · Aktiv315 t/sArtificial Analysis2026-07-21
Gemini 3.1 Pro PreviewGoogle2026-02-19AA output speedPerformance · Aktiv136 t/sArtificial Analysis2026-07-21
Gemini 3.5 FlashGoogle2026-05-19AA output speedPerformance · Aktiv287 t/sArtificial Analysis2026-07-21
Gemini 3.5 Flash (medium)Google2026-05-19AA output speedPerformance · Aktiv299 t/sArtificial Analysis2026-07-21
Gemma 4 12B (Non-reasoning)Google2026-06-10AA output speedPerformance · Aktiv119 t/sArtificial Analysis2026-07-21
Gemma 4 12B (Reasoning)Google2026-06-07AA output speedPerformance · Aktiv129 t/sArtificial Analysis2026-07-21
Gemma 4 31B ITGoogle2026-03-01AA output speedPerformance · Aktiv36 t/sArtificial Analysis2026-07-21
GLM-5.1Zhipu2026-04-07AA output speedPerformance · Aktiv85 t/sArtificial Analysis2026-07-21
GLM-5.2Zhipu2026-06-13AA output speedPerformance · Aktiv196 t/sArtificial Analysis2026-07-21
GPT 5.4OpenAI2026-03-05AA output speedPerformance · Aktiv152 t/sArtificial Analysis2026-07-21
GPT 5.5OpenAI2026-04-23AA output speedPerformance · Aktiv90 t/sArtificial Analysis2026-07-21
GPT-5.1OpenAI2025-11-13AA output speedPerformance · Aktiv110 t/sArtificial Analysis2026-07-21
GPT-5.2OpenAI2025-12-11AA output speedPerformance · Aktiv87 t/sArtificial Analysis2026-07-21
GPT-5.3 Codex (xhigh)OpenAI2026-02-05AA output speedPerformance · Aktiv127 t/sArtificial Analysis2026-07-21
GPT-5.4 MiniOpenAI2026-03-17AA output speedPerformance · Aktiv180 t/sArtificial Analysis2026-07-21
GPT-5.4 NanoOpenAI2026-03-17AA output speedPerformance · Aktiv163 t/sArtificial Analysis2026-07-21
GPT-5.4 ProOpenAI2026-03-05AA output speedPerformance · Aktiv0 t/sArtificial Analysis2026-07-21
GPT-5.5 (high)OpenAI2026-04-23AA output speedPerformance · Aktiv77 t/sArtificial Analysis2026-07-21
GPT-5.5 (low)OpenAI2026-04-23AA output speedPerformance · Aktiv76 t/sArtificial Analysis2026-07-21
GPT-5.5 (medium)OpenAI2026-04-23AA output speedPerformance · Aktiv76 t/sArtificial Analysis2026-07-21
GPT-5.5 ProOpenAI2026-04-23AA output speedPerformance · Aktiv0 t/sArtificial Analysis2026-07-21
GPT-5.6 LunaOpenAI2026-07-09AA output speedPerformance · Aktiv203 t/sArtificial Analysis2026-07-21
GPT-5.6 SolOpenAI2026-07-09AA output speedPerformance · Aktiv67 t/sArtificial Analysis2026-07-21
GPT-5.6 TerraOpenAI2026-07-09AA output speedPerformance · Aktiv157 t/sArtificial Analysis2026-07-21
Grok 4.20 ReasoningxAI2026-03-05AA output speedPerformance · Aktiv227 t/sArtificial Analysis2026-07-21
Grok 4.3xAI2026-04-30AA output speedPerformance · Aktiv124 t/sArtificial Analysis2026-07-21
Grok 4.5xAI2026-07-08AA output speedPerformance · Aktiv77 t/sArtificial Analysis2026-07-21
HyperNova 60B 2605Multiverse2026-05-06AA output speedPerformance · Aktiv381 t/sArtificial Analysis2026-07-21
Kimi K2.5Moonshot2026-01-27AA output speedPerformance · Aktiv50 t/sArtificial Analysis2026-07-21
Kimi K2.6Moonshot2026-04-20AA output speedPerformance · Aktiv56 t/sArtificial Analysis2026-07-21
Kimi K2.7 CodeMoonshot2026-06-12AA output speedPerformance · Aktiv47 t/sArtificial Analysis2026-07-21
Kimi K3Moonshot2026-07-16AA output speedPerformance · Aktiv38 t/sArtificial Analysis2026-07-21
LFM2.5-8B-A1BLiquid2026-06-08AA output speedPerformance · Aktiv343 t/sArtificial Analysis2026-07-21
Llama 4 MaverickMeta2026-04-05AA output speedPerformance · Aktiv110 t/sArtificial Analysis2026-07-21
Llama 4 ScoutMeta2026-04-05AA output speedPerformance · Aktiv76 t/sArtificial Analysis2026-07-21
LongCat-2.0Meituan2026-06-29AA output speedPerformance · Aktiv0 t/sArtificial Analysis2026-07-21
MiMo-V2.5-ProXiaomi2026-04-22AA output speedPerformance · Aktiv58 t/sArtificial Analysis2026-07-21
MiniCPM5-1B (Reasoning)OpenBMB2026-06-04AA output speedPerformance · Aktiv0 t/sArtificial Analysis2026-07-21
MiniMax M2.5MiniMax2026-04-01AA output speedPerformance · Aktiv87 t/sArtificial Analysis2026-07-21
MiniMax M2.7MiniMax2026-04-15AA output speedPerformance · Aktiv59 t/sArtificial Analysis2026-07-21
MiniMax M3MiniMax2026-05-31AA output speedPerformance · Aktiv97 t/sArtificial Analysis2026-07-21
Mistral Large 3Mistral2025-12-02AA output speedPerformance · Aktiv64 t/sArtificial Analysis2026-07-21
Muse SparkOther2026-01-01AA output speedPerformance · Aktiv0 t/sArtificial Analysis2026-07-21
Muse Spark 1.1Meta2026-07-09AA output speedPerformance · Aktiv122 t/sArtificial Analysis2026-07-21
Nemotron 3 Ultra 550B A55B (Reasoning)NVIDIA2026-06-04AA output speedPerformance · Aktiv215 t/sArtificial Analysis2026-07-21
North Mini CodeCohere2026-06-09AA output speedPerformance · Aktiv96 t/sArtificial Analysis2026-07-21
OpenAI o1OpenAI2024-09-12AA output speedPerformance · Aktiv0 t/sArtificial Analysis2026-07-21
OpenAI o3OpenAI2025-04-16AA output speedPerformance · Aktiv155 t/sArtificial Analysis2026-07-21
Qwen 3.7 PlusAlibaba2026-06-02AA output speedPerformance · Aktiv53 t/sArtificial Analysis2026-07-21
Qwen3.7 MaxAlibaba2026-05-19AA output speedPerformance · Aktiv207 t/sArtificial Analysis2026-07-21
Step 3.7 FlashStepFun2026-06-01AA output speedPerformance · Aktiv401 t/sArtificial Analysis2026-07-21
Claude 3 OpusAnthropic2024-03-04AA time to first tokenPerformance · Aktiv0.00sArtificial Analysis2026-07-21
Claude Fable 5Anthropic2026-06-09AA time to first tokenPerformance · Aktiv68.33sArtificial Analysis2026-07-21
Claude Opus 4.5Anthropic2025-11-24AA time to first tokenPerformance · Aktiv1.32sArtificial Analysis2026-07-21
Claude Opus 4.6Anthropic2026-02-05AA time to first tokenPerformance · Aktiv1.85sArtificial Analysis2026-07-21
Claude Opus 4.6 (Adaptive Reasoning, Max Effort)Anthropic2026-02-05AA time to first tokenPerformance · Aktiv14.02sArtificial Analysis2026-07-21
Claude Opus 4.7Anthropic2026-04-16AA time to first tokenPerformance · Aktiv16.72sArtificial Analysis2026-07-21
Claude Opus 4.7 (Non-reasoning, High Effort)Anthropic2026-04-16AA time to first tokenPerformance · Aktiv1.55sArtificial Analysis2026-07-21
Claude Opus 4.8Anthropic2026-05-28AA time to first tokenPerformance · Aktiv30.13sArtificial Analysis2026-07-21
Claude Sonnet 4.6Anthropic2026-02-17AA time to first tokenPerformance · Aktiv1.18sArtificial Analysis2026-07-21
Claude Sonnet 4.6 (Adaptive Reasoning, Max Effort)Anthropic2026-02-17AA time to first tokenPerformance · Aktiv57.98sArtificial Analysis2026-07-21
Claude Sonnet 5Anthropic2026-06-30AA time to first tokenPerformance · Aktiv88.49sArtificial Analysis2026-07-21
Command ACohere2026-03-15AA time to first tokenPerformance · Aktiv0.36sArtificial Analysis2026-07-21
DeepSeek Coder V2DeepSeek2024-05-15AA time to first tokenPerformance · Aktiv0.00sArtificial Analysis2026-07-21
DeepSeek R1DeepSeek2025-01-20AA time to first tokenPerformance · Aktiv0.00sArtificial Analysis2026-07-21
DeepSeek V4 Pro (Reasoning, Max Effort)DeepSeek2026-04-24AA time to first tokenPerformance · Aktiv1.01sArtificial Analysis2026-07-21
Gemini 1.0 UltraGoogle2024-02-08AA time to first tokenPerformance · Aktiv0.00sArtificial Analysis2026-07-21
Gemini 3 Flash PreviewGoogle2025-12-17AA time to first tokenPerformance · Aktiv0.72sArtificial Analysis2026-07-21
Gemini 3 ProGoogle2025-11-18AA time to first tokenPerformance · Aktiv0.00sArtificial Analysis2026-07-21
Gemini 3.1 Flash LiteGoogle2026-05-07AA time to first tokenPerformance · Aktiv4.90sArtificial Analysis2026-07-21
Gemini 3.1 Pro PreviewGoogle2026-02-19AA time to first tokenPerformance · Aktiv21.91sArtificial Analysis2026-07-21
Gemini 3.5 FlashGoogle2026-05-19AA time to first tokenPerformance · Aktiv12.11sArtificial Analysis2026-07-21
Gemini 3.5 Flash (medium)Google2026-05-19AA time to first tokenPerformance · Aktiv8.89sArtificial Analysis2026-07-21
Gemma 4 12B (Non-reasoning)Google2026-06-10AA time to first tokenPerformance · Aktiv1.49sArtificial Analysis2026-07-21
Gemma 4 12B (Reasoning)Google2026-06-07AA time to first tokenPerformance · Aktiv1.46sArtificial Analysis2026-07-21
Gemma 4 31B ITGoogle2026-03-01AA time to first tokenPerformance · Aktiv0.98sArtificial Analysis2026-07-21
GLM-5.1Zhipu2026-04-07AA time to first tokenPerformance · Aktiv0.86sArtificial Analysis2026-07-21
GLM-5.2Zhipu2026-06-13AA time to first tokenPerformance · Aktiv0.84sArtificial Analysis2026-07-21
GPT 5.4OpenAI2026-03-05AA time to first tokenPerformance · Aktiv129.43sArtificial Analysis2026-07-21
GPT 5.5OpenAI2026-04-23AA time to first tokenPerformance · Aktiv31.38sArtificial Analysis2026-07-21
GPT-5.1OpenAI2025-11-13AA time to first tokenPerformance · Aktiv38.96sArtificial Analysis2026-07-21
GPT-5.2OpenAI2025-12-11AA time to first tokenPerformance · Aktiv97.23sArtificial Analysis2026-07-21
GPT-5.3 Codex (xhigh)OpenAI2026-02-05AA time to first tokenPerformance · Aktiv41.56sArtificial Analysis2026-07-21
GPT-5.4 MiniOpenAI2026-03-17AA time to first tokenPerformance · Aktiv8.20sArtificial Analysis2026-07-21
GPT-5.4 NanoOpenAI2026-03-17AA time to first tokenPerformance · Aktiv3.46sArtificial Analysis2026-07-21
GPT-5.4 ProOpenAI2026-03-05AA time to first tokenPerformance · Aktiv0.00sArtificial Analysis2026-07-21
GPT-5.5 (high)OpenAI2026-04-23AA time to first tokenPerformance · Aktiv13.95sArtificial Analysis2026-07-21
GPT-5.5 (low)OpenAI2026-04-23AA time to first tokenPerformance · Aktiv1.61sArtificial Analysis2026-07-21
GPT-5.5 (medium)OpenAI2026-04-23AA time to first tokenPerformance · Aktiv6.88sArtificial Analysis2026-07-21
GPT-5.5 ProOpenAI2026-04-23AA time to first tokenPerformance · Aktiv0.00sArtificial Analysis2026-07-21
GPT-5.6 LunaOpenAI2026-07-09AA time to first tokenPerformance · Aktiv83.80sArtificial Analysis2026-07-21
GPT-5.6 SolOpenAI2026-07-09AA time to first tokenPerformance · Aktiv76.91sArtificial Analysis2026-07-21
GPT-5.6 TerraOpenAI2026-07-09AA time to first tokenPerformance · Aktiv100.45sArtificial Analysis2026-07-21
Grok 4.20 ReasoningxAI2026-03-05AA time to first tokenPerformance · Aktiv16.81sArtificial Analysis2026-07-21
Grok 4.3xAI2026-04-30AA time to first tokenPerformance · Aktiv31.32sArtificial Analysis2026-07-21
Grok 4.5xAI2026-07-08AA time to first tokenPerformance · Aktiv9.69sArtificial Analysis2026-07-21
HyperNova 60B 2605Multiverse2026-05-06AA time to first tokenPerformance · Aktiv0.60sArtificial Analysis2026-07-21
Kimi K2.5Moonshot2026-01-27AA time to first tokenPerformance · Aktiv1.02sArtificial Analysis2026-07-21
Kimi K2.6Moonshot2026-04-20AA time to first tokenPerformance · Aktiv1.08sArtificial Analysis2026-07-21
Kimi K2.7 CodeMoonshot2026-06-12AA time to first tokenPerformance · Aktiv1.17sArtificial Analysis2026-07-21
Kimi K3Moonshot2026-07-16AA time to first tokenPerformance · Aktiv6.19sArtificial Analysis2026-07-21
LFM2.5-8B-A1BLiquid2026-06-08AA time to first tokenPerformance · Aktiv1.79sArtificial Analysis2026-07-21
Llama 4 MaverickMeta2026-04-05AA time to first tokenPerformance · Aktiv0.60sArtificial Analysis2026-07-21
Llama 4 ScoutMeta2026-04-05AA time to first tokenPerformance · Aktiv0.56sArtificial Analysis2026-07-21
LongCat-2.0Meituan2026-06-29AA time to first tokenPerformance · Aktiv0.00sArtificial Analysis2026-07-21
MiMo-V2.5-ProXiaomi2026-04-22AA time to first tokenPerformance · Aktiv2.38sArtificial Analysis2026-07-21
MiniCPM5-1B (Reasoning)OpenBMB2026-06-04AA time to first tokenPerformance · Aktiv0.00sArtificial Analysis2026-07-21
MiniMax M2.5MiniMax2026-04-01AA time to first tokenPerformance · Aktiv1.02sArtificial Analysis2026-07-21
MiniMax M2.7MiniMax2026-04-15AA time to first tokenPerformance · Aktiv1.17sArtificial Analysis2026-07-21
MiniMax M3MiniMax2026-05-31AA time to first tokenPerformance · Aktiv1.26sArtificial Analysis2026-07-21
Mistral Large 3Mistral2025-12-02AA time to first tokenPerformance · Aktiv0.59sArtificial Analysis2026-07-21
Muse SparkOther2026-01-01AA time to first tokenPerformance · Aktiv0.00sArtificial Analysis2026-07-21
Muse Spark 1.1Meta2026-07-09AA time to first tokenPerformance · Aktiv0.83sArtificial Analysis2026-07-21
Nemotron 3 Ultra 550B A55B (Reasoning)NVIDIA2026-06-04AA time to first tokenPerformance · Aktiv0.88sArtificial Analysis2026-07-21
North Mini CodeCohere2026-06-09AA time to first tokenPerformance · Aktiv0.23sArtificial Analysis2026-07-21
OpenAI o1OpenAI2024-09-12AA time to first tokenPerformance · Aktiv0.00sArtificial Analysis2026-07-21
OpenAI o3OpenAI2025-04-16AA time to first tokenPerformance · Aktiv4.84sArtificial Analysis2026-07-21
Qwen 3.7 PlusAlibaba2026-06-02AA time to first tokenPerformance · Aktiv1.69sArtificial Analysis2026-07-21
Qwen3.7 MaxAlibaba2026-05-19AA time to first tokenPerformance · Aktiv1.55sArtificial Analysis2026-07-21
Step 3.7 FlashStepFun2026-06-01AA time to first tokenPerformance · Aktiv0.72sArtificial Analysis2026-07-21
Claude Fable 5Anthropic2026-06-09AA-LCRLanger Kontext · Aktiv70%Artificial Analysis2026-07-21
Claude Opus 4.5Anthropic2025-11-24AA-LCRLanger Kontext · Aktiv65.33%Artificial Analysis2026-07-21
Claude Opus 4.6Anthropic2026-02-05AA-LCRLanger Kontext · Aktiv58.33%Artificial Analysis2026-07-21
Claude Opus 4.6 (Adaptive Reasoning, Max Effort)Anthropic2026-02-05AA-LCRLanger Kontext · Aktiv70.67%Artificial Analysis2026-07-21
Claude Opus 4.7Anthropic2026-04-16AA-LCRLanger Kontext · Aktiv70.33%Artificial Analysis2026-07-21
Claude Opus 4.7 (Non-reasoning, High Effort)Anthropic2026-04-16AA-LCRLanger Kontext · Aktiv67%Artificial Analysis2026-07-21
Claude Opus 4.8Anthropic2026-05-28AA-LCRLanger Kontext · Aktiv58.3%Artificial Analysis — AA-LCR2026-06-17
Claude Sonnet 4.6Anthropic2026-02-17AA-LCRLanger Kontext · Aktiv57.67%Artificial Analysis2026-07-21
Claude Sonnet 4.6 (Adaptive Reasoning, Max Effort)Anthropic2026-02-17AA-LCRLanger Kontext · Aktiv70.67%Artificial Analysis2026-07-21
Claude Sonnet 5Anthropic2026-06-30AA-LCRLanger Kontext · Aktiv70.67%Artificial Analysis2026-07-21
Command ACohere2026-03-15AA-LCRLanger Kontext · Aktiv18%Artificial Analysis2026-07-21
DeepSeek R1DeepSeek2025-01-20AA-LCRLanger Kontext · Aktiv54.67%Artificial Analysis2026-07-21
DeepSeek V4 Pro (Reasoning, Max Effort)DeepSeek2026-04-24AA-LCRLanger Kontext · Aktiv66.33%Artificial Analysis2026-07-21
Gemini 3 Flash PreviewGoogle2025-12-17AA-LCRLanger Kontext · Aktiv48%Artificial Analysis2026-07-21
Gemini 3 ProGoogle2025-11-18AA-LCRLanger Kontext · Aktiv70.67%Artificial Analysis2026-07-21
Gemini 3.1 Flash LiteGoogle2026-05-07AA-LCRLanger Kontext · Aktiv65.33%Artificial Analysis2026-07-21
Gemini 3.1 Pro PreviewGoogle2026-02-19AA-LCRLanger Kontext · Aktiv72.67%Artificial Analysis2026-07-21
Gemini 3.5 FlashGoogle2026-05-19AA-LCRLanger Kontext · Aktiv69.33%Artificial Analysis2026-07-21
Gemini 3.5 Flash (medium)Google2026-05-19AA-LCRLanger Kontext · Aktiv71%Artificial Analysis2026-07-21
Gemma 4 12B (Non-reasoning)Google2026-06-10AA-LCRLanger Kontext · Aktiv30.67%Artificial Analysis2026-07-21
Gemma 4 12B (Reasoning)Google2026-06-07AA-LCRLanger Kontext · Aktiv55.33%Artificial Analysis2026-07-21
Gemma 4 31B ITGoogle2026-03-01AA-LCRLanger Kontext · Aktiv62%Artificial Analysis2026-07-21
GLM-5.1Zhipu2026-04-07AA-LCRLanger Kontext · Aktiv62.33%Artificial Analysis2026-07-21
GLM-5.2Zhipu2026-06-13AA-LCRLanger Kontext · Aktiv71.33%Artificial Analysis2026-07-21
GPT 5.4OpenAI2026-03-05AA-LCRLanger Kontext · Aktiv74%Artificial Analysis2026-07-21
GPT 5.5OpenAI2026-04-23AA-LCRLanger Kontext · Aktiv52.1%Artificial Analysis — AA-LCR2026-06-17
GPT-5.1OpenAI2025-11-13AA-LCRLanger Kontext · Aktiv75%Artificial Analysis2026-07-21
GPT-5.2OpenAI2025-12-11AA-LCRLanger Kontext · Aktiv72.67%Artificial Analysis2026-07-21
GPT-5.3 Codex (xhigh)OpenAI2026-02-05AA-LCRLanger Kontext · Aktiv74%Artificial Analysis2026-07-21
GPT-5.4 MiniOpenAI2026-03-17AA-LCRLanger Kontext · Aktiv69.33%Artificial Analysis2026-07-21
GPT-5.4 NanoOpenAI2026-03-17AA-LCRLanger Kontext · Aktiv66%Artificial Analysis2026-07-21
GPT-5.5 (high)OpenAI2026-04-23AA-LCRLanger Kontext · Aktiv73.33%Artificial Analysis2026-07-21
GPT-5.5 (low)OpenAI2026-04-23AA-LCRLanger Kontext · Aktiv72%Artificial Analysis2026-07-21
GPT-5.5 (medium)OpenAI2026-04-23AA-LCRLanger Kontext · Aktiv72.33%Artificial Analysis2026-07-21
GPT-5.6 LunaOpenAI2026-07-09AA-LCRLanger Kontext · Aktiv74%Artificial Analysis2026-07-21
GPT-5.6 SolOpenAI2026-07-09AA-LCRLanger Kontext · Aktiv73.67%Artificial Analysis2026-07-21
GPT-5.6 TerraOpenAI2026-07-09AA-LCRLanger Kontext · Aktiv74%Artificial Analysis2026-07-21
Grok 4.20 ReasoningxAI2026-03-05AA-LCRLanger Kontext · Aktiv58%Artificial Analysis2026-07-21
Grok 4.3xAI2026-04-30AA-LCRLanger Kontext · Aktiv64.33%Artificial Analysis2026-07-21
Grok 4.5xAI2026-07-08AA-LCRLanger Kontext · Aktiv67.67%Artificial Analysis2026-07-21
HyperNova 60B 2605Multiverse2026-05-06AA-LCRLanger Kontext · Aktiv31.67%Artificial Analysis2026-07-21
Kimi K2.5Moonshot2026-01-27AA-LCRLanger Kontext · Aktiv65.33%Artificial Analysis2026-07-21
Kimi K2.6Moonshot2026-04-20AA-LCRLanger Kontext · Aktiv69.67%Artificial Analysis2026-07-21
Kimi K2.7 CodeMoonshot2026-06-12AA-LCRLanger Kontext · Aktiv66.33%Artificial Analysis2026-07-21
Kimi K3Moonshot2026-07-16AA-LCRLanger Kontext · Aktiv74.67%Artificial Analysis2026-07-21
LFM2.5-8B-A1BLiquid2026-06-08AA-LCRLanger Kontext · Aktiv0%Artificial Analysis2026-07-21
Llama 4 MaverickMeta2026-04-05AA-LCRLanger Kontext · Aktiv46%Artificial Analysis2026-07-21
Llama 4 ScoutMeta2026-04-05AA-LCRLanger Kontext · Aktiv25.8%Artificial Analysis2026-07-21
LongCat-2.0Meituan2026-06-29AA-LCRLanger Kontext · Aktiv58%Artificial Analysis2026-07-21
MiMo-V2.5-ProXiaomi2026-04-22AA-LCRLanger Kontext · Aktiv73.33%Artificial Analysis2026-07-21
MiniCPM5-1B (Reasoning)OpenBMB2026-06-04AA-LCRLanger Kontext · Aktiv3.67%Artificial Analysis2026-07-21
MiniMax M2.5MiniMax2026-04-01AA-LCRLanger Kontext · Aktiv66%Artificial Analysis2026-07-21
MiniMax M2.7MiniMax2026-04-15AA-LCRLanger Kontext · Aktiv68.67%Artificial Analysis2026-07-21
MiniMax M3MiniMax2026-05-31AA-LCRLanger Kontext · Aktiv74%Artificial Analysis2026-07-21
Mistral Large 3Mistral2025-12-02AA-LCRLanger Kontext · Aktiv34.67%Artificial Analysis2026-07-21
Muse SparkOther2026-01-01AA-LCRLanger Kontext · Aktiv69.67%Artificial Analysis2026-07-21
Muse Spark 1.1Meta2026-07-09AA-LCRLanger Kontext · Aktiv63.33%Artificial Analysis2026-07-21
Nemotron 3 Ultra 550B A55B (Reasoning)NVIDIA2026-06-04AA-LCRLanger Kontext · Aktiv67%Artificial Analysis2026-07-21
North Mini CodeCohere2026-06-09AA-LCRLanger Kontext · Aktiv32.33%Artificial Analysis2026-07-21
OpenAI o1OpenAI2024-09-12AA-LCRLanger Kontext · Aktiv59.33%Artificial Analysis2026-07-21
OpenAI o3OpenAI2025-04-16AA-LCRLanger Kontext · Aktiv69.33%Artificial Analysis2026-07-21
Qwen 3.7 PlusAlibaba2026-06-02AA-LCRLanger Kontext · Aktiv65%Artificial Analysis2026-07-21
Qwen3.7 MaxAlibaba2026-05-19AA-LCRLanger Kontext · Aktiv69%Artificial Analysis2026-07-21
Step 3.7 FlashStepFun2026-06-01AA-LCRLanger Kontext · Aktiv63.67%Artificial Analysis2026-07-21
Claude 3 OpusAnthropic2024-03-04AIMEMathe · Ausgedient3.33%Artificial Analysis2026-07-21
Claude 3.7 Sonnet (2025-02)Anthropic2025-02-19AIMEMathe · Ausgedient93.7%Anthropic Claude 3.7 Sonnet announcement2025-02-19
Claude Opus 4.5Anthropic2025-11-24AIMEMathe · Ausgedient62.67%Artificial Analysis2026-07-21
Claude Opus 4.8Anthropic2026-05-28AIMEMathe · Ausgedient94.2%Anthropic Claude 4 family2026-05-28
Command ACohere2026-03-15AIMEMathe · Ausgedient13%Artificial Analysis2026-07-21
DeepSeek R1DeepSeek2025-01-20AIMEMathe · Ausgedient88.4%DeepSeek R1 model card2025-01-20
Gemini 3 Flash PreviewGoogle2025-12-17AIMEMathe · Ausgedient55.67%Artificial Analysis2026-07-21
Gemini 3 ProGoogle2025-11-18AIMEMathe · Ausgedient95.67%Artificial Analysis2026-07-21
Gemini 3.1 ProGoogle2026-02-19AIMEMathe · Ausgedient87.6%Google Gemini 3.1 Pro2026-02-19
GPT 5OpenAI2025-12-11AIMEMathe · Ausgedient89.2%OpenAI model release notes2025-12-01
GPT 5.5OpenAI2026-04-23AIMEMathe · Ausgedient91.8%OpenAI model release notes2026-04-23
GPT-5.1OpenAI2025-11-13AIMEMathe · Ausgedient94%Artificial Analysis2026-07-21
Kimi K2.6Moonshot2026-04-20AIMEMathe · Ausgedient85.2%Moonshot Kimi K2.62026-04-20
Llama 4 MaverickMeta2026-04-05AIMEMathe · Ausgedient19.33%Artificial Analysis2026-07-21
Llama 4 ScoutMeta2026-04-05AIMEMathe · Ausgedient14%Artificial Analysis2026-07-21
Mistral Large 3Mistral2025-12-02AIMEMathe · Ausgedient38%Artificial Analysis2026-07-21
o3 (cons@64, AIME 2025)OpenAI2025-04-16AIMEMathe · Ausgedient87.5%OpenAI: Learning to Reason2025-01-20
OpenAI o1 (AIME 2024, cons@64)OpenAI2024-09-12AIMEMathe · Ausgedient83.3%OpenAI: Learning to Reason2024-09-12
OpenAI o3OpenAI2025-04-16AIMEMathe · Ausgedient88.33%Artificial Analysis2026-07-21
Claude Mythos (ARC-AGI-2, low compute)Anthropic2026-06-01ARC-AGIReasoning · Aktiv24.1%ARC Prize leaderboard2026-06-02
Claude Opus 4.6 (Max)Anthropic2026-03-09ARC-AGIReasoning · Aktiv0.5%ARC-AGI-3 paper (arXiv 2603.24621)2026-03-20
Claude Opus 4.7 (Adaptive)Anthropic2026-04-16ARC-AGIReasoning · Aktiv75.8%ARC Prize leaderboard2026-05-15
Claude Sonnet 4.6Anthropic2026-02-17ARC-AGIReasoning · Aktiv58.3%ARC Prize semi-private evaluation2026-02-17
Gemini 3 ProGoogle2025-12-01ARC-AGIReasoning · Aktiv75.7%ARC Prize leaderboard2026-02-19
Gemini 3 Pro Deep ThinkGoogle2025-12-01ARC-AGIReasoning · Aktiv45.1%ARC Prize leaderboard2026-05-15
Gemini 3.1 ProGoogle2026-02-19ARC-AGIReasoning · Aktiv77.1%ARC Prize leaderboard2026-05-15
Gemini 3.1 Pro PreviewGoogle2026-02-19ARC-AGIReasoning · Aktiv0.4%ARC-AGI-3 paper (arXiv 2603.24621)2026-03-20
Gemini 3.5 FlashGoogle2026-05-19ARC-AGIReasoning · Aktiv72.1%ARC Prize leaderboard2026-05-15
GPT 5.2OpenAI2025-12-11ARC-AGIReasoning · Aktiv52.9%ARC Prize leaderboard2026-05-15
GPT 5.4 (High)OpenAI2026-04-15ARC-AGIReasoning · Aktiv0.2%ARC-AGI-3 paper (arXiv 2603.24621)2026-03-20
GPT 5.4 ProOpenAI2026-04-15ARC-AGIReasoning · Aktiv83.3%ARC Prize leaderboard2026-05-15
GPT 5.5OpenAI2026-04-23ARC-AGIReasoning · Aktiv85%ARC Prize leaderboard2026-05-15
Grok 4.20xAI2026-03-05ARC-AGIReasoning · Aktiv53.3%ARC Prize leaderboard2026-05-15
Grok 4.20 (Reasoning)xAI2026-03-09ARC-AGIReasoning · Aktiv0.1%ARC-AGI-3 paper (arXiv 2603.24621)2026-03-20
OpenAI o3 (high compute)OpenAI2025-01-20ARC-AGIReasoning · Aktiv87.5%ARC Prize / OpenAI o3 announcement2025-04-01
Claude 3 OpusAnthropic2024-03-04Artificial Analysis Intelligence IndexReasoning · Aktiv11.8%Artificial Analysis2026-07-21
Claude Fable 5Anthropic2026-06-09Artificial Analysis Intelligence IndexReasoning · Aktiv59.9%Artificial Analysis2026-07-21
Claude Opus 4.5Anthropic2025-11-24Artificial Analysis Intelligence IndexReasoning · Aktiv34.7%Artificial Analysis2026-07-21
Claude Opus 4.6Anthropic2026-02-05Artificial Analysis Intelligence IndexReasoning · Aktiv37.8%Artificial Analysis2026-07-21
Claude Opus 4.6 (Adaptive Reasoning, Max Effort)Anthropic2026-02-05Artificial Analysis Intelligence IndexReasoning · Aktiv43.7%Artificial Analysis2026-07-21
Claude Opus 4.7Anthropic2026-04-16Artificial Analysis Intelligence IndexReasoning · Aktiv53.5%Artificial Analysis2026-07-21
Claude Opus 4.7 (Non-reasoning, High Effort)Anthropic2026-04-16Artificial Analysis Intelligence IndexReasoning · Aktiv42.7%Artificial Analysis2026-07-21
Claude Opus 4.8Anthropic2026-05-28Artificial Analysis Intelligence IndexReasoning · Aktiv55.7%Artificial Analysis2026-07-21
Claude Sonnet 4.6Anthropic2026-02-17Artificial Analysis Intelligence IndexReasoning · Aktiv35.9%Artificial Analysis2026-07-21
Claude Sonnet 4.6 (Adaptive Reasoning, Max Effort)Anthropic2026-02-17Artificial Analysis Intelligence IndexReasoning · Aktiv47.2%Artificial Analysis2026-07-21
Claude Sonnet 5Anthropic2026-06-30Artificial Analysis Intelligence IndexReasoning · Aktiv53.4%Artificial Analysis2026-07-21
Command ACohere2026-03-15Artificial Analysis Intelligence IndexReasoning · Aktiv7.7%Artificial Analysis2026-07-21
DeepSeek Coder V2DeepSeek2024-05-15Artificial Analysis Intelligence IndexReasoning · Aktiv5.1%Artificial Analysis2026-07-21
DeepSeek R1DeepSeek2025-01-20Artificial Analysis Intelligence IndexReasoning · Aktiv20.1%Artificial Analysis2026-07-21
DeepSeek V4 Pro (Reasoning, Max Effort)DeepSeek2026-04-24Artificial Analysis Intelligence IndexReasoning · Aktiv44.3%Artificial Analysis2026-07-21
Gemini 1.0 UltraGoogle2024-02-08Artificial Analysis Intelligence IndexReasoning · Aktiv4.6%Artificial Analysis2026-07-21
Gemini 3 Flash PreviewGoogle2025-12-17Artificial Analysis Intelligence IndexReasoning · Aktiv27.4%Artificial Analysis2026-07-21
Gemini 3 ProGoogle2025-11-18Artificial Analysis Intelligence IndexReasoning · Aktiv39.6%Artificial Analysis2026-07-21
Gemini 3.1 Flash LiteGoogle2026-05-07Artificial Analysis Intelligence IndexReasoning · Aktiv25%Artificial Analysis2026-07-21
Gemini 3.1 Pro PreviewGoogle2026-02-19Artificial Analysis Intelligence IndexReasoning · Aktiv46.5%Artificial Analysis2026-07-21
Gemini 3.5 FlashGoogle2026-05-19Artificial Analysis Intelligence IndexReasoning · Aktiv50.2%Artificial Analysis2026-07-21
Gemini 3.5 Flash (medium)Google2026-05-19Artificial Analysis Intelligence IndexReasoning · Aktiv45.4%Artificial Analysis2026-07-21
Gemma 4 12B (Non-reasoning)Google2026-06-10Artificial Analysis Intelligence IndexReasoning · Aktiv13.2%Artificial Analysis2026-07-21
Gemma 4 12B (Reasoning)Google2026-06-07Artificial Analysis Intelligence IndexReasoning · Aktiv22%Artificial Analysis2026-07-21
Gemma 4 31B ITGoogle2026-03-01Artificial Analysis Intelligence IndexReasoning · Aktiv29.4%Artificial Analysis2026-07-21
GLM-5.1Zhipu2026-04-07Artificial Analysis Intelligence IndexReasoning · Aktiv40.2%Artificial Analysis2026-07-21
GLM-5.2Zhipu2026-06-13Artificial Analysis Intelligence IndexReasoning · Aktiv51.1%Artificial Analysis2026-07-21
GPT 5.4OpenAI2026-03-05Artificial Analysis Intelligence IndexReasoning · Aktiv51.4%Artificial Analysis2026-07-21
GPT 5.5OpenAI2026-04-23Artificial Analysis Intelligence IndexReasoning · Aktiv54.8%Artificial Analysis2026-07-21
GPT-5.1OpenAI2025-11-13Artificial Analysis Intelligence IndexReasoning · Aktiv36.9%Artificial Analysis2026-07-21
GPT-5.2OpenAI2025-12-11Artificial Analysis Intelligence IndexReasoning · Aktiv42.2%Artificial Analysis2026-07-21
GPT-5.3 Codex (xhigh)OpenAI2026-02-05Artificial Analysis Intelligence IndexReasoning · Aktiv44.3%Artificial Analysis2026-07-21
GPT-5.4 MiniOpenAI2026-03-17Artificial Analysis Intelligence IndexReasoning · Aktiv40%Artificial Analysis2026-07-21
GPT-5.4 NanoOpenAI2026-03-17Artificial Analysis Intelligence IndexReasoning · Aktiv38.2%Artificial Analysis2026-07-21
GPT-5.5 (high)OpenAI2026-04-23Artificial Analysis Intelligence IndexReasoning · Aktiv53.1%Artificial Analysis2026-07-21
GPT-5.5 (low)OpenAI2026-04-23Artificial Analysis Intelligence IndexReasoning · Aktiv43.5%Artificial Analysis2026-07-21
GPT-5.5 (medium)OpenAI2026-04-23Artificial Analysis Intelligence IndexReasoning · Aktiv50.4%Artificial Analysis2026-07-21
GPT-5.6 LunaOpenAI2026-07-09Artificial Analysis Intelligence IndexReasoning · Aktiv51.2%Artificial Analysis2026-07-21
GPT-5.6 SolOpenAI2026-07-09Artificial Analysis Intelligence IndexReasoning · Aktiv58.9%Artificial Analysis2026-07-21
GPT-5.6 TerraOpenAI2026-07-09Artificial Analysis Intelligence IndexReasoning · Aktiv55%Artificial Analysis2026-07-21
Grok 4.20 ReasoningxAI2026-03-05Artificial Analysis Intelligence IndexReasoning · Aktiv37%Artificial Analysis2026-07-21
Grok 4.3xAI2026-04-30Artificial Analysis Intelligence IndexReasoning · Aktiv37.6%Artificial Analysis2026-07-21
Grok 4.5xAI2026-07-08Artificial Analysis Intelligence IndexReasoning · Aktiv53.8%Artificial Analysis2026-07-21
HyperNova 60B 2605Multiverse2026-05-06Artificial Analysis Intelligence IndexReasoning · Aktiv17.8%Artificial Analysis2026-07-21
Kimi K2.5Moonshot2026-01-27Artificial Analysis Intelligence IndexReasoning · Aktiv35.4%Artificial Analysis2026-07-21
Kimi K2.6Moonshot2026-04-20Artificial Analysis Intelligence IndexReasoning · Aktiv44.2%Artificial Analysis2026-07-21
Kimi K2.7 CodeMoonshot2026-06-12Artificial Analysis Intelligence IndexReasoning · Aktiv41.9%Artificial Analysis2026-07-21
Kimi K3Moonshot2026-07-16Artificial Analysis Intelligence IndexReasoning · Aktiv57.1%Artificial Analysis2026-07-21
LFM2.5-8B-A1BLiquid2026-06-08Artificial Analysis Intelligence IndexReasoning · Aktiv8.3%Artificial Analysis2026-07-21
Llama 4 MaverickMeta2026-04-05Artificial Analysis Intelligence IndexReasoning · Aktiv14.3%Artificial Analysis2026-07-21
Llama 4 ScoutMeta2026-04-05Artificial Analysis Intelligence IndexReasoning · Aktiv10%Artificial Analysis2026-07-21
LongCat-2.0Meituan2026-06-29Artificial Analysis Intelligence IndexReasoning · Aktiv33.5%Artificial Analysis2026-07-21
MiMo-V2.5-ProXiaomi2026-04-22Artificial Analysis Intelligence IndexReasoning · Aktiv42.2%Artificial Analysis2026-07-21
MiniCPM5-1B (Reasoning)OpenBMB2026-06-04Artificial Analysis Intelligence IndexReasoning · Aktiv12%Artificial Analysis2026-07-21
MiniMax M2.5MiniMax2026-04-01Artificial Analysis Intelligence IndexReasoning · Aktiv33.7%Artificial Analysis2026-07-21
MiniMax M2.7MiniMax2026-04-15Artificial Analysis Intelligence IndexReasoning · Aktiv38.1%Artificial Analysis2026-07-21
MiniMax M3MiniMax2026-05-31Artificial Analysis Intelligence IndexReasoning · Aktiv44.4%Artificial Analysis2026-07-21
Mistral Large 3Mistral2025-12-02Artificial Analysis Intelligence IndexReasoning · Aktiv15.9%Artificial Analysis2026-07-21
Muse SparkOther2026-01-01Artificial Analysis Intelligence IndexReasoning · Aktiv43.1%Artificial Analysis2026-07-21
Muse Spark 1.1Meta2026-07-09Artificial Analysis Intelligence IndexReasoning · Aktiv50.6%Artificial Analysis2026-07-21
Nemotron 3 Ultra 550B A55B (Reasoning)NVIDIA2026-06-04Artificial Analysis Intelligence IndexReasoning · Aktiv37.8%Artificial Analysis2026-07-21
North Mini CodeCohere2026-06-09Artificial Analysis Intelligence IndexReasoning · Aktiv19.8%Artificial Analysis2026-07-21
OpenAI o1OpenAI2024-09-12Artificial Analysis Intelligence IndexReasoning · Aktiv23.4%Artificial Analysis2026-07-21
OpenAI o3OpenAI2025-04-16Artificial Analysis Intelligence IndexReasoning · Aktiv30.4%Artificial Analysis2026-07-21
Qwen 3.7 PlusAlibaba2026-06-02Artificial Analysis Intelligence IndexReasoning · Aktiv39%Artificial Analysis2026-07-21
Qwen3.7 MaxAlibaba2026-05-19Artificial Analysis Intelligence IndexReasoning · Aktiv46%Artificial Analysis2026-07-21
Step 3.7 FlashStepFun2026-06-01Artificial Analysis Intelligence IndexReasoning · Aktiv30.3%Artificial Analysis2026-07-21
Claude Haiku 4.5Anthropic2025-10-01BFCLTool-Nutzung · Aktiv71.8%Berkeley Function Calling Leaderboard V42026-04-15
Claude Opus 4.8Anthropic2026-05-28BFCLTool-Nutzung · Aktiv86.9%Berkeley Function Calling Leaderboard V42026-04-15
Claude Sonnet 4.6Anthropic2026-02-17BFCLTool-Nutzung · Aktiv88.7%Berkeley Function Calling Leaderboard V42026-04-15
Cohere Command ACohere2026-03-15BFCLTool-Nutzung · Aktiv70.6%Berkeley Function Calling Leaderboard V42026-04-15
DeepSeek R1DeepSeek2025-01-20BFCLTool-Nutzung · Aktiv72.4%Berkeley Function Calling Leaderboard V42026-04-15
DeepSeek V4DeepSeek2026-04-24BFCLTool-Nutzung · Aktiv74.6%Berkeley Function Calling Leaderboard V42026-04-15
DeepSeek V4 Flash MaxDeepSeek2026-04-24BFCLTool-Nutzung · Aktiv76.8%Berkeley Function Calling Leaderboard V42026-04-15
Gemini 3 Flash PreviewGoogle2025-12-17BFCLTool-Nutzung · Aktiv79.4%Berkeley Function Calling Leaderboard V42026-04-15
Gemini 3.1 ProGoogle2026-02-19BFCLTool-Nutzung · Aktiv81.6%Berkeley Function Calling Leaderboard V42026-04-15
Gemini 3.5 FlashGoogle2026-05-19BFCLTool-Nutzung · Aktiv82.3%Berkeley Function Calling Leaderboard V42026-04-15
GPT 5.4OpenAI2026-03-05BFCLTool-Nutzung · Aktiv83.8%Berkeley Function Calling Leaderboard V42026-04-15
GPT 5.5OpenAI2026-04-23BFCLTool-Nutzung · Aktiv87.4%Berkeley Function Calling Leaderboard V42026-04-15
Grok 4.3xAI2026-04-30BFCLTool-Nutzung · Aktiv77.2%Berkeley Function Calling Leaderboard V42026-04-15
Kimi K2.6Moonshot2026-04-20BFCLTool-Nutzung · Aktiv85.2%Berkeley Function Calling Leaderboard V42026-04-15
Llama 4 MaverickMeta2026-04-05BFCLTool-Nutzung · Aktiv75.9%Berkeley Function Calling Leaderboard V42026-04-15
Llama 4 ScoutMeta2026-04-05BFCLTool-Nutzung · Aktiv74.1%Berkeley Function Calling Leaderboard V42026-04-15
MiniMax M3MiniMax2026-05-31BFCLTool-Nutzung · Aktiv76.2%Berkeley Function Calling Leaderboard V42026-04-15
Mistral Large 3Mistral2025-12-02BFCLTool-Nutzung · Aktiv80.1%Berkeley Function Calling Leaderboard V42026-04-15
o3OpenAI2025-04-16BFCLTool-Nutzung · Aktiv78.1%Berkeley Function Calling Leaderboard V42026-04-15
Qwen 3.7 MaxAlibaba2026-05-20BFCLTool-Nutzung · Aktiv78.4%Berkeley Function Calling Leaderboard V42026-04-15
Claude Fable 5 (max)Anthropic2026-06-09DeepSWECoding · Aktiv70%DeepSWE leaderboard v1.12026-06-20
Claude Opus 4.8 (max)Anthropic2026-05-28DeepSWECoding · Aktiv59%DeepSWE leaderboard v1.12026-06-20
Gemini 3.5 Flash (medium)Google2026-04-10DeepSWECoding · Aktiv37%DeepSWE leaderboard v1.12026-06-20
GLM 5.2 (max)Zhipu2026-05-15DeepSWECoding · Aktiv44%DeepSWE leaderboard v1.12026-06-20
GPT 5.4 (xhigh)OpenAI2026-03-15DeepSWECoding · Aktiv52%DeepSWE leaderboard v1.12026-06-20
GPT 5.5 (xhigh)OpenAI2026-04-23DeepSWECoding · Aktiv67%DeepSWE leaderboard v1.12026-06-20
Claude Fable 5Anthropic2026-06-09GDPvalAgentisch · Aktiv1818Artificial Analysis — GDPval-AA v22026-06-17
Claude Opus 4.8Anthropic2026-05-28GDPvalAgentisch · Aktiv1638Artificial Analysis — GDPval-AA v22026-06-17
GPT 5.2OpenAI2025-12-11GDPvalAgentisch · Aktiv71.8%OpenAI GDPval2025-12-11
GPT 5.2 ProOpenAI2026-05-12GDPvalAgentisch · Aktiv74.1%OpenAI GDPval paper (arXiv)2026-05-12
GPT 5.5 (xhigh)OpenAI2026-04-23GDPvalAgentisch · Aktiv1531Artificial Analysis — GDPval-AA v22026-06-17
GPT 5.5 ProOpenAI2026-04-23GDPvalAgentisch · Aktiv82.3%OpenAI GDPval grading portal2026-04-23
Claude 3 OpusAnthropic2024-03-04GPQA DiamondReasoning · Aktiv48.9%Artificial Analysis2026-07-21
Claude Fable 5Anthropic2026-06-09GPQA DiamondReasoning · Aktiv92.6%Artificial Analysis2026-07-21
Claude Mythos PreviewAnthropic2026-06-01GPQA DiamondReasoning · Aktiv94.6%GPQA Diamond paper leaderboard2026-06-02
Claude Opus 4.5Anthropic2025-11-24GPQA DiamondReasoning · Aktiv81%Artificial Analysis2026-07-21
Claude Opus 4.6Anthropic2026-02-05GPQA DiamondReasoning · Aktiv84%Artificial Analysis2026-07-21
Claude Opus 4.6 (Adaptive Reasoning, Max Effort)Anthropic2026-02-05GPQA DiamondReasoning · Aktiv89.6%Artificial Analysis2026-07-21
Claude Opus 4.7Anthropic2026-04-16GPQA DiamondReasoning · Aktiv91.4%Artificial Analysis2026-07-21
Claude Opus 4.7 (Non-reasoning, High Effort)Anthropic2026-04-16GPQA DiamondReasoning · Aktiv88.5%Artificial Analysis2026-07-21
Claude Opus 4.8Anthropic2026-05-28GPQA DiamondReasoning · Aktiv79.8%GPQA Diamond paper leaderboard2026-05-15
Claude Sonnet 4.6Anthropic2026-02-17GPQA DiamondReasoning · Aktiv77.2%Artificial Analysis GPQA Diamond evaluation2026-06-09
Claude Sonnet 4.6 (Adaptive Reasoning, Max Effort)Anthropic2026-02-17GPQA DiamondReasoning · Aktiv87.5%Artificial Analysis2026-07-21
Claude Sonnet 5Anthropic2026-06-30GPQA DiamondReasoning · Aktiv91.1%Artificial Analysis2026-07-21
Command ACohere2026-03-15GPQA DiamondReasoning · Aktiv52.7%Artificial Analysis2026-07-21
DeepSeek R1DeepSeek2025-01-20GPQA DiamondReasoning · Aktiv81.3%Artificial Analysis2026-07-21
DeepSeek V4 Pro (Reasoning, Max Effort)DeepSeek2026-04-24GPQA DiamondReasoning · Aktiv88.8%Artificial Analysis2026-07-21
DeepSeek V4 Pro MaxDeepSeek2026-04-24GPQA DiamondReasoning · Aktiv75.6%Artificial Analysis GPQA Diamond evaluation2026-06-09
Gemini 3 Flash PreviewGoogle2025-12-17GPQA DiamondReasoning · Aktiv81.2%Artificial Analysis2026-07-21
Gemini 3 ProGoogle2025-11-18GPQA DiamondReasoning · Aktiv90.8%Artificial Analysis2026-07-21
Gemini 3.1 Flash LiteGoogle2026-05-07GPQA DiamondReasoning · Aktiv82.2%Artificial Analysis2026-07-21
Gemini 3.1 ProGoogle2026-02-19GPQA DiamondReasoning · Aktiv78.4%Artificial Analysis GPQA Diamond evaluation2026-06-09
Gemini 3.1 Pro PreviewGoogle2026-02-19GPQA DiamondReasoning · Aktiv94.1%Artificial Analysis2026-07-21
Gemini 3.5 FlashGoogle2026-05-19GPQA DiamondReasoning · Aktiv74.1%Artificial Analysis GPQA Diamond evaluation2026-06-09
Gemini 3.5 Flash (medium)Google2026-05-19GPQA DiamondReasoning · Aktiv92.1%Artificial Analysis2026-07-21
Gemma 4 12B (Non-reasoning)Google2026-06-10GPQA DiamondReasoning · Aktiv66.1%Artificial Analysis2026-07-21
Gemma 4 12B (Reasoning)Google2026-06-07GPQA DiamondReasoning · Aktiv75.3%Artificial Analysis2026-07-21
Gemma 4 31B ITGoogle2026-03-01GPQA DiamondReasoning · Aktiv85.7%Artificial Analysis2026-07-21
GLM-5.1Zhipu2026-04-07GPQA DiamondReasoning · Aktiv86.8%Artificial Analysis2026-07-21
GLM-5.2Zhipu2026-06-13GPQA DiamondReasoning · Aktiv89.5%Artificial Analysis2026-07-21
GPT 5.4OpenAI2026-03-05GPQA DiamondReasoning · Aktiv92%Artificial Analysis2026-07-21
GPT 5.5OpenAI2026-04-23GPQA DiamondReasoning · Aktiv81.2%GPQA Diamond paper leaderboard2026-05-15
GPT-5.1OpenAI2025-11-13GPQA DiamondReasoning · Aktiv87.3%Artificial Analysis2026-07-21
GPT-5.2OpenAI2025-12-11GPQA DiamondReasoning · Aktiv90.3%Artificial Analysis2026-07-21
GPT-5.3 Codex (xhigh)OpenAI2026-02-05GPQA DiamondReasoning · Aktiv91.5%Artificial Analysis2026-07-21
GPT-5.4 MiniOpenAI2026-03-17GPQA DiamondReasoning · Aktiv87.5%Artificial Analysis2026-07-21
GPT-5.4 NanoOpenAI2026-03-17GPQA DiamondReasoning · Aktiv81.7%Artificial Analysis2026-07-21
GPT-5.5 (high)OpenAI2026-04-23GPQA DiamondReasoning · Aktiv93.2%Artificial Analysis2026-07-21
GPT-5.5 (low)OpenAI2026-04-23GPQA DiamondReasoning · Aktiv91%Artificial Analysis2026-07-21
GPT-5.5 (medium)OpenAI2026-04-23GPQA DiamondReasoning · Aktiv92.6%Artificial Analysis2026-07-21
GPT-5.6 LunaOpenAI2026-07-09GPQA DiamondReasoning · Aktiv91.1%Artificial Analysis2026-07-21
GPT-5.6 SolOpenAI2026-07-09GPQA DiamondReasoning · Aktiv94.1%Artificial Analysis2026-07-21
GPT-5.6 TerraOpenAI2026-07-09GPQA DiamondReasoning · Aktiv92.5%Artificial Analysis2026-07-21
Grok 4.20 ReasoningxAI2026-03-05GPQA DiamondReasoning · Aktiv91.1%Artificial Analysis2026-07-21
Grok 4.3xAI2026-04-30GPQA DiamondReasoning · Aktiv88%GPQA Diamond paper leaderboard2026-05-15
Grok 4.5xAI2026-07-08GPQA DiamondReasoning · Aktiv93.1%Artificial Analysis2026-07-21
HyperNova 60B 2605Multiverse2026-05-06GPQA DiamondReasoning · Aktiv73.3%Artificial Analysis2026-07-21
Kimi K2.5Moonshot2026-01-27GPQA DiamondReasoning · Aktiv87.9%Artificial Analysis2026-07-21
Kimi K2.6Moonshot2026-04-20GPQA DiamondReasoning · Aktiv90.5%GPQA Diamond paper leaderboard2026-05-15
Kimi K2.7 CodeMoonshot2026-06-12GPQA DiamondReasoning · Aktiv89.6%Artificial Analysis2026-07-21
Kimi K3Moonshot2026-07-16GPQA DiamondReasoning · Aktiv93.5%Artificial Analysis2026-07-21
LFM2.5-8B-A1BLiquid2026-06-08GPQA DiamondReasoning · Aktiv51.3%Artificial Analysis2026-07-21
Llama 4 MaverickMeta2026-04-05GPQA DiamondReasoning · Aktiv69.4%Artificial Analysis GPQA Diamond evaluation2026-06-09
Llama 4 ScoutMeta2026-04-05GPQA DiamondReasoning · Aktiv58.7%Artificial Analysis2026-07-21
LongCat-2.0Meituan2026-06-29GPQA DiamondReasoning · Aktiv78%Artificial Analysis2026-07-21
MiMo-V2.5-ProXiaomi2026-04-22GPQA DiamondReasoning · Aktiv86.6%Artificial Analysis2026-07-21
MiniCPM5-1B (Reasoning)OpenBMB2026-06-04GPQA DiamondReasoning · Aktiv27.8%Artificial Analysis2026-07-21
MiniMax M2.5MiniMax2026-04-01GPQA DiamondReasoning · Aktiv84.8%Artificial Analysis2026-07-21
MiniMax M2.7MiniMax2026-04-15GPQA DiamondReasoning · Aktiv87.4%Artificial Analysis2026-07-21
MiniMax M3MiniMax2026-05-31GPQA DiamondReasoning · Aktiv92.9%Artificial Analysis2026-07-21
Mistral Large 3Mistral2025-12-02GPQA DiamondReasoning · Aktiv71.2%Artificial Analysis GPQA Diamond evaluation2026-06-09
Muse SparkOther2026-01-01GPQA DiamondReasoning · Aktiv88.4%Artificial Analysis2026-07-21
Muse Spark 1.1Meta2026-07-09GPQA DiamondReasoning · Aktiv89.8%Artificial Analysis2026-07-21
Nemotron 3 Ultra 550B A55B (Reasoning)NVIDIA2026-06-04GPQA DiamondReasoning · Aktiv86.7%Artificial Analysis2026-07-21
North Mini CodeCohere2026-06-09GPQA DiamondReasoning · Aktiv75.7%Artificial Analysis2026-07-21
OpenAI o1OpenAI2024-09-12GPQA DiamondReasoning · Aktiv74.7%Artificial Analysis2026-07-21
OpenAI o3OpenAI2025-04-16GPQA DiamondReasoning · Aktiv82.7%Artificial Analysis2026-07-21
Qwen 3.7 MaxAlibaba2026-05-20GPQA DiamondReasoning · Aktiv73.8%Artificial Analysis GPQA Diamond evaluation2026-06-09
Qwen 3.7 PlusAlibaba2026-06-02GPQA DiamondReasoning · Aktiv90%Artificial Analysis2026-07-21
Qwen3.7 MaxAlibaba2026-05-19GPQA DiamondReasoning · Aktiv92.3%Artificial Analysis2026-07-21
Step 3.7 FlashStepFun2026-06-01GPQA DiamondReasoning · Aktiv80.9%Artificial Analysis2026-07-21
Claude Opus 4 (2024-07)Anthropic2024-07-01HELM SafetySicherheit · Aktiv92.1%Stanford HELM leaderboard2024-08-15
Claude Opus 4.8Anthropic2026-05-28HELM SafetySicherheit · Aktiv91.8%Stanford HELM leaderboard2026-05-28
Claude Sonnet 4.6Anthropic2026-02-17HELM SafetySicherheit · Aktiv89.2%Stanford HELM leaderboard2026-02-17
DeepSeek V4 Pro MaxDeepSeek2026-04-24HELM SafetySicherheit · Aktiv86.4%Stanford HELM leaderboard2026-04-24
Gemini 1.5 Pro (2024-06)Google2024-06-01HELM SafetySicherheit · Aktiv88.7%Stanford HELM leaderboard2024-08-15
Gemini 3.1 ProGoogle2026-02-19HELM SafetySicherheit · Aktiv88.9%Stanford HELM leaderboard2026-02-19
GPT 5.5OpenAI2026-04-23HELM SafetySicherheit · Aktiv90.6%Stanford HELM leaderboard2026-04-23
GPT-4o (2024-05)OpenAI2024-05-13HELM SafetySicherheit · Aktiv89.4%Stanford HELM leaderboard2024-08-15
Mistral Large 2 (2024-07)Mistral2024-07-24HELM SafetySicherheit · Aktiv84.3%Stanford HELM leaderboard2024-08-15
Claude 3.5 Sonnet (2024-06)Anthropic2024-06-20HumanEvalCoding · Ausgedient92% pass@1Anthropic Claude 3.5 Sonnet2024-06-20
Claude Opus 4.6Anthropic2026-02-05HumanEvalCoding · Ausgedient96.3% pass@1Anthropic Claude 3.7/4.6 model card2026-01-01
Claude Opus 4.8Anthropic2026-05-28HumanEvalCoding · Ausgedient95.8% pass@1Anthropic Claude 4 family2026-05-28
Claude Sonnet 4.6Anthropic2026-02-17HumanEvalCoding · Ausgedient94.1% pass@1Anthropic Claude 3.7/4.6 model card2026-01-01
DeepSeek Coder V2DeepSeek2024-05-15HumanEvalCoding · Ausgedient92.7% pass@1DeepSeek Coder V2 repository2024-05-15
DeepSeek V4 Pro MaxDeepSeek2026-04-24HumanEvalCoding · Ausgedient93.4% pass@1DeepSeek V4 release2026-04-24
Gemini 3.5 FlashGoogle2026-05-19HumanEvalCoding · Ausgedient94.6% pass@1CodeSOTA HumanEval leaderboard2026-05-19
GPT 5.5OpenAI2026-04-23HumanEvalCoding · Ausgedient96.2% pass@1CodeSOTA HumanEval leaderboard2026-04-23
GPT-4 (2023)OpenAI2023-03-14HumanEvalCoding · Ausgedient67% pass@1GPT-4 Technical Report2023-03-15
GPT-5OpenAI2025-12-11HumanEvalCoding · Ausgedient95.1% pass@1CodeSOTA HumanEval leaderboard2025-12-01
Kimi K2.6Moonshot2026-04-20HumanEvalCoding · Ausgedient93.8% pass@1CodeSOTA HumanEval leaderboard2026-04-20
Llama 4 MaverickMeta2026-04-05HumanEvalCoding · Ausgedient91.8% pass@1Meta Llama 4 model card2026-04-05
Mistral Large 3Mistral2025-12-02HumanEvalCoding · Ausgedient92.4% pass@1Mistral Large 3 model card2025-12-02
o3OpenAI2025-04-16HumanEvalCoding · Ausgedient94.8% pass@1CodeSOTA HumanEval leaderboard2025-04-01
Qwen 3.7 MaxAlibaba2026-05-20HumanEvalCoding · Ausgedient93.1% pass@1CodeSOTA HumanEval leaderboard2026-05-20
Claude 3 OpusAnthropic2024-03-04Humanity's Last ExamReasoning · Aktiv3.1%Artificial Analysis2026-07-21
Claude Fable 5Anthropic2026-06-09Humanity's Last ExamReasoning · Aktiv53.3%Artificial Analysis2026-07-21
Claude Opus 4.5Anthropic2025-11-24Humanity's Last ExamReasoning · Aktiv12.9%Artificial Analysis2026-07-21
Claude Opus 4.6Anthropic2026-02-05Humanity's Last ExamReasoning · Aktiv18.6%Artificial Analysis2026-07-21
Claude Opus 4.6 (Adaptive Reasoning, Max Effort)Anthropic2026-02-05Humanity's Last ExamReasoning · Aktiv36.7%Artificial Analysis2026-07-21
Claude Opus 4.7Anthropic2026-04-16Humanity's Last ExamReasoning · Aktiv39.6%Artificial Analysis2026-07-21
Claude Opus 4.7 (Non-reasoning, High Effort)Anthropic2026-04-16Humanity's Last ExamReasoning · Aktiv31.2%Artificial Analysis2026-07-21
Claude Opus 4.8Anthropic2026-05-28Humanity's Last ExamReasoning · Aktiv45.7%Artificial Analysis2026-07-21
Claude Sonnet 4.6Anthropic2026-02-17Humanity's Last ExamReasoning · Aktiv13.2%Artificial Analysis2026-07-21
Claude Sonnet 4.6 (Adaptive Reasoning, Max Effort)Anthropic2026-02-17Humanity's Last ExamReasoning · Aktiv30%Artificial Analysis2026-07-21
Claude Sonnet 5Anthropic2026-06-30Humanity's Last ExamReasoning · Aktiv39.6%Artificial Analysis2026-07-21
Command ACohere2026-03-15Humanity's Last ExamReasoning · Aktiv4.6%Artificial Analysis2026-07-21
DeepSeek R1DeepSeek2025-01-20Humanity's Last ExamReasoning · Aktiv14.9%Artificial Analysis2026-07-21
DeepSeek V4 Pro (Reasoning, Max Effort)DeepSeek2026-04-24Humanity's Last ExamReasoning · Aktiv35.9%Artificial Analysis2026-07-21
Gemini 3 Flash PreviewGoogle2025-12-17Humanity's Last ExamReasoning · Aktiv14.1%Artificial Analysis2026-07-21
Gemini 3 ProGoogle2025-11-18Humanity's Last ExamReasoning · Aktiv37.2%Artificial Analysis2026-07-21
Gemini 3.1 Flash LiteGoogle2026-05-07Humanity's Last ExamReasoning · Aktiv16.2%Artificial Analysis2026-07-21
Gemini 3.1 Pro PreviewGoogle2026-02-19Humanity's Last ExamReasoning · Aktiv44.7%Artificial Analysis2026-07-21
Gemini 3.5 FlashGoogle2026-05-19Humanity's Last ExamReasoning · Aktiv41%Artificial Analysis2026-07-21
Gemini 3.5 Flash (medium)Google2026-05-19Humanity's Last ExamReasoning · Aktiv39.9%Artificial Analysis2026-07-21
Gemma 4 12B (Non-reasoning)Google2026-06-10Humanity's Last ExamReasoning · Aktiv6.2%Artificial Analysis2026-07-21
Gemma 4 12B (Reasoning)Google2026-06-07Humanity's Last ExamReasoning · Aktiv14.8%Artificial Analysis2026-07-21
Gemma 4 31B ITGoogle2026-03-01Humanity's Last ExamReasoning · Aktiv22.7%Artificial Analysis2026-07-21
GLM-5.1Zhipu2026-04-07Humanity's Last ExamReasoning · Aktiv28%Artificial Analysis2026-07-21
GLM-5.2Zhipu2026-06-13Humanity's Last ExamReasoning · Aktiv40.1%Artificial Analysis2026-07-21
GPT 5.4OpenAI2026-03-05Humanity's Last ExamReasoning · Aktiv41.6%Artificial Analysis2026-07-21
GPT 5.5OpenAI2026-04-23Humanity's Last ExamReasoning · Aktiv44.3%Artificial Analysis2026-07-21
GPT-5.1OpenAI2025-11-13Humanity's Last ExamReasoning · Aktiv26.5%Artificial Analysis2026-07-21
GPT-5.2OpenAI2025-12-11Humanity's Last ExamReasoning · Aktiv35.4%Artificial Analysis2026-07-21
GPT-5.3 Codex (xhigh)OpenAI2026-02-05Humanity's Last ExamReasoning · Aktiv39.9%Artificial Analysis2026-07-21
GPT-5.4 MiniOpenAI2026-03-17Humanity's Last ExamReasoning · Aktiv26.6%Artificial Analysis2026-07-21
GPT-5.4 NanoOpenAI2026-03-17Humanity's Last ExamReasoning · Aktiv26.5%Artificial Analysis2026-07-21
GPT-5.5 (high)OpenAI2026-04-23Humanity's Last ExamReasoning · Aktiv43%Artificial Analysis2026-07-21
GPT-5.5 (low)OpenAI2026-04-23Humanity's Last ExamReasoning · Aktiv31%Artificial Analysis2026-07-21
GPT-5.5 (medium)OpenAI2026-04-23Humanity's Last ExamReasoning · Aktiv40.6%Artificial Analysis2026-07-21
GPT-5.6 LunaOpenAI2026-07-09Humanity's Last ExamReasoning · Aktiv37.2%Artificial Analysis2026-07-21
GPT-5.6 SolOpenAI2026-07-09Humanity's Last ExamReasoning · Aktiv47.2%Artificial Analysis2026-07-21
GPT-5.6 TerraOpenAI2026-07-09Humanity's Last ExamReasoning · Aktiv41.8%Artificial Analysis2026-07-21
Grok 4.20 ReasoningxAI2026-03-05Humanity's Last ExamReasoning · Aktiv32.2%Artificial Analysis2026-07-21
Grok 4.3xAI2026-04-30Humanity's Last ExamReasoning · Aktiv35%Artificial Analysis2026-07-21
Grok 4.5xAI2026-07-08Humanity's Last ExamReasoning · Aktiv40.3%Artificial Analysis2026-07-21
HyperNova 60B 2605Multiverse2026-05-06Humanity's Last ExamReasoning · Aktiv15.1%Artificial Analysis2026-07-21
Kimi K2.5Moonshot2026-01-27Humanity's Last ExamReasoning · Aktiv29.4%Artificial Analysis2026-07-21
Kimi K2.6Moonshot2026-04-20Humanity's Last ExamReasoning · Aktiv35.9%Artificial Analysis2026-07-21
Kimi K2.7 CodeMoonshot2026-06-12Humanity's Last ExamReasoning · Aktiv32.8%Artificial Analysis2026-07-21
Kimi K3Moonshot2026-07-16Humanity's Last ExamReasoning · Aktiv44.3%Artificial Analysis2026-07-21
LFM2.5-8B-A1BLiquid2026-06-08Humanity's Last ExamReasoning · Aktiv6.9%Artificial Analysis2026-07-21
Llama 4 MaverickMeta2026-04-05Humanity's Last ExamReasoning · Aktiv4.8%Artificial Analysis2026-07-21
Llama 4 ScoutMeta2026-04-05Humanity's Last ExamReasoning · Aktiv4.3%Artificial Analysis2026-07-21
LongCat-2.0Meituan2026-06-29Humanity's Last ExamReasoning · Aktiv32.1%Artificial Analysis2026-07-21
MiMo-V2.5-ProXiaomi2026-04-22Humanity's Last ExamReasoning · Aktiv33.8%Artificial Analysis2026-07-21
MiniCPM5-1B (Reasoning)OpenBMB2026-06-04Humanity's Last ExamReasoning · Aktiv6.5%Artificial Analysis2026-07-21
MiniMax M2.5MiniMax2026-04-01Humanity's Last ExamReasoning · Aktiv19.1%Artificial Analysis2026-07-21
MiniMax M2.7MiniMax2026-04-15Humanity's Last ExamReasoning · Aktiv28.1%Artificial Analysis2026-07-21
MiniMax M3MiniMax2026-05-31Humanity's Last ExamReasoning · Aktiv37.1%Artificial Analysis2026-07-21
Mistral Large 3Mistral2025-12-02Humanity's Last ExamReasoning · Aktiv4.1%Artificial Analysis2026-07-21
Muse SparkOther2026-01-01Humanity's Last ExamReasoning · Aktiv39.9%Artificial Analysis2026-07-21
Muse Spark 1.1Meta2026-07-09Humanity's Last ExamReasoning · Aktiv45.1%Artificial Analysis2026-07-21
Nemotron 3 Ultra 550B A55B (Reasoning)NVIDIA2026-06-04Humanity's Last ExamReasoning · Aktiv26.6%Artificial Analysis2026-07-21
North Mini CodeCohere2026-06-09Humanity's Last ExamReasoning · Aktiv10%Artificial Analysis2026-07-21
OpenAI o1OpenAI2024-09-12Humanity's Last ExamReasoning · Aktiv7.7%Artificial Analysis2026-07-21
OpenAI o3OpenAI2025-04-16Humanity's Last ExamReasoning · Aktiv20%Artificial Analysis2026-07-21
Qwen 3.7 PlusAlibaba2026-06-02Humanity's Last ExamReasoning · Aktiv33.4%Artificial Analysis2026-07-21
Qwen3.7 MaxAlibaba2026-05-19Humanity's Last ExamReasoning · Aktiv38.1%Artificial Analysis2026-07-21
Step 3.7 FlashStepFun2026-06-01Humanity's Last ExamReasoning · Aktiv19.9%Artificial Analysis2026-07-21
Claude Fable 5Anthropic2026-06-09IFBenchReasoning · Ausgedient63.47%Artificial Analysis2026-07-21
Claude Opus 4.5Anthropic2025-11-24IFBenchReasoning · Ausgedient42.99%Artificial Analysis2026-07-21
Claude Opus 4.6Anthropic2026-02-05IFBenchReasoning · Ausgedient44.63%Artificial Analysis2026-07-21
Claude Opus 4.6 (Adaptive Reasoning, Max Effort)Anthropic2026-02-05IFBenchReasoning · Ausgedient53.13%Artificial Analysis2026-07-21
Claude Opus 4.7Anthropic2026-04-16IFBenchReasoning · Ausgedient58.64%Artificial Analysis2026-07-21
Claude Opus 4.7 (Non-reasoning, High Effort)Anthropic2026-04-16IFBenchReasoning · Ausgedient43.61%Artificial Analysis2026-07-21
Claude Opus 4.8Anthropic2026-05-28IFBenchReasoning · Ausgedient62.24%Artificial Analysis2026-07-21
Claude Sonnet 4.6Anthropic2026-02-17IFBenchReasoning · Ausgedient41.16%Artificial Analysis2026-07-21
Claude Sonnet 4.6 (Adaptive Reasoning, Max Effort)Anthropic2026-02-17IFBenchReasoning · Ausgedient56.6%Artificial Analysis2026-07-21
DeepSeek R1DeepSeek2025-01-20IFBenchReasoning · Ausgedient39.59%Artificial Analysis2026-07-21
DeepSeek V4 Pro (Reasoning, Max Effort)DeepSeek2026-04-24IFBenchReasoning · Ausgedient76.46%Artificial Analysis2026-07-21
Gemini 3 Flash PreviewGoogle2025-12-17IFBenchReasoning · Ausgedient55.1%Artificial Analysis2026-07-21
Gemini 3 ProGoogle2025-11-18IFBenchReasoning · Ausgedient70.41%Artificial Analysis2026-07-21
Gemini 3.1 Flash LiteGoogle2026-05-07IFBenchReasoning · Ausgedient77.21%Artificial Analysis2026-07-21
Gemini 3.1 Pro PreviewGoogle2026-02-19IFBenchReasoning · Ausgedient77.14%Artificial Analysis2026-07-21
Gemini 3.5 FlashGoogle2026-05-19IFBenchReasoning · Ausgedient76.33%Artificial Analysis2026-07-21
Gemini 3.5 Flash (medium)Google2026-05-19IFBenchReasoning · Ausgedient74.56%Artificial Analysis2026-07-21
Gemma 4 12B (Non-reasoning)Google2026-06-10IFBenchReasoning · Ausgedient45.17%Artificial Analysis2026-07-21
Gemma 4 12B (Reasoning)Google2026-06-07IFBenchReasoning · Ausgedient73.54%Artificial Analysis2026-07-21
Gemma 4 31B ITGoogle2026-03-01IFBenchReasoning · Ausgedient75.58%Artificial Analysis2026-07-21
GLM-5.1Zhipu2026-04-07IFBenchReasoning · Ausgedient76.26%Artificial Analysis2026-07-21
GLM-5.2Zhipu2026-06-13IFBenchReasoning · Ausgedient73.33%Artificial Analysis2026-07-21
GPT 5.4OpenAI2026-03-05IFBenchReasoning · Ausgedient73.95%Artificial Analysis2026-07-21
GPT 5.5OpenAI2026-04-23IFBenchReasoning · Ausgedient75.85%Artificial Analysis2026-07-21
GPT-5.1OpenAI2025-11-13IFBenchReasoning · Ausgedient72.86%Artificial Analysis2026-07-21
GPT-5.2OpenAI2025-12-11IFBenchReasoning · Ausgedient75.44%Artificial Analysis2026-07-21
GPT-5.3 Codex (xhigh)OpenAI2026-02-05IFBenchReasoning · Ausgedient75.37%Artificial Analysis2026-07-21
GPT-5.4 MiniOpenAI2026-03-17IFBenchReasoning · Ausgedient73.27%Artificial Analysis2026-07-21
GPT-5.4 NanoOpenAI2026-03-17IFBenchReasoning · Ausgedient75.92%Artificial Analysis2026-07-21
GPT-5.5 (high)OpenAI2026-04-23IFBenchReasoning · Ausgedient71.63%Artificial Analysis2026-07-21
GPT-5.5 (low)OpenAI2026-04-23IFBenchReasoning · Ausgedient64.35%Artificial Analysis2026-07-21
GPT-5.5 (medium)OpenAI2026-04-23IFBenchReasoning · Ausgedient70.95%Artificial Analysis2026-07-21
GPT-5.6 SolOpenAI2026-07-09IFBenchReasoning · Ausgedient72.65%Artificial Analysis2026-07-21
GPT-5.6 TerraOpenAI2026-07-09IFBenchReasoning · Ausgedient71.22%Artificial Analysis2026-07-21
Grok 4.20 ReasoningxAI2026-03-05IFBenchReasoning · Ausgedient81.22%Artificial Analysis2026-07-21
Grok 4.3xAI2026-04-30IFBenchReasoning · Ausgedient81.29%Artificial Analysis2026-07-21
HyperNova 60B 2605Multiverse2026-05-06IFBenchReasoning · Ausgedient66.46%Artificial Analysis2026-07-21
Kimi K2.5Moonshot2026-01-27IFBenchReasoning · Ausgedient70.2%Artificial Analysis2026-07-21
Kimi K2.6Moonshot2026-04-20IFBenchReasoning · Ausgedient75.99%Artificial Analysis2026-07-21
Kimi K2.7 CodeMoonshot2026-06-12IFBenchReasoning · Ausgedient63.13%Artificial Analysis2026-07-21
LFM2.5-8B-A1BLiquid2026-06-08IFBenchReasoning · Ausgedient55.65%Artificial Analysis2026-07-21
Llama 4 MaverickMeta2026-04-05IFBenchReasoning · Ausgedient42.99%Artificial Analysis2026-07-21
Llama 4 ScoutMeta2026-04-05IFBenchReasoning · Ausgedient39.52%Artificial Analysis2026-07-21
MiMo-V2.5-ProXiaomi2026-04-22IFBenchReasoning · Ausgedient79.86%Artificial Analysis2026-07-21
MiniCPM5-1B (Reasoning)OpenBMB2026-06-04IFBenchReasoning · Ausgedient49.32%Artificial Analysis2026-07-21
MiniMax M2.5MiniMax2026-04-01IFBenchReasoning · Ausgedient71.63%Artificial Analysis2026-07-21
MiniMax M2.7MiniMax2026-04-15IFBenchReasoning · Ausgedient75.71%Artificial Analysis2026-07-21
MiniMax M3MiniMax2026-05-31IFBenchReasoning · Ausgedient82.86%Artificial Analysis2026-07-21
Mistral Large 3Mistral2025-12-02IFBenchReasoning · Ausgedient36.19%Artificial Analysis2026-07-21
Muse SparkOther2026-01-01IFBenchReasoning · Ausgedient75.92%Artificial Analysis2026-07-21
Nemotron 3 Ultra 550B A55B (Reasoning)NVIDIA2026-06-04IFBenchReasoning · Ausgedient81.36%Artificial Analysis2026-07-21
North Mini CodeCohere2026-06-09IFBenchReasoning · Ausgedient57.55%Artificial Analysis2026-07-21
OpenAI o1OpenAI2024-09-12IFBenchReasoning · Ausgedient70.34%Artificial Analysis2026-07-21
OpenAI o3OpenAI2025-04-16IFBenchReasoning · Ausgedient71.43%Artificial Analysis2026-07-21
Qwen 3.7 PlusAlibaba2026-06-02IFBenchReasoning · Ausgedient77.96%Artificial Analysis2026-07-21
Qwen3.7 MaxAlibaba2026-05-19IFBenchReasoning · Ausgedient80.54%Artificial Analysis2026-07-21
Step 3.7 FlashStepFun2026-06-01IFBenchReasoning · Ausgedient67.28%Artificial Analysis2026-07-21
Claude Haiku 4.5Anthropic2025-10-01LiveBenchReasoning · Aktiv57.8%LiveBench leaderboard2026-04-15
Claude Opus 4.6Anthropic2026-02-05LiveBenchReasoning · Aktiv71.4%LiveBench leaderboard2026-04-15
Claude Opus 4.8Anthropic2026-05-28LiveBenchReasoning · Aktiv70.8%LiveBench leaderboard2026-04-15
Claude Sonnet 4.6Anthropic2026-02-17LiveBenchReasoning · Aktiv67.2%LiveBench leaderboard2026-04-15
DeepSeek R1DeepSeek2025-01-20LiveBenchReasoning · Aktiv64.1%LiveBench leaderboard2026-04-15
DeepSeek V4DeepSeek2026-04-24LiveBenchReasoning · Aktiv61.9%LiveBench leaderboard2026-04-15
Gemini 3 Flash PreviewGoogle2025-12-17LiveBenchReasoning · Aktiv63.5%LiveBench leaderboard2026-04-15
Gemini 3.1 ProGoogle2026-02-19LiveBenchReasoning · Aktiv65.8%LiveBench leaderboard2026-04-15
Gemini 3.5 FlashGoogle2026-05-19LiveBenchReasoning · Aktiv64.2%LiveBench leaderboard2026-04-15
GPT 5.4OpenAI2026-03-05LiveBenchReasoning · Aktiv66.4%LiveBench leaderboard2026-04-15
GPT 5.5OpenAI2026-04-23LiveBenchReasoning · Aktiv69.8%LiveBench leaderboard2026-04-15
Grok 4.20 ReasoningxAI2026-03-05LiveBenchReasoning · Aktiv56.4%LiveBench leaderboard2026-04-15
Grok 4.3xAI2026-04-30LiveBenchReasoning · Aktiv60.8%LiveBench leaderboard2026-04-15
Kimi K2.5Moonshot2026-01-27LiveBenchReasoning · Aktiv61.2%LiveBench leaderboard2026-04-15
Kimi K2.6Moonshot2026-04-20LiveBenchReasoning · Aktiv62.4%LiveBench leaderboard2026-04-15
Llama 4 MaverickMeta2026-04-05LiveBenchReasoning · Aktiv62.1%LiveBench leaderboard2026-04-15
Llama 4 ScoutMeta2026-04-05LiveBenchReasoning · Aktiv58.9%LiveBench leaderboard2026-04-15
MiniMax M3MiniMax2026-05-31LiveBenchReasoning · Aktiv59.6%LiveBench leaderboard2026-04-15
Mistral Large 3Mistral2025-12-02LiveBenchReasoning · Aktiv62.8%LiveBench leaderboard2026-04-15
o3OpenAI2025-04-16LiveBenchReasoning · Aktiv68.5%LiveBench leaderboard2026-04-15
Qwen 3.7 MaxAlibaba2026-05-20LiveBenchReasoning · Aktiv61.6%LiveBench leaderboard2026-04-15
Claude 3 OpusAnthropic2024-03-04LiveCodeBenchCoding · Aktiv27.9%Artificial Analysis2026-07-21
Claude Opus 4.5Anthropic2025-11-24LiveCodeBenchCoding · Aktiv73.8%Artificial Analysis2026-07-21
Command ACohere2026-03-15LiveCodeBenchCoding · Aktiv28.7%Artificial Analysis2026-07-21
DeepSeek R1DeepSeek2025-01-20LiveCodeBenchCoding · Aktiv77%Artificial Analysis2026-07-21
Gemini 3 Flash PreviewGoogle2025-12-17LiveCodeBenchCoding · Aktiv79.7%Artificial Analysis2026-07-21
Gemini 3 ProGoogle2025-11-18LiveCodeBenchCoding · Aktiv91.7%Artificial Analysis2026-07-21
GPT-5.1OpenAI2025-11-13LiveCodeBenchCoding · Aktiv86.8%Artificial Analysis2026-07-21
GPT-5.2OpenAI2025-12-11LiveCodeBenchCoding · Aktiv88.9%Artificial Analysis2026-07-21
Llama 4 MaverickMeta2026-04-05LiveCodeBenchCoding · Aktiv39.7%Artificial Analysis2026-07-21
Llama 4 ScoutMeta2026-04-05LiveCodeBenchCoding · Aktiv29.9%Artificial Analysis2026-07-21
Mistral Large 3Mistral2025-12-02LiveCodeBenchCoding · Aktiv46.5%Artificial Analysis2026-07-21
OpenAI o1OpenAI2024-09-12LiveCodeBenchCoding · Aktiv67.9%Artificial Analysis2026-07-21
OpenAI o3OpenAI2025-04-16LiveCodeBenchCoding · Aktiv80.8%Artificial Analysis2026-07-21
Claude Haiku 4.5Anthropic2025-10-01LMArena (Chatbot Arena)Menschliche Präferenz · Aktiv1368LMArena leaderboard2026-05-25
Claude Opus 4.7Anthropic2026-04-16LMArena (Chatbot Arena)Menschliche Präferenz · Aktiv1412LMArena leaderboard2026-05-25
Claude Opus 4.8Anthropic2026-05-28LMArena (Chatbot Arena)Menschliche Präferenz · Aktiv1462LMArena leaderboard2026-05-25
Claude Sonnet 4.6Anthropic2026-02-17LMArena (Chatbot Arena)Menschliche Präferenz · Aktiv1396LMArena leaderboard2026-05-25
DeepSeek V4DeepSeek2026-04-24LMArena (Chatbot Arena)Menschliche Präferenz · Aktiv1418LMArena leaderboard2026-05-25
Gemini 3.1 ProGoogle2026-02-19LMArena (Chatbot Arena)Menschliche Präferenz · Aktiv1402LMArena leaderboard2026-05-25
Gemini 3.5 FlashGoogle2026-05-19LMArena (Chatbot Arena)Menschliche Präferenz · Aktiv1455LMArena leaderboard2026-05-25
GPT 5.4OpenAI2026-03-05LMArena (Chatbot Arena)Menschliche Präferenz · Aktiv1405LMArena leaderboard2026-05-25
GPT 5.5OpenAI2026-04-23LMArena (Chatbot Arena)Menschliche Präferenz · Aktiv1473LMArena leaderboard2026-05-25
Grok 4.3xAI2026-04-30LMArena (Chatbot Arena)Menschliche Präferenz · Aktiv1441LMArena leaderboard2026-05-25
Kimi K2.6Moonshot2026-04-20LMArena (Chatbot Arena)Menschliche Präferenz · Aktiv1388LMArena leaderboard2026-05-25
MiniMax M3MiniMax2026-05-31LMArena (Chatbot Arena)Menschliche Präferenz · Aktiv1376LMArena leaderboard2026-05-25
Qwen 3.7 MaxAlibaba2026-05-20LMArena (Chatbot Arena)Menschliche Präferenz · Aktiv1409LMArena leaderboard2026-05-25
Claude Haiku 4.5Anthropic2025-10-01LongBench v2Langer Kontext · Aktiv44.8%LongBench v2 leaderboard2026-04-01
Claude Opus 4.8Anthropic2026-05-28LongBench v2Langer Kontext · Aktiv58.4%LongBench v2 leaderboard2026-04-01
Claude Sonnet 4.6Anthropic2026-02-17LongBench v2Langer Kontext · Aktiv52.6%LongBench v2 leaderboard2026-04-01
DeepSeek V4DeepSeek2026-04-24LongBench v2Langer Kontext · Aktiv48.6%LongBench v2 leaderboard2026-04-01
Gemini 2.0 UltraGoogle2024-12-11LongBench v2Langer Kontext · Aktiv54.8%LongBench v2 leaderboard2026-04-01
Gemini 3 Flash PreviewGoogle2025-12-17LongBench v2Langer Kontext · Aktiv51.4%LongBench v2 leaderboard2026-04-01
Gemini 3.1 ProGoogle2026-02-19LongBench v2Langer Kontext · Aktiv55.4%LongBench v2 leaderboard2026-04-01
Gemini 3.5 FlashGoogle2026-05-19LongBench v2Langer Kontext · Aktiv53.8%LongBench v2 leaderboard2026-04-01
GPT 5.4OpenAI2026-03-05LongBench v2Langer Kontext · Aktiv54.2%LongBench v2 leaderboard2026-04-01
GPT 5.5OpenAI2026-04-23LongBench v2Langer Kontext · Aktiv56.1%LongBench v2 leaderboard2026-04-01
Grok 4.3xAI2026-04-30LongBench v2Langer Kontext · Aktiv46.2%LongBench v2 leaderboard2026-04-01
Kimi K2.5Moonshot2026-01-27LongBench v2Langer Kontext · Aktiv48.2%LongBench v2 leaderboard2026-04-01
Kimi K2.6Moonshot2026-04-20LongBench v2Langer Kontext · Aktiv49.1%LongBench v2 leaderboard2026-04-01
Llama 4 MaverickMeta2026-04-05LongBench v2Langer Kontext · Aktiv49.8%LongBench v2 leaderboard2026-04-01
Llama 4 ScoutMeta2026-04-05LongBench v2Langer Kontext · Aktiv57.2%LongBench v2 leaderboard2026-04-01
MiniMax M3MiniMax2026-05-31LongBench v2Langer Kontext · Aktiv45.6%LongBench v2 leaderboard2026-04-01
Mistral Large 3Mistral2025-12-02LongBench v2Langer Kontext · Aktiv50.8%LongBench v2 leaderboard2026-04-01
o3OpenAI2025-04-16LongBench v2Langer Kontext · Aktiv51.2%LongBench v2 leaderboard2026-04-01
Qwen 3.7 MaxAlibaba2026-05-20LongBench v2Langer Kontext · Aktiv47.8%LongBench v2 leaderboard2026-04-01
Claude 3 OpusAnthropic2024-03-04MATHMathe · Ausgedient64.07%Artificial Analysis2026-07-21
Claude 3.5 Sonnet (2024-06)Anthropic2024-06-20MATHMathe · Ausgedient71.1%Anthropic Claude 3.5 Sonnet2024-06-20
Claude Opus 4Anthropic2024-07-01MATHMathe · Ausgedient85.6%Anthropic model card2025-06-01
Claude Opus 4.8Anthropic2026-05-28MATHMathe · Ausgedient88.4%Anthropic Claude 4 family2026-05-28
Claude Sonnet 4.6Anthropic2026-02-17MATHMathe · Ausgedient84.2%Anthropic Claude 3.7/4.6 model card2026-02-17
Command ACohere2026-03-15MATHMathe · Ausgedient81.87%Artificial Analysis2026-07-21
DeepSeek Coder V2DeepSeek2024-05-15MATHMathe · Ausgedient74.27%Artificial Analysis2026-07-21
DeepSeek R1DeepSeek2025-01-20MATHMathe · Ausgedient79.8%DeepSeek R1 model card2025-01-20
DeepSeek V4 Pro MaxDeepSeek2026-04-24MATHMathe · Ausgedient83.9%DeepSeek V4 release2026-04-24
Gemini 3.1 ProGoogle2026-02-19MATHMathe · Ausgedient86.7%Google Gemini 3.1 Pro2026-02-19
GPT 5OpenAI2025-12-11MATHMathe · Ausgedient87.2%OpenAI model release notes2025-12-01
GPT 5.5OpenAI2026-04-23MATHMathe · Ausgedient89.6%OpenAI model release notes2026-04-23
GPT-4 (2023)OpenAI2023-03-14MATHMathe · Ausgedient52.9%GPT-4 Technical Report2023-03-15
Kimi K2.6Moonshot2026-04-20MATHMathe · Ausgedient82.5%Moonshot Kimi K2.62026-04-20
Llama 4 MaverickMeta2026-04-05MATHMathe · Ausgedient88.87%Artificial Analysis2026-07-21
Llama 4 ScoutMeta2026-04-05MATHMathe · Ausgedient84.4%Artificial Analysis2026-07-21
o3 (high compute)OpenAI2025-04-16MATHMathe · Ausgedient91.1%OpenAI: Learning to Reason2025-01-20
OpenAI o1OpenAI2024-09-12MATHMathe · Ausgedient97%Artificial Analysis2026-07-21
OpenAI o3OpenAI2025-04-16MATHMathe · Ausgedient99.2%Artificial Analysis2026-07-21
Qwen 3.7 MaxAlibaba2026-05-20MATHMathe · Ausgedient81.6%Alibaba Qwen 3.7 Max2026-05-20
Claude Opus 4.8Anthropic2026-05-28MCP AtlasTool-Nutzung · Aktiv79.2%MCP Atlas leaderboard2026-06-09
Claude Sonnet 4.6Anthropic2026-02-17MCP AtlasTool-Nutzung · Aktiv75.4%MCP Atlas leaderboard2026-06-09
DeepSeek V4 Pro MaxDeepSeek2026-04-24MCP AtlasTool-Nutzung · Aktiv72.6%MCP Atlas leaderboard2026-06-09
Gemini 3.1 ProGoogle2026-02-19MCP AtlasTool-Nutzung · Aktiv74.1%MCP Atlas leaderboard2026-06-09
Gemini 3.5 FlashGoogle2026-05-19MCP AtlasTool-Nutzung · Aktiv83.6%MCP Atlas leaderboard2026-05-15
GPT 5.5OpenAI2026-04-23MCP AtlasTool-Nutzung · Aktiv77.8%MCP Atlas leaderboard2026-06-09
Kimi K2.6Moonshot2026-04-20MCP AtlasTool-Nutzung · Aktiv69.7%MCP Atlas leaderboard2026-06-09
MiniMax M3MiniMax2026-05-31MCP AtlasTool-Nutzung · Aktiv68.9%MCP Atlas leaderboard2026-06-09
Mistral Large 3Mistral2025-12-02MCP AtlasTool-Nutzung · Aktiv70.4%MCP Atlas leaderboard2026-06-09
Qwen 3.7 MaxAlibaba2026-05-20MCP AtlasTool-Nutzung · Aktiv71.8%MCP Atlas leaderboard2026-06-09
Claude 3 OpusAnthropic2024-03-04MMLUWissen · Gesättigt86.8%Anthropic Claude 3 model card2024-03-04
Claude Haiku 4.5Anthropic2025-10-01MMLUWissen · Gesättigt85.6%Anthropic Claude Haiku 4.52025-10-01
Claude Opus 4.6Anthropic2026-02-05MMLUWissen · Gesättigt91.2%Anthropic Claude 3.7/4.6 model card2026-01-01
Claude Opus 4.8Anthropic2026-05-28MMLUWissen · Gesättigt91.4%Anthropic Claude 4 family2026-05-28
Claude Sonnet 4.6Anthropic2026-02-17MMLUWissen · Gesättigt90.6%Anthropic Claude 3.7/4.6 model card2026-02-17
DeepSeek R1DeepSeek2025-01-20MMLUWissen · Gesättigt87.4%DeepSeek R1 model card2025-01-20
DeepSeek V4 Pro MaxDeepSeek2026-04-24MMLUWissen · Gesättigt89.7%DeepSeek V4 release2026-04-24
Gemini 1.5 Ultra (2024)Google2024-02-15MMLUWissen · Gesättigt90%Gemini technical report2023-12-06
Gemini 3 FlashGoogle2025-12-17MMLUWissen · Gesättigt87.2%Google Gemini 3 Flash2025-12-17
Gemini 3.1 ProGoogle2026-02-19MMLUWissen · Gesättigt90.3%Google Gemini 3.1 Pro2026-02-19
Gemini 3.5 FlashGoogle2026-05-19MMLUWissen · Gesättigt88.4%Google Gemini 3.5 Flash2026-05-19
GPT 5.4OpenAI2026-03-05MMLUWissen · Gesättigt89.8%OpenAI GPT-5.4 release2026-03-05
GPT 5.5OpenAI2026-04-23MMLUWissen · Gesättigt90.8%OpenAI model release notes2025-12-01
GPT-4 (2023)OpenAI2023-03-14MMLUWissen · Gesättigt86.4%GPT-4 Technical Report2023-03-15
Grok 4.3xAI2026-04-30MMLUWissen · Gesättigt88.5%xAI Grok 4.32026-04-30
Kimi K2.5Moonshot2026-01-27MMLUWissen · Gesättigt86.4%Moonshot Kimi K2.52026-01-27
Kimi K2.6Moonshot2026-04-20MMLUWissen · Gesättigt89.1%Moonshot Kimi K2.62026-04-20
Llama 4 MaverickMeta2026-04-05MMLUWissen · Gesättigt86.1%Meta Llama 4 model card2026-04-05
Llama 4 ScoutMeta2026-04-05MMLUWissen · Gesättigt85.2%Meta Llama 4 Scout model card2026-04-05
MiniMax M3MiniMax2026-05-31MMLUWissen · Gesättigt84.8%MiniMax M32026-05-31
Mistral Large 3Mistral2025-12-02MMLUWissen · Gesättigt87.8%Mistral Large 3 model card2025-12-02
Qwen 3.7 MaxAlibaba2026-05-20MMLUWissen · Gesättigt88.9%Alibaba Qwen 3.7 Max2026-05-20
Claude 3 OpusAnthropic2024-03-04MMLU-ProWissen · Aktiv68.4%MMLU-Pro paper2024-06-03
Claude Opus 4.5Anthropic2025-11-24MMLU-ProWissen · Aktiv88.9%Artificial Analysis2026-07-21
Claude Opus 4.8Anthropic2026-05-28MMLU-ProWissen · Aktiv82.4%MMLU-Pro HuggingFace leaderboard2026-05-28
Claude Sonnet 4.6Anthropic2026-02-17MMLU-ProWissen · Aktiv78.2%MMLU-Pro HuggingFace leaderboard2026-02-17
Command ACohere2026-03-15MMLU-ProWissen · Aktiv71.2%Artificial Analysis2026-07-21
DeepSeek R1DeepSeek2025-01-20MMLU-ProWissen · Aktiv84.9%Artificial Analysis2026-07-21
DeepSeek V4 Pro MaxDeepSeek2026-04-24MMLU-ProWissen · Aktiv76.4%MMLU-Pro HuggingFace leaderboard2026-04-24
Gemini 3 Flash PreviewGoogle2025-12-17MMLU-ProWissen · Aktiv88.2%Artificial Analysis2026-07-21
Gemini 3 ProGoogle2025-11-18MMLU-ProWissen · Aktiv89.8%Artificial Analysis2026-07-21
Gemini 3.1 ProGoogle2026-02-19MMLU-ProWissen · Aktiv79.8%MMLU-Pro HuggingFace leaderboard2026-02-19
GPT 5.5OpenAI2026-04-23MMLU-ProWissen · Aktiv81.6%MMLU-Pro HuggingFace leaderboard2026-04-23
GPT-4o (2024)OpenAI2024-05-01MMLU-ProWissen · Aktiv72.6%MMLU-Pro paper2024-06-03
GPT-5.1OpenAI2025-11-13MMLU-ProWissen · Aktiv87%Artificial Analysis2026-07-21
GPT-5.2OpenAI2025-12-11MMLU-ProWissen · Aktiv87.4%Artificial Analysis2026-07-21
Kimi K2.6Moonshot2026-04-20MMLU-ProWissen · Aktiv74.6%MMLU-Pro HuggingFace leaderboard2026-04-20
Llama 4 MaverickMeta2026-04-05MMLU-ProWissen · Aktiv80.9%Artificial Analysis2026-07-21
Llama 4 ScoutMeta2026-04-05MMLU-ProWissen · Aktiv75.2%Artificial Analysis2026-07-21
Mistral Large 3Mistral2025-12-02MMLU-ProWissen · Aktiv72.8%MMLU-Pro HuggingFace leaderboard2025-12-02
OpenAI o1OpenAI2024-09-12MMLU-ProWissen · Aktiv84.1%Artificial Analysis2026-07-21
OpenAI o3OpenAI2025-04-16MMLU-ProWissen · Aktiv85.3%Artificial Analysis2026-07-21
Qwen 3.7 MaxAlibaba2026-05-20MMLU-ProWissen · Aktiv75.1%MMLU-Pro HuggingFace leaderboard2026-05-20
Claude Opus 4.8Anthropic2026-05-28MMMUMultimodal · Aktiv70.6%MMMU leaderboard2026-05-28
Claude Sonnet 4.6Anthropic2026-02-17MMMUMultimodal · Aktiv66.2%MMMU leaderboard2026-02-17
Gemini 1.0 UltraGoogle2024-02-08MMMUMultimodal · Aktiv59.4%Gemini technical report2023-12-06
Gemini 3.1 ProGoogle2026-02-19MMMUMultimodal · Aktiv72.4%MMMU leaderboard2026-02-19
Gemini 3.5 FlashGoogle2026-05-19MMMUMultimodal · Aktiv68.9%MMMU leaderboard2026-05-19
GPT 5.5OpenAI2026-04-23MMMUMultimodal · Aktiv71.8%MMMU leaderboard2026-04-23
GPT-4V (2023)OpenAI2023-09-25MMMUMultimodal · Aktiv56.8%MMMU paper2023-11-27
Llama 4 MaverickMeta2026-04-05MMMUMultimodal · Aktiv61.4%MMMU leaderboard2026-04-05
Claude 3 OpusAnthropic2024-03-04SciCodeCoding · Aktiv23.3%Artificial Analysis2026-07-21
Claude Fable 5Anthropic2026-06-09SciCodeCoding · Aktiv60.2%Artificial Analysis2026-07-21
Claude Opus 4.5Anthropic2025-11-24SciCodeCoding · Aktiv47%Artificial Analysis2026-07-21
Claude Opus 4.6Anthropic2026-02-05SciCodeCoding · Aktiv45.7%Artificial Analysis2026-07-21
Claude Opus 4.6 (Adaptive Reasoning, Max Effort)Anthropic2026-02-05SciCodeCoding · Aktiv51.9%Artificial Analysis2026-07-21
Claude Opus 4.7Anthropic2026-04-16SciCodeCoding · Aktiv54.5%Artificial Analysis2026-07-21
Claude Opus 4.7 (Non-reasoning, High Effort)Anthropic2026-04-16SciCodeCoding · Aktiv50.1%Artificial Analysis2026-07-21
Claude Opus 4.8Anthropic2026-05-28SciCodeCoding · Aktiv53.5%Artificial Analysis2026-07-21
Claude Sonnet 4.6Anthropic2026-02-17SciCodeCoding · Aktiv46.9%Artificial Analysis2026-07-21
Claude Sonnet 4.6 (Adaptive Reasoning, Max Effort)Anthropic2026-02-17SciCodeCoding · Aktiv46.8%Artificial Analysis2026-07-21
Claude Sonnet 5Anthropic2026-06-30SciCodeCoding · Aktiv53.6%Artificial Analysis2026-07-21
Command ACohere2026-03-15SciCodeCoding · Aktiv28.1%Artificial Analysis2026-07-21
DeepSeek R1DeepSeek2025-01-20SciCodeCoding · Aktiv40.3%Artificial Analysis2026-07-21
DeepSeek V4 Pro (Reasoning, Max Effort)DeepSeek2026-04-24SciCodeCoding · Aktiv50%Artificial Analysis2026-07-21
Gemini 3 Flash PreviewGoogle2025-12-17SciCodeCoding · Aktiv49.9%Artificial Analysis2026-07-21
Gemini 3 ProGoogle2025-11-18SciCodeCoding · Aktiv56.1%Artificial Analysis2026-07-21
Gemini 3.1 Flash LiteGoogle2026-05-07SciCodeCoding · Aktiv41.9%Artificial Analysis2026-07-21
Gemini 3.1 Pro PreviewGoogle2026-02-19SciCodeCoding · Aktiv58.9%Artificial Analysis2026-07-21
Gemini 3.5 FlashGoogle2026-05-19SciCodeCoding · Aktiv53.1%Artificial Analysis2026-07-21
Gemini 3.5 Flash (medium)Google2026-05-19SciCodeCoding · Aktiv53%Artificial Analysis2026-07-21
Gemma 4 12B (Non-reasoning)Google2026-06-10SciCodeCoding · Aktiv29.7%Artificial Analysis2026-07-21
Gemma 4 12B (Reasoning)Google2026-06-07SciCodeCoding · Aktiv38.2%Artificial Analysis2026-07-21
Gemma 4 31B ITGoogle2026-03-01SciCodeCoding · Aktiv43.4%Artificial Analysis2026-07-21
GLM-5.1Zhipu2026-04-07SciCodeCoding · Aktiv43.8%Artificial Analysis2026-07-21
GLM-5.2Zhipu2026-06-13SciCodeCoding · Aktiv50.5%Artificial Analysis2026-07-21
GPT 5.4OpenAI2026-03-05SciCodeCoding · Aktiv56.6%Artificial Analysis2026-07-21
GPT 5.5OpenAI2026-04-23SciCodeCoding · Aktiv56.1%Artificial Analysis2026-07-21
GPT-5.1OpenAI2025-11-13SciCodeCoding · Aktiv43.3%Artificial Analysis2026-07-21
GPT-5.2OpenAI2025-12-11SciCodeCoding · Aktiv52.1%Artificial Analysis2026-07-21
GPT-5.3 Codex (xhigh)OpenAI2026-02-05SciCodeCoding · Aktiv53.2%Artificial Analysis2026-07-21
GPT-5.4 MiniOpenAI2026-03-17SciCodeCoding · Aktiv49.9%Artificial Analysis2026-07-21
GPT-5.4 NanoOpenAI2026-03-17SciCodeCoding · Aktiv46.9%Artificial Analysis2026-07-21
GPT-5.5 (high)OpenAI2026-04-23SciCodeCoding · Aktiv55.9%Artificial Analysis2026-07-21
GPT-5.5 (low)OpenAI2026-04-23SciCodeCoding · Aktiv51.6%Artificial Analysis2026-07-21
GPT-5.5 (medium)OpenAI2026-04-23SciCodeCoding · Aktiv53.5%Artificial Analysis2026-07-21
GPT-5.6 LunaOpenAI2026-07-09SciCodeCoding · Aktiv52.5%Artificial Analysis2026-07-21
GPT-5.6 SolOpenAI2026-07-09SciCodeCoding · Aktiv56.1%Artificial Analysis2026-07-21
GPT-5.6 TerraOpenAI2026-07-09SciCodeCoding · Aktiv53.9%Artificial Analysis2026-07-21
Grok 4.20 ReasoningxAI2026-03-05SciCodeCoding · Aktiv45.6%Artificial Analysis2026-07-21
Grok 4.3xAI2026-04-30SciCodeCoding · Aktiv47.3%Artificial Analysis2026-07-21
Grok 4.5xAI2026-07-08SciCodeCoding · Aktiv54.1%Artificial Analysis2026-07-21
HyperNova 60B 2605Multiverse2026-05-06SciCodeCoding · Aktiv33%Artificial Analysis2026-07-21
Kimi K2.5Moonshot2026-01-27SciCodeCoding · Aktiv49%Artificial Analysis2026-07-21
Kimi K2.6Moonshot2026-04-20SciCodeCoding · Aktiv53.5%Artificial Analysis2026-07-21
Kimi K2.7 CodeMoonshot2026-06-12SciCodeCoding · Aktiv47.5%Artificial Analysis2026-07-21
Kimi K3Moonshot2026-07-16SciCodeCoding · Aktiv58.7%Artificial Analysis2026-07-21
LFM2.5-8B-A1BLiquid2026-06-08SciCodeCoding · Aktiv7.8%Artificial Analysis2026-07-21
Llama 4 MaverickMeta2026-04-05SciCodeCoding · Aktiv33.1%Artificial Analysis2026-07-21
Llama 4 ScoutMeta2026-04-05SciCodeCoding · Aktiv17%Artificial Analysis2026-07-21
LongCat-2.0Meituan2026-06-29SciCodeCoding · Aktiv35.4%Artificial Analysis2026-07-21
MiMo-V2.5-ProXiaomi2026-04-22SciCodeCoding · Aktiv50.2%Artificial Analysis2026-07-21
MiniCPM5-1B (Reasoning)OpenBMB2026-06-04SciCodeCoding · Aktiv4.4%Artificial Analysis2026-07-21
MiniMax M2.5MiniMax2026-04-01SciCodeCoding · Aktiv42.6%Artificial Analysis2026-07-21
MiniMax M2.7MiniMax2026-04-15SciCodeCoding · Aktiv47%Artificial Analysis2026-07-21
MiniMax M3MiniMax2026-05-31SciCodeCoding · Aktiv45.4%Artificial Analysis2026-07-21
Mistral Large 3Mistral2025-12-02SciCodeCoding · Aktiv36.2%Artificial Analysis2026-07-21
Muse SparkOther2026-01-01SciCodeCoding · Aktiv51.5%Artificial Analysis2026-07-21
Muse Spark 1.1Meta2026-07-09SciCodeCoding · Aktiv58.2%Artificial Analysis2026-07-21
Nemotron 3 Ultra 550B A55B (Reasoning)NVIDIA2026-06-04SciCodeCoding · Aktiv39.9%Artificial Analysis2026-07-21
North Mini CodeCohere2026-06-09SciCodeCoding · Aktiv38.2%Artificial Analysis2026-07-21
OpenAI o1OpenAI2024-09-12SciCodeCoding · Aktiv35.8%Artificial Analysis2026-07-21
OpenAI o3OpenAI2025-04-16SciCodeCoding · Aktiv41%Artificial Analysis2026-07-21
Qwen 3.7 PlusAlibaba2026-06-02SciCodeCoding · Aktiv45.5%Artificial Analysis2026-07-21
Qwen3.7 MaxAlibaba2026-05-19SciCodeCoding · Aktiv48.8%Artificial Analysis2026-07-21
Step 3.7 FlashStepFun2026-06-01SciCodeCoding · Aktiv40%Artificial Analysis2026-07-21
Claude Mythos PreviewAnthropic2026-06-01SWE-bench VerifiedCoding · Gesättigt93.9%SWE-bench official leaderboard2026-06-02
Claude Opus 4.5 (SEAL)Anthropic2025-11-01SWE-bench VerifiedCoding · Gesättigt80.9%SWE-bench SEAL leaderboard2026-05-30
Claude Opus 4.6Anthropic2026-02-01SWE-bench VerifiedCoding · Gesättigt80.8%SWE-bench official leaderboard2026-05-30
Claude Opus 4.7 (Adaptive)Anthropic2026-04-16SWE-bench VerifiedCoding · Gesättigt87.6%SWE-bench official leaderboard2026-05-30
Claude Opus 4.8Anthropic2026-05-28SWE-bench VerifiedCoding · Gesättigt88.6%SWE-bench official leaderboard2026-05-30
Claude Sonnet 4.6Anthropic2026-02-17SWE-bench VerifiedCoding · Gesättigt79.6%SWE-bench official leaderboard2026-05-30
DeepSeek V4 Flash MaxDeepSeek2026-05-10SWE-bench VerifiedCoding · Gesättigt79%SWE-bench official leaderboard2026-05-30
DeepSeek V4 Pro MaxDeepSeek2026-04-24SWE-bench VerifiedCoding · Gesättigt80.6%SWE-bench official leaderboard2026-05-30
Gemini 3 FlashGoogle2025-12-17SWE-bench VerifiedCoding · Gesättigt78%SWE-bench official leaderboard2026-05-30
Gemini 3.1 ProGoogle2026-02-19SWE-bench VerifiedCoding · Gesättigt80.6%SWE-bench official leaderboard2026-05-30
Gemini 3.5 FlashGoogle2026-05-19SWE-bench VerifiedCoding · Gesättigt77.2%SWE-bench Verified leaderboard2026-06-09
GPT 5.2OpenAI2025-12-11SWE-bench VerifiedCoding · Gesättigt80%SWE-bench official leaderboard2026-05-30
GPT 5.4OpenAI2026-03-05SWE-bench VerifiedCoding · Gesättigt80%SWE-bench official leaderboard2026-05-30
GPT 5.5OpenAI2026-04-23SWE-bench VerifiedCoding · Gesättigt82.5%SWE-bench Verified leaderboard2026-06-01
Grok 4.3xAI2026-04-30SWE-bench VerifiedCoding · Gesättigt77.6%SWE-bench Verified leaderboard2026-06-09
Kimi K2.6Moonshot2026-04-20SWE-bench VerifiedCoding · Gesättigt80.2%SWE-bench official leaderboard2026-05-30
Llama 4 MaverickMeta2026-04-05SWE-bench VerifiedCoding · Gesättigt74.8%SWE-bench Verified leaderboard2026-06-09
LongCat-2.0Meituan2026-06-29SWE-bench VerifiedCoding · Gesättigt59.5%Meituan LongCat-2.0 release materials2026-06-29
MiniMax M2.5MiniMax2026-04-01SWE-bench VerifiedCoding · Gesättigt80.2%SWE-bench official leaderboard2026-05-30
MiniMax M3MiniMax2026-05-31SWE-bench VerifiedCoding · Gesättigt78.4%SWE-bench Verified leaderboard2026-06-09
Mistral Large 3Mistral2025-12-02SWE-bench VerifiedCoding · Gesättigt76.2%SWE-bench Verified leaderboard2026-06-09
Qwen 3.6 PlusAlibaba2026-04-01SWE-bench VerifiedCoding · Gesättigt78.8%SWE-bench official leaderboard2026-05-30
Qwen 3.7 MaxAlibaba2026-05-20SWE-bench VerifiedCoding · Gesättigt79.4%SWE-bench Verified leaderboard2026-06-09
Claude Fable 5Anthropic2026-06-09Terminal-BenchAgentisch · Aktiv84.64%Artificial Analysis2026-07-21
Claude Haiku 4.5Anthropic2025-10-01Terminal-BenchAgentisch · Aktiv61.4%Terminal-Bench 2.0 leaderboard2026-06-09
Claude Mythos PreviewAnthropic2026-06-01Terminal-BenchAgentisch · Aktiv84.1%Terminal-Bench 2.0 leaderboard2026-06-02
Claude Opus 4.5Anthropic2025-11-24Terminal-BenchAgentisch · Aktiv40.91%Artificial Analysis2026-07-21
Claude Opus 4.6 (Adaptive Reasoning, Max Effort)Anthropic2026-02-05Terminal-BenchAgentisch · Aktiv46.21%Artificial Analysis2026-07-21
Claude Opus 4.6 (ForgeCode)Anthropic2026-02-01Terminal-BenchAgentisch · Aktiv79.8%Terminal-Bench 2.0 leaderboard2026-05-20
Claude Opus 4.7 (Adaptive)Anthropic2026-04-16Terminal-BenchAgentisch · Aktiv69.4%Terminal-Bench 2.0 leaderboard2026-05-20
Claude Opus 4.7 (Non-reasoning, High Effort)Anthropic2026-04-16Terminal-BenchAgentisch · Aktiv54.55%Artificial Analysis2026-07-21
Claude Opus 4.8Anthropic2026-05-28Terminal-BenchAgentisch · Aktiv74.6%Terminal-Bench 2.0 leaderboard2026-05-20
Claude Sonnet 4.6Anthropic2026-02-17Terminal-BenchAgentisch · Aktiv68.4%Terminal-Bench 2.0 leaderboard2026-06-09
Claude Sonnet 4.6 (Adaptive Reasoning, Max Effort)Anthropic2026-02-17Terminal-BenchAgentisch · Aktiv71.16%Artificial Analysis2026-07-21
Claude Sonnet 5Anthropic2026-06-30Terminal-BenchAgentisch · Aktiv80.52%Artificial Analysis2026-07-21
Command ACohere2026-03-15Terminal-BenchAgentisch · Aktiv0.76%Artificial Analysis2026-07-21
DeepSeek R1DeepSeek2025-01-20Terminal-BenchAgentisch · Aktiv15.91%Artificial Analysis2026-07-21
DeepSeek V4 Pro (Reasoning, Max Effort)DeepSeek2026-04-24Terminal-BenchAgentisch · Aktiv64.04%Artificial Analysis2026-07-21
DeepSeek V4 Pro MaxDeepSeek2026-04-24Terminal-BenchAgentisch · Aktiv67.9%Terminal-Bench 2.0 leaderboard2026-05-20
Gemini 3 Flash PreviewGoogle2025-12-17Terminal-BenchAgentisch · Aktiv31.82%Artificial Analysis2026-07-21
Gemini 3 ProGoogle2025-11-18Terminal-BenchAgentisch · Aktiv41.67%Artificial Analysis2026-07-21
Gemini 3.1 Flash LiteGoogle2026-05-07Terminal-BenchAgentisch · Aktiv31.09%Artificial Analysis2026-07-21
Gemini 3.1 ProGoogle2026-02-19Terminal-BenchAgentisch · Aktiv65.4%Terminal-Bench 2.0 leaderboard2026-05-20
Gemini 3.1 Pro PreviewGoogle2026-02-19Terminal-BenchAgentisch · Aktiv73.78%Artificial Analysis2026-07-21
Gemini 3.5 FlashGoogle2026-05-19Terminal-BenchAgentisch · Aktiv76.2%Terminal-Bench 2.0 leaderboard2026-05-20
Gemini 3.5 Flash (medium)Google2026-05-19Terminal-BenchAgentisch · Aktiv39.39%Artificial Analysis2026-07-21
Gemma 4 12B (Non-reasoning)Google2026-06-10Terminal-BenchAgentisch · Aktiv11.36%Artificial Analysis2026-07-21
Gemma 4 12B (Reasoning)Google2026-06-07Terminal-BenchAgentisch · Aktiv18.18%Artificial Analysis2026-07-21
Gemma 4 31B ITGoogle2026-03-01Terminal-BenchAgentisch · Aktiv43.45%Artificial Analysis2026-07-21
GLM-5.1Zhipu2026-04-07Terminal-BenchAgentisch · Aktiv61.8%Artificial Analysis2026-07-21
GLM-5.2Zhipu2026-06-13Terminal-BenchAgentisch · Aktiv77.9%Artificial Analysis2026-07-21
GPT 5.4 (ForgeCode)OpenAI2026-03-05Terminal-BenchAgentisch · Aktiv81.8%Terminal-Bench 2.0 leaderboard2026-05-20
GPT 5.5 (Codex CLI)OpenAI2026-04-23Terminal-BenchAgentisch · Aktiv82%Terminal-Bench 2.0 leaderboard2026-05-20
GPT-5.1OpenAI2025-11-13Terminal-BenchAgentisch · Aktiv52.43%Artificial Analysis2026-07-21
GPT-5.2OpenAI2025-12-11Terminal-BenchAgentisch · Aktiv46.97%Artificial Analysis2026-07-21
GPT-5.3 Codex (xhigh)OpenAI2026-02-05Terminal-BenchAgentisch · Aktiv53.03%Artificial Analysis2026-07-21
GPT-5.4 MiniOpenAI2026-03-17Terminal-BenchAgentisch · Aktiv59.18%Artificial Analysis2026-07-21
GPT-5.4 NanoOpenAI2026-03-17Terminal-BenchAgentisch · Aktiv60.67%Artificial Analysis2026-07-21
GPT-5.5 (high)OpenAI2026-04-23Terminal-BenchAgentisch · Aktiv79.4%Artificial Analysis2026-07-21
GPT-5.5 (low)OpenAI2026-04-23Terminal-BenchAgentisch · Aktiv65.54%Artificial Analysis2026-07-21
GPT-5.5 (medium)OpenAI2026-04-23Terminal-BenchAgentisch · Aktiv80.52%Artificial Analysis2026-07-21
GPT-5.6 LunaOpenAI2026-07-09Terminal-BenchAgentisch · Aktiv80.9%Artificial Analysis2026-07-21
GPT-5.6 SolOpenAI2026-07-09Terminal-BenchAgentisch · Aktiv88.01%Artificial Analysis2026-07-21
GPT-5.6 TerraOpenAI2026-07-09Terminal-BenchAgentisch · Aktiv88.01%Artificial Analysis2026-07-21
Grok 4.20 ReasoningxAI2026-03-05Terminal-BenchAgentisch · Aktiv37.88%Artificial Analysis2026-07-21
Grok 4.3xAI2026-04-30Terminal-BenchAgentisch · Aktiv63.8%Terminal-Bench 2.0 leaderboard2026-06-09
Grok 4.5xAI2026-07-08Terminal-BenchAgentisch · Aktiv81.65%Artificial Analysis2026-07-21
HyperNova 60B 2605Multiverse2026-05-06Terminal-BenchAgentisch · Aktiv18.35%Artificial Analysis2026-07-21
Kimi K2.5Moonshot2026-01-27Terminal-BenchAgentisch · Aktiv45.69%Artificial Analysis2026-07-21
Kimi K2.6Moonshot2026-04-20Terminal-BenchAgentisch · Aktiv66.7%Terminal-Bench 2.0 leaderboard2026-05-20
Kimi K2.7 CodeMoonshot2026-06-12Terminal-BenchAgentisch · Aktiv67.42%Artificial Analysis2026-07-21
Kimi K3Moonshot2026-07-16Terminal-BenchAgentisch · Aktiv85.02%Artificial Analysis2026-07-21
LFM2.5-8B-A1BLiquid2026-06-08Terminal-BenchAgentisch · Aktiv4.55%Artificial Analysis2026-07-21
Llama 4 MaverickMeta2026-04-05Terminal-BenchAgentisch · Aktiv7.87%Artificial Analysis2026-07-21
Llama 4 ScoutMeta2026-04-05Terminal-BenchAgentisch · Aktiv58.6%Terminal-Bench 2.0 leaderboard2026-06-09
LongCat-2.0Meituan2026-06-29Terminal-BenchAgentisch · Aktiv70.8%Meituan LongCat-2.0 release materials2026-06-29
MiMo-V2.5-ProXiaomi2026-04-22Terminal-BenchAgentisch · Aktiv65.17%Artificial Analysis2026-07-21
MiniCPM5-1B (Reasoning)OpenBMB2026-06-04Terminal-BenchAgentisch · Aktiv0%Artificial Analysis2026-07-21
MiniMax M2.5MiniMax2026-04-01Terminal-BenchAgentisch · Aktiv34.85%Artificial Analysis2026-07-21
MiniMax M2.7MiniMax2026-04-15Terminal-BenchAgentisch · Aktiv55.43%Artificial Analysis2026-07-21
MiniMax M3MiniMax2026-05-31Terminal-BenchAgentisch · Aktiv66%Terminal-Bench 2.0 leaderboard2026-05-20
Mistral Large 3Mistral2025-12-02Terminal-BenchAgentisch · Aktiv11.99%Artificial Analysis2026-07-21
Muse SparkOther2026-01-01Terminal-BenchAgentisch · Aktiv62.17%Artificial Analysis2026-07-21
Muse Spark 1.1Meta2026-07-09Terminal-BenchAgentisch · Aktiv77.9%Artificial Analysis2026-07-21
Nemotron 3 Ultra 550B A55B (Reasoning)NVIDIA2026-06-04Terminal-BenchAgentisch · Aktiv53.93%Artificial Analysis2026-07-21
North Mini CodeCohere2026-06-09Terminal-BenchAgentisch · Aktiv35.58%Artificial Analysis2026-07-21
OpenAI o1OpenAI2024-09-12Terminal-BenchAgentisch · Aktiv12.88%Artificial Analysis2026-07-21
OpenAI o3OpenAI2025-04-16Terminal-BenchAgentisch · Aktiv37.12%Artificial Analysis2026-07-21
Qwen 3.7 MaxAlibaba2026-05-20Terminal-BenchAgentisch · Aktiv69.7%Terminal-Bench 2.0 leaderboard2026-05-20
Qwen 3.7 PlusAlibaba2026-06-02Terminal-BenchAgentisch · Aktiv61.05%Artificial Analysis2026-07-21
Qwen3.7 MaxAlibaba2026-05-19Terminal-BenchAgentisch · Aktiv74.53%Artificial Analysis2026-07-21
Step 3.7 FlashStepFun2026-06-01Terminal-BenchAgentisch · Aktiv39.33%Artificial Analysis2026-07-21
Claude Fable 5Anthropic2026-06-09Vals IndexAgentisch · Aktiv75.1%Vals AI — Vals Index2026-07-16
Claude Haiku 4.5 ThinkingAnthropic2025-10-01Vals IndexAgentisch · Aktiv40.33%Vals AI — Vals Index2026-06-04
Claude Mythos PreviewAnthropic2026-06-01Vals IndexAgentisch · Aktiv73.42%Vals AI — Vals Index2026-06-04
Claude Opus 4.7Anthropic2026-04-16Vals IndexAgentisch · Aktiv66.1%Vals AI — Vals Index2026-06-04
Claude Opus 4.8Anthropic2026-05-28Vals IndexAgentisch · Aktiv70.4%Vals AI — Vals Index2026-06-04
Claude Sonnet 4.6Anthropic2026-02-17Vals IndexAgentisch · Aktiv60.3%Vals AI — Vals Index2026-06-04
DeepSeek V4 ProDeepSeek2026-04-24Vals IndexAgentisch · Aktiv56.23%Vals AI — Vals Index2026-06-04
Gemini 3 Flash PreviewGoogle2025-12-17Vals IndexAgentisch · Aktiv49.31%Vals AI — Vals Index2026-06-04
Gemini 3.1 Flash Lite PreviewGoogle2026-05-07Vals IndexAgentisch · Aktiv35.24%Vals AI — Vals Index2026-06-04
Gemini 3.1 Pro PreviewGoogle2026-02-19Vals IndexAgentisch · Aktiv53.42%Vals AI — Vals Index2026-06-04
GPT 5.5OpenAI2026-04-23Vals IndexAgentisch · Aktiv68%Vals AI — Vals Index2026-06-04
GPT-5.4 MiniOpenAI2026-03-17Vals IndexAgentisch · Aktiv51.42%Vals AI — Vals Index2026-06-04
GPT-5.4 NanoOpenAI2026-03-17Vals IndexAgentisch · Aktiv46.46%Vals AI — Vals Index2026-06-04
GPT-5.6 SolOpenAI2026-07-09Vals IndexAgentisch · Aktiv73.1%Vals AI — Vals Index2026-07-16
Grok 4.20 0309 ReasoningxAI2026-03-05Vals IndexAgentisch · Aktiv39.11%Vals AI — Vals Index2026-06-04
Grok 4.3xAI2026-04-30Vals IndexAgentisch · Aktiv46.63%Vals AI — Vals Index2026-06-04
Kimi K2.6 ThinkingMoonshot2026-04-20Vals IndexAgentisch · Aktiv55.55%Vals AI — Vals Index2026-06-04
Kimi K3Moonshot2026-07-16Vals IndexAgentisch · Aktiv74.7%Vals AI — Vals Index2026-07-16
MiniMax M2.7MiniMax2026-04-15Vals IndexAgentisch · Aktiv41.41%Vals AI — Vals Index2026-06-04
Qwen 3.7 MaxAlibaba2026-05-20Vals IndexAgentisch · Aktiv48.04%Vals AI — Vals Index2026-06-04
Claude Fable 5 (high)Anthropic2026-06-09Vending-Bench 2Agentisch · Aktiv5680.26Andon Labs Vending-Bench 22026-06-01
Claude Opus 4.6Anthropic2026-03-09Vending-Bench 2Agentisch · Aktiv8017.59Andon Labs Vending-Bench 22026-06-01
Claude Opus 4.7Anthropic2026-05-01Vending-Bench 2Agentisch · Aktiv10936.76Andon Labs Vending-Bench 22026-06-01
GLM 5.2Zhipu2026-05-15Vending-Bench 2Agentisch · Aktiv8313.78Andon Labs Vending-Bench 22026-06-01
GPT 5.5OpenAI2026-04-23Vending-Bench 2Agentisch · Aktiv7523.84Andon Labs Vending-Bench 22026-06-01
Claude Fable 5Anthropic2026-06-09τ³-Bench BankingAgentisch · Ausgedient62.4%Artificial Analysis — τ³-Bench Banking2026-06-17
Claude Opus 4.5Anthropic2025-11-24τ³-Bench BankingAgentisch · Ausgedient86.26%Artificial Analysis2026-07-21
Claude Opus 4.6Anthropic2026-02-05τ³-Bench BankingAgentisch · Ausgedient84.8%Artificial Analysis2026-07-21
Claude Opus 4.6 (Adaptive Reasoning, Max Effort)Anthropic2026-02-05τ³-Bench BankingAgentisch · Ausgedient92.11%Artificial Analysis2026-07-21
Claude Opus 4.7Anthropic2026-04-16τ³-Bench BankingAgentisch · Ausgedient28.87%Artificial Analysis2026-07-21
Claude Opus 4.7 (Non-reasoning, High Effort)Anthropic2026-04-16τ³-Bench BankingAgentisch · Ausgedient73.98%Artificial Analysis2026-07-21
Claude Opus 4.8Anthropic2026-05-28τ³-Bench BankingAgentisch · Ausgedient27.63%Artificial Analysis2026-07-21
Claude Sonnet 4.6Anthropic2026-02-17τ³-Bench BankingAgentisch · Ausgedient79.53%Artificial Analysis2026-07-21
Claude Sonnet 4.6 (Adaptive Reasoning, Max Effort)Anthropic2026-02-17τ³-Bench BankingAgentisch · Ausgedient30.52%Artificial Analysis2026-07-21
Claude Sonnet 5Anthropic2026-06-30τ³-Bench BankingAgentisch · Ausgedient28.25%Artificial Analysis2026-07-21
Command ACohere2026-03-15τ³-Bench BankingAgentisch · Ausgedient15.2%Artificial Analysis2026-07-21
DeepSeek R1DeepSeek2025-01-20τ³-Bench BankingAgentisch · Ausgedient36.55%Artificial Analysis2026-07-21
DeepSeek V4 Pro (Reasoning, Max Effort)DeepSeek2026-04-24τ³-Bench BankingAgentisch · Ausgedient25.77%Artificial Analysis2026-07-21
Gemini 3 Flash PreviewGoogle2025-12-17τ³-Bench BankingAgentisch · Ausgedient43.27%Artificial Analysis2026-07-21
Gemini 3 ProGoogle2025-11-18τ³-Bench BankingAgentisch · Ausgedient87.13%Artificial Analysis2026-07-21
Gemini 3.1 Flash LiteGoogle2026-05-07τ³-Bench BankingAgentisch · Ausgedient8.66%Artificial Analysis2026-07-21
Gemini 3.1 Pro PreviewGoogle2026-02-19τ³-Bench BankingAgentisch · Ausgedient16.49%Artificial Analysis2026-07-21
Gemini 3.5 FlashGoogle2026-05-19τ³-Bench BankingAgentisch · Ausgedient25.36%Artificial Analysis2026-07-21
Gemini 3.5 Flash (medium)Google2026-05-19τ³-Bench BankingAgentisch · Ausgedient95.61%Artificial Analysis2026-07-21
Gemma 4 12B (Non-reasoning)Google2026-06-10τ³-Bench BankingAgentisch · Ausgedient31.87%Artificial Analysis2026-07-21
Gemma 4 12B (Reasoning)Google2026-06-07τ³-Bench BankingAgentisch · Ausgedient36.26%Artificial Analysis2026-07-21
Gemma 4 31B ITGoogle2026-03-01τ³-Bench BankingAgentisch · Ausgedient15.05%Artificial Analysis2026-07-21
GLM-5.1Zhipu2026-04-07τ³-Bench BankingAgentisch · Ausgedient11.55%Artificial Analysis2026-07-21
GLM-5.2Zhipu2026-06-13τ³-Bench BankingAgentisch · Ausgedient26.8%Artificial Analysis2026-07-21
GPT 5.4OpenAI2026-03-05τ³-Bench BankingAgentisch · Ausgedient30.31%Artificial Analysis2026-07-21
GPT 5.5OpenAI2026-04-23τ³-Bench BankingAgentisch · Ausgedient54.8%Artificial Analysis — τ³-Bench Banking2026-06-17
GPT-5.1OpenAI2025-11-13τ³-Bench BankingAgentisch · Ausgedient14.02%Artificial Analysis2026-07-21
GPT-5.2OpenAI2025-12-11τ³-Bench BankingAgentisch · Ausgedient84.8%Artificial Analysis2026-07-21
GPT-5.3 Codex (xhigh)OpenAI2026-02-05τ³-Bench BankingAgentisch · Ausgedient85.96%Artificial Analysis2026-07-21
GPT-5.4 MiniOpenAI2026-03-17τ³-Bench BankingAgentisch · Ausgedient21.44%Artificial Analysis2026-07-21
GPT-5.4 NanoOpenAI2026-03-17τ³-Bench BankingAgentisch · Ausgedient21.03%Artificial Analysis2026-07-21
GPT-5.5 (high)OpenAI2026-04-23τ³-Bench BankingAgentisch · Ausgedient29.48%Artificial Analysis2026-07-21
GPT-5.5 (low)OpenAI2026-04-23τ³-Bench BankingAgentisch · Ausgedient21.24%Artificial Analysis2026-07-21
GPT-5.5 (medium)OpenAI2026-04-23τ³-Bench BankingAgentisch · Ausgedient25.77%Artificial Analysis2026-07-21
GPT-5.6 LunaOpenAI2026-07-09τ³-Bench BankingAgentisch · Ausgedient27.22%Artificial Analysis2026-07-21
GPT-5.6 SolOpenAI2026-07-09τ³-Bench BankingAgentisch · Ausgedient32.99%Artificial Analysis2026-07-21
GPT-5.6 TerraOpenAI2026-07-09τ³-Bench BankingAgentisch · Ausgedient31.75%Artificial Analysis2026-07-21
Grok 4.20 ReasoningxAI2026-03-05τ³-Bench BankingAgentisch · Ausgedient92.98%Artificial Analysis2026-07-21
Grok 4.3xAI2026-04-30τ³-Bench BankingAgentisch · Ausgedient12.16%Artificial Analysis2026-07-21
Grok 4.5xAI2026-07-08τ³-Bench BankingAgentisch · Ausgedient32.58%Artificial Analysis2026-07-21
HyperNova 60B 2605Multiverse2026-05-06τ³-Bench BankingAgentisch · Ausgedient5.36%Artificial Analysis2026-07-21
Kimi K2.5Moonshot2026-01-27τ³-Bench BankingAgentisch · Ausgedient14.23%Artificial Analysis2026-07-21
Kimi K2.6Moonshot2026-04-20τ³-Bench BankingAgentisch · Ausgedient20.62%Artificial Analysis2026-07-21
Kimi K2.7 CodeMoonshot2026-06-12τ³-Bench BankingAgentisch · Ausgedient18.14%Artificial Analysis2026-07-21
Kimi K3Moonshot2026-07-16τ³-Bench BankingAgentisch · Ausgedient33.4%Artificial Analysis2026-07-21
LFM2.5-8B-A1BLiquid2026-06-08τ³-Bench BankingAgentisch · Ausgedient16.08%Artificial Analysis2026-07-21
Llama 4 MaverickMeta2026-04-05τ³-Bench BankingAgentisch · Ausgedient3.92%Artificial Analysis2026-07-21
Llama 4 ScoutMeta2026-04-05τ³-Bench BankingAgentisch · Ausgedient3.3%Artificial Analysis2026-07-21
LongCat-2.0Meituan2026-06-29τ³-Bench BankingAgentisch · Ausgedient12.78%Artificial Analysis2026-07-21
MiMo-V2.5-ProXiaomi2026-04-22τ³-Bench BankingAgentisch · Ausgedient8.66%Artificial Analysis2026-07-21
MiniCPM5-1B (Reasoning)OpenBMB2026-06-04τ³-Bench BankingAgentisch · Ausgedient80.99%Artificial Analysis2026-07-21
MiniMax M2.5MiniMax2026-04-01τ³-Bench BankingAgentisch · Ausgedient95.32%Artificial Analysis2026-07-21
MiniMax M2.7MiniMax2026-04-15τ³-Bench BankingAgentisch · Ausgedient8.87%Artificial Analysis2026-07-21
MiniMax M3MiniMax2026-05-31τ³-Bench BankingAgentisch · Ausgedient12.99%Artificial Analysis2026-07-21
Mistral Large 3Mistral2025-12-02τ³-Bench BankingAgentisch · Ausgedient5.77%Artificial Analysis2026-07-21
Muse SparkOther2026-01-01τ³-Bench BankingAgentisch · Ausgedient19.59%Artificial Analysis2026-07-21
Muse Spark 1.1Meta2026-07-09τ³-Bench BankingAgentisch · Ausgedient25.15%Artificial Analysis2026-07-21
Nemotron 3 Ultra 550B A55B (Reasoning)NVIDIA2026-06-04τ³-Bench BankingAgentisch · Ausgedient13.81%Artificial Analysis2026-07-21
North Mini CodeCohere2026-06-09τ³-Bench BankingAgentisch · Ausgedient6.39%Artificial Analysis2026-07-21
OpenAI o1OpenAI2024-09-12τ³-Bench BankingAgentisch · Ausgedient62.57%Artificial Analysis2026-07-21
OpenAI o3OpenAI2025-04-16τ³-Bench BankingAgentisch · Ausgedient80.7%Artificial Analysis2026-07-21
Qwen 3.7 PlusAlibaba2026-06-02τ³-Bench BankingAgentisch · Ausgedient17.87%Artificial Analysis2026-07-21
Qwen3.7 MaxAlibaba2026-05-19τ³-Bench BankingAgentisch · Ausgedient10.93%Artificial Analysis2026-07-21
Step 3.7 FlashStepFun2026-06-01τ³-Bench BankingAgentisch · Ausgedient11.34%Artificial Analysis2026-07-21
The Lab

Öffentliche Scores zeigen, was Anbieter veröffentlichen. Im Lab testet VerdictPal selbst und legt Methode, Prompts und Rohbeispiele offen, damit du den Lauf wiederholen kannst.

Lab öffnen