VerdictPal · Redaktions-Desk · Stand 5. Sept. 2026VerdictPal
Benchmarks

Jeder Benchmark, ehrlich gelesen.

Wähle ein Modell und sieh die öffentlichen Benchmark-Belege, die VerdictPal dafür hat. Jede Zeile ist datiert, belegt und mit Caveats versehen. Die Seite liest sich wie Evidenz, nicht wie ein Scoreboard. Für die modellzentrierte Ansicht (Ränge, Familien, Quellen-Ledger) öffne den modellzentrierten Atlas.
Das ist kein Leaderboard
Ein Benchmark ist ein konkreter Test — Coding-Bugs, harte Wissenschaftsfragen, Agenten-Workflows — keine Krone für „bestes Modell“. Scores wandern, Anbieter cherry-picken, alte Suites lecken in Trainingsdaten. Jede Zahl ist datiert, belegt und mit Kontaminationsrisiko markiert.

So liest du einen Score

  1. Was er misst — die konkrete Fähigkeit oder Aufgabenfamilie, die dieser Test bewertet.
  2. Was er nicht beweist — jede Suite hat blinde Flecken; lies die Caveats, bevor du eine Behauptung absendest.
  3. Wann du ihn nutzt — nimm den Primärtest für deinen Job, dann öffne das Dossier für das volle Ledger.

Neu bei Elo, Kontamination oder Sättigung? Glossar öffnen

27
Öffentliche Benchmarks
2112
Ledger-Zeilen
1965/2112
Quellgeprüfte Scores
14
Belegte Quellen

Der Atlas ist nach dem gruppiert, was der Benchmark messen will. Score-Zeilen sitzen unter jedem Test, damit unvergleichbare Metriken nicht in ein Fake-Ranking kollabieren.

Das sind die Diskriminatoren, die wir in jeder Familie zuerst öffnen würden. Gelöste und gesättigte Suites bleiben unten in der Bibliothek als Glossar — nicht als aktuelle Evidenz.

Omniscience AccuracyAA-Omniscience
WissenPrimär · WissenKontamination mittel

Nimm diesen Test, wenn · Für quellenstarke Studierende ist die relevante Fehlerart die selbstsichere Falschantwort. AA-Omniscience ist die öffentliche Suite, die Abruf und Hallucination gemeinsam über Domänen bewertet, die in Papers tatsächlich vorkommen.

Sagt dir nicht · Open-Web-Recherche — die Fragen sind Closed-Book. Ein Modell, das suchen und zitieren sollte, wird hier nicht getestet.

12 Score-Zeilen · 1 Quelle · aktualisiert 2026-09-01

Humanity's Last ExamHLE
ReasoningPrimär · ReasoningKontamination niedrig

Nimm diesen Test, wenn · Wenn du eine harte, fachübergreifende Expertenprüfung brauchst — von Mathe bis professionellem Recht und Medizin — als Closed-Book-Stresstest, nicht als Forschungsproduktivitäts-Proxy.

Sagt dir nicht · Echte Forschungsproduktivität — Prüfungsfragen erfassen nicht die unordentliche Such-und-Synthetisieren-Arbeit, die eine Forscher:in tatsächlich leistet.

180 Score-Zeilen · 1 Quelle · aktualisiert 2026-09-01

Papers / model cardsFrontierMathFrontierMath Tiers 1-3
MathePrimär · MatheKontamination niedrig

Nimm diesen Test, wenn · Wenn MATH und AIME die Frontier nicht mehr trennen, ist das der lebende Mathe-Trenner: originale Expertenaufgaben, Python-fähig, noch weit von der Decke.

Sagt dir nicht · Tier-4-Forschungsprobleme — die 43-Aufgaben-Erweiterung ist ein separates, härteres Set. Tiers-1-3-Headlines nicht mit Tier 4 mischen.

15 Score-Zeilen · 1 Quelle · aktualisiert 2026-08-15

DeepSWEDeepSWE
CodingPrimär · CodingKontamination niedrig

Nimm diesen Test, wenn · Wenn du Langhorizont-Softwarearbeit über mehrere Sprachen mit Verhaltens-Verifiers brauchst — härtere Kontaminationslage als klassisches SWE-bench Verified.

Sagt dir nicht · Kein Python-only-Issue-Fixing wie SWE-bench Verified — DeepSWE umfasst Go, Rust, TypeScript und mehr.

8 Score-Zeilen · 1 Quelle · aktualisiert 2026-08-04

Terminal-BenchTerminal-Bench 2.1
AgentischPrimär · AgentischKontamination niedrig

Nimm diesen Test, wenn · Wenn du realistische containerisierte Terminal-Arbeit brauchst — Debug, Dateien, Befehle, Artefakte — als agentisches Ops-Signal mit Gewicht im AA Index v4.1.

Sagt dir nicht · Nicht nur das Modell — Harness, Tools, Retries, Zeitlimits und Container-Setup können Werte stark verschieben.

184 Score-Zeilen · 3 Quellen · aktualisiert 2026-09-01

MMMU-ProMMMU Pro
MultimodalPrimär · MultimodalKontamination mittel

Nimm diesen Test, wenn · Originales MMMU trennt die Frontier nicht mehr. MMMU-Pro ist die lebende multimodale Prüfung: Shortcuts entfernt, zehn Optionen, noch Spreizung unter der alten 88-%-Decke.

Sagt dir nicht · Originale MMMU-Headlines — die enthalten noch textlösbare Items. Eine 88-%-MMMU-Zeile ist keine MMMU-Pro-Zeile.

8 Score-Zeilen · 1 Quelle · aktualisiert 2026-09-01

Artificial Analysis Long Context ReasoningAA-LCR
Langer KontextPrimär · Langer KontextKontamination niedrig

Nimm diesen Test, wenn · Long-Context-Research scheitert, wenn Modelle den Faden über entfernte Evidenz verlieren. AA-LCR ist eine der wenigen öffentlichen Suites, die Synthese über lange Inputs bewertet — nicht nur Retrieval-Trivia.

Sagt dir nicht · Retrieval aus externen Datenbanken — der Kontext liegt nur im Prompt.

179 Score-Zeilen · 1 Quelle · aktualisiert 2026-09-01

Berkeley BFCLBerkeley Function Calling LeaderboardBFCL
Tool-NutzungPrimär · Tool-NutzungKontamination mittel

Nimm diesen Test, wenn · Tool Calling ist die Sanitäranlage hinter Agenten, Automationen und Forschungsassistenten. BFCL macht daraus einen öffentlichen Test statt jede Function-Call-Demo als Evidenz zu behandeln.

Sagt dir nicht · Nicht, ob das Tool-Ergebnis nützlich ist — BFCL fokussiert Auswahl und Formatierung von Calls, nicht den gesamten Produktworkflow danach.

20 Score-Zeilen · 1 Quelle · aktualisiert 2026-06-09

AA output speedOutput tokens per second
PerformancePrimär · PerformanceKontamination unbekannt

Nimm diesen Test, wenn · Wenn es um Streaming-Geschwindigkeit nach dem ersten Chunk geht — IDE-Gefühl, Chat-Responsivität, Batch-Durchsatz — nicht um Antwortqualität.

Sagt dir nicht · IDE- oder Chat-App-Latenz — nur First-Party-API-Routen, die AA als Default-Provider trackt.

187 Score-Zeilen · 1 Quelle · aktualisiert 2026-09-05

Stanford HELMHELM SafetyHolistic Evaluation of Language Models
SicherheitPrimär · SicherheitKontamination mittel

Nimm diesen Test, wenn · Sicherheitsevidenz ist oft Marketingtext oder Red-Team-Anekdote. HELM gibt Lesern einen öffentlichen, wiederholbaren Ort für mehrere Sicherheitsmetriken nebeneinander.

Sagt dir nicht · Kein reales Deployment-Risiko allein — ein Modell kann in HELM sicherer aussehen als in einem Produkt mit Tools, Memory, Browsing oder schwacher Policy-Durchsetzung.

9 Score-Zeilen · 1 Quelle · aktualisiert 2026-06-09

LMArenaLMArena (Chatbot Arena)Chatbot Arena
Menschliche PräferenzPrimär · Menschliche PräferenzKontamination niedrig

Nimm diesen Test, wenn · Wenn du ein menschliches Präferenzsignal im großen Maßstab brauchst — wie Antworten im blinden Nebeneinander-Chat wirken — keine Korrektheitsprüfung.

Sagt dir nicht · Korrektheit — Wähler belohnen, was gut aussieht; Formatierung, Länge und Selbstsicherheit können Genauigkeit schlagen.

13 Score-Zeilen · 1 Quelle · aktualisiert 2026-06-09

AktivGesättigtGelöst
Archiv · 7 EinträgeGesättigt, gelöst oder eingestellt
IFBenchInstruction-Following Benchmark
ReasoningGesättigtKontamination mittel

Nimm diesen Test, wenn · Historischer Instruction-Following-Stresstest für neue Format-Constraints. Gesättigt und aus AA Intelligence Index v4.1 entfernt — Glossar-Ehrlichkeit, keine aktuelle Frontier-Rangordnung.

Sagt dir nicht · Frontier-Trennung heute — Artificial Analysis entfernte IFBench aus dem Intelligence Index v4.1, weil Frontier-Modelle ihn sättigten.

127 Score-Zeilen · 1 Quelle · aktualisiert 2026-09-01

Papers / model cardsMassive Multitask Language UnderstandingMMLU
WissenGesättigtKontamination hoch

Nimm diesen Test, wenn · Historische breite Wissensprüfung über 57 Fächer — nützlicher Glossar-Kontext dafür, wie Modelle einst verglichen wurden. An der Frontier gesättigt; nicht für aktuelle Rangordnung.

Sagt dir nicht · Schlussfolgern unter Unsicherheit — ein Modell kann den richtigen Buchstaben erraten, ohne die Frage zu verstehen.

22 Score-Zeilen · 2 Quellen · aktualisiert 2026-06-09

Papers / model cardsMassive Multi-discipline Multimodal UnderstandingMMMU
MultimodalGesättigtKontamination mittel

Nimm diesen Test, wenn · Wenn du multimodales Verständnis auf Hochschulniveau brauchst — Diagramme, Schaltpläne, Strukturen, Scans — keine rein textlichen Wissensprüfungen.

Sagt dir nicht · Reine Bildqualität — viele Items lassen sich teils allein aus dem Text lösen, was Werte aufbläht.

8 Score-Zeilen · 1 Quelle · aktualisiert 2026-06-09

SWE-benchSWE-bench Verified
CodingGesättigtKontamination mittel

Nimm diesen Test, wenn · Einst der Flagship-Test für echte Python-Issues — weiter nützliche Herkunft. Frontier-Scores clustern jetzt eng; für aktuelles Agent-Signal DeepSWE oder SWE-Lancer bevorzugen.

Sagt dir nicht · Nichts außer Python — die Suite ist Python-only und sagt wenig über andere Sprachen oder Frontend aus.

23 Score-Zeilen · 2 Quellen · aktualisiert 2026-07-01

American Invitational Mathematics ExaminationAIME
MatheAusgedientKontamination mittel

Nimm diesen Test, wenn · Historisches Wettbewerbs-Mathe-Signal — einst nützlich für hartes Ganzzahl-Reasoning. Für Frontier-Modelle mit Extended Thinking gelöst; für Kontext behalten, nicht für aktuelle Rangordnung.

Sagt dir nicht · Winzige Stichprobe (15 Aufgaben/Jahr) — eine Aufgabe ist ~6,7 %, Einzelläufe sind verrauscht; pass@k oder mehrere Seeds verlangen.

37 Score-Zeilen · 3 Quellen · aktualisiert 2026-09-01

Vendor claimsHumanEval
CodingAusgedientKontamination hoch

Nimm diesen Test, wenn · Historische Code-Generierungs-Baseline — kurze Python-Funktionen aus Docstrings. Gelöst und stark kontaminiert; für Herkunft behalten, nicht für Frontier-Coding-Rang.

Sagt dir nicht · Echte Softwarearbeit — 164 eigenständige Spielfunktionen sind weit von einer Produktions-Codebasis entfernt.

15 Score-Zeilen · 3 Quellen · aktualisiert 2026-06-09

MATH
MatheAusgedientKontamination hoch

Nimm diesen Test, wenn · Historische Wettbewerbs-Mathe-Suite — einst Standard-Reasoning-Maßstab. Jetzt gesättigt; für Kontext behalten, für Frontier-Trennung härtere Mathe-Evals bevorzugen.

Sagt dir nicht · Ob die Herleitung korrekt ist — nur die Endantwort zählt, eine richtige Antwort aus falschem Weg wird gewertet.

25 Score-Zeilen · 3 Quellen · aktualisiert 2026-09-01

Evidenz-Konsole — Modell-Lookup (14 Quellen)

Modell-Belege nachschlagen

Wähle ein oder zwei Modelle aus dem Ledger. Scores bleiben nach Benchmark gruppiert, damit Arena-Elo nie gegen MMLU-Genauigkeit gerankt wird.

Letzte Ledger-Aktualisierung: 2026-09-05Statischer Snapshot; Quellen unten verlinkt2 / 2 Modellplätzen belegt
Modell-Evidenz — 61 Zeilen
61 Zeilen gefunden
OpenAI

GPT 5.5

Veröffentlicht 2026-04-23

31 Zeilen
Wissen
Omniscience Accuracy

AA-Omniscience Accuracy

57%
Artificial Analysis — AA-OmniscienceQuelle geprüftRang 5

Quelle· Quelle vom 2026-09-01· eingelesen 2026-09-01

MMLU-Pro

MMLU-Pro

81.6%
MMLU-Pro HuggingFace leaderboardAudit nötigRang 2

Quelle· Quelle vom 2026-04-23· eingelesen 2026-06-09

Reasoning
CritPt

CritPt composite (AA run)

27.1%
Artificial Analysis — CritPtQuelle geprüftRang 7

Quelle· Quelle vom 2026-09-01· eingelesen 2026-09-01

GPQA Diamond

GPQA Diamond accuracy (CoT)

81.2%
GPQA Diamond paper leaderboardQuelle geprüftRang 3

Quelle· Quelle vom 2026-05-15· eingelesen 2026-06-05

IFBench

IFBench (AA run)

75.85%
Artificial AnalysisQuelle geprüft

Quelle· Quelle vom 2026-09-01· eingelesen 2026-09-01

LiveBench

LiveBench

69.8%
LiveBench leaderboardAudit nötigRang 3

Quelle· Quelle vom 2026-04-15· eingelesen 2026-06-09

Mathe
FrontierMath

FrontierMath Tiers 1-3 (v2) best Epoch run

51.7%
Epoch AI FrontierMath Tiers 1-3 (v2) CSVQuelle geprüftRang 2

Quelle· Quelle vom 2026-08-15· eingelesen 2026-08-15

MATH

MATH

89.6%
OpenAI model release notesAudit nötigRang 2

Quelle· Quelle vom 2026-04-23· eingelesen 2026-06-09

Coding
DeepSWE

DeepSWE pass@1 (xhigh effort)

67%
DeepSWE leaderboard v1.1Quelle geprüftRang 2

Quelle· Quelle vom 2026-06-20· eingelesen 2026-06-22

HumanEval

HumanEval

96.2% pass@1
CodeSOTA HumanEval leaderboardAudit nötigRang 2

Quelle· Quelle vom 2026-04-23· eingelesen 2026-06-09

SciCode

SciCode (AA run)

56.1%
Artificial AnalysisQuelle geprüft

Quelle· Quelle vom 2026-09-01· eingelesen 2026-09-01

SWE-bench Verified

SWE-bench Verified

82.5%
SWE-bench Verified leaderboardQuelle geprüft

Quelle· Quelle vom 2026-06-01· eingelesen 2026-06-09

Agentisch
GDPval

GDPval-AA v2

1531
Artificial Analysis — GDPval-AA v2Quelle geprüftRang 3

Quelle· Quelle vom 2026-06-17· eingelesen 2026-06-22

τ³-Bench Banking

τ³-Bench Banking (AA run)

38.97%
Artificial AnalysisQuelle geprüft

Quelle· Quelle vom 2026-09-01· eingelesen 2026-09-01

Terminal-Bench

Terminal-Bench 2.0 (audited harness)

82%
Terminal-Bench 2.0 leaderboardQuelle geprüftRang 2

Quelle· Quelle vom 2026-05-20· eingelesen 2026-06-05

Vals Index

Vals Index

68%
Vals AI — Vals IndexQuelle geprüft

Quelle· Quelle vom 2026-06-04· eingelesen 2026-06-09

Vending-Bench 2

Final bank balance (USD)

7523.84
Andon Labs Vending-Bench 2Quelle geprüftRang 6

Quelle· Quelle vom 2026-08-04· eingelesen 2026-08-04

Multimodal
Langer Kontext
LongBench v2

LongBench v2

56.1%
LongBench v2 leaderboardAudit nötigRang 3

Quelle· Quelle vom 2026-04-01· eingelesen 2026-06-09

Tool-Nutzung
MCP Atlas

MCP Atlas

77.8%
MCP Atlas leaderboardAudit nötigRang 3

Quelle· Quelle vom 2026-06-09· eingelesen 2026-06-09

Performance
AA output speed

Median output tokens/s (1k prompt, default provider)

0 t/s
Artificial AnalysisQuelle geprüft

Quelle· Quelle vom 2026-09-01· eingelesen 2026-09-01

AA time to first token

Median time to first token (1k prompt, default provider)

0.00s
Artificial AnalysisQuelle geprüft

Quelle· Quelle vom 2026-09-01· eingelesen 2026-09-01

Sicherheit
HELM Safety

HELM Safety

90.6%
Stanford HELM leaderboardAudit nötigRang 3

Quelle· Quelle vom 2026-04-23· eingelesen 2026-06-09

Menschliche Präferenz
LMArena (Chatbot Arena)

LMArena Elo (Style Controlled)

1473
LMArena leaderboardQuelle geprüftRang 1

Quelle· Quelle vom 2026-05-25· eingelesen 2026-06-05

Anthropic

Claude Opus 4.8

Veröffentlicht 2026-05-28

30 Zeilen
Wissen
Omniscience Accuracy

AA-Omniscience Accuracy

48.8%
Artificial Analysis — AA-OmniscienceQuelle geprüftRang 18

Quelle· Quelle vom 2026-09-01· eingelesen 2026-09-01

MMLU-Pro

MMLU-Pro

82.4%
MMLU-Pro HuggingFace leaderboardAudit nötigRang 1

Quelle· Quelle vom 2026-05-28· eingelesen 2026-06-09

Reasoning
CritPt

CritPt composite (AA run)

20.9%
Artificial Analysis — CritPtQuelle geprüftRang 11

Quelle· Quelle vom 2026-09-01· eingelesen 2026-09-01

GPQA Diamond

GPQA Diamond accuracy (CoT)

79.8%
GPQA Diamond paper leaderboardQuelle geprüftRang 4

Quelle· Quelle vom 2026-05-15· eingelesen 2026-06-05

IFBench

IFBench (AA run)

62.24%
Artificial AnalysisQuelle geprüft

Quelle· Quelle vom 2026-09-01· eingelesen 2026-09-01

LiveBench

LiveBench

70.8%
LiveBench leaderboardAudit nötigRang 2

Quelle· Quelle vom 2026-04-15· eingelesen 2026-06-09

Mathe
FrontierMath

FrontierMath Tiers 1-3 (v2) best Epoch run

47.24%
Epoch AI FrontierMath Tiers 1-3 (v2) CSVQuelle geprüftRang 5

Quelle· Quelle vom 2026-08-15· eingelesen 2026-08-15

MATH

MATH

88.4%
Anthropic Claude 4 familyAudit nötigRang 3

Quelle· Quelle vom 2026-05-28· eingelesen 2026-06-09

Coding
DeepSWE

DeepSWE pass@1 (max effort)

59%
DeepSWE leaderboard v1.1Quelle geprüftRang 3

Quelle· Quelle vom 2026-06-20· eingelesen 2026-06-22

HumanEval

HumanEval

95.8% pass@1
Anthropic Claude 4 familyAudit nötigRang 3

Quelle· Quelle vom 2026-05-28· eingelesen 2026-06-09

SciCode

SciCode (AA run)

53.5%
Artificial AnalysisQuelle geprüft

Quelle· Quelle vom 2026-09-01· eingelesen 2026-09-01

SWE-bench Verified

SWE-bench Verified

88.6%
SWE-bench official leaderboardQuelle geprüftRang 2

Quelle· Quelle vom 2026-05-30· eingelesen 2026-06-05

Agentisch
GDPval

GDPval-AA v2

1638
Artificial Analysis — GDPval-AA v2Quelle geprüftRang 2

Quelle· Quelle vom 2026-06-17· eingelesen 2026-06-22

τ³-Bench Banking

τ³-Bench Banking (AA run)

34.23%
Artificial AnalysisQuelle geprüft

Quelle· Quelle vom 2026-09-01· eingelesen 2026-09-01

Terminal-Bench

Terminal-Bench 2.0 (audited harness)

74.6%
Terminal-Bench 2.0 leaderboardQuelle geprüftRang 5

Quelle· Quelle vom 2026-05-20· eingelesen 2026-06-05

Terminal-Bench-Science

TB-Science 0.1 resolution (Claude Code)

10.5%
Terminal-Bench-Science 0.1 announcementQuelle geprüftRang 4

Quelle· Quelle vom 2026-08-27· eingelesen 2026-09-01

Vals Index

Vals Index

70.4%
Vals AI — Vals IndexQuelle geprüft

Quelle· Quelle vom 2026-06-04· eingelesen 2026-06-09

Multimodal
Langer Kontext
LongBench v2

LongBench v2

58.4%
LongBench v2 leaderboardAudit nötigRang 1

Quelle· Quelle vom 2026-04-01· eingelesen 2026-06-09

Tool-Nutzung
MCP Atlas

MCP Atlas

79.2%
MCP Atlas leaderboardAudit nötigRang 2

Quelle· Quelle vom 2026-06-09· eingelesen 2026-06-09

Performance
AA output speed

Median output tokens/s (1k prompt, default provider)

0 t/s
Artificial AnalysisQuelle geprüft

Quelle· Quelle vom 2026-09-01· eingelesen 2026-09-01

AA time to first token

Median time to first token (1k prompt, default provider)

0.00s
Artificial AnalysisQuelle geprüft

Quelle· Quelle vom 2026-09-01· eingelesen 2026-09-01

Sicherheit
HELM Safety

HELM Safety

91.8%
Stanford HELM leaderboardAudit nötigRang 2

Quelle· Quelle vom 2026-05-28· eingelesen 2026-06-09

Menschliche Präferenz
LMArena (Chatbot Arena)

LMArena Elo (Style Controlled)

1462
LMArena leaderboardQuelle geprüftRang 2

Quelle· Quelle vom 2026-05-25· eingelesen 2026-06-05

Score-Datenbank — 2112 Ledger-Zeilen

Diese Datenbank trägt den Evidenz-Überblick. Sie enthält den geprüften Snapshot und ältere Score-Zeilen aus Benchmark-Seiten.

1807

api · api

Vals AI23

manual-snapshot · manual

SWE-bench22

official-json · scheduled

Terminal-Bench25

official-page · manual

LMArena13

official-page · manual

CodeSOTA6

manual-snapshot · manual

Stanford HELM9

official-page · manual

Berkeley BFCL20

official-page · manual

LongBench19

official-page · manual

LiveBench21

official-page · manual

Papers / model cards95

manual-snapshot · manual

Vendor claims34

manual-snapshot · manual

DeepSWE8

official-page · manual

Vending-Bench10

official-page · manual

ModellVeröffentlichungBenchmarkScoreSkala innerhalb des BenchmarksQuelleDatum
A.X-K2Other2026-08-12AA output speedPerformance · Aktiv0 t/sArtificial Analysis2026-09-01
Agnes 2.5 Pro AlphaOther2026-07-24AA output speedPerformance · Aktiv174 t/sArtificial Analysis2026-09-01
Agnes 2.5 Pro BetaOther2026-08-26AA output speedPerformance · Aktiv152 t/sArtificial Analysis2026-09-01
Apodex 1.1Other2026-08-30AA output speedPerformance · Aktiv0 t/sArtificial Analysis2026-09-01
Claude 3 OpusAnthropic2024-03-04AA output speedPerformance · Aktiv0 t/sArtificial Analysis2026-09-01
Claude 4 Opus (Reasoning)Anthropic2025-05-22AA output speedPerformance · Aktiv0 t/sArtificial Analysis2026-09-01
Claude 4.1 Opus (Reasoning)Anthropic2025-08-05AA output speedPerformance · Aktiv0 t/sArtificial Analysis2026-09-01
Claude 4.5 Sonnet (Reasoning)Anthropic2025-09-29AA output speedPerformance · Aktiv0 t/sArtificial Analysis2026-09-01
Claude Fable 5Anthropic2026-06-09AA output speedPerformance · Aktiv58 t/sArtificial Analysis2026-09-01
Claude Opus 4.5Anthropic2025-11-24AA output speedPerformance · Aktiv0 t/sArtificial Analysis2026-09-01
Claude Opus 4.5 (Reasoning)Anthropic2025-11-24AA output speedPerformance · Aktiv0 t/sArtificial Analysis2026-09-01
Claude Opus 4.6Anthropic2026-02-05AA output speedPerformance · Aktiv0 t/sArtificial Analysis2026-09-01
Claude Opus 4.6 (Adaptive Reasoning, Max Effort)Anthropic2026-02-05AA output speedPerformance · Aktiv0 t/sArtificial Analysis2026-09-01
Claude Opus 4.7Anthropic2026-04-16AA output speedPerformance · Aktiv0 t/sArtificial Analysis2026-09-01
Claude Opus 4.7 (Non-reasoning, High Effort)Anthropic2026-04-16AA output speedPerformance · Aktiv0 t/sArtificial Analysis2026-09-01
Claude Opus 4.8Anthropic2026-05-28AA output speedPerformance · Aktiv0 t/sArtificial Analysis2026-09-01
Claude Opus 5 (Adaptive Reasoning, High Effort)Anthropic2026-07-24AA output speedPerformance · Aktiv47 t/sArtificial Analysis2026-09-01
Claude Opus 5 (Adaptive Reasoning, Low Effort)Anthropic2026-07-24AA output speedPerformance · Aktiv47 t/sArtificial Analysis2026-09-01
Claude Opus 5 (Adaptive Reasoning, Max Effort)Anthropic2026-07-24AA output speedPerformance · Aktiv49 t/sArtificial Analysis2026-09-01
Claude Opus 5 (Adaptive Reasoning, Medium Effort)Anthropic2026-07-24AA output speedPerformance · Aktiv46 t/sArtificial Analysis2026-09-01
Claude Opus 5 (Adaptive Reasoning, Xhigh Effort)Anthropic2026-07-24AA output speedPerformance · Aktiv48 t/sArtificial Analysis2026-09-01
Claude Sonnet 4.6Anthropic2026-02-17AA output speedPerformance · Aktiv0 t/sArtificial Analysis2026-09-01
Claude Sonnet 4.6 (Adaptive Reasoning, Max Effort)Anthropic2026-02-17AA output speedPerformance · Aktiv0 t/sArtificial Analysis2026-09-01
Claude Sonnet 4.6 (Non-reasoning, Low Effort)Anthropic2026-02-17AA output speedPerformance · Aktiv45 t/sArtificial Analysis2026-09-01
Claude Sonnet 5Anthropic2026-06-30AA output speedPerformance · Aktiv80 t/sArtificial Analysis2026-09-01
Command ACohere2026-03-15AA output speedPerformance · Aktiv228 t/sArtificial Analysis2026-09-01
DeepSeek Coder V2DeepSeek2024-05-15AA output speedPerformance · Aktiv0 t/sArtificial Analysis2026-09-01
DeepSeek R1DeepSeek2025-01-20AA output speedPerformance · Aktiv0 t/sArtificial Analysis2026-09-01
DeepSeek V3.2 (Reasoning)DeepSeek2025-12-01AA output speedPerformance · Aktiv0 t/sArtificial Analysis2026-09-01
DeepSeek V4 Flash (Non-reasoning)DeepSeek2026-04-24AA output speedPerformance · Aktiv0 t/sArtificial Analysis2026-09-01
DeepSeek V4 Flash (Reasoning, High Effort)DeepSeek2026-04-24AA output speedPerformance · Aktiv0 t/sArtificial Analysis2026-09-01
DeepSeek V4 Flash 0731 (Reasoning, Max Effort)DeepSeek2026-07-31AA output speedPerformance · Aktiv106 t/sArtificial Analysis2026-09-01
DeepSeek V4 Flash Vision (Reasoning, Max Effort)DeepSeek2026-08-21AA output speedPerformance · Aktiv111 t/sArtificial Analysis2026-09-01
DeepSeek V4 Pro (Non-reasoning)DeepSeek2026-04-24AA output speedPerformance · Aktiv50 t/sArtificial Analysis2026-09-01
DeepSeek V4 Pro (Reasoning, High Effort)DeepSeek2026-04-24AA output speedPerformance · Aktiv50 t/sArtificial Analysis2026-09-01
DeepSeek V4 Pro 0813 (Reasoning, Max Effort)DeepSeek2026-08-13AA output speedPerformance · Aktiv51 t/sArtificial Analysis2026-09-01
DiffusionGemma 26B A4BGoogle2026-06-10AA output speedPerformance · Aktiv0 t/sArtificial Analysis2026-09-01
EXAONE 4.5 33BOther2026-04-09AA output speedPerformance · Aktiv0 t/sArtificial Analysis2026-09-01
G9v3-39A5BOther2026-08-03AA output speedPerformance · Aktiv0 t/sArtificial Analysis2026-09-01
G9v3-3BOther2026-07-23AA output speedPerformance · Aktiv0 t/sArtificial Analysis2026-09-01
Gemini 1.0 UltraGoogle2024-02-08AA output speedPerformance · Aktiv0 t/sArtificial Analysis2026-09-01
Gemini 3 Flash PreviewGoogle2025-12-17AA output speedPerformance · Aktiv0 t/sArtificial Analysis2026-09-01
Gemini 3 Flash Preview (Reasoning)Google2025-12-17AA output speedPerformance · Aktiv0 t/sArtificial Analysis2026-09-01
Gemini 3 ProGoogle2025-11-18AA output speedPerformance · Aktiv0 t/sArtificial Analysis2026-09-01
Gemini 3 Pro Preview (low)Google2025-11-18AA output speedPerformance · Aktiv0 t/sArtificial Analysis2026-09-01
Gemini 3.1 Flash LiteGoogle2026-05-07AA output speedPerformance · Aktiv0 t/sArtificial Analysis2026-09-01
Gemini 3.1 Pro PreviewGoogle2026-02-19AA output speedPerformance · Aktiv113 t/sArtificial Analysis2026-09-01
Gemini 3.5 FlashGoogle2026-05-19AA output speedPerformance · Aktiv0 t/sArtificial Analysis2026-09-01
Gemini 3.5 Flash (medium)Google2026-05-19AA output speedPerformance · Aktiv232 t/sArtificial Analysis2026-09-01
Gemini 3.5 Flash (minimal)Google2026-05-19AA output speedPerformance · Aktiv217 t/sArtificial Analysis2026-09-01
Gemini 3.5 Flash-LiteGoogle2026-07-21AA output speedPerformance · Aktiv316 t/sArtificial Analysis2026-09-01
Gemini 3.6 Flash (high)Google2026-07-21AA output speedPerformance · Aktiv161 t/sArtificial Analysis2026-09-01
Gemini 3.7 FlashGoogle2026-08-13AA output speedPerformance · Aktiv307 t/sArtificial Analysis2026-09-01
Gemma 4 12B (Non-reasoning)Google2026-06-10AA output speedPerformance · Aktiv130 t/sArtificial Analysis2026-09-01
Gemma 4 12B (Reasoning)Google2026-06-07AA output speedPerformance · Aktiv131 t/sArtificial Analysis2026-09-01
Gemma 4 31B ITGoogle2026-03-01AA output speedPerformance · Aktiv36 t/sArtificial Analysis2026-09-01
GLM 5V Turbo (Reasoning)Zhipu2026-04-01AA output speedPerformance · Aktiv0 t/sArtificial Analysis2026-09-01
GLM-4.7 (Reasoning)Zhipu2025-12-22AA output speedPerformance · Aktiv0 t/sArtificial Analysis2026-09-01
GLM-5 (Non-reasoning)Zhipu2026-02-11AA output speedPerformance · Aktiv0 t/sArtificial Analysis2026-09-01
GLM-5 (Reasoning)Zhipu2026-02-11AA output speedPerformance · Aktiv0 t/sArtificial Analysis2026-09-01
The Lab

Öffentliche Scores zeigen, was Anbieter veröffentlichen. Im Lab testet VerdictPal selbst und legt Methode, Prompts und Rohbeispiele offen, damit du den Lauf wiederholen kannst.

Lab öffnen