88.9%
MMLU
Modelle / Alibaba
Qwen · Release 2026-05-20
Alibabas Open-Weights-Flaggschiff Mai 2026, das Frontier-Reasoning zu Open-Weight-Preisen bietet. AA Intelligence Index 56,6 (global #6), Terminal-Bench 2.0 69,7 %. 128K-Kontext, $0,40 / $1,20 pro 1M Tokens.
Default-Modell für kostenkritische Deployments, mehrsprachige Anwendungen (insbesondere Chinesisch) und Teams, die Open Weights mit Frontier-Scores brauchen.
Familienprofil
Bester veröffentlichter Score je abgedeckter Benchmark-Familie.
8 getestete Benchmark-Familien
Wo Qwen 3.7 Max auf jeder öffentlichen Benchmark-Quelle mit Zeile steht. Rang zählt jedes Modell mit neuester Zeile im selben Test — kein universeller Qualitätsscore.
| Benchmark | Family | Rang | Score | Quelle | Datum |
|---|---|---|---|---|---|
| LMArena (Chatbot Arena) | Human preference | #7/ 13 | 82 | LMArena leaderboard | 2026-05-25 |
| MCP Atlas | Tool use | #7/ 10 | 72 | MCP Atlas leaderboard | 2026-06-09 |
| BFCL | Tool use | #10/ 20 | 78 | Berkeley Function Calling Leaderboard V4 | 2026-04-15 |
| HumanEval | Coding | #10/ 15 | 93 | CodeSOTA HumanEval leaderboard | 2026-05-20 |
| MMLU | Knowledge | #10/ 22 | 89 | Alibaba Qwen 3.7 Max | 2026-05-20 |
| SWE-bench Verified | Coding | #14/ 23 | 79 | SWE-bench Verified leaderboard | 2026-06-09 |
| LiveBench | Reasoning | #15/ 21 | 62 | LiveBench leaderboard | 2026-04-15 |
| LongBench v2 | Long context | #16/ 19 | 48 | LongBench v2 leaderboard | 2026-04-01 |
| Vals Index | Agentic | #17/ 23 | 48 | Vals AI — Vals Index | 2026-06-04 |
| MATH | Math | #20/ 25 | 82 | Alibaba Qwen 3.7 Max | 2026-05-20 |
| MMLU-Pro | Knowledge | #34/ 39 | 75 | MMLU-Pro HuggingFace leaderboard | 2026-05-20 |
| Terminal-Bench | Agentic | #44/ 184 | 70 | Terminal-Bench 2.0 leaderboard | 2026-05-20 |
| GPQA Diamond | Reasoning | #159/ 185 | 74 | Artificial Analysis GPQA Diamond evaluation | 2026-06-09 |
Die drei höchstscorierenden kartierten Modelle pro Capability-Family. Wo Qwen 3.7 Max auftaucht, ist es hervorgehoben.
Benchmark-Zeilen im öffentlichen Ledger für Qwen 3.7 Max in den letzten 120 Tagen. Ältere Zeilen stehen in der vollen Tabelle unten.
| Benchmark | Family | Score | Quelle | Tage her |
|---|---|---|---|---|
| SWE-bench Verified | Coding | 79.4% | SWE-bench Verified leaderboard | 89 |
| GPQA Diamond | Reasoning | 73.8% | Artificial Analysis GPQA Diamond evaluation | 89 |
| MCP Atlas | Tool use | 71.8% | MCP Atlas leaderboard | 89 |
| Vals Index | Agentic | 48.04% | Vals AI — Vals Index | 94 |
| SWE-bench Verified | Coding | 78.8% | SWE-bench official leaderboard | 99 |
| LMArena (Chatbot Arena) | Human preference | 1409 | LMArena leaderboard | 104 |
| Terminal-Bench | Agentic | 69.7% | Terminal-Bench 2.0 leaderboard | 109 |
| HumanEval | Coding | 93.1% pass@1 | CodeSOTA HumanEval leaderboard | 109 |
| MATH | Math | 81.6% | Alibaba Qwen 3.7 Max | 109 |
| MMLU-Pro | Knowledge | 75.1% | MMLU-Pro HuggingFace leaderboard | 109 |
| MMLU | Knowledge | 88.9% | Alibaba Qwen 3.7 Max | 109 |
Ein hoher Composite, der eine schwache Family versteckt, ist eine Falle. Diese Balken zeigen Families ohne öffentlichen Test — und wo das Modell führt.
Hover auf einen Punkt zeigt Name, Score und Input-Preis. Per Tastatur: die zwölf besten mit Tab durchgehen oder die Rangliste unten nutzen.
Jeder Katalog-Benchmark für Qwen 3.7 Max. Scores verlinken zur Originalquelle; Lücken heißen: noch keine öffentliche Zeile.
13 von 37 Katalog-Benchmarks haben eine belegte Zeile für Qwen 3.7 Max.
73.8%
GPQA Diamond
61.6%
LiveBench
81.6%
MATH
93.1% pass@1
HumanEval
79.4%
SWE-bench Verified
69.7%
Terminal-Bench 2.0 (audited harness)
48.04%
Vals Index
47.8%
LongBench v2
1409
LMArena Elo (Style Controlled)