88.9%
MMLU
Modelle / Alibaba
Qwen · Release 2026-05-20
Alibabas Open-Weights-Flaggschiff Mai 2026, das Frontier-Reasoning zu Open-Weight-Preisen bietet. AA Intelligence Index 56,6 (global #6), Terminal-Bench 2.0 69,7 %. 128K-Kontext, $0,40 / $1,20 pro 1M Tokens.
Default-Modell für kostenkritische Deployments, mehrsprachige Anwendungen (insbesondere Chinesisch) und Teams, die Open Weights mit Frontier-Scores brauchen.
77average across 8 tested families
Wo Qwen 3.7 Max auf jeder öffentlichen Benchmark-Quelle mit Zeile steht. Rang zählt jedes Modell mit neuester Zeile im selben Test — kein universeller Qualitätsscore.
| Benchmark | Family | Rang | Score | Quelle | Datum |
|---|---|---|---|---|---|
| LMArena (Chatbot Arena) | Human preference | #7/ 13 | 82 | LMArena leaderboard | 2026-05-25 |
| MCP Atlas | Tool use | #7/ 10 | 72 | MCP Atlas leaderboard | 2026-06-09 |
| BFCL | Tool use | #10/ 20 | 78 | Berkeley Function Calling Leaderboard V4 | 2026-04-15 |
| HumanEval | Coding | #10/ 15 | 93 | CodeSOTA HumanEval leaderboard | 2026-05-20 |
| MMLU | Knowledge | #10/ 22 | 89 | Alibaba Qwen 3.7 Max | 2026-05-20 |
| SWE-bench Verified | Coding | #14/ 23 | 79 | SWE-bench Verified leaderboard | 2026-06-09 |
| Vals Index | Agentic | #14/ 20 | 48 | Vals AI — Vals Index | 2026-06-04 |
| LiveBench | Reasoning | #15/ 21 | 62 | LiveBench leaderboard | 2026-04-15 |
| MATH | Math | #15/ 20 | 82 | Alibaba Qwen 3.7 Max | 2026-05-20 |
| LongBench v2 | Long context | #16/ 19 | 48 | LongBench v2 leaderboard | 2026-04-01 |
| MMLU-Pro | Knowledge | #16/ 21 | 75 | MMLU-Pro HuggingFace leaderboard | 2026-05-20 |
| Terminal-Bench | Agentic | #22/ 69 | 70 | Terminal-Bench 2.0 leaderboard | 2026-05-20 |
| GPQA Diamond | Reasoning | #60/ 69 | 74 | Artificial Analysis GPQA Diamond evaluation | 2026-06-09 |
Die drei höchstscorierenden kartierten Modelle pro Capability-Family. Wo Qwen 3.7 Max auftaucht, ist es hervorgehoben.
Benchmark-Zeilen im öffentlichen Ledger für Qwen 3.7 Max in den letzten 120 Tagen. Ältere Zeilen stehen in der vollen Tabelle unten.
| Benchmark | Family | Score | Quelle | Tage her |
|---|---|---|---|---|
| SWE-bench Verified | Coding | 79.4% | SWE-bench Verified leaderboard | 44 |
| GPQA Diamond | Reasoning | 73.8% | Artificial Analysis GPQA Diamond evaluation | 44 |
| MCP Atlas | Tool use | 71.8% | MCP Atlas leaderboard | 44 |
| Vals Index | Agentic | 48.04% | Vals AI — Vals Index | 49 |
| SWE-bench Verified | Coding | 78.8% | SWE-bench official leaderboard | 54 |
| LMArena (Chatbot Arena) | Human preference | 1409 | LMArena leaderboard | 59 |
| Terminal-Bench | Agentic | 69.7% | Terminal-Bench 2.0 leaderboard | 64 |
| HumanEval | Coding | 93.1% pass@1 | CodeSOTA HumanEval leaderboard | 64 |
| MATH | Math | 81.6% | Alibaba Qwen 3.7 Max | 64 |
| MMLU-Pro | Knowledge | 75.1% | MMLU-Pro HuggingFace leaderboard | 64 |
| MMLU | Knowledge | 88.9% | Alibaba Qwen 3.7 Max | 64 |
| BFCL | Tool use | 78.4% | Berkeley Function Calling Leaderboard V4 | 99 |
| LiveBench | Reasoning | 61.6% | LiveBench leaderboard | 99 |
| LongBench v2 | Long context | 47.8% | LongBench v2 leaderboard | 113 |
Ein hoher Composite, der eine schwache Family versteckt, ist eine Falle. Diese Balken zeigen Families ohne öffentlichen Test — und wo das Modell führt.
Hover or tab any dot for name, score, and input price.
Jeder Katalog-Benchmark für Qwen 3.7 Max. Scores verlinken zur Originalquelle; Lücken heißen: noch keine öffentliche Zeile.
13 of 32 catalog benchmarks have a sourced row for Qwen 3.7 Max.
73.8%
GPQA Diamond
61.6%
LiveBench
81.6%
MATH
93.1% pass@1
HumanEval
79.4%
SWE-bench Verified
69.7%
Terminal-Bench 2.0 (audited harness)
48.04%
Vals Index
47.8%
LongBench v2
1409
LMArena Elo (Style Controlled)