86.1%
MMLU
Modelle / Meta
Llama 4 · Release 2026-04-05
Metas reasoning-fokussiertes Llama-4-MoE. 1M-Kontext, 17B aktiv / 400B gesamt, 128 Experten. Open Weights für multimodale Assistenten und Coding.
Standard-Llama-4-Wahl für qualitätsorientiertes Self-Hosting, wenn Scouts 10M-Kontext nicht nötig ist.
66average across 8 tested families
Wo Llama 4 Maverick auf jeder öffentlichen Benchmark-Quelle mit Zeile steht. Rang zählt jedes Modell mit neuester Zeile im selben Test — kein universeller Qualitätsscore.
Die drei höchstscorierenden kartierten Modelle pro Capability-Family. Wo Llama 4 Maverick auftaucht, ist es hervorgehoben.
Benchmark-Zeilen im öffentlichen Ledger für Llama 4 Maverick in den letzten 120 Tagen. Ältere Zeilen stehen in der vollen Tabelle unten.
Ein hoher Composite, der eine schwache Family versteckt, ist eine Falle. Diese Balken zeigen Families ohne öffentlichen Test — und wo das Modell führt.
Hover or tab any dot for name, score, and input price.
Jeder Katalog-Benchmark für Llama 4 Maverick. Scores verlinken zur Originalquelle; Lücken heißen: noch keine öffentliche Zeile.
21 of 32 catalog benchmarks have a sourced row for Llama 4 Maverick.
14.3%
AA Intelligence Index v4.1
69.4%
GPQA Diamond
4.8%
HLE (AA run)
42.99%
IFBench (AA run)
62.1%
LiveBench
91.8% pass@1
HumanEval
39.7%
LiveCodeBench (AA run)
33.1%
SciCode (AA run)
74.8%
SWE-bench Verified
7.87%
Terminal-Bench v2.1 (AA run)
3.92%
τ³-Bench Banking (AA run)
61.4%
MMMU
46%
AA-LCR (AA run)
49.8%
LongBench v2
75.9%
BFCL
110 t/s
Median output tokens/s (1k prompt, default provider)
0.60s
Median time to first token (1k prompt, default provider)