89.1%
MMLU
Modelle / Moonshot
Kimi · Release 2026-04-20
Moonshots Open-Weights-Flaggschiff April 2026. Vals-Index 55,55 % (#5 auf dem öffentlichen Leaderboard), SWE-bench Verified 80,2 %, Terminal-Bench 2.0 66,7 %. Führt das Open-Source-Feld bei GPQA Diamond mit 90,5 % an. 256K-Kontext, $0,60 / $2,50 pro 1M Tokens.
Default-Open-Weights-Modell eines chinesischen Anbieters für englischsprachige Arbeit. Das stärkste Open-Source-Modell bei GPQA Diamond (90,5 %) und Vals (55,55 %) Stand Juni 2026.
82average across 8 tested families
Wo Kimi K2.6 auf jeder öffentlichen Benchmark-Quelle mit Zeile steht. Rang zählt jedes Modell mit neuester Zeile im selben Test — kein universeller Qualitätsscore.
Die drei höchstscorierenden kartierten Modelle pro Capability-Family. Wo Kimi K2.6 auftaucht, ist es hervorgehoben.
Benchmark-Zeilen im öffentlichen Ledger für Kimi K2.6 in den letzten 120 Tagen. Ältere Zeilen stehen in der vollen Tabelle unten.
Ein hoher Composite, der eine schwache Family versteckt, ist eine Falle. Diese Balken zeigen Families ohne öffentlichen Test — und wo das Modell führt.
Hover or tab any dot for name, score, and input price.
Jeder Katalog-Benchmark für Kimi K2.6. Scores verlinken zur Originalquelle; Lücken heißen: noch keine öffentliche Zeile.
22 of 32 catalog benchmarks have a sourced row for Kimi K2.6.
44.2%
AA Intelligence Index v4.1
90.5%
GPQA Diamond accuracy (open-source leader)
35.9%
HLE (AA run)
75.99%
IFBench (AA run)
62.4%
LiveBench
93.8% pass@1
HumanEval
53.5%
SciCode (AA run)
80.2%
SWE-bench Verified
66.7%
Terminal-Bench 2.0 (audited harness)
55.55%
Vals Index
20.62%
τ³-Bench Banking (AA run)
69.67%
AA-LCR (AA run)
49.1%
LongBench v2
56 t/s
Median output tokens/s (1k prompt, default provider)
1.08s
Median time to first token (1k prompt, default provider)
1388
LMArena Elo (Style Controlled)