VerdictPal · editorial desk · 2026VerdictPal
Compare · Two models, head-to-head

Pick two models. See the diff.

Composite scores, benchmark ranks, capability grids, and pricing per million tokens. All sourced from the same data that powers the model atlas.

Kimi K3 vs Kimi K2.5

Kimi K33stats won
Tied0stats
Kimi K2.54stats won
Spec showdown

Capacity, price, freshness.

Kimi K3vsKimi K2.5

Kimi K3 dominates on composite score (65 vs 53), driven by broader benchmark coverage and stronger per-family performance. Kimi K3 has the higher Vals/AA intelligence score (75 vs 35). Kimi K2.5 is significantly cheaper at $0.60/1M input vs $3.0/1M input. Kimi K3's 1M context window dwarfs Kimi K2.5's 262K — a meaningful difference for long-document or codebase work.

  1. Composite score
    Kimi K365Winner on this rowKimi K2.553
  2. Intelligence (Vals/AA)
    Kimi K375Winner on this rowKimi K2.535
  3. Context window
    Kimi K31MWinner on this rowKimi K2.5262K
  4. Max output
    Kimi K3Kimi K2.566KWinner on this row
  5. Input price / 1M (lower wins)
    Kimi K3$3.0Kimi K2.5$0.60Winner on this row
  6. Output speed (AA default API)
    Kimi K338 t/sKimi K2.550 t/sWinner on this row
  7. Time to first token (AA default API)
    Kimi K36.19sKimi K2.51.02sWinner on this row
Composite score
65Winner on this row
vs
53
Intelligence (Vals/AA)
75Winner on this row
vs
35
Context window
1MWinner on this row
vs
262K
Max output
vs
66KWinner on this row
Input price / 1M (lower wins)
$3.0
vs
$0.60Winner on this row
Output speed (AA default API)
38 t/s
vs
50 t/sWinner on this row
Time to first token (AA default API)
6.19s
vs
1.02sWinner on this row
Capability grid

What each model can do.

Modalities

Kimi K3Kimi K2.5
Text
Image
Audio
Video
Code
Tool use
Reasoning

Access

Kimi K3Kimi K2.5
API
Consumer app
Open weights
Managed cloud
On-device
Family radar

Top score per benchmark family.

Reasoning
94Winner on this row
vs
88
Coding
59Winner on this row
vs
49
Agentic
85Winner on this row
vs
46
Long context
75Winner on this row
vs
65
Benchmark ranks

Every shared benchmark, side by side.

Reasoning

Artificial Analysis Intelligence Index#3/67 · #44/67
57.1%Winner on this row
vs
35.4%
GPQA Diamond#4/69 · #32/69
93.5%Winner on this row
vs
87.9%
Humanity's Last Exam#7/65 · #37/65
44.3%Winner on this row
vs
29.4%

Coding

SciCode#3/65 · #31/65
58.7%Winner on this row
vs
49%

Agentic

Terminal-Bench#3/69 · #48/69
85.02%Winner on this row
vs
45.69%
τ³-Bench Banking#20/64 · #48/64
33.4%Winner on this row
vs
14.23%

Long context

AA-LCR#2/64 · #39/64
74.67%Winner on this row
vs
65.33%

Performance

AA output speed#57/69 · #55/69
38 t/s
vs
50 t/sWinner on this row
AA time to first token#24/69 · #43/69
6.19s
vs
1.02sWinner on this row
Dossier facts

Dates, sources, fineprint.

Kimi K3Kimi K2.5
ProviderMoonshotMoonshot
FamilyKimi K3Kimi
Release date2026-07-162026-01-27
Knowledge cutoffunpublished2025-10-01
Context window1M262K
Max output66K
Input price /1M$3.0$0.60
Output price /1M$15$3.0
Statussolidsolid
Composite score6553
Intelligence score7535
Intel sourcevalsaa
Benchmark rows1013
Source count24
Freshnessfreshfresh
Pricing checked2026-07-192026-06-09
Ecosystem

Which tools wrap each model.

Kimi K3

Not listed in any tool yet.

Kimi K2.5

Not listed in any tool yet.

Verdict

Which model to actually pick.

Kimi K3 dominates on composite score (65 vs 53), driven by broader benchmark coverage and stronger per-family performance. Kimi K3 has the higher Vals/AA intelligence score (75 vs 35). Kimi K2.5 is significantly cheaper at $0.60/1M input vs $3.0/1M input. Kimi K3's 1M context window dwarfs Kimi K2.5's 262K — a meaningful difference for long-document or codebase work.