Modelle / Zhipu

GLM-5.2

GLM · Release 2026-06-13

Z.ais Juni-2026-Flaggschiff für Long-Horizon-Coding. 1M-Kontext, 128K Max-Output, Terminal-Bench 2.1 81,0, SWE-bench Pro 62,1. Höchstplatziertes Open-Source-Modell auf FrontierSWE, PostTrainBench und SWE-Marathon. $1,40 / $4,40 pro 1M Tokens, MIT-Weights ausstehend.

Long-Horizon-Coding- und autonomes-Agenten-Modell für projektgroße Engineering-Aufgaben. Die GLM-Wahl, wenn 1M-Kontext gebraucht wird, der über mehrtägige Refactors nutzbar bleibt, nicht nur ein großes Fenster.

#8 von 51 im AA Index · aktueller Snapshot
51 AA Index · 12 Benchmark-Zeilen · 3 QuellenPosition ist benchmark-spezifisch — kein Cross-Family- oder Cross-Source-Ranking.
Composite58
Kontext1M
Input / 1M$1.4
Output / 1M$4.4
Wissensstichtagopen
Output-Speed196 t/s
TTFT (Default-API)0.84s
Statussolid
ReasoningCodingAgenticLong context
Reasoning
90
Coding
51
Agentic
78
Long context
71

73average across 4 tested families

Redaktionsnotiz
GLM-5.2 ist das stärkste Open-Source-Coding-Modell, das wir tracken. Terminal-Bench 2.1 bei 81,0 liegt innerhalb von 4 Punkten von Claude Opus 4.8 (85,0), und der FrontierSWE-Abstand zu Opus beträgt 1 %. Die Karte bleibt solid, bis unabhängige Benchmarks jenseits von Z.ais eigenen Berichten im Ledger landen. MIT-Weights sind angekündigt, aber noch nicht veröffentlicht — vor dem Pinning selbst-gehosteter Workflows verifizieren.
Benchmark-Platzierungen

Wo GLM-5.2 auf jeder öffentlichen Benchmark-Quelle mit Zeile steht. Rang zählt jedes Modell mit neuester Zeile im selben Test — kein universeller Qualitätsscore.

BenchmarkFamilyRangScoreQuelleDatum
Vending-Bench 2Agentic#2/ 5Andon Labs Vending-Bench 22026-06-01
DeepSWECoding#5/ 644DeepSWE leaderboard v1.12026-06-20
AA output speedPerformance#12/ 69Artificial Analysis2026-07-21
Artificial Analysis Intelligence IndexReasoning#13/ 6751Artificial Analysis2026-07-21
Humanity's Last ExamReasoning#14/ 6540Artificial Analysis2026-07-21
Terminal-BenchAgentic#14/ 6978Artificial Analysis2026-07-21
AA-LCRLong context#15/ 6471Artificial Analysis2026-07-21
IFBenchReasoning#24/ 5773Artificial Analysis2026-07-21
SciCodeCoding#25/ 6551Artificial Analysis2026-07-21
GPQA DiamondReasoning#27/ 6990Artificial Analysis2026-07-21
τ³-Bench BankingAgentic#32/ 6427Artificial Analysis2026-07-21
AA time to first tokenPerformance#49/ 69Artificial Analysis2026-07-21
Family-Kontext

Die drei höchstscorierenden kartierten Modelle pro Capability-Family. Wo GLM-5.2 auftaucht, ist es hervorgehoben.

Neueste Belege

Benchmark-Zeilen im öffentlichen Ledger für GLM-5.2 in den letzten 120 Tagen. Ältere Zeilen stehen in der vollen Tabelle unten.

12 neu
Family-Abdeckung

Ein hoher Composite, der eine schwache Family versteckt, ist eine Falle. Diese Balken zeigen Families ohne öffentlichen Test — und wo das Modell führt.

Reasoning90
Coding51
Agentic78
Long context71
Preis vs. Performance
0255075100$0.10$0.30$1$3$10$30input USD / 1M tokens · log scale →← intelligence

Hover or tab any dot for name, score, and input price.

AnthropicOpenAIMistralAlibabaDeepSeekGoogleMoonshotMiniMaxxAIMetaZhipuXiaomiMeituanCohere

Volles Benchmark-Ledger

Jeder Katalog-Benchmark für GLM-5.2. Scores verlinken zur Originalquelle; Lücken heißen: noch keine öffentliche Zeile.

12 Quell-Zeilen

12 of 32 catalog benchmarks have a sourced row for GLM-5.2.

Reasoning

Coding

Agentic

Long context

Performance

Changelog
  1. GLM-5.2 mit 1M-Kontext, 128K Max-Output, zwei Thinking-Modi und Long-Horizon-Coding-Fokus veröffentlicht. MIT-Open-Weights für die folgende Woche angekündigt.
Quellen