Modelle / Zhipu

GLM-5.2

GLM · Release 2026-06-13

Z.ais Juni-2026-Flaggschiff für Long-Horizon-Coding. 1M-Kontext, 128K Max-Output, Terminal-Bench 2.1 81,0, SWE-bench Pro 62,1. Höchstplatziertes Open-Source-Modell auf FrontierSWE, PostTrainBench und SWE-Marathon. $1,40 / $4,40 pro 1M Tokens, MIT-Weights ausstehend.

Long-Horizon-Coding- und autonomes-Agenten-Modell für projektgroße Engineering-Aufgaben. Die GLM-Wahl, wenn 1M-Kontext gebraucht wird, der über mehrtägige Refactors nutzbar bleibt, nicht nur ein großes Fenster.

#16 von 168 im AA Index · aktueller Snapshot
53 AA Index · 12 Benchmark-Zeilen · 3 QuellenPosition ist benchmark-spezifisch — kein Cross-Family- oder Cross-Source-Ranking.
Composite60
Kontext1M
Input / 1M$1.4
Output / 1M$4.4
Wissensstichtagopen
Output-Speed69 t/s
TTFT (Default-API)1.36s
Statussolid

Familienprofil

Bester veröffentlichter Score je abgedeckter Benchmark-Familie.

74/100 Ø
Reasoning
90
Coding
51
Agentisch
78
Langer Kontext
77

4 getestete Benchmark-Familien

Redaktionsnotiz
GLM-5.2 ist das stärkste Open-Source-Coding-Modell, das wir tracken. Terminal-Bench 2.1 bei 81,0 liegt innerhalb von 4 Punkten von Claude Opus 4.8 (85,0), und der FrontierSWE-Abstand zu Opus beträgt 1 %. Das Tool bleibt solid, bis unabhängige Benchmarks jenseits von Z.ais eigenen Berichten im Ledger landen. MIT-Weights sind angekündigt, aber noch nicht veröffentlicht — vor dem Pinning selbst-gehosteter Workflows verifizieren.
Benchmark-Platzierungen

Wo GLM-5.2 auf jeder öffentlichen Benchmark-Quelle mit Zeile steht. Rang zählt jedes Modell mit neuester Zeile im selben Test — kein universeller Qualitätsscore.

BenchmarkFamilyRangScoreQuelleDatum
Vending-Bench 2Agentic#4/ 10Andon Labs Vending-Bench 22026-08-04
DeepSWECoding#7/ 844DeepSWE leaderboard v1.12026-06-20
Artificial Analysis Intelligence IndexReasoning#26/ 18753Artificial Analysis2026-09-01
Humanity's Last ExamReasoning#29/ 18041Artificial Analysis2026-09-01
τ³-Bench BankingAgentic#29/ 10635Artificial Analysis2026-09-01
Terminal-BenchAgentic#30/ 18478Artificial Analysis2026-09-01
AA-LCRLong context#32/ 17977Artificial Analysis2026-09-01
IFBenchReasoning#35/ 12773Artificial Analysis2026-09-01
SciCodeCoding#39/ 18051Artificial Analysis2026-09-01
GPQA DiamondReasoning#49/ 18590Artificial Analysis2026-09-01
AA time to first tokenPerformance#50/ 186Artificial Analysis2026-09-01
AA output speedPerformance#56/ 187Artificial Analysis2026-09-01
Family-Kontext

Die drei höchstscorierenden kartierten Modelle pro Capability-Family. Wo GLM-5.2 auftaucht, ist es hervorgehoben.

Neueste Belege

Benchmark-Zeilen im öffentlichen Ledger für GLM-5.2 in den letzten 120 Tagen. Ältere Zeilen stehen in der vollen Tabelle unten.

12 neu
Family-Abdeckung

Ein hoher Composite, der eine schwache Family versteckt, ist eine Falle. Diese Balken zeigen Families ohne öffentlichen Test — und wo das Modell führt.

Reasoning90
Coding51
Agentisch78
Langer Kontext77
Preis vs. Performance
0255075100$0.10$0.30$1$3$10$30Input-USD / 1M Tokens · log-Skala →← Intelligenz

Hover auf einen Punkt zeigt Name, Score und Input-Preis. Per Tastatur: die zwölf besten mit Tab durchgehen oder die Rangliste unten nutzen.

AnthropicOpenAIMistralAlibabaDeepSeekGoogleMoonshotMetaMiniMaxxAIZhipuXiaomiOtherMeituanCohereNVIDIA

Volles Benchmark-Ledger

Jeder Katalog-Benchmark für GLM-5.2. Scores verlinken zur Originalquelle; Lücken heißen: noch keine öffentliche Zeile.

12 Quell-Zeilen

12 von 37 Katalog-Benchmarks haben eine belegte Zeile für GLM-5.2.

Reasoning

Coding

Agentic

Long context

Performance

Changelog
  1. GLM-5.2 mit 1M-Kontext, 128K Max-Output, zwei Thinking-Modi und Long-Horizon-Coding-Fokus veröffentlicht. MIT-Open-Weights für die folgende Woche angekündigt.
Quellen