Modelle / Zhipu

GLM-5.2

GLM · Release 2026-06-13

Z.ais Juni-2026-Flaggschiff für Long-Horizon-Coding. 1M-Kontext, 128K Max-Output, Terminal-Bench 2.1 81,0, SWE-bench Pro 62,1. Höchstplatziertes Open-Source-Modell auf FrontierSWE, PostTrainBench und SWE-Marathon. $1,40 / $4,40 pro 1M Tokens, MIT-Weights ausstehend.

Long-Horizon-Coding- und autonomes-Agenten-Modell für projektgroße Engineering-Aufgaben. Die GLM-Wahl, wenn 1M-Kontext gebraucht wird, der über mehrtägige Refactors nutzbar bleibt, nicht nur ein großes Fenster.

#23 von 184 im AA Index · aktueller Snapshot
39 AA Index · 12 Benchmark-Zeilen · 3 QuellenPosition ist benchmark-spezifisch — kein Cross-Family- oder Cross-Source-Ranking.
Composite58
Kontext1M
Input / 1M$1.4
Output / 1M$4.4
Wissensstichtagopen
Output-Speed68 t/s
TTFT (Default-API)1.37s
Statussolid

Familienprofil

Bester veröffentlichter Score je abgedeckter Benchmark-Familie.

74/100 Ø
Reasoning
90
Coding
51
Agentisch
78
Langer Kontext
78

4 getestete Benchmark-Familien

Redaktionsnotiz
GLM-5.2 ist das stärkste Open-Source-Coding-Modell, das wir tracken. Terminal-Bench 2.1 bei 81,0 liegt innerhalb von 4 Punkten von Claude Opus 4.8 (85,0), und der FrontierSWE-Abstand zu Opus beträgt 1 %. Das Tool bleibt solid, bis unabhängige Benchmarks jenseits von Z.ais eigenen Berichten im Ledger landen. MIT-Weights sind angekündigt, aber noch nicht veröffentlicht — vor dem Pinning selbst-gehosteter Workflows verifizieren.
Benchmark-Platzierungen

Wo GLM-5.2 auf jeder öffentlichen Benchmark-Quelle mit Zeile steht. Rang zählt jedes Modell mit neuester Zeile im selben Test — kein universeller Qualitätsscore.

BenchmarkFamilyRangScoreQuelleDatum
Vending-Bench 2Agentic#4/ 10Andon Labs Vending-Bench 22026-08-04
DeepSWECoding#7/ 844DeepSWE leaderboard v1.12026-06-20
Artificial Analysis Intelligence IndexReasoning#26/ 18839Artificial Analysis2026-09-10
Humanity's Last ExamReasoning#33/ 18541Artificial Analysis2026-09-10
τ³-Bench BankingAgentic#33/ 11035Artificial Analysis2026-09-10
Terminal-BenchAgentic#34/ 18978Artificial Analysis2026-09-10
IFBenchReasoning#35/ 12773Artificial Analysis2026-09-10
SciCodeCoding#35/ 9351Artificial Analysis2026-09-10
AA time to first tokenPerformance#48/ 190Artificial Analysis2026-09-10
GPQA DiamondReasoning#53/ 19090Artificial Analysis2026-09-10
AA-LCRLong context#54/ 18278Artificial Analysis2026-09-10
AA output speedPerformance#55/ 190Artificial Analysis2026-09-10
Family-Kontext

Die drei höchstscorierenden kartierten Modelle pro Capability-Family. Wo GLM-5.2 auftaucht, ist es hervorgehoben.

Neueste Belege

Benchmark-Zeilen im öffentlichen Ledger für GLM-5.2 in den letzten 120 Tagen. Ältere Zeilen stehen in der vollen Tabelle unten.

12 neu
Family-Abdeckung

Ein hoher Composite, der eine schwache Family versteckt, ist eine Falle. Diese Balken zeigen Families ohne öffentlichen Test — und wo das Modell führt.

Reasoning90
Coding51
Agentisch78
Langer Kontext78
Preis vs. Performance
0255075100$0.10$0.30$1$3$10$30Input-USD / 1M Tokens · log-Skala →← Intelligenz

Hover auf einen Punkt zeigt Name, Score und Input-Preis. Per Tastatur: die zwölf besten mit Tab durchgehen oder die Rangliste unten nutzen.

AnthropicOpenAIMistralAlibabaDeepSeekGoogleMoonshotMetaxAIMiniMaxZhipuXiaomiOtherMeituanCohereNVIDIA

Volles Benchmark-Ledger

Jeder Katalog-Benchmark für GLM-5.2. Scores verlinken zur Originalquelle; Lücken heißen: noch keine öffentliche Zeile.

12 Quell-Zeilen

12 von 37 Katalog-Benchmarks haben eine belegte Zeile für GLM-5.2.

Reasoning

Coding

Agentic

Long context

Performance

Changelog
  1. GLM-5.2 mit 1M-Kontext, 128K Max-Output, zwei Thinking-Modi und Long-Horizon-Coding-Fokus veröffentlicht. MIT-Open-Weights für die folgende Woche angekündigt.
Quellen

The Pack · Redaktionsnewsletter

Neue Tools in dein Postfach. Kostenlos.

Eine kurze E-Mail, wenn ein Tool erscheint oder den Status wechselt. Kein Tracking, keine Drittanbieter-Analytics. Abmeldung mit einem Klick.