Hero-titelkort för jämförelsen mellan GLM-5.3 och GLM-5.2, med undertexten 'Samma hjärna, fördubblade benchmarks', med två modellkort som delar ett enda sammankopplat 743B MoE-basblock och en krökt uppgraderingspil märkt 'endast post-träning' som pekar från GLM-5.2 till GLM-5.3.
Guides & Insights

GLM-5.3 vs GLM-5.2: Samma hjärna, fördubblade riktmärken

Författare

Rowan Sterling

Publiceringsdatum

Senaste modellerna · 20Visa alla modeller
Benchmarks: Artificial Analysis · uppdateras dagligen
Tillbaka till alla inlägg

Zhipu AIs egen beskrivning av uppgraderingen från GLM-5.2 till G​LM-5.3 är den ärliga: läroboken ändrades inte, bara elevens träning. G​LM-5.3, som släpptes den 14 augusti 2026, bygger på exakt samma MoE-bas med 743 miljarder parametrar som GLM-5.2, som kröntes till ledare inom kategorin öppna vikter på Artificial Analysis Intelligence Index i juni. Arkitekturen är oförändrad, avtrycket är oförändrat, priset på 1,40 dollar / 4,40 dollar per miljon är oförändrat – och ändå rapporterar Z.ai att den omtränade modellen presterar dubbelt så bra eller bättre än sin föregångare på flera av de kodnings- och säkerhetsbenchmarks som båda versionerna publicerar. Huruvida det gör G​LM-5.3 till en måste-uppgradering eller ett avvakta-och-se beror på hur mycket du litar på en modell som förbättrats så mycket utan att ändra sin egen arkitektur, och på om dess nyuppkomna cyberförmåga är en funktion du vill ha bakom ett tvåveckors säkerhetsfönster.

Samma hjärna, omtränad

Allt som gjorde GLM-5.2 till en praktisk server följer med: 743B MoE med cirka 40B aktiva parametrar, IndexShare-sparse attention som minskade FLOPs vid 1M kontext, MIT-licensen, kontextfönstret på 1M och det smidiga tokenflödet som uppmättes till ~145–168 tokens/sekund vid oberoende mätning. G​LM-5.3 skiljer sig endast i en dimension — efterträning. Z.ai skalade upp förstärkningsinlärningsstadiet med ramverken IndexShare, SAO och Slime, lade till dussintals gånger fler uppgiftsmiljöer med lång horisont och utökade dem från kodfelsökning till upptäckt av säkerhetssårbarheter och systemteknik. Resultatet är en modell som beter sig annorlunda på samma hårdvara, vilket är precis varför uppgraderingsfrågan inte är "behöver jag nya GPU:er" utan "behöver jag nytt beteende".

Referensdeltat, i båda riktningarna

Betraktat som en före-och-efter-jämförelse av Z.ais publicerade siffror är hoppet det största i open-weights-historien. Terminal-Bench 3.0 – den svårare versionen, där båda poängsattes – går från 4,6 till 28,3, ett sexfaldigt hopp. DeepSWE v1.1 går från 46,2 till 66,9, vilket är skillnaden mellan ”bra öppen modell” och ”konkurrenskraftig med de stängda frontlöparna”. The Agents' Last Exam CLI-delmängd går från 23,8 till 28,5. CyberGym sårbarhetsupptäckt stiger från 77,2 till 84,5. ExploitBench mer än fördubblas, från 24,4 till 54,4, och ExploitGyms genomströmning går från 29 och 39 slutförda uppgifter (två och sex timmar) till 105 och 130. Z.ai sammanfattar det som ungefär en 50 % förbättring av kodningsförmågan, och vinsternas form – koncentrerade till långsiktig kodning, terminalautomatisering och säkerhet – är förenlig med en modell som endast post-tränats: den råa kunskapen är densamma, men förmågan att faktiskt utföra flerstegsarbete är vad som blev starkare.

• Terminal-Bench 3.0 — GLM-5.2 4.6 mot G​LM-5.3 28.3

• DeepSWE v1.1 — GLM-5.2 46.2 mot GLM-5.3 66.9

• Agents' Last Exam (CLI) — GLM-5.2 23.8 vs G​LM-5.3 28.5

• Upptäckt av sårbarheter i CyberGym — GLM-5.2 77.2 vs GLM-5.3 84.5

• ExploitBench — GLM-5.2 24.4 mot G​LM-5.3 54.4

The OrcaRouter GLM-5.2 model page showing Z.ai's open-weights flagship with its per-million-token pricing, context window and model ID.Scoreboard contrasting GLM-5.2 (Terminal-Bench 3.0 4.6, DeepSWE v1.1 46.2, Agents' Last Exam CLI 23.8, CyberGym 77.2, ExploitBench 24.4, Price $1.40/$4.40 per M) with GLM-5.3 (Terminal-Bench 3.0 28.3, DeepSWE v1.1 66.9, Agents' Last Exam CLI 28.5, CyberGym 84.5, ExploitBench 54.4, Price $1.40/$4.40 per M).

Förmågan ingen schemalade.

Säkerhetsvinsterna förtjänar ett eget stycke eftersom Z.ai säger att de inte var planen. Efterträningsteamet lade till miljöer för sårbarhetsupptäckt och förväntade sig blygsamma förbättringar; modellen började istället kedja samman fullständiga exploits, ett emergent beteende som tvingade Z.ai att hålla tillbaka vikterna i ungefär två veckor för säkerhetshärdning. I verkliga tester med säkerhetsteam bidrog G​LM-5.3 till att hitta 2 436 sårbarheter i 269 projekt, varav 1 097 var medel- eller högrisk, inklusive brister som legat oupptäckta i årtionden i brett använd programvara. GLM-5.2 hade säkerhetsförmåga i vanlig mening – den kunde läsa kod för att hitta buggar. G​LM-5.3 har den i en annan mening: den är det som säkerhetsfönstret handlar om. Det är en förändring i slag, inte grad, och det är det enskilt starkaste skälet att behandla de två modellerna som olika produkter trots den gemensamma basen.

Infographic titled 'The upgrade delta' showing a two-column before-and-after comparison of GLM-5.2 vs GLM-5.3 across five benchmarks with upward arrows: Terminal-Bench 3.0 4.6 to 28.3, DeepSWE v1.1 46.2 to 66.9, Agents' Last Exam CLI 23.8 to 28.5, CyberGym 77.2 to 84.5, ExploitBench 24.4 to 54.4.

Konsekvensförbehållet

Motvikten till varje siffra ovan är att tidiga tester från tredje part beskriver G​LM-5.3 som inkonsekvent på ett sätt som GLM-5.2 inte var. Oberoende granskare rapporterar att samma modell presterar som en knappt godkänd utkontrakterad ingenjör på vissa uppgifter och levererar professionella resultat på andra, där skillnaden följer hur tydligt kraven var specificerade. Det är exakt den felfördelning du skulle förutsäga för en modell vars vinster helt kom från miljötung efterträning: den generaliserar från de uppgiftsformer den tränades på, och dåligt specificerade prompter hamnar utanför dem. Inget av de oberoende resultaten är så rent som Z.ais publicerade tabeller, och inga av Z.ais siffror är ännu oberoende reproducerade. För produktion talar det för en uttrycklig utvärdering på din egen arbetsbelastning före migreringen — samma varning som GLM-5.2 motiverade, nu med en större spridning mellan bästa och sämsta fall.

Pris, tillgång och väntefrågan

{{1}}Prissättningen är identisk, vilket eliminerar den vanliga uppgraderingsfriktionen{{/1}}: {{2}}båda modellerna kostar 1,40 $ / 4,40 $ per miljon tokens, där G​LM-5.3 kräver att tänkarläget är aktiverat{{/2}}. {{3}}Åtkomsten är den verkliga skillnaden{{/3}}. {{4}}G​LM-5.2 är nedladdningsbar idag under MIT{{/4}}, {{5}}självhostningsbar på ett FP8-fotavtryck under en terabyte{{/5}} och {{6}}anropsbar via OrcaRouter till listpris utan påslag{{/6}} — {{7}}modellen du kan dirigera till just nu, stabil och oberoende utvärderad{{/7}}. {{8}}G​LM-5.3 kan användas nu genom Z.ai:s ZCode / AutoClaw och G​LM Coding Plan{{/8}}, {{9}}men det publika API:t och vikterna är båda spärrade under säkerhetsfönstret{{/9}}, {{10}}och dess benchmarksiffror är alla rapporterade av leverantören i väntan på att tredje part upprepar testerna{{/10}}. {{11}}Så det ärliga svaret på "borde jag vänta" har två delar{{/11}}: {{12}}för produktionstrafik som inte får försämras förblir G​LM-5.2 det säkra valet med öppna vikter idag{{/12}}, {{13}}och när G​LM-5.3:s API öppnas och oberoende körningar bekräftar siffrorna är flytten en rutändring, inte en omskrivning{{/13}} — {{14}}du behåller samma enkelnyckelkonfiguration och byter fil{{/14}}. {{15}}För utforskande arbete och säkerhetsutvärdering är G​LM-5.3 värd att prova nu genom Z.ai:s verktyg{{/15}}, {{16}}med förståelsen att dess publicerade försprång är overifierat och att dess beteende är mer variabelt än den ersatta modellens{{/16}}.

Den ärliga domen

G​LM-5.3 är den bättre modellen enligt Z.ai:s egna siffror — dramatiskt bättre på långsiktig kodning och kategoriskt annorlunda när det gäller säkerhet — och den är gratis för ditt arbetsflöde eftersom basen, fotavtrycket och priset är oförändrade. Men ”bättre på leverantörens utvärderingar” och ”bättre i din pipeline” skiljs åt av de två sakerna som GLM-5.2 redan har och som G​LM-5.3 ännu inte har: oberoende reproduktion och publicerade vikter. Om du redan kör GLM-5.2 är uppgraderingsvägen den billigaste i historien om öppna vikter — samma hårdvara, samma pris, samma API-yta och en tvåveckors väntan på vikterna. Beslutet handlar mindre om huruvida G​LM-5.3 är bättre än GLM-5.2 och mer om huruvida du är villig att satsa produktion på en modell vars förbättringar, och vars nyligen framträdda säkerhetsförmåga, ännu inte har bekräftats av någon utanför Z.ai.

© 2026 OrcaRouter

För leverantörer

Driver du en inferensplattform? Få dina modeller på OrcaRouter.

Kontakta oss

Gå med i vår community

DiscordEmailXGitHubYouTube