
GLM-5.3 vs GLM-5.2: Ten sam mózg, podwojone benchmarki
- obsidianNOWOŚĆQwen3.8 27B Uncensored (Aggressive)2026-08-1552Inteligencja68Kod
- qwenNOWOŚĆQwen: Qwen3.8 27B (free)2026-08-1357 tok/s
- deepseekNOWOŚĆDeepSeek: DeepSeek V4 Pro 08132026-08-1253Inteligencja69Kod
- grokNOWOŚĆSpaceXAI: Grok 4.62026-08-1261Inteligencja77Kod
- metaNOWOŚĆMeta: Muse Spark 1.22026-08-0557Inteligencja72Kod
- qwenQwen: Qwen3.8 Max2026-08-0358Inteligencja72Kod
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3152Inteligencja69Kod
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 za 1 mln tokenów · 231 tok/s
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2463Inteligencja78Kod
- googleGoogle: Gemini 3.6 Flash2026-07-2152Inteligencja69Kod
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2137Inteligencja49Kod
- metaMeta: Muse Spark 1.12026-07-1653Inteligencja71Kod
- kimiMoonshotAI: Kimi K32026-07-1560Inteligencja76Kod
- openaiOpenAI: GPT-5.6 Luna2026-07-0952Inteligencja71Kod
- openaiOpenAI: GPT-5.6 Terra2026-07-0957Inteligencja77Kod
- openaiOpenAI: GPT-5.6 Sol2026-07-0961Inteligencja77Kod
- grokxAI: Grok 4.52026-07-0856Inteligencja72Kod
- tencentTencent: Hy32026-07-0642Inteligencja59Kod
Własna narracja Zhipu AI dotycząca aktualizacji z GLM-5.2 do GLM-5.3 jest tą uczciwą: podręcznik się nie zmienił, zmienił się tylko trening ucznia. GLM-5.3, wydany 14 sierpnia 2026 r., jest zbudowany na dokładnie tej samej bazie MoE o 743 miliardach parametrów co GLM-5.2, który w czerwcu zajął pierwsze miejsce w kategorii modeli o otwartych wagach w indeksie Artificial Analysis Intelligence Index. Architektura bez zmian, rozmiar bez zmian, cena 1,40 USD / 4,40 USD za milion tokenów bez zmian — a jednak Z.ai podaje, że ponownie wytrenowany model dwukrotnie lub więcej przewyższa swojego poprzednika w kilku benchmarkach kodowania i bezpieczeństwa publikowanych przez obie wersje. To, czy GLM-5.3 to aktualizacja, którą trzeba wykonać od razu, czy też taka, na którą warto poczekać, zależy od tego, jak bardzo ufasz modelowi, który poprawił się tak bardzo bez zmiany własnej architektury, oraz od tego, czy jego nowo wyłoniona zdolność cybernetyczna to funkcja, którą chcesz mieć odblokowywaną dopiero po dwutygodniowym oknie bezpieczeństwa.
Ten sam mózg, wytrenowany na nowo.
Wszystko, co czyniło z GLM-5.2 praktyczny serwer, pozostaje bez zmian: 743B MoE z około 40B aktywnymi parametrami, mechanizm sparse attention IndexShare, który zredukował FLOPs przy kontekście 1M, licencja MIT, okno kontekstowe 1M oraz wydajna przepustowość tokenów, która w niezależnych obserwacjach osiągała ~145–168 tokenów/sek. GLM-5.3 różni się tylko w jednym wymiarze — post-training. Z.ai rozbudował etap uczenia przez wzmacnianie przy użyciu frameworków IndexShare, SAO i Slime, dodał kilkadziesiąt razy więcej środowisk zadań o długim horyzoncie czasowym i rozszerzył je z debugowania kodu na wykrywanie luk w zabezpieczeniach oraz inżynierię systemów. Efektem jest model, który na tym samym sprzęcie zachowuje się inaczej, i właśnie dlatego pytanie o aktualizację nie brzmi „czy potrzebuję nowych GPU”, ale „czy potrzebuję nowego zachowania”.
Delta benchmarku w obu kierunkach
Odczytując to jako porównanie przed i po na podstawie opublikowanych wyników Z.ai, ten skok jest największy w historii modeli o otwartych wagach. Terminal-Bench 3.0 — trudniejsza wersja, w której oba zostały ocenione — wzrasta z 4.6 do 28.3, czyli sześciokrotnie. DeepSWE v1.1 przechodzi z 46.2 na 66.9, co stanowi różnicę między „dobrym otwartym modelem” a „konkurencyjnym wobec zamkniętych liderów”. Podzbiór CLI Agents' Last Exam przesuwa się z 23.8 na 28.5. Wykrywanie podatności CyberGym rośnie z 77.2 do 84.5. ExploitBench ponad podwaja wynik, z 24.4 na 54.4, a przepustowość ExploitGym rośnie z 29 i 39 ukończonych zadań (dwie i sześć godzin) do 105 i 130. Z.ai podsumowuje to jako mniej więcej 50-procentową poprawę w kodowaniu, a kształt tych zysków — skoncentrowany na kodowaniu o długim horyzoncie czasowym, automatyzacji terminala i bezpieczeństwie — jest spójny z modelem poddanym wyłącznie post-treningowi: surowa wiedza pozostała ta sama, ale zdolność do faktycznego wykonywania wieloetapowych zadań to właśnie ta, która się wzmocniła.
• Terminal-Bench 3.0 — GLM-5.2 4.6 vs GLM-5.3 28.3
• DeepSWE v1.1 — GLM-5.2 46.2 vs GLM-5.3 66.9
• Agents' Last Exam (CLI) — GLM-5.2 23.8 vs GLM-5.3 28.5
• CyberGym wykrywanie podatności — GLM-5.2 77.2 vs GLM-5.3 84.5
ExploitBench — GLM-5.2 24.4 vs GLM-5.3 54.4


Zdolność, której nikt nie zaplanował
Zyski w zakresie bezpieczeństwa zasługują na osobny akapit, ponieważ Z.ai twierdzi, że nie były planowane. Zespół odpowiedzialny za post-trening dodał środowiska do wykrywania podatności, spodziewając się umiarkowanej poprawy; model zamiast tego zaczął łączyć kompletne exploity — zachowanie emergentne, które zmusiło Z.ai do wstrzymania udostępnienia wag na około dwa tygodnie w celu wzmocnienia bezpieczeństwa. W testach w rzeczywistych warunkach z zespołami ds. bezpieczeństwa GLM-5.3 przyczynił się do znalezienia 2 436 podatności w 269 projektach, z czego 1 097 to podatności średniego lub wysokiego ryzyka, w tym błędy, które przez dekady pozostawały niewykryte w szeroko stosowanym oprogramowaniu. GLM-5.2 miał zdolności bezpieczeństwa w zwykłym znaczeniu — potrafił czytać kod w poszukiwaniu błędów. GLM-5.3 ma je w innym znaczeniu: to jest to, o co chodzi w oknie bezpieczeństwa. To zmiana rodzaju, nie stopnia, i to najsilniejszy powód, aby traktować te dwa modele jako różne produkty, mimo wspólnej bazy.

Zastrzeżenie dotyczące spójności
Przeciwwagą dla każdej liczby powyżej jest to, że wczesne testy zewnętrzne opisują GLM-5.3 jako niespójny w sposób, w jaki GLM-5.2 nie był. Niezależni recenzenci donoszą, że ten sam model przy niektórych zadaniach sprawuje się jak ledwie zdający egzamin inżynier z outsourcingu, a przy innych dostarcza wyników na poziomie profesjonalnym – a różnica zależy od tego, jak jasno określone były wymagania. To dokładnie taki profil niepowodzeń, jaki przewidziałbyś dla modelu, którego zyski pochodzą w całości z intensywnego post-treningu skoncentrowanego na środowisku: generalizuje on na podstawie kształtów zadań, na których był trenowany, a słabo określone prompty wypadają poza ich zakres. Żaden z niezależnych wyników nie jest tak czysty jak opublikowane tabele Z.ai, a żadna z liczb Z.ai nie została jeszcze niezależnie odtworzona. Do celów produkcyjnych przemawia to za jawną ewaluacją na własnym obciążeniu przed migracją – to samo zastrzeżenie, jakie dotyczyło GLM-5.2, teraz z większym rozrzutem między najlepszym a najgorszym przypadkiem.
Cena, dostęp i kwestia oczekiwania.
Ceny są identyczne, co eliminuje typowe tarcia przy aktualizacji: oba modele kosztują $1,40 / $4,40 za milion tokenów, przy czym GLM-5.3 wymaga włączonego trybu myślenia. Prawdziwą różnicą jest dostęp. GLM-5.2 jest dziś do pobrania na licencji MIT, można go hostować samodzielnie przy zajętości poniżej terabajta w formacie FP8 oraz wywoływać przez OrcaRouter po cenie katalogowej bez narzutu — to model, do którego możesz kierować ruch już teraz: stabilny i niezależnie oceniany. GLM-5.3 jest teraz dostępny przez ZCode / AutoClaw od Z.ai oraz plan GLM Coding Plan, ale zarówno publiczne API, jak i wagi są ograniczone na czas okna bezpieczeństwa, a wszystkie jego wyniki w benchmarkach pochodzą od dostawcy, do czasu powtórzenia ich przez niezależne podmioty. Uczciwa odpowiedź na pytanie „czy powinienem czekać” ma więc dwie części: dla ruchu produkcyjnego, który nie może zanotować regresji, GLM-5.2 pozostaje dziś bezpiecznym wyborem wśród modeli o otwartych wagach, a gdy tylko API GLM-5.3 zostanie otwarte, a niezależne testy wypadną pomyślnie, zmiana to tylko zmiana trasy, a nie przepisywanie kodu — zachowujesz tę samą konfigurację z jednym kluczem i zmieniasz pas ruchu. Do prac eksploracyjnych i ewaluacji bezpieczeństwa GLM-5.3 warto wypróbować już teraz za pomocą narzędzi Z.ai, ze świadomością, że jego publikowana przewaga nie jest zweryfikowana, a jego zachowanie jest bardziej zmienne niż zachowanie modelu, który zastępuje.
Uczciwy werdykt
GLM-5.3 jest lepszym modelem według liczb samego Z.ai — zdecydowanie lepszym w kodowaniu długoterminowym i całkowicie innym pod względem bezpieczeństwa — i jest bezkosztowy dla Twojego przepływu pracy, ponieważ baza, ślad i cena pozostają niezmienione. Ale „lepszy w ewaluacjach sprzedawcy” i „lepszy w Twoim potoku” oddzielają dwie rzeczy, które GLM-5.2 już ma, a GLM-5.3 jeszcze nie: niezależna reprodukcja i wagi produkcyjne. Jeśli już używasz GLM-5.2, ścieżka aktualizacji jest najtańsza w historii otwartych wag — ten sam sprzęt, ta sama cena, ten sam interfejs API i dwa tygodnie czekania na wagi. Decyzja dotyczy mniej tego, czy GLM-5.3 jest lepszy od GLM-5.2, a bardziej tego, czy jesteś gotów postawić produkcję na model, którego ulepszenia i nowo ujawniona zdolność w zakresie bezpieczeństwa nie zostały jeszcze potwierdzone przez nikogo spoza Z.ai.
