Karta tytułowa hero do porównania GLM-5.3 i GLM-5.2, z podtytułem „Ten sam mózg, podwojone wyniki benchmarków”, z dwiema kartami modeli współdzielącymi jeden połączony blok bazowy 743B MoE oraz zakrzywioną strzałką aktualizacji oznaczoną „tylko po treningu”, wskazującą od GLM-5.2 do GLM-5.3.
Guides & Insights

GLM-5.3 vs GLM-5.2: Ten sam mózg, podwojone benchmarki

Autor

Rowan Sterling

Data publikacji

Najnowsze modele · 20Zobacz wszystkie modele
Benchmarki: Artificial Analysis · aktualizowane codziennie
Powrót do wszystkich wpisów

Własna narracja Zhipu AI dotycząca aktualizacji z GLM-5.2 do G​LM-5.3 jest tą uczciwą: podręcznik się nie zmienił, zmienił się tylko trening ucznia. G​LM-5.3, wydany 14 sierpnia 2026 r., jest zbudowany na dokładnie tej samej bazie MoE o 743 miliardach parametrów co GLM-5.2, który w czerwcu zajął pierwsze miejsce w kategorii modeli o otwartych wagach w indeksie Artificial Analysis Intelligence Index. Architektura bez zmian, rozmiar bez zmian, cena 1,40 USD / 4,40 USD za milion tokenów bez zmian — a jednak Z.ai podaje, że ponownie wytrenowany model dwukrotnie lub więcej przewyższa swojego poprzednika w kilku benchmarkach kodowania i bezpieczeństwa publikowanych przez obie wersje. To, czy G​LM-5.3 to aktualizacja, którą trzeba wykonać od razu, czy też taka, na którą warto poczekać, zależy od tego, jak bardzo ufasz modelowi, który poprawił się tak bardzo bez zmiany własnej architektury, oraz od tego, czy jego nowo wyłoniona zdolność cybernetyczna to funkcja, którą chcesz mieć odblokowywaną dopiero po dwutygodniowym oknie bezpieczeństwa.

Ten sam mózg, wytrenowany na nowo.

Wszystko, co czyniło z GLM-5.2 praktyczny serwer, pozostaje bez zmian: 743B MoE z około 40B aktywnymi parametrami, mechanizm sparse attention IndexShare, który zredukował FLOPs przy kontekście 1M, licencja MIT, okno kontekstowe 1M oraz wydajna przepustowość tokenów, która w niezależnych obserwacjach osiągała ~145–168 tokenów/sek. G​LM-5.3 różni się tylko w jednym wymiarze — post-training. Z.ai rozbudował etap uczenia przez wzmacnianie przy użyciu frameworków IndexShare, SAO i Slime, dodał kilkadziesiąt razy więcej środowisk zadań o długim horyzoncie czasowym i rozszerzył je z debugowania kodu na wykrywanie luk w zabezpieczeniach oraz inżynierię systemów. Efektem jest model, który na tym samym sprzęcie zachowuje się inaczej, i właśnie dlatego pytanie o aktualizację nie brzmi „czy potrzebuję nowych GPU”, ale „czy potrzebuję nowego zachowania”.

Delta benchmarku w obu kierunkach

Odczytując to jako porównanie przed i po na podstawie opublikowanych wyników Z.ai, ten skok jest największy w historii modeli o otwartych wagach. Terminal-Bench 3.0 — trudniejsza wersja, w której oba zostały ocenione — wzrasta z 4.6 do 28.3, czyli sześciokrotnie. DeepSWE v1.1 przechodzi z 46.2 na 66.9, co stanowi różnicę między „dobrym otwartym modelem” a „konkurencyjnym wobec zamkniętych liderów”. Podzbiór CLI Agents' Last Exam przesuwa się z 23.8 na 28.5. Wykrywanie podatności CyberGym rośnie z 77.2 do 84.5. ExploitBench ponad podwaja wynik, z 24.4 na 54.4, a przepustowość ExploitGym rośnie z 29 i 39 ukończonych zadań (dwie i sześć godzin) do 105 i 130. Z.ai podsumowuje to jako mniej więcej 50-procentową poprawę w kodowaniu, a kształt tych zysków — skoncentrowany na kodowaniu o długim horyzoncie czasowym, automatyzacji terminala i bezpieczeństwie — jest spójny z modelem poddanym wyłącznie post-treningowi: surowa wiedza pozostała ta sama, ale zdolność do faktycznego wykonywania wieloetapowych zadań to właśnie ta, która się wzmocniła.

• Terminal-Bench 3.0 — GLM-5.2 4.6 vs GLM-5.3 28.3

• DeepSWE v1.1 — GLM-5.2 46.2 vs GLM-5.3 66.9

• Agents' Last Exam (CLI) — GLM-5.2 23.8 vs GLM-5.3 28.5

• CyberGym wykrywanie podatności — GLM-5.2 77.2 vs G​LM-5.3 84.5

ExploitBench — GLM-5.2 24.4 vs G​LM-5.3 54.4

The OrcaRouter GLM-5.2 model page showing Z.ai's open-weights flagship with its per-million-token pricing, context window and model ID.Scoreboard contrasting GLM-5.2 (Terminal-Bench 3.0 4.6, DeepSWE v1.1 46.2, Agents' Last Exam CLI 23.8, CyberGym 77.2, ExploitBench 24.4, Price $1.40/$4.40 per M) with GLM-5.3 (Terminal-Bench 3.0 28.3, DeepSWE v1.1 66.9, Agents' Last Exam CLI 28.5, CyberGym 84.5, ExploitBench 54.4, Price $1.40/$4.40 per M).

Zdolność, której nikt nie zaplanował

Zyski w zakresie bezpieczeństwa zasługują na osobny akapit, ponieważ Z.ai twierdzi, że nie były planowane. Zespół odpowiedzialny za post-trening dodał środowiska do wykrywania podatności, spodziewając się umiarkowanej poprawy; model zamiast tego zaczął łączyć kompletne exploity — zachowanie emergentne, które zmusiło Z.ai do wstrzymania udostępnienia wag na około dwa tygodnie w celu wzmocnienia bezpieczeństwa. W testach w rzeczywistych warunkach z zespołami ds. bezpieczeństwa G​LM-5.3 przyczynił się do znalezienia 2 436 podatności w 269 projektach, z czego 1 097 to podatności średniego lub wysokiego ryzyka, w tym błędy, które przez dekady pozostawały niewykryte w szeroko stosowanym oprogramowaniu. GLM-5.2 miał zdolności bezpieczeństwa w zwykłym znaczeniu — potrafił czytać kod w poszukiwaniu błędów. G​LM-5.3 ma je w innym znaczeniu: to jest to, o co chodzi w oknie bezpieczeństwa. To zmiana rodzaju, nie stopnia, i to najsilniejszy powód, aby traktować te dwa modele jako różne produkty, mimo wspólnej bazy.

Infographic titled 'The upgrade delta' showing a two-column before-and-after comparison of GLM-5.2 vs GLM-5.3 across five benchmarks with upward arrows: Terminal-Bench 3.0 4.6 to 28.3, DeepSWE v1.1 46.2 to 66.9, Agents' Last Exam CLI 23.8 to 28.5, CyberGym 77.2 to 84.5, ExploitBench 24.4 to 54.4.

Zastrzeżenie dotyczące spójności

Przeciwwagą dla każdej liczby powyżej jest to, że wczesne testy zewnętrzne opisują G​LM-5.3 jako niespójny w sposób, w jaki GLM-5.2 nie był. Niezależni recenzenci donoszą, że ten sam model przy niektórych zadaniach sprawuje się jak ledwie zdający egzamin inżynier z outsourcingu, a przy innych dostarcza wyników na poziomie profesjonalnym – a różnica zależy od tego, jak jasno określone były wymagania. To dokładnie taki profil niepowodzeń, jaki przewidziałbyś dla modelu, którego zyski pochodzą w całości z intensywnego post-treningu skoncentrowanego na środowisku: generalizuje on na podstawie kształtów zadań, na których był trenowany, a słabo określone prompty wypadają poza ich zakres. Żaden z niezależnych wyników nie jest tak czysty jak opublikowane tabele Z.ai, a żadna z liczb Z.ai nie została jeszcze niezależnie odtworzona. Do celów produkcyjnych przemawia to za jawną ewaluacją na własnym obciążeniu przed migracją – to samo zastrzeżenie, jakie dotyczyło GLM-5.2, teraz z większym rozrzutem między najlepszym a najgorszym przypadkiem.

Cena, dostęp i kwestia oczekiwania.

Ceny są identyczne, co eliminuje typowe tarcia przy aktualizacji: oba modele kosztują $1,40 / $4,40 za milion tokenów, przy czym G​LM-5.3 wymaga włączonego trybu myślenia. Prawdziwą różnicą jest dostęp. GLM-5.2 jest dziś do pobrania na licencji MIT, można go hostować samodzielnie przy zajętości poniżej terabajta w formacie FP8 oraz wywoływać przez OrcaRouter po cenie katalogowej bez narzutu — to model, do którego możesz kierować ruch już teraz: stabilny i niezależnie oceniany. G​LM-5.3 jest teraz dostępny przez ZCode / AutoClaw od Z.ai oraz plan G​LM Coding Plan, ale zarówno publiczne API, jak i wagi są ograniczone na czas okna bezpieczeństwa, a wszystkie jego wyniki w benchmarkach pochodzą od dostawcy, do czasu powtórzenia ich przez niezależne podmioty. Uczciwa odpowiedź na pytanie „czy powinienem czekać” ma więc dwie części: dla ruchu produkcyjnego, który nie może zanotować regresji, GLM-5.2 pozostaje dziś bezpiecznym wyborem wśród modeli o otwartych wagach, a gdy tylko API G​LM-5.3 zostanie otwarte, a niezależne testy wypadną pomyślnie, zmiana to tylko zmiana trasy, a nie przepisywanie kodu — zachowujesz tę samą konfigurację z jednym kluczem i zmieniasz pas ruchu. Do prac eksploracyjnych i ewaluacji bezpieczeństwa G​LM-5.3 warto wypróbować już teraz za pomocą narzędzi Z.ai, ze świadomością, że jego publikowana przewaga nie jest zweryfikowana, a jego zachowanie jest bardziej zmienne niż zachowanie modelu, który zastępuje.

Uczciwy werdykt

G​LM-5.3 jest lepszym modelem według liczb samego Z.ai — zdecydowanie lepszym w kodowaniu długoterminowym i całkowicie innym pod względem bezpieczeństwa — i jest bezkosztowy dla Twojego przepływu pracy, ponieważ baza, ślad i cena pozostają niezmienione. Ale „lepszy w ewaluacjach sprzedawcy” i „lepszy w Twoim potoku” oddzielają dwie rzeczy, które GLM-5.2 już ma, a G​LM-5.3 jeszcze nie: niezależna reprodukcja i wagi produkcyjne. Jeśli już używasz GLM-5.2, ścieżka aktualizacji jest najtańsza w historii otwartych wag — ten sam sprzęt, ta sama cena, ten sam interfejs API i dwa tygodnie czekania na wagi. Decyzja dotyczy mniej tego, czy G​LM-5.3 jest lepszy od GLM-5.2, a bardziej tego, czy jesteś gotów postawić produkcję na model, którego ulepszenia i nowo ujawniona zdolność w zakresie bezpieczeństwa nie zostały jeszcze potwierdzone przez nikogo spoza Z.ai.

© 2026 OrcaRouter

Dla dostawców

Prowadzisz platformę inferencyjną? Udostępnij swoje modele w OrcaRouter.

Skontaktuj się z nami

Dołącz do społeczności

DiscordEmailXGitHubYouTube