Karta główna do objaśnienia GLM-5.2, przedstawiająca kartę z napisem „753B łącznych parametrów”, szeroką wstęgę kontekstu z napisem „kontekst 1M tokenów” oraz plakietkę z napisem „otwarte wagi MIT”, a w stopce napis „GLM-5.2 – wydany 16 czerwca 2026 – Z.ai”.
Guides & Insights

Czym jest GLM-5.2? Flagowy model Z.ai z otwartymi wagami i kontekstem 1M, dwie wersje później

Autor

Magnus Corvin

Data publikacji

Najnowsze modele · 20Zobacz wszystkie modele
Benchmarki: Artificial Analysis · aktualizowane codziennie
Powrót do wszystkich wpisów

GLM-5.2 to duży model językowy z otwartymi wagami, obsługujący wyłącznie tekst, od Z.ai, pekińskiego laboratorium znanego wcześniej jako Zhipu AI, wydany 16 czerwca 2026 r. na licencji MIT. To model typu mixture-of-experts o 753 miliardach parametrów i oknem kontekstowym mieszczącym milion tokenów, a przez około dwa miesiące był najsilniejszym modelem do kodowania z otwartymi wagami, jaki można było pobrać. Nie zajmuje już tej pozycji, ponieważ Z.ai wypuściło od tego czasu dwóch jego następców zbudowanych na jego bazie — a to jest część, którą pomija większość stron o GLM-5.2, i ta, która decyduje, czy nadal powinno cię to interesować.

Czterdzieści trzy artykuły w archiwum tego bloga wspominają o GLM-5.2. Do tej pory ani jeden z nich nie dotyczył jego samego: model pojawia się jako przeciwnik w porównaniu za porównaniem, stały punkt odniesienia, względem którego mierzy się nowsze modele. To dziwna rola dla modelu, którego jego własny twórca ma już za sobą, i to jest powód, dla którego istnieje ta strona — bezpośredni opis tego, czym GLM-5.2 faktycznie jest, ile kosztuje, w czym jest dobry i kto wciąż powinien go wybierać.

Gdzie w ofercie Z.ai plasuje się GLM-5.2

Z.ai publikuje datowany rejestr wydań i jest to najczystsze źródło do tego. Przeczytaj go po kolei, a kształt rodziny stanie się oczywisty:

Z.ai's public release-notes page, listing dated model entries in reverse chronological order: 2026-08-26 GLM-5.3-Flash, 2026-08-18 GLM-5.3, 2026-06-16 GLM-5.2 and 2026-04-07 GLM-5.1, each with its own summary bullet points.

GLM-5 — 12 lutego 2026. Pierwszy GLM-5, ukierunkowany na złożoną inżynierię systemów i długodystansowe zadania agentowe.
GLM-5.1 — 7 kwietnia 2026. Praca długoterminowa, zdolny do samodzielnego działania przez maksymalnie osiem godzin w jednym przebiegu.
• GLM-5.2 — 16 czerwca 2026. Flagowy model z kontekstem 1M do zadań długoterminowych; dziennik Z.ai opisuje go jako „bezstratny kontekst 1M, znacząco poprawiający możliwości w zadaniach długoterminowych”.
GLM-5.3 — 18 sierpnia 2026. Ten sam model bazowy co GLM-5.2, a zyski pochodzą z post-trainingu. Z.ai raportuje 50% wzrost względem GLM-5.2 w swoim wewnętrznym Code Bench oraz najlepszy wśród otwartoźródłowych wynik na Terminal Bench 3.0.
GLM-5.3-Flash — 26 sierpnia 2026. Inny, mniejszy model zbudowany na nowo wytrenowanej bazie (łącznie 320B, 18B aktywnych), pierwszy natywnie multimodalny GLM-5.

Ważny jest wiersz dotyczący GLM-5.3. GLM-5.3 nie jest większym GLM-5.2 — to te same wagi bazowe, doprowadzone dalej dzięki dodatkowemu treningowi po wstępnym treningu. To czyni GLM-5.2 ostatnim modelem w tej linii, którego możliwości wynikały z architektury, a GLM-5.3 — obecnym flagowym modelem tekstowym. Jeśli wybierasz dziś model Z.ai kierując się wyłącznie jakością, odpowiedzią jest GLM-5.3, a nie GLM-5.2.

GLM-5.3-Flash to osobna gałąź, a nie tańszy GLM-5.3: mniejszy, natywnie multimodalny model (tekst, obraz i wideo) wyceniony o rząd wielkości poniżej flagowych modeli tekstowych. Jeśli potrzebujesz możliwości wizualnych, GLM-5.2 tak czy inaczej nie jest modelem, którego szukasz.

Arkusz specyfikacji

• Parametry — łącznie 753B, zgodnie z kartą modelu pod adresem zai-org/GLM-5.2-FP8. Z.ai nie podaje na tej karcie liczby aktywnych parametrów; zestawienia firm trzecich szacują ją na około 40B na token i nie udało nam się potwierdzić tej wartości w źródle pierwotnym.
• Okno kontekstu — 1M tokenów, opisane na karcie jako „solidny kontekst 1M tokenów, który stabilnie podtrzymuje pracę w długim horyzoncie”.
• Maksymalne wyjście — 128K tokenów.
• Modalność — tekst na wejściu, tekst na wyjściu. Brak wejścia obrazowego, brak dźwięku. Nasz własny wpis katalogowy dotyczący tego modelu stwierdza, że „obsługuje wyłącznie wejście tekstowe”.
• Licencja — MIT, bez ograniczeń regionalnych. Wagi są udostępniane za pośrednictwem zai-org — organizacji na Hugging Face — w wariantach BF16 i FP8.
• Kontrola rozumowania — hybrydowy tryb myślenia sterowany przez reasoning_effort — parametr zhigh i max jako ustawieniami, domyślnie max. Obsługiwane są natywne wywoływanie narzędzi i ustrukturyzowane wyjście.
• Architektura — IndexShare, który ponownie wykorzystuje jeden lekki indekser w co czwartej warstwie rzadkiej uwagi i, zgodnie z kartą modelu, zmniejsza liczbę FLOP-ów na token o 2,9× przy pełnym kontekście; do tego ulepszona warstwa wielotokenowej predykcji, która zwiększa długość akceptacji dekodowania spekulatywnego nawet o 20%.
• Sprzęt szkoleniowy — relacje prasowe z premiery podają, że model był trenowany na akceleratorach Huawei Ascend, bez sprzętu Nvidii. To twierdzenie pochodzące z doniesień medialnych, a nie z karty modelu, i przekazujemy je właśnie jako takie.

A scoreboard card for GLM-5.2 with six rows: released 16 June 2026, 753B total parameters MoE, 1M-token context with 128K output, MIT licence text only, price $1.40 and $4.40 per million tokens, and an Artificial Analysis Intelligence Index of 34, 11th of 114. The footer reads that vendor benchmarks are from Z.ai and the index is per Artificial Analysis v4.3.2.

W czym GLM-5.2 jest wymiernie dobry

Prawie wszystko, w czym GLM-5.2 jest dobry, to pomiary dotyczące kodowania lub działania agentowego, a liczby poniżej są raportowane przez dostawcę — pochodzą one z tabeli benchmarków na karcie modelu Z.ai, a nie z niezależnego odtworzenia.

• Terminal Bench 2.1 (Terminus-2) — 81,0 w porównaniu z 63,5 dla GLM-5.1. To największy skok międzypokoleniowy w tabeli.
• SWE-bench Pro — 62,1 w porównaniu z 58,4 dla GLM-5.1.
• FrontierSWE (Dominance) — 74,4 w porównaniu z 30,5 dla GLM-5.1 i 72,6 dla GPT-5.5.
• AIME 2026 — 99,2. GPQA-Diamond — 91,2. Oba wyniki są z powodzeniem konkurencyjne wobec zamkniętej czołówki w tabeli samego Z.ai.
• MCP-Atlas (zestaw publiczny) — 76,8, zasadniczo na poziomie 77,8 Claude Opus 4.8 w tej samej tabeli.
• Przywoływanie w długim kontekście — 78,3, czyli liczba, która ma największe znaczenie dla okna o długości 1M tokenów. Okno jest przydatne tylko wtedy, gdy przywoływanie utrzymuje się na głębokości, a własny wynik Z.ai wskazuje, że w większości tak jest.

Niezależny obraz jest uboższy, ale prawdziwy. Artificial Analysis notuje GLM-5.2 z wynikiem 34 w Intelligence Index na swoim Intelligence Index v4.3.2, co daje mu 11. miejsce wśród 114 modeli w swojej klasie. Z tą liczbą wiążą się dwa zastrzeżenia i Artificial Analysis samo podaje oba: model jest oznaczony jako przestarzały na ich stronie, a oni „kontynuują testy wydajności wyłącznie dla domyślnego obciążenia wejściowego o rozmiarze 10k tokenów” — wyniki dla innych obciążeń są historyczne i nie są już aktualizowane. Nasz własny wpis katalogowy dla tego modelu zawiera starszą migawkę oceny z 25 czerwca 2026 r. z wynikiem Intelligence 33,7, która nie pochodzi z tej samej rewizji indeksu co bieżąca wartość i nie należy jej odczytywać jako zmiany w modelu.

W czym jest wymiernie zły

Trzy rzeczy i warto powiedzieć je bez ogródek.

• Obsługuje wyłącznie tekst. Brak wejścia obrazu, brak wejścia audio. GLM-5.3-Flash to model multimodalny w tej rodzinie, a jeśli Twoje obciążenie obejmuje zrzuty ekranu, pliki PDF lub wideo, GLM-5.2 to całkowicie niewłaściwa gałąź.
• Przegrywa wyraźnie w pomiarach o najdłuższym horyzoncie i najtrudniejszych zadaniach inżynierii oprogramowania. W SWE-Marathon uzyskuje 13,0 wobec 26,0 Claude'a Opusa 4.8. W DeepSWE uzyskuje 46,2 wobec 58 dla Claude'a Opusa 4.8 i 70 dla GPT-5.5. W NL2Repo uzyskuje 48,9 wobec 69,7 Opusa 4.8. Wszystkie te wartości są podane przez dostawcę i pochodzą z tej samej tabeli, w której GLM-5.2 wygrywa w innych miejscach, i właśnie to czyni je wiarygodnymi: Z.ai opublikowało je obok własnych zwycięstw.
• Został wyparty w pomiarach, które go rozsławiły. GLM-5.3 korzysta z tej samej bazy i bije go o 50% w Code Bench firmy Z.ai, a także w Terminal Bench 3.0 i Agents' Last Exam. GLM-5.2 jest również oznaczony jako przestarzały w Artificial Analysis.

Jednej liczby nie udało nam się uzyskać: nie mogliśmy potwierdzić aktualnego niezależnego pomiaru przepustowości lub opóźnienia dla GLM-5.2 ze źródła, które udało nam się otworzyć, więc ta strona nie podaje żadnej, zamiast powtarzać liczbę, której nie mogliśmy sprawdzić.

Cena i gdzie to uruchomić

Własny cennik Z.ai, odczytany dzisiaj, podaje GLM-5.2 na poziomie:

• Wejście — 1,40 USD za milion tokenów
• Buforowane wejście — 0,26 USD za milion tokenów
• Wyjście — 4,40 USD za milion tokenów

Przechowywanie danych wejściowych w pamięci podręcznej jest wymienione jako bezpłatne przez ograniczony czas. Warto zauważyć, że GLM-5.3 ma dokładnie te same trzy stawki, więc nowszy model nie jest droższy na liście Z.ai — co eliminuje zwykły powód, by pozostawać przy starszym.

W kwestii dostępności: model jest udostępniany przez własny endpoint Z.ai zgodny z OpenAI pod adresem api.z.ai/api/paas/v4/chat/completions, z oficjalnymi zestawami SDK dla Pythona i Javy, a wagi można pobrać z Hugging Face do samodzielnego hostowania na licencji MIT. Poza tym jest dostępny za pośrednictwem szeregu zewnętrznych platform inferencyjnych. My go routujemy: OrcaRouter udostępnia GLM-5.2 na swojej stronie modelu w stawce dostawcy Z.ai bez żadnej marży, więc podane wyżej $1.40 / $4.40 to kwota, którą płacisz u nas, a nie podrożona jego kopia. Ten sam klucz daje też dostęp do pozostałej części katalogu, co ma tu znaczenie z konkretnego powodu — patrz poniżej.

The OrcaRouter model page for z-ai/glm-5.2, showing a Featured badge, a 1M-token context, 128K maximum output, text-only input and output, and rate cards reading $1.40 per million input tokens and $4.40 per million output tokens, alongside measured latency and a seven-day traffic figure.

Kto powinien wybrać GLM-5.2, a kto powinien wybrać coś innego

Wybierz GLM-5.2, jeśli hostujesz samodzielnie i wymogiem jest okno 1 mln tokenów, a nie wyniki benchmarków. Licencja MIT bez ograniczeń regionalnych, opublikowane wagi FP8 i projekt mechanizmu uwagi IndexShare czynią go naprawdę praktycznym rozwiązaniem do uruchamiania w długim kontekście, a wskaźnik przywołania na głębokości to wartość, która uzasadnia to okno. To również rozsądny wybór, jeśli masz potok już dostrojony do jego reasoning_effort i powiązanego z nim zachowania, a koszt ponownej walidacji promptów względem GLM-5.3 przewyższa zysk.

Wybierz zamiast tego GLM-5.3, jeśli kupujesz tokeny, a nie wagi, a jakość to jedyne kryterium. To ten sam model bazowy, lepiej dostrojony po treningu wstępnym, w identycznych cenach katalogowych. Nie ma żadnego argumentu cenowego za starszym modelem we własnym cenniku Z.ai.

Zamiast tego wybierz GLM-5.3-Flash jeśli potrzebujesz obsługi wizji albo najtańszej odpowiedniej opcji: obsługuje tekst, obrazy i wideo, a jego cena jest znacznie niższa niż w przypadku obu flagowych modeli tekstowych.

Wybierz coś zupełnie innego, jeśli twoja praca znajduje się na trudnym końcu długoterminowej inżynierii oprogramowania. W opublikowanej przez samo Z.ai tabeli Claude Opus 4.8 bije GLM-5.2 w SWE-Marathon, DeepSWE, NL2Repo, SWE-bench Pro, ProgramBench i Tool-Decathlon; GPT-5.5 bije go w DeepSWE i ProgramBench. Zwycięstwa GLM-5.2 są prawdziwe, ale koncentrują się na kodowaniu agentowym w stylu terminala i rozumowaniu, a nie na zadaniach maratonu. Jeśli twoja ocena wygląda jak dwugodzinne uruchomienie agenta wobec dużego nieznanego repozytorium, przewaga cenowa otwartych wag nie zamyka tej luki przy tych liczbach.

Praktyczne podsumowanie

GLM-5.2 to wyłącznie tekstowy model MoE o 753 mld parametrów, na licencji MIT, z kontekstem 1M, wydany 16 czerwca 2026 r. w cenie 1,40 / 4,40 USD za milion tokenów, z raportowanymi przez dostawcę wynikami Terminal Bench 2.1 na poziomie 81,0 i SWE-bench Pro na poziomie 62,1 oraz niezależnym Artificial Analysis Intelligence Index na poziomie 34. To ostatni flagowy model GLM, którego możliwości pochodziły z architektury, a nie z treningu następczego; został dwukrotnie zastąpiony przez własnego twórcę i jest oznaczony jako przestarzały w niezależnym indeksie, który go ocenił.

Nic z tego nie czyni go złym modelem. Czyni go modelem ustalonym: ciekawe pytanie dotyczące GLM-5.2 we wrześniu 2026 nie brzmi, czy jest dobry, lecz czy konkretna rzecz, której potrzebujesz — model do kodowania z długim kontekstem, możliwy do samodzielnego hostowania i objęty licencją MIT — jest dla ciebie warta więcej niż trzy punkty, które GLM-5.3 dodaje do tych samych wag. Dla większości nabywców tokenów odpowiedź brzmi: nie. Dla każdego, kto pobiera wagi, nadal brzmi: tak.

Jeśli chcesz to przetestować samodzielnie, nie angażując w to ścieżki produkcyjnej, warstwa routingu jest tanim sposobem, by to zrobić: skieruj to samo żądanie do GLM-5.2 i GLM-5.3 przez jeden endpoint, porównaj na własnych promptach i pozwól automatycznemu przełączaniu awaryjnemu obsłużyć przypadek, w którym to endpoint starszego modelu ulega awarii.

Call GLM-5.2 through OrcaRouter at the Z.ai provider rate, zero markup. https://www.orcarouter.ai/models/z-ai/glm-5.2 One API key reaches GLM-5.2, GLM-5.3 and 200+ other models, with automatic failover if an endpoint goes down.

Porównane w tym artykule2

Wykryto na podstawie tego artykułu · Benchmarki: Artificial Analysis · aktualizowane codziennie