
GLM 5.3 Prime: te same wagi GLM-5.3, w dokładnie dwukrotnie wyższej cenie niż w cenniku
- openaiNOWOŚĆOpenAI: GPT-6 Luna2026-09-2237Inteligencja
- openaiNOWOŚĆOpenAI: GPT-6 Sol2026-09-2248Inteligencja
- anthropicNOWOŚĆAnthropic: Claude Opus 5.52026-09-2258Inteligencja
- grokNOWOŚĆGrok 4.72026-09-2146Inteligencja
- OrcaNOWOŚĆOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 za 1 mln tokenów · 177 tok/s
- orcaNOWOŚĆOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 za 1 mln tokenów · 1323 tok/s
- deepseekNOWOŚĆDeepSeek: DeepSeek V4.1 Flash2026-09-1040Inteligencja
- openaiOpenAI: GPT-6 Astra2026-09-0453Inteligencja77Kod
- googleGoogle: Gemini 3.8 Flash2026-09-0241Inteligencja76Kod
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Inteligencja76Kod
- anthropicAnthropic: Claude Fable 5.12026-09-0153Inteligencja82Kod
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 za 1 mln tokenów · 108 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Inteligencja72Kod
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 za 1 mln tokenów · 220 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Inteligencja75Kod
- obsidianQwen3.8 27B2026-08-1534Inteligencja68Kod
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Inteligencja69Kod
- grokSpaceXAI: Grok 4.62026-08-1244Inteligencja77Kod
- metaMeta: Muse Spark 1.22026-08-0540Inteligencja72Kod
- qwenQwen: Qwen3.8 Max2026-08-0345Inteligencja76Kod
GLM 5.3 Prime kosztuje 2,80 USD za milion tokenów wejściowych i 8,80 USD za milion tokenów wyjściowych. GLM-5.3, model, na którym działa, kosztuje 1,40 USD i 4,40 USD. To nie jest różnica wynikająca z zaokrąglenia ani promocyjna rozpiętość — to dokładnie 2,0× w obu pozycjach i jedyna rzecz, co do której te dwa produkty się nie zgadzają. GLM 5.3 Prime nie jest nowym modelem. Ma w sobie wagi samego GLM-5.3, te, które Z.ai udostępnił 25 sierpnia 2026 r., za szybszym stosem serwowania. Sam GLM-5.3 ogłoszono 14 sierpnia 2026 r., a do API trafił 18 sierpnia. W modelu bazowym nic się nie zmieniło, gdy pod koniec września pojawił się identyfikator Prime. Zmieniło się to, że ktoś przypiął do niego drugą metkę z ceną.
Jeśli czytasz to, ponieważ lista modeli pokazała Ci nieznaną nazwę obok znanej, krótka odpowiedź brzmi: patrzysz na poziom udostępniania, a nie na wydanie. Dłuższa odpowiedź jest warta dwóch minut, ponieważ arytmetyka jest wyjątkowo przejrzysta, a pochodzenie wyjątkowo mętne.
Czym jest poziom „Prime”, w jednym akapicie
Poziom usługi to drugi identyfikator produktu wskazujący na te same wagi, dostrojony pod przepustowość, a nie pod koszt. Nie otrzymujesz większego modelu, dłuższego kontekstu, lepszego trybu rozumowania ani szerszego zestawu narzędzi. Otrzymujesz szybsze wydawanie tokenów, a za ten przywilej płacisz przy każdym tokenie, a nie za zaoszczędzony czas zegarowy. Ten kompromis jest realny i czasem właściwy — wieloetapowa pętla agenta wykonująca dziesięć kolejnych wywołań naprawdę korzysta z szybszego powrotu każdego z nich — ale to zakup opóźnienia, a nie zakup możliwości, i tak powinien być wyceniany.
Opis dostawcy dla GLM 5.3 Prime mówi wprost to, co zwykle się przemilcza: to „szybki wariant GLM-5.3 firmy Z.ai, dziedziczący pełne możliwości, a jednocześnie zapewniający 1,5–2× większą przepustowość wyjściową dzięki przyspieszeniu wnioskowania”. Pełne możliwości. To samo okno kontekstu wynoszące 1 000 000 tokenów. Ten sam limit wyjścia wynoszący 131 072 tokenów. Tekst na wejściu, tekst na wyjściu. Rozumowanie obowiązkowe, z poziomami wysiłku low, high i max oraz max jako domyślnym — identycznie jak w modelu bazowym.
Cennik, obok siebie
• Wejście — GLM 5.3 Prime 2,80 USD za 1 mln vs GLM-5.3 1,40 USD za 1 mln
• Wyjście — GLM 5.3 Prime 8,80 USD za 1 mln vs GLM-5.3 4,40 USD za 1 mln
• Wejście z pamięci podręcznej — GLM 5.3 Prime 0,56 USD za 1 mln vs GLM-5.3 0,26 USD za 1 mln
• Mnożnik — 2,0× we wszystkich trzech wierszach, w obu kierunkach
• Kontekst — 1 000 000 tokenów w obu
• Maksymalne wyjście — 131 072 tokenów w obu
• Rozumowanie — obowiązkowe w obu, te same trzy poziomy wysiłku, ten sam domyślny
Pozycja dotycząca pamięci podręcznej jest tym, co ludzie przeoczają. Odczyt z pamięci podręcznej to najtańszy token, jaki kiedykolwiek kupisz od modelu czołowego, i to właśnie tam obciążenia agentowe faktycznie wydają swój budżet — prompt systemowy, definicje narzędzi i rosnący transkrypt są odczytywane ponownie w każdej turze. Podwojenie stawki za odczyt z pamięci podręcznej podwaja największą pozycję w długiej sesji agentowej, co oznacza, że efektywna dopłata w rzeczywistym obciążeniu jest bliższa 2×, niż sugeruje nagłówkowa rozpiętość cen na świeżych tokenach wejściowych. Jeśli liczyłeś, że szybka ścieżka będzie w praktyce tańsza, bo agresywnie korzystasz z pamięci podręcznej, to nie jest.
Kto tak naprawdę to sprzedaje?
To tutaj lista staje się interesująca i tutaj uważny czytelnik powinien zwolnić. Własna dokumentacja Z.ai, jej przegląd modeli i opublikowana strona z cennikiem nie wymieniają żadnego SKU Prime. Przeszukaj identyfikatory modeli dostawcy w poszukiwaniu glm-5.3-prime i nie znajdziesz nic. Własny poziom szybkości Z.ai to zupełnie inny produkt w całkowicie innej linii — GLM-5.3-FlashX, który należy do tańszej rodziny Flash, został wprowadzony 18 września 2026 r. i jest wyceniony na 0,37 USD i 1,25 USD za milion tokenów.
Więc Prime to produkt po stronie platformy zbudowany na wagach Z.ai. Dwa szczegóły wskazują na to, czyja to platforma. Pierwszy to sformułowanie „przepustowość wyjściowa 1,5–2×”, które jest tym samym określeniem, jakiego duży dostawca chmury używa dla własnego przyspieszonego trybu obsługi — trybu, który włącza się przez zmianę identyfikatora modelu, przy czym możliwości i limity użycia pozostają wyraźnie niezmienione. Drugi to fakt, że oferta wskazuje dokładnie jednego dostawcę upstream stojącego za punktem końcowym. Pojedynczy dostawca za SKU szybkiej warstwy to nie sposób, w jaki obsługuje się model o otwartych wagach; tak właśnie wygląda z zewnątrz własne przyspieszone wdrożenie platformy.
Nic z tego nie sprawia, że GLM 5.3 Prime to zły produkt. Sprawia natomiast, że jest to produkt z jednym dostawcą, co jest kwestią odporności, którą należy rozważyć, zanim skierujesz przez niego ruch produkcyjny.
Ile warta jest deklaracja prędkości

Wartość 1,5–2× to deklarowana przepustowość mierzona w warunkach samego dostawcy, a przepustowość jest wskaźnikiem najbardziej wrażliwym na te warunki. Liczba tokenów wyjściowych na sekundę przy rozgrzanym cache'u, krótkim prompcie i bezczynnym klastrze to nie jest liczba, jaką widzi agent z długim kontekstem. Niezależny pomiar modelu bazowego wskazuje, że GLM-5.3 osiąga około 61 tokenów wyjściowych na sekundę, a GLM-5.3-Flash około 46, w zestawie, w którym średnia dla klasy wynosi 67 — więc tańsza ścieżka jest także wolniejsza, co jest przeciwieństwem tego, co sugerują nazwy. Są to mediany z standaryzowanego zestawu ewaluacyjnego, a nie wartości szczytowe.
Jest jeszcze subtelniejszy koszt. Domyślny poziom wysiłku rozumowania dla obu identyfikatorów to max, czyli ustawienie dające najdłuższe łańcuchy myśli. Szybkość i rozwlekłość ciągną tu w przeciwnych kierunkach: szybka warstwa, która dodatkowo rozumuje z maksymalną długością, wciąż może być wolna od początku do końca przy trudnym problemie, ponieważ wąskim gardłem jest liczba tokenów, które model zdecyduje się wygenerować, a nie tempo, w jakim je generuje. Jeśli Twoje obciążenie jest mocno oparte na rozumowaniu, zejdź do high lub low, zanim zapłacisz 2× za przyspieszenie — poziom wysiłku wpłynie na Twoje opóźnienie bardziej niż warstwa obsługująca.
Trzy sposoby na kupno tego samego modelu

GLM-5.3 istnieje teraz w trzech formach dostępnych w sprzedaży i nie są to trzy modele:
• GLM-5.3 za 1,40 USD / 4,40 USD — podstawowy cennik, pełne możliwości, wersja z opublikowanymi otwartymi wagami, którą możesz hostować u siebie
• GLM 5.3 Prime za 2,80 USD / 8,80 USD — te same wagi w przyspieszonym stosie, jeden dostawca upstream, bez udostępniania wag
• GLM-5.3-FlashX za 0,37 USD / 1,25 USD — to wcale nie GLM-5.3, lecz wariant szybkościowy w tańszej rodzinie Flash i zdecydowanie najtańszy sposób na kupno niskich opóźnień
To na tę trzecią linię warto patrzeć. Jeśli tak naprawdę zależy Ci na szybszych tokenach i jesteś elastyczny co do tego, z którego GLM je otrzymasz, FlashX zapewnia przyspieszenie na modelu, który już kosztuje około jednej dziesiątej ceny flagowca, za mniej niż połowę tego, co flagowiec kosztuje bez przyspieszenia. Prime ma sens tylko wtedy, gdy konkretnie potrzebujesz jakości rozumowania GLM-5.3 i konkretnie potrzebujesz jej szybciej.
Gdzie to się znajduje po naszej stronie

Powiedzmy sobie jedno wprost: OrcaRouter nie hostuje GLM 5.3 Prime, a my nie hostujemy również GLM-5.3-FlashX. Obie strony tych modeli zwracają na naszej witrynie 404. Jeśli chcesz warstwę przyspieszoną, musisz kupić ją na platformie, która ją sprzedaje, albo skorzystać z własnego API dostawcy dla modelu bazowego.
To, co hostujemy, to GLM-5.3 i GLM-5.3-Flash, w cenie katalogowej dostawcy, bez żadnej marży z naszej strony — te same 1,40 USD i 4,40 USD, które widzisz w cenniku samego Z.ai, przekazywane dalej, a nie wyceniane od nowa. Ma to większe znaczenie, niż mogłoby się wydawać, w przypadku modelu, którego cena zmieniła się dwukrotnie w ciągu sześciu tygodni. Ponieważ nie doliczamy żadnej marży, zmiana ceny przez dostawcę obowiązuje u nas tego samego dnia, w którym wchodzi w życie u niego — bez migracji czy zgłoszenia do wsparcia. Oba identyfikatory są dostępne za jednym kluczem API obok ponad 200 innych modeli, więc test A/B między GLM-5.3 a GLM-5.3-Flash to zmiana nazwy modelu w jednej linijce, a nie drugi kontrakt, a automatyczne przełączenie awaryjne chroni cię, gdy pojedynczy dostawca w łańcuchu zacznie działać gorzej — czyli dokładnie to ryzyko, jakie niesie ze sobą szybka warstwa oparta na jednym dostawcy.
Czy powinieneś zapłacić 2×
Zapłać za to, jeśli człowiek lub usługa nadrzędna jest zablokowana w oczekiwaniu na odpowiedź, obciążenie jest ograniczone opóźnieniem, a nie przepustowością, i jeśli masz już potwierdzone, że to wysiłek rozumowania jest prawdziwym powodem Twojego opóźnienia. Nie płać za to, jeśli uruchamiasz generowanie wsadowe przez noc, jeśli Twój wolumen jest tak duży, że 2× wyższa opłata za tokeny przewyższa zaoszczędzony czas zegarowy, albo jeśli liczyłeś, że ten poziom po cichu będzie lepszym modelem. Nie jest. To GLM-5.3 z włączonym stoperem, a stoper rozlicza za token.
Uczciwe przedstawienie całej rodziny GLM-5.3 w tej chwili wygląda tak, że Z.ai wypuściło jeden model w sierpniu, a rynek spędził wrzesień na przepakowywaniu go w czterech różnych cenach. GLM 5.3 Prime jest najdroższym z tych pakietów. Jest też tym najmniej udokumentowanym, ponieważ firma, której nazwa widnieje na wagach, nie wymienia go. To nie jest powód, by go unikać. To powód, by dokładnie wiedzieć, co się kupuje, zanim wprowadzi się go na ścieżkę produkcyjną.
Porównane w tym artykule1
Wykryto na podstawie tego artykułu · Benchmarki: Artificial Analysis · aktualizowane codziennie
