
GLM 5.5 czy GLM 5.3-Vision? Anonimowy model pasujący do odcisku palca Z.ai właśnie się pojawił.
- openaiNOWOŚĆOpenAI: GPT-6.1 Sol2026-09-2952Inteligencja
- anthropicNOWOŚĆAnthropic: Claude Sonnet 5.52026-09-2856Inteligencja
- typesafeNOWOŚĆTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 za 1 mln tokenów · 150 tok/s
- OpenAINOWOŚĆOpenAI: GPT-6 Luna2026-09-2238Inteligencja
- OpenAINOWOŚĆOpenAI: GPT-6 Sol2026-09-2248Inteligencja
- AnthropicNOWOŚĆAnthropic: Claude Opus 5.52026-09-2258Inteligencja
- xAIGrok 4.72026-09-2146Inteligencja
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 za 1 mln tokenów · 126 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 za 1 mln tokenów · 1202 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Inteligencja
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Inteligencja77Kod
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Inteligencja76Kod
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Inteligencja76Kod
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Inteligencja82Kod
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 za 1 mln tokenów · 52 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 za 1 mln tokenów · 250 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Inteligencja72Kod
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 za 1 mln tokenów · 230 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Inteligencja75Kod
- obsidianQwen3.8 27B2026-08-1534Inteligencja68Kod
Nieznany model, którego profil serwowania — prędkość, czas do pierwszego tokenu, współczynnik trafień w cache — odpowiada stosowi GLM od Z.ai, zaczął przyciągać uwagę analityków mocy obliczeniowej, a robocza hipoteza głosi, że może nosić nazwę GLM 5.3-Vision lub GLM 5.5. 20 sierpnia analityk mocy obliczeniowej i przepustowości teortaxesTex napisał, że śledzony przez niego anonimowy model „wyraźnie nie jest DeepSeekiem, przynajmniej", że „na razie nic nie wyklucza GLM" i że „prędkość, ttft, współczynnik trafień w cache również pasują do GLM". Według niego należy spodziewać się nazwy GLM 5.3-Vision lub 5.5 i wyniku około 61 w Artificial Analysis Intelligence Index — o jeden punkt powyżej miejsca, w którym obecnie znajduje się wydany GLM-5.3. Nic tutaj nie jest potwierdzone. Nie ma karty modelu, ogłoszenia Z.ai ani API, a ta strona traktuje tę obserwację jako to, czym jest: wczesny, niepotwierdzony sygnał przecieku, który warto śledzić właśnie dlatego, że GLM-5.5 był oczekiwanym flagowcem Z.ai przez cały miesiąc i nie pojawił się. Pięć dni po tym wpisie pojawił się drugi — tym razem w pełni weryfikowalny — punkt danych: 25 sierpnia vLLM, czyli środowisko wnioskowania stojące za większością wielkoskalowego serwowania modeli, otworzył pull request oznaczony Do-Not-Merge, dodający obsługę jądra masked-MHA dla wymiarów głowy GLM-5. Nie wymienia żadnego wariantu ani nie dowodzi premiery; to podwaliny stosu serwowania — rodzaj aktywności w tle, jaką po sobie zostawia nowy model.
Co tak naprawdę mówi sygnał
Źródłem jest pojedynczy post na X od teortaxesTex, datowany na 20 sierpnia — to samo konto, którego sygnał o czasie „mniej więcej tydzień” dotyczący premiery GLM-5.3 sprawdził się co do dnia w sierpniu. Ujęcie jest jednoznaczne co do poziomu dowodów: „mocne dowody (nie powtórzono)”. Analityk wyklucza DeepSeek, nie znajduje niczego, co przeczyłoby GLM, i wymienia trzy pomiary na poziomie serwowania — przepustowość, czas do pierwszego tokena oraz współczynnik trafień w cache — jako zgodne ze stackiem Z.ai. Następnie dwie potencjalne nazwy i przewidywany wynik: „Obecnie spodziewam się, że będzie się nazywać GLM 5.3-Vision lub 5.5 i uzyska mniej więcej 61 punktów w AA.”
Potraktuj każdą część osobno. Twierdzenia o tożsamości (nie DeepSeek, pasuje do GLM) to wnioskowanie na podstawie odcisków palców sposobu serwowania modelu, a nie karta modelu. Wynik to oczekiwanie, a nie pomiar. Nazwy to przypuszczenia. To, co sprawia, że sygnał jest wart więcej niż szum, to fakt, że jest kierunkowo spójny ze wszystkim innym, co wiemy o mapie drogowej Z.ai na ten miesiąc: GLM-5.3 został wydany wyłącznie w wersji tekstowej, najgłośniejszym żądaniem społeczności była wizja, a GLM-5.5 — według doniesień wielu redakcji (za pośrednictwem JPMorgan, Reuters, CGTN oraz notatki Goldmana z 18 sierpnia) — ma się pojawić „w sierpniu” — nadszedł finał miesiąca.
Dlaczego fingerprint serwowania ma znaczenie
Czas do pierwszego tokena i współczynnik trafień w cache to sygnatury na poziomie infrastruktury. {{1}}Są one determinowane przez to, jak dostawca buduje swój stos wnioskowania — scheduler, układ cache, politykę batchowania — a nie przez to, jaką nazwę modelu wywołuje prompt.{{/1}} Gdy analityk twierdzi, że TTFT i współczynnik trafień w cache anonimowego modelu odpowiadają GLM, ma na myśli, że stos serwujący za nim działa jak stos Z.ai, co jest {{2}}najbliższym odpowiednikiem odcisku palca, jaki można uzyskać{{/2}} bez wag i karty modelu. To nie jest dowód. Inny dostawca mógłby odwzorować ten sam stos, a Z.ai mogłoby obsługiwać model dla partnera. Ale to {{3}}konkretne, weryfikowalne twierdzenie{{/3}}, a zastrzeżenie „haven't replicated" mówi ci, że analityk nie przedstawia tego jako rozstrzygniętego.
Wykluczenie DeepSeek też ma znaczenie. DeepSeek V4 Pro uzyskał ogólną dostępność 13 sierpnia, a jego wersja Flash była drugim szybkim chińskim wydaniem open-weight w tym miesiącu. Anonimowy model, który wyklucza DeepSeek, ale wskazuje na GLM, zawęża pole do pipeline'u Z.ai — a pipeline Z.ai ma dwóch prawdopodobnych kandydatów, co jest dokładnie tym rozwidleniem, które wskazuje sygnał.
Drugi sygnał: stack serwujący buduje się pod kątem attention GLM-5
25 sierpnia pojawił się drugi punkt danych — tym razem w pełni weryfikowalny. vLLM, środowisko wykonawcze wnioskowania odpowiadające za serwowanie większości modeli na dużą skalę, otrzymał pull request #53785 zatytułowany „[Do Not Merge][Attention] Enable masked MHA for GLM-5 head dimensions". Zweryfikowany względem repozytorium, włącza ścieżkę prefill dla masked-MHA w geometrii attention modelu GLM-5: 64 głowice, ranga KV równa 512, wymiar głowicy QK 192+64 oraz wymiar głowicy V 256 — układ QK/V 256/256, zgodnie z opisem PR. Zależy on od zmiany w FlashAttention zapewniającej obsługę maski dla wymiaru głowicy 256, tymczasowo przypina FlashAttention do commita w forku (właśnie po to jest znacznik Do Not Merge) i dodaje wyznaczone benchmarkami progi routingu dla nowej ścieżki: limity czystego prefill FlashMLA wynoszące 8K / 20K / 48K / 112K tokenów przy TP 1/2/4/8 oraz zaokrąglony limit 64K dla FlashInfer przy TP8. Autor zauważa, że żaden inny otwarty PR nie obejmował wsparcia dla masked-MHA w GLM-5.
Czytaj to jako to, czym jest: fundamenty stosu serwującego, a nie ogłoszenie. PR nie wymienia GLM 5.5 ani GLM 5.3-Vision — mówi „GLM-5” — a włączenie ścieżki prefillu z maskowanym MHA dla wymiarów głów GLM-5 to infrastrukturalna praca nad rodziną, którą ekosystem vLLM już dziś obsługuje przez ścieżkę rzadkiego MLA (tam serwowana jest dziś własna linia GLM-5.3). Nie jest to też odosobnione: pokrewne PR-y z tego miesiąca obejmowały kontrolę wymiarów MLA w FlashInfer dla GLM-5, fallback Triton dla rzadkiego MLA dla modeli klasy GLM-5 oraz deklarowaną przez FlashAttention obsługę wymiarów. Dwa szczegóły utrzymują to na radarze tropicieli przecieków. Po pierwsze, docelowa geometria — 64 głowy, ranga KV 512, QK/V 256/256 — różni się od 192/128 u DeepSeeka, co jest tym samym rozdzieleniem „to nie DeepSeek, pasuje do GLM”, jakie kreśli odcisk palca anonimowego modelu, a teraz widocznym na poziomie jądra uwagi. Po drugie, czas: PR otwarto 25 sierpnia, w tym samym sierpniowym oknie, w którym przez cały miesiąc oczekiwano GLM-5.5. Nic z tego nie dowodzi, że anonimowy model to GLM nowej generacji — równie dobrze to może być inżynieria nad modelem, który już wydano — ale to ten rodzaj aktywności w tle, jaką ekosystem serwujący prowadzi przed premierą modelu, i jest to weryfikowalne w sposób, w jaki żaden post na X nie jest.
Dwie nazwy, jeden fork: GLM 5.3-Vision vs GLM 5.5
Te dwie kandydujące tożsamości to rzeczywiście różne produkty, a przeciek nie rozstrzyga, która z nich znajduje się na płycie.
• {{1}}GLM 5.3-Vision{{/1}} byłby wariantem modelu z obsługą wizji, wydanego {{2}}14 sierpnia{{/2}}. GLM-5.3 przyjmuje wyłącznie tekst — {{3}}Artificial Analysis{{/3}} klasyfikuje go jako tekst na wejściu, tekst na wyjściu, bez obsługi obrazów — i ta luka jest najgłośniejszą skargą społeczności. Gdy {{5}}Tang Jie{{/5}} z {{4}}Z.ai{{/4}} przeprowadził globalną kampanię zbierania opinii, komentarze były praktycznie jednogłośne co do wizji, a Z.ai ma już gotowe elementy (model multimodalny {{6}}GLM-5V-Turbo{{/6}} i enkoder {{7}}CogVLM{{/7}}), których jeszcze nie włączył do flagowej linii. Wariant {{8}}5.3-Vision{{/8}} byłby najszybszym sposobem na zamknięcie tej luki.
• GLM 5.5 to sam flagowiec. Podawane, ale niepotwierdzone specyfikacje wskazują na bazę powyżej biliona parametrów (wzrost z 743B w GLM-5.3), przeniesiony kontekst 1M tokenów, otwarte wagi oraz większy nacisk na agentowość/kodowanie. Każda notatka analityków w tym miesiącu traktuje 5.5 jako tę wielką — pojazd, który — jak sugerował współzałożyciel Z.ai, Tang Jie — ma zamknąć lukę do zamkniętych modeli klasy Fable. Oczekiwany jest w sierpniu i na dzień pisania tego tekstu nie został jeszcze wydany.
Ten sam odcisk palca nie powie ci, które z tych dwóch to jest — dostrojony pod kątem wizji 5.3 i nowy flagowiec mogą korzystać z tego samego stosu serwującego. Ta niejednoznaczność jest prawdziwym stanem sygnału, a dwie nazwy w poście analityka odzwierciedlają ją, zamiast ją rozstrzygać.
img src="2.png" alt="Tablica wyników z dwiema kolumnami zatytułowana 'GLM 5.5 vs GLM-5.3 — tablica wyników'. Lewa kolumna GLM 5.5 (wyciek): 'AA Index ~61 (prognozowany, niezweryfikowany)', 'Status: niewydany', 'Rozmiar >1T parametrów (plotka)', 'Wizja: oczekiwana', 'Kontekst: 1M (oczekiwany)', 'Cena: TBD'. Prawa kolumna GLM-5.3 (wydany): 'AA Index 60', 'Status: API aktywny od 19 sierpnia', 'Rozmiar 743B MoE / 40B aktywnych', 'Wizja: tylko tekst', 'Kontekst: 1M', 'Cena: $1.40 / $4.40'. Stopka głosi 'Dane GLM 5.5 to niezweryfikowane prognozy; GLM-5.3 według Artificial Analysis.'" />

Co oznaczałoby uzyskanie ~61 w Indeksie Inteligencji AA?
Przewidywany wynik to najostrzejsza część wycieku. Artificial Analysis Intelligence Index (w wersji 4.1.1) obecnie plasuje GLM-5.3 na 60 — ex aequo z Kimi K3 na szczycie wśród otwartych wag, i o 7 punktów przed GLM-5.2, który ma 53. O jeden punkt wyżej, na 61, zaczyna się terytorium GPT-5.6 Sol, z Claude Fable 5 na 62 i Claude Opus 5 na 63. Mówiąc wprost: model z rodziny GLM uzyskujący 61 punktów byłby najwyższym pojedynczym wynikiem wśród otwartych wag w tym indeksie, samodzielnie powyżej Kimi K3 i GLM-5.3, i praktycznie na granicy z modelami zamkniętymi.
Warto podkreślić, czym 61 nie jest. To oczekiwanie teortaxesTex co do tego, co zwróci niezależna ewaluacja, a nie opublikowany wynik Artificial Analysis ani liczba od dostawcy. Prognoza może być błędna w każdą stronę — wariant wizyjny może stracić punkt lub dwa w indeksie zorientowanym na tekst, a flagowiec >1T może wypaść wyżej lub niżej, w zależności od tego, jak potoczy się jego post-training. Wartość tej liczby tkwi w twierdzeniu, które ze sobą niesie: kimkolwiek okaże się ten anonimowy model, oczekuje się, że pokona obecnego lidera wśród modeli o otwartych wagach, a nie tylko mu dorówna.

Co jest potwierdzone, a co nie
Utrzymuj księgi w czystości, bo od tego zależy życie artykułu o przecieku.
• Potwierdzone: GLM-5.3 jest prawdziwy — wydany 14 sierpnia, API działa od 18/19 sierpnia, uzyskał 60 punktów w Indeksie Inteligencji AA (zmierzone niezależnie przez Artificial Analysis), wyceniony na 1,40 $ / 4,40 $ za 1 mln tokenów, wyłącznie wejście tekstowe, z otwartymi wagami potwierdzonymi na piątek, 28 sierpnia. Te fakty nie zależą od przecieku.
• Potwierdzone: GLM-5.5 wciąż nie zostało wydane. W chwili pisania tego tekstu nie ma karty modelu, cennika ani dostępności; okno sierpniowe i liczba parametrów >1T są doniesieniami analityków, a nie zobowiązaniami Z.ai.
• Niepotwierdzone: że anonimowy model istnieje jako osobny produkt, że jest GLM, że jego nazwa będzie GLM 5.3-Vision lub 5.5, oraz że osiąga wynik 61. Wszystkie cztery opierają się na jednym niezreplikowanym poście analityka.
• Także niepotwierdzone: czy ten anonimowy model w ogóle różni się od samego GLM-5.3. Działający endpoint GLM-5.3 pod aliasem bez etykiety dawałby ten sam fingerprint serwowania. Dopóki nazwa, karta modelu lub publikacja wag nie rozstrzygnie tej kwestii, interpretacja „nowego modelu" pozostaje silnym priorem, ale nie faktem.
Co obejrzeć dalej
• Piątek, 28 sierpnia — wagi GLM-5.3. Jeśli anonimowy model to tak naprawdę przemianowany 5.3 lub 5.3-Vision, publikacja wag i karta modelu szybko to rozstrzygną.
* Drugie potwierdzające dostrzeżenie. Odcisk palca jednego analityka to hipoteza; drugi, niezależny odczyt tego samego anonimowego wpisu lub lista Artificial Analysis, która go wymienia, podnosi go do rangi dowodu.
• Jakiekolwiek oświadczenie ze strony Z.ai. GLM-5.5 był zapowiadany na okno sierpniowe, a miesiąc prawie dobiega końca. Oficjalna nazwa, strona cenowa lub wpis w dzienniku zmian API to wydarzenie, które zamienia ten przeciek w historię premiery.
Czy wynik AA zmaterializuje się na poziomie 61. Jeśli anonimowy model jest prawdziwy i należy do rodziny GLM, niezależny wynik indeksu bliski 61 byłby pierwszą liczbą o otwartych wagach, która przekroczy 60.
• Czy prace nad mechanizmem uwagi vLLM otrzymają przypisaną nazwę modelu. PR #53785 celuje w wymiary głowic "GLM-5", nie wymieniając 5.3-Vision ani 5.5; scalenie, wpis na liście obsługiwanych modeli lub karta modelu powiązująca tę geometrię z konkretną nazwą byłaby jak dotąd najmocniejszym sygnałem.
Jak postąpić w przypadku takiego wycieku
Wyciek to powód do przygotowań, a nie do zmiany platformy. Jeśli następny model z rodziny GLM znajdzie się na szczycie lub w pobliżu szczytu rankingu modeli o otwartych wagach, praktyczne pytanie brzmi: czy kierować na niego realny ruch — a nieprzetestowany model, za którym stoją jedynie deklaracje producenta i prognoza jednego analityka, to dokładnie sytuacja, w której chcesz mieć siatkę bezpieczeństwa, a nie zakład. Model GLM-5.3, który został wydany w zeszłym tygodniu, jest już aktywny na OrcaRouter — strona modelu pokazuje cenę $1.26 / $3.96 za 1M tokenów, czyli 10% rabatu startowego od ceny katalogowej producenta $1.40 / $4.40, przekazywanego bez żadnej marży — a konfiguracja routingu jest dokładnie tym, co model 5.5 lub 5.3-Vision odziedziczy w dniu premiery. Skieruj część ruchu na nowy model przez router z automatycznym przełączaniem awaryjnym na sprawdzony model — GLM-5.3, DeepSeek V4 Pro, GPT-5.6 Sol — a otrzymasz sygnał jakości na własnym obciążeniu zamiast pokazu slajdów. Jeśli prognoza z wycieku jest trafna, dowiesz się o tym jako pierwszy; jeśli jest błędna, przełączenie awaryjne to wchłonie i nic nie trafi do klientów w wadliwej formie. Ten sam klucz, bez drugiej umowy i bez konieczności wybierania między dwoma kandydatami, dopóki nie zrobi tego Z.ai.
Nadchodzi kolejny GLM — jedyne otwarte pytanie brzmi, jakie imię będzie nosić. GLM 5.3-Vision byłoby dla Z.ai zamknięciem najbardziej krytykowanej luki w świeżo wydanym modelu; GLM 5.5 byłoby flagowym modelem o bilionie parametrów, na który cały miesiąc wskazywał. Anonimowy wpis teortaxesTex, którego odcisk pobrano 20 sierpnia, jest pierwszym konkretnym obiektem, który przypomina którekolwiek z nich, a jego prognozowane 61 w indeksie AA Intelligence plasowałoby go przed wszystkimi obecnymi modelami o otwartych wagach. Pięć dni po pobraniu odcisku stack serwujący również ruszył: praca vLLM nad mechanizmem attention w GLM-5 jest dokładnie takimi podwalinami, jakie zostawia po sobie nowy model, nawet jeśli nie wymienia żadnego wariantu. Nic z tego nie jest potwierdzone, a ta strona zaktualizuje się w momencie, gdy nazwa, karta lub wagi to rozstrzygną. Do tego czasu najbezpieczniejszym posunięciem jest przygotowanie routingu — a nie stawianie stacku na odcisk palca.

Porównane w tym artykule1
Wykryto na podstawie tego artykułu · Benchmarki: Artificial Analysis · aktualizowane codziennie
