Karta hero artykułu z napisem „GLM 5.5 czy GLM 5.3-Vision?”, z podtytułem „Właśnie pojawił się anonimowy model pasujący do odcisku palca Z.ai” i plakietką „LEAK — niezweryfikowany”, na tle miękkiego biało-niebieskiego gradientu z subtelnym motywem sieci neuronowej i elementem znaku zapytania.
Guides & Insights

GLM 5.5 czy GLM 5.3-Vision? Anonimowy model pasujący do odcisku palca Z.ai właśnie się pojawił.

Autor

Magnus Corvin

Data publikacji

Najnowsze modele · 20Zobacz wszystkie modele →
Benchmarki: Artificial Analysis · aktualizowane codziennie
Powrót do wszystkich wpisów

Nieznany model, którego profil serwowania — prędkość, czas do pierwszego tokenu, współczynnik trafień w cache — odpowiada stosowi G​LM od Z.ai, zaczął przyciągać uwagę analityków mocy obliczeniowej, a robocza hipoteza głosi, że może nosić nazwę GLM 5.3-Vision lub GLM 5.5. 20 sierpnia analityk mocy obliczeniowej i przepustowości teortaxesTex napisał, że śledzony przez niego anonimowy model „wyraźnie nie jest Dee​pSeekiem, przynajmniej", że „na razie nic nie wyklucza G​LM" i że „prędkość, ttft, współczynnik trafień w cache również pasują do G​LM". Według niego należy spodziewać się nazwy GLM 5.3-Vision lub 5.5 i wyniku około 61 w Artificial Analysis Intelligence Index — o jeden punkt powyżej miejsca, w którym obecnie znajduje się wydany GLM-5.3. Nic tutaj nie jest potwierdzone. Nie ma karty modelu, ogłoszenia Z.ai ani API, a ta strona traktuje tę obserwację jako to, czym jest: wczesny, niepotwierdzony sygnał przecieku, który warto śledzić właśnie dlatego, że GLM-5.5 był oczekiwanym flagowcem Z.ai przez cały miesiąc i nie pojawił się. Pięć dni po tym wpisie pojawił się drugi — tym razem w pełni weryfikowalny — punkt danych: 25 sierpnia vLLM, czyli środowisko wnioskowania stojące za większością wielkoskalowego serwowania modeli, otworzył pull request oznaczony Do-Not-Merge, dodający obsługę jądra masked-MHA dla wymiarów głowy G​LM-5. Nie wymienia żadnego wariantu ani nie dowodzi premiery; to podwaliny stosu serwowania — rodzaj aktywności w tle, jaką po sobie zostawia nowy model.

Co tak naprawdę mówi sygnał

Źródłem jest pojedynczy post na X od teortaxesTex, datowany na 20 sierpnia — to samo konto, którego sygnał o czasie „mniej więcej tydzień” dotyczący premiery GLM-5.3 sprawdził się co do dnia w sierpniu. Ujęcie jest jednoznaczne co do poziomu dowodów: „mocne dowody (nie powtórzono)”. Analityk wyklucza Dee​pSeek, nie znajduje niczego, co przeczyłoby G​LM, i wymienia trzy pomiary na poziomie serwowania — przepustowość, czas do pierwszego tokena oraz współczynnik trafień w cache — jako zgodne ze stackiem Z.ai. Następnie dwie potencjalne nazwy i przewidywany wynik: „Obecnie spodziewam się, że będzie się nazywać GLM 5.3-Vision lub 5.5 i uzyska mniej więcej 61 punktów w AA.”

Potraktuj każdą część osobno. Twierdzenia o tożsamości (nie Dee​pSeek, pasuje do G​LM) to wnioskowanie na podstawie odcisków palców sposobu serwowania modelu, a nie karta modelu. Wynik to oczekiwanie, a nie pomiar. Nazwy to przypuszczenia. To, co sprawia, że sygnał jest wart więcej niż szum, to fakt, że jest kierunkowo spójny ze wszystkim innym, co wiemy o mapie drogowej Z.ai na ten miesiąc: GLM-5.3 został wydany wyłącznie w wersji tekstowej, najgłośniejszym żądaniem społeczności była wizja, a GLM-5.5 — według doniesień wielu redakcji (za pośrednictwem JPMorgan, Reuters, CGTN oraz notatki Goldmana z 18 sierpnia) — ma się pojawić „w sierpniu” — nadszedł finał miesiąca.

Dlaczego fingerprint serwowania ma znaczenie

Czas do pierwszego tokena i współczynnik trafień w cache to sygnatury na poziomie infrastruktury. {{1}}Są one determinowane przez to, jak dostawca buduje swój stos wnioskowania — scheduler, układ cache, politykę batchowania — a nie przez to, jaką nazwę modelu wywołuje prompt.{{/1}} Gdy analityk twierdzi, że TTFT i współczynnik trafień w cache anonimowego modelu odpowiadają G​LM, ma na myśli, że stos serwujący za nim działa jak stos Z.ai, co jest {{2}}najbliższym odpowiednikiem odcisku palca, jaki można uzyskać{{/2}} bez wag i karty modelu. To nie jest dowód. Inny dostawca mógłby odwzorować ten sam stos, a Z.ai mogłoby obsługiwać model dla partnera. Ale to {{3}}konkretne, weryfikowalne twierdzenie{{/3}}, a zastrzeżenie „haven't replicated" mówi ci, że analityk nie przedstawia tego jako rozstrzygniętego.

Wykluczenie Dee​pSeek też ma znaczenie. DeepSeek V4 Pro uzyskał ogólną dostępność 13 sierpnia, a jego wersja Flash była drugim szybkim chińskim wydaniem open-weight w tym miesiącu. Anonimowy model, który wyklucza Dee​pSeek, ale wskazuje na G​LM, zawęża pole do pipeline'u Z.ai — a pipeline Z.ai ma dwóch prawdopodobnych kandydatów, co jest dokładnie tym rozwidleniem, które wskazuje sygnał.

Drugi sygnał: stack serwujący buduje się pod kątem attention GLM-5

25 sierpnia pojawił się drugi punkt danych — tym razem w pełni weryfikowalny. vLLM, środowisko wykonawcze wnioskowania odpowiadające za serwowanie większości modeli na dużą skalę, otrzymał pull request #53785 zatytułowany „[Do Not Merge][Attention] Enable masked MHA for GLM-5 head dimensions". Zweryfikowany względem repozytorium, włącza ścieżkę prefill dla masked-MHA w geometrii attention modelu G​LM-5: 64 głowice, ranga KV równa 512, wymiar głowicy QK 192+64 oraz wymiar głowicy V 256 — układ QK/V 256/256, zgodnie z opisem PR. Zależy on od zmiany w FlashAttention zapewniającej obsługę maski dla wymiaru głowicy 256, tymczasowo przypina FlashAttention do commita w forku (właśnie po to jest znacznik Do Not Merge) i dodaje wyznaczone benchmarkami progi routingu dla nowej ścieżki: limity czystego prefill FlashMLA wynoszące 8K / 20K / 48K / 112K tokenów przy TP 1/2/4/8 oraz zaokrąglony limit 64K dla FlashInfer przy TP8. Autor zauważa, że żaden inny otwarty PR nie obejmował wsparcia dla masked-MHA w G​LM-5.

Czytaj to jako to, czym jest: fundamenty stosu serwującego, a nie ogłoszenie. PR nie wymienia GLM 5.5 ani GLM 5.3-Vision — mówi „GLM-5” — a włączenie ścieżki prefillu z maskowanym MHA dla wymiarów głów G​LM-5 to infrastrukturalna praca nad rodziną, którą ekosystem vLLM już dziś obsługuje przez ścieżkę rzadkiego MLA (tam serwowana jest dziś własna linia GLM-5.3). Nie jest to też odosobnione: pokrewne PR-y z tego miesiąca obejmowały kontrolę wymiarów MLA w FlashInfer dla GLM-5, fallback Triton dla rzadkiego MLA dla modeli klasy GLM-5 oraz deklarowaną przez FlashAttention obsługę wymiarów. Dwa szczegóły utrzymują to na radarze tropicieli przecieków. Po pierwsze, docelowa geometria — 64 głowy, ranga KV 512, QK/V 256/256 — różni się od 192/128 u Dee​pSeeka, co jest tym samym rozdzieleniem „to nie Dee​pSeek, pasuje do G​LM”, jakie kreśli odcisk palca anonimowego modelu, a teraz widocznym na poziomie jądra uwagi. Po drugie, czas: PR otwarto 25 sierpnia, w tym samym sierpniowym oknie, w którym przez cały miesiąc oczekiwano GLM-5.5. Nic z tego nie dowodzi, że anonimowy model to G​LM nowej generacji — równie dobrze to może być inżynieria nad modelem, który już wydano — ale to ten rodzaj aktywności w tle, jaką ekosystem serwujący prowadzi przed premierą modelu, i jest to weryfikowalne w sposób, w jaki żaden post na X nie jest.

Dwie nazwy, jeden fork: GLM 5.3-Vision vs GLM 5.5

Te dwie kandydujące tożsamości to rzeczywiście różne produkty, a przeciek nie rozstrzyga, która z nich znajduje się na płycie.

• {{1}}GLM 5.3-Vision{{/1}} byłby wariantem modelu z obsługą wizji, wydanego {{2}}14 sierpnia{{/2}}. GLM-5.3 przyjmuje wyłącznie tekst — {{3}}Artificial Analysis{{/3}} klasyfikuje go jako tekst na wejściu, tekst na wyjściu, bez obsługi obrazów — i ta luka jest najgłośniejszą skargą społeczności. Gdy {{5}}Tang Jie{{/5}} z {{4}}Z.ai{{/4}} przeprowadził globalną kampanię zbierania opinii, komentarze były praktycznie jednogłośne co do wizji, a Z.ai ma już gotowe elementy (model multimodalny {{6}}GLM-5V-Turbo{{/6}} i enkoder {{7}}CogVLM{{/7}}), których jeszcze nie włączył do flagowej linii. Wariant {{8}}5.3-Vision{{/8}} byłby najszybszym sposobem na zamknięcie tej luki.

• GLM 5.5 to sam flagowiec. Podawane, ale niepotwierdzone specyfikacje wskazują na bazę powyżej biliona parametrów (wzrost z 743B w GLM-5.3), przeniesiony kontekst 1M tokenów, otwarte wagi oraz większy nacisk na agentowość/kodowanie. Każda notatka analityków w tym miesiącu traktuje 5.5 jako tę wielką — pojazd, który — jak sugerował współzałożyciel Z.ai, Tang Jie — ma zamknąć lukę do zamkniętych modeli klasy Fable. Oczekiwany jest w sierpniu i na dzień pisania tego tekstu nie został jeszcze wydany.

Ten sam odcisk palca nie powie ci, które z tych dwóch to jest — dostrojony pod kątem wizji 5.3 i nowy flagowiec mogą korzystać z tego samego stosu serwującego. Ta niejednoznaczność jest prawdziwym stanem sygnału, a dwie nazwy w poście analityka odzwierciedlają ją, zamiast ją rozstrzygać.

img src="2.png" alt="Tablica wyników z dwiema kolumnami zatytułowana 'GLM 5.5 vs GLM-5.3 — tablica wyników'. Lewa kolumna GLM 5.5 (wyciek): 'AA Index ~61 (prognozowany, niezweryfikowany)', 'Status: niewydany', 'Rozmiar >1T parametrów (plotka)', 'Wizja: oczekiwana', 'Kontekst: 1M (oczekiwany)', 'Cena: TBD'. Prawa kolumna GLM-5.3 (wydany): 'AA Index 60', 'Status: API aktywny od 19 sierpnia', 'Rozmiar 743B MoE / 40B aktywnych', 'Wizja: tylko tekst', 'Kontekst: 1M', 'Cena: $1.40 / $4.40'. Stopka głosi 'Dane GLM 5.5 to niezweryfikowane prognozy; GLM-5.3 według Artificial Analysis.'" />

A two-column comparison scoreboard titled 'GLM 5.5 vs GLM-5.3 — the scoreboard'. Left column GLM 5.5 (leaked): 'AA Index: ~61 (projected)', 'Status: unreleased', 'Size: >1T params (rumored)', 'Vision: expected', 'Context: 1M (expected)', 'Price: TBD'. Right column GLM-5.3 (shipped): 'AA Index: 60', 'Status: API live Aug 19', 'Size: 743B MoE / 40B active', 'Vision: text-only', 'Context: 1M', 'Price: $1.40 / $4.40'. Footer reads 'GLM 5.5 figures are unverified projections; GLM-5.3 per Artificial Analysis.'

Co oznaczałoby uzyskanie ~61 w Indeksie Inteligencji AA?

Przewidywany wynik to najostrzejsza część wycieku. Artificial Analysis Intelligence Index (w wersji 4.1.1) obecnie plasuje GLM-5.3 na 60 — ex aequo z Kimi K3 na szczycie wśród otwartych wag, i o 7 punktów przed GLM-5.2, który ma 53. O jeden punkt wyżej, na 61, zaczyna się terytorium GPT-5.6 Sol, z Claude Fable 5 na 62 i Claude Opus 5 na 63. Mówiąc wprost: model z rodziny G​LM uzyskujący 61 punktów byłby najwyższym pojedynczym wynikiem wśród otwartych wag w tym indeksie, samodzielnie powyżej Kimi K3 i GLM-5.3, i praktycznie na granicy z modelami zamkniętymi.

Warto podkreślić, czym 61 nie jest. To oczekiwanie teortaxesTex co do tego, co zwróci niezależna ewaluacja, a nie opublikowany wynik Artificial Analysis ani liczba od dostawcy. Prognoza może być błędna w każdą stronę — wariant wizyjny może stracić punkt lub dwa w indeksie zorientowanym na tekst, a flagowiec >1T może wypaść wyżej lub niżej, w zależności od tego, jak potoczy się jego post-training. Wartość tej liczby tkwi w twierdzeniu, które ze sobą niesie: kimkolwiek okaże się ten anonimowy model, oczekuje się, że pokona obecnego lidera wśród modeli o otwartych wagach, a nie tylko mu dorówna.

A screenshot of the Artificial Analysis page for GLM-5.3 (max) showing an Intelligence Index of 60 (well above the median of 35), $1.40 per 1M input tokens and $4.40 per 1M output tokens, text input and text output, a 1M-token context window, and summary text describing the model as leading in intelligence and reasonably priced.

Co jest potwierdzone, a co nie

Utrzymuj księgi w czystości, bo od tego zależy życie artykułu o przecieku.

• Potwierdzone: GLM-5.3 jest prawdziwy — wydany 14 sierpnia, API działa od 18/19 sierpnia, uzyskał 60 punktów w Indeksie Inteligencji AA (zmierzone niezależnie przez Artificial Analysis), wyceniony na 1,40 $ / 4,40 $ za 1 mln tokenów, wyłącznie wejście tekstowe, z otwartymi wagami potwierdzonymi na piątek, 28 sierpnia. Te fakty nie zależą od przecieku.

• Potwierdzone: GLM-5.5 wciąż nie zostało wydane. W chwili pisania tego tekstu nie ma karty modelu, cennika ani dostępności; okno sierpniowe i liczba parametrów >1T są doniesieniami analityków, a nie zobowiązaniami Z.ai.

• Niepotwierdzone: że anonimowy model istnieje jako osobny produkt, że jest G​LM, że jego nazwa będzie GLM 5.3-Vision lub 5.5, oraz że osiąga wynik 61. Wszystkie cztery opierają się na jednym niezreplikowanym poście analityka.

• Także niepotwierdzone: czy ten anonimowy model w ogóle różni się od samego GLM-5.3. Działający endpoint GLM-5.3 pod aliasem bez etykiety dawałby ten sam fingerprint serwowania. Dopóki nazwa, karta modelu lub publikacja wag nie rozstrzygnie tej kwestii, interpretacja „nowego modelu" pozostaje silnym priorem, ale nie faktem.

Co obejrzeć dalej

• Piątek, 28 sierpnia — wagi GLM-5.3. Jeśli anonimowy model to tak naprawdę przemianowany 5.3 lub 5.3-Vision, publikacja wag i karta modelu szybko to rozstrzygną.

* Drugie potwierdzające dostrzeżenie. Odcisk palca jednego analityka to hipoteza; drugi, niezależny odczyt tego samego anonimowego wpisu lub lista Artificial Analysis, która go wymienia, podnosi go do rangi dowodu.

• Jakiekolwiek oświadczenie ze strony Z.ai. GLM-5.5 był zapowiadany na okno sierpniowe, a miesiąc prawie dobiega końca. Oficjalna nazwa, strona cenowa lub wpis w dzienniku zmian API to wydarzenie, które zamienia ten przeciek w historię premiery.

Czy wynik AA zmaterializuje się na poziomie 61. Jeśli anonimowy model jest prawdziwy i należy do rodziny G​LM, niezależny wynik indeksu bliski 61 byłby pierwszą liczbą o otwartych wagach, która przekroczy 60.

• Czy prace nad mechanizmem uwagi vLLM otrzymają przypisaną nazwę modelu. PR #53785 celuje w wymiary głowic "GLM-5", nie wymieniając 5.3-Vision ani 5.5; scalenie, wpis na liście obsługiwanych modeli lub karta modelu powiązująca tę geometrię z konkretną nazwą byłaby jak dotąd najmocniejszym sygnałem.

Jak postąpić w przypadku takiego wycieku

Wyciek to powód do przygotowań, a nie do zmiany platformy. Jeśli następny model z rodziny G​LM znajdzie się na szczycie lub w pobliżu szczytu rankingu modeli o otwartych wagach, praktyczne pytanie brzmi: czy kierować na niego realny ruch — a nieprzetestowany model, za którym stoją jedynie deklaracje producenta i prognoza jednego analityka, to dokładnie sytuacja, w której chcesz mieć siatkę bezpieczeństwa, a nie zakład. Model GLM-5.3, który został wydany w zeszłym tygodniu, jest już aktywny na OrcaRouter — strona modelu pokazuje cenę $1.26 / $3.96 za 1M tokenów, czyli 10% rabatu startowego od ceny katalogowej producenta $1.40 / $4.40, przekazywanego bez żadnej marży — a konfiguracja routingu jest dokładnie tym, co model 5.5 lub 5.3-Vision odziedziczy w dniu premiery. Skieruj część ruchu na nowy model przez router z automatycznym przełączaniem awaryjnym na sprawdzony model — GLM-5.3, DeepSeek V4 Pro, GPT-5.6 Sol — a otrzymasz sygnał jakości na własnym obciążeniu zamiast pokazu slajdów. Jeśli prognoza z wycieku jest trafna, dowiesz się o tym jako pierwszy; jeśli jest błędna, przełączenie awaryjne to wchłonie i nic nie trafi do klientów w wadliwej formie. Ten sam klucz, bez drugiej umowy i bez konieczności wybierania między dwoma kandydatami, dopóki nie zrobi tego Z.ai.

Nadchodzi kolejny G​LM — jedyne otwarte pytanie brzmi, jakie imię będzie nosić. GLM 5.3-Vision byłoby dla Z.ai zamknięciem najbardziej krytykowanej luki w świeżo wydanym modelu; GLM 5.5 byłoby flagowym modelem o bilionie parametrów, na który cały miesiąc wskazywał. Anonimowy wpis teortaxesTex, którego odcisk pobrano 20 sierpnia, jest pierwszym konkretnym obiektem, który przypomina którekolwiek z nich, a jego prognozowane 61 w indeksie AA Intelligence plasowałoby go przed wszystkimi obecnymi modelami o otwartych wagach. Pięć dni po pobraniu odcisku stack serwujący również ruszył: praca vLLM nad mechanizmem attention w G​LM-5 jest dokładnie takimi podwalinami, jakie zostawia po sobie nowy model, nawet jeśli nie wymienia żadnego wariantu. Nic z tego nie jest potwierdzone, a ta strona zaktualizuje się w momencie, gdy nazwa, karta lub wagi to rozstrzygną. Do tego czasu najbezpieczniejszym posunięciem jest przygotowanie routingu — a nie stawianie stacku na odcisk palca.

The OrcaRouter model page for z-ai/glm-5.3, showing the model id, capability chips (Tools, JSON, Reasoning), a 1,000,000-token context window, a 128,000-token max output, text input and text output, and pass-through pricing of $1.26 per 1M input tokens and $3.96 per 1M output tokens.

Porównane w tym artykule1

Wykryto na podstawie tego artykułu · Benchmarki: Artificial Analysis · aktualizowane codziennie