
GLM-5.3-Flash, pięć tygodni później: niezależne 42, uruchomienie exploita na poziomie Mythos i agent GLM, który przebudował własny stos serwowania
- OrcaNOWOŚĆOrca: OrcaCyber Zero 1.52026-10-10$3.00 / $7.50 za 1 mln tokenów · 87 tok/s
- openaiNOWOŚĆOpenAI: GPT-6.1 Sol2026-09-2952Inteligencja
- anthropicNOWOŚĆAnthropic: Claude Sonnet 5.52026-09-2856Inteligencja
- typesafeTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 za 1 mln tokenów · 115 tok/s
- OpenAIOpenAI: GPT-6 Luna2026-09-2238Inteligencja
- OpenAIOpenAI: GPT-6 Sol2026-09-2248Inteligencja
- AnthropicAnthropic: Claude Opus 5.52026-09-2258Inteligencja
- xAIGrok 4.72026-09-2146Inteligencja
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 za 1 mln tokenów · 47 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 za 1 mln tokenów · 777 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Inteligencja
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Inteligencja77Kod
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Inteligencja76Kod
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Inteligencja76Kod
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Inteligencja82Kod
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 za 1 mln tokenów · 61 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 za 1 mln tokenów · 452 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Inteligencja72Kod
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 za 1 mln tokenów · 231 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Inteligencja75Kod
GLM-5.3-Flash obsługuje ruch produkcyjny od pięciu tygodni, a 17 września 2026 r. firma Zhipu AI ujawniła coś na temat tego, gdzie: poinformowała, że każde zapytanie produkcyjne do GLM-5.3-Flash jest teraz obsługiwane przez flotę ponad 100 000 produkowanych w Chinach akceleratorów AI, że od pierwszego uruchomienia na tym sprzęcie do obsługi całego bieżącego obciążenia przeszło w niecałe dwa tygodnie oraz że przepustowość end-to-end wzrosła 3,2-krotnie w tym samym okresie. Najdalej idącym elementem jest to, kto wykonał tę pracę. Znaczna jej część została wykonana nie przez zespół infrastruktury, lecz przez agenta sterowanego przez samego GLM-5.3, który analizował wąskie gardła, proponował poprawki i pisał kod systemu wnioskowania, podczas gdy inżynierowie wyznaczali cele, budowali środowisko informacji zwrotnej i przeglądali wszystko, co dotyczyło semantyki numerycznej, współbieżności lub ryzyka produkcyjnego. GLM-5.3-Flash to multimodalny model o łącznej liczbie 320 mld parametrów i 18 mld aktywnych (320B-A18B), który Zhipu wprowadził i udostępnił jako open source 26 sierpnia 2026 r. — anonimowy „Ox Alpha”, którego firma ujawniła tego dnia — a jego większy brat GLM-5.3 to flagowy model 743B, względem którego wyceniano GLM-5.3-Flash. Żadna z trzech liczb w dzisiejszym ujawnieniu nie pochodzi od nas ani od nikogo innego: są to liczby samego Zhipu. Flagowy model również nie jest już jedynym porównaniem, które się liczy: w ExploitBench, niezależnej ocenie tego, jak daleko model wspina się po rzeczywistej drabinie exploitów Chrome, GLM-5.3-Flash został obecnie zmierzony na równi z Claude Mythos Preview — zamkniętym modelem frontier, który jego twórca udostępnił wyłącznie zweryfikowanym obrońcom — przy ułamku kosztu na próbę.
To dobra wiadomość i jest prawdziwa, ale pochodzi od dostawcy. Trzy inne rzeczy zmieniły się od czasu, gdy ten wpis po raz pierwszy ukazał się w dniu premiery, a dwie z nich działają w przeciwnym kierunku. Artificial Analysis opublikowało teraz własny pomiar tego modelu, a jego liczba nie jest liczbą Zhipu. Zniżka premierowa, dzięki której był to najtańszy kompetentny model na rynku, wygasła zgodnie z planem 9 września i nie została przedłużona. A niezależna firma ewaluacyjna Generality Labs opublikowała własny przebieg ExploitBench, w którym GLM-5.3-Flash uzyskał wynik powyżej średniej z trzech przebiegów Claude Mythos Preview na tej samej drabince — za około sześć centów na dolara. Dla każdego, kto pod koniec sierpnia zapisał ten model w zakładkach jako „ten tani”, arytmetyka wygląda dziś inaczej niż wtedy, a uczciwy nagłówek jest mieszany: ekonomika obsługi rzeczywiście się poprawiła, cena wzrosła, bo zakończyła się promocja, szeroko cytowany wskaźnik inteligencji nie przetrwał pierwszego kontaktu z niezależnym stanowiskiem testowym, a porównanie możliwości, które wypadło na korzyść modelu, to pojedynczy niepoddany recenzji przebieg, o którym sami jego autorzy mówią, że nie należy go nadinterpretować.
Zhipu jest jedynym źródłem informacji o rozmiarze klastra, dwutygodniowym harmonogramie i mnożniku 3,2x — żadna z tych danych nie została niezależnie zweryfikowana, a sama firma twierdzi, że nie osiągnęła rekurencyjnego samodoskonalenia, opisując ten wynik jako pętlę minimalnej skali, a nie coś prawdziwego. To, co dało się sprawdzić, sprawdziliśmy: jedyny konkretny artefakt w tej relacji, który istnieje poza murami Zhipu — poprawka precyzji w jądrze Flash Linear Attention — rzeczywiście został scalony upstream i to potwierdziliśmy. Tam, gdzie dana liczba poniżej pochodzi od Zhipu, jest to zaznaczone. Tam, gdzie pochodzi z Artificial Analysis, podano właśnie to źródło. Tam, gdzie pochodzi z Generality Labs — zespołu zajmującego się oceną bezpieczeństwa, stojącego za liczbami dotyczącymi exploitów w tym artykule — podano właśnie to źródło, wraz z zastrzeżeniami, które sami autorzy do niego dodali: jeden przebieg, 41 błędów, samodzielnie opublikowana metoda, brak reprodukcji przez strony trzecie oraz kwestia zanieczyszczenia danych, którą podnoszą z własnej inicjatywy. Tam, gdzie liczba pochodzi od Anthropic — jedyne dane tutaj pochodzące z laboratorium, które ma konkurencyjny interes w odpowiedzi — w tekście podano, który model faktycznie zmierzono, ponieważ nie wszystkie dotyczą tego modelu.
Co faktycznie zostało wydane
GLM-5.3-Flash to model typu mixture-of-experts o łącznej liczbie 320B / 18B aktywnych parametrów i 45 warstwach, co sprawia, że jego aktywny rozmiar to nieco ponad połowa około 32B w GLM-5.2. Główną możliwością jest modalność: natywnie przyjmuje dane wejściowe w postaci tekstu, obrazu i wideo — jako pierwszy model GLM-5, który to robi — zamiast kierować przetwarzanie wizji przez osobny adapter. Kontekst sięga 1 miliona tokenów, a Zhipu twierdzi, że koszt obsługi długiego kontekstu kształtuje się na poziomie około jednej trzeciej tego w GLM-5.3.
Co do architektury, Zhipu opisuje ją jako pierwszy otwartoźródłowy model frontierowy, który łączy hybrydową uwagę rzadką i liniową z Manifold-Constrained Hyper-Connections (mHC) do skalowania oraz mechanizm IndexPool, który kompresuje cztery wektory kluczy indeksatora w jedną ważoną pulę, aby zmniejszyć opóźnienie w długim kontekście. Pretrening przeprowadzono na multimodalnym korpusie 30 bilionów tokenów. Nic z tego nie zostało niezależnie zaudytowane — to Zhipu opisuje własny model — ale twierdzenia o wydajności serwowania są wystarczająco konkretne, by przetestować je teraz, gdy wagi są już dostępne w otwartoźródłowym stosie wnioskowania, a relacja z 17 września dodaje pierwszy szczegółowy obraz tego, jak faktycznie zbudowano stronę serwującą.
Specyfikacja z dnia premiery w skrócie:
• Parametry — 320B łącznie / 18B aktywne, 45 warstw, MoE.
• Modalność — natywne wejście tekstowe, obrazowe i wideo; wyjście tekstowe.
• Okno kontekstu — do 1 000 000 tokenów.
• Licencja — MIT, otwarte wagi na Hugging Face od dnia premiery.
• Cena — 0,15 USD / 0,50 USD za milion tokenów (wejście / wyjście), 0,03 USD za milion buforowanych tokenów wejściowych.

Ta karta to migawka z dnia premiery, a dwa z jej wierszy zmieniły się od 26 sierpnia. Wartość AA Index to nadal własne twierdzenie Zhipu i obecnie stoi w sprzeczności z niezależnym pomiarem — więcej na ten temat poniżej. Pokazywana na niej cena promocyjna już nie obowiązuje; promocja zakończyła się 9 września. Liczba parametrów, okno kontekstowe, licencja i modalność to niezmienione aktualne fakty i to głównie ze względu na nie powstał ten obraz.
Tydzień Ox Alpha, czyli co tak naprawdę testował darmowy giveaway
Ujawnienie zakończyło tydzień spekulacji. 20 sierpnia na zewnętrznej platformie API AI pojawił się anonimowy model z oknem kontekstu 1 miliona tokenów, obsługą tekstu/obrazu/wideo i ceną zero, który szybko stał się najczęściej wywoływanym modelem w cotygodniowych rankingach tej platformy. Społeczność w ciągu 48 godzin ustaliła na podstawie „odcisku palca”, że należy on do rodziny GLM firmy Zhipu — ten sam wzorzec anonimowego, a następnie zgłoszonego modelu, który wcześniej pozwolił zidentyfikować modele z innych chińskich laboratoriów — a analitycy powszechnie zgadywali, że to wariant Flash modelu GLM-5.3. Ogłoszenie z 26 sierpnia potwierdziło przypuszczenie: darmowy tydzień był celowym testem, a firma twierdzi, że anonimowe uruchomienie przetworzyło ponad 62 biliony tokenów w sześć dni na platformach kodowania, na których było oferowane, a wszystko to było obsługiwane przez rodzime chińskie chipy.
Ta ostatnia klauzula wyglądała wtedy jak przypis. Okazało się, że właśnie o to chodziło. Darmowy tydzień nie był przede wszystkim chwytem marketingowym ani nawet testem obciążeniowym modelu; był testem obciążeniowym stojącej pod nim floty akceleratorów, przeprowadzonym w skali, w której awaria byłaby publiczna i nic by nie kosztowała. Trzy tygodnie później Zhipu opisuje tę samą flotę jako obsługującą 100% ruchu produkcyjnego modelu.

Logika cenowa z tamtego tygodnia nadal obowiązuje, z jedną korektą. Model rozdawany za 0 USD przez tydzień, a następnie wprowadzony na rynek za jedną dziesiątą ceny flagowca z dodatkową 50-procentową zniżką, był celowym posunięciem kreującym rynek w segmencie budżetowym, a określenie „ograniczony czasowo” zawsze było elementem, na który trzeba było uważać. Oznaczyliśmy to jako coś, co może zostać wycofane. Zostało wycofane zgodnie z harmonogramem — co warto powiedzieć wprost, ponieważ wygaśnięcie rabatu to jedyna zmiana w tej historii, która pojawia się na rachunku.
Stos serwowania odbudowany przez agenta
Techniczny raport Zhipu z 17 września jest pierwszym szczegółowym opisem tego, jak GLM-5.3-Flash jest obsługiwany na chińskim krzemie, a jego główna teza mówi, że model pomógł zoptymalizować system, który go uruchamia. Firma nazywa ten mechanizm gęstym sprzężeniem zwrotnym: testy poprawności, dzienniki wykonania, ślady, mikrobenchmarki i metryki end-to-end spięto tak, aby agent mógł lokalnie zweryfikować hipotezę, zamiast czekać na pełne wdrożenie i test obciążeniowy po każdej zmianie. Zdaniem Zhipu, aby to działało, sprzężenie zwrotne musiało być lokalne, tanie i obiektywnie sprawdzalne — powiązane z konkretnym kernelem lub ścieżką kodu, wystarczająco szybkie, by móc na nim iterować, oraz prawdziwe albo fałszywe bez człowieka w pętli.
Po wdrożeniu tej pętli agent znalazł i naprawił trzy rzeczy, które firma szczegółowo opisała:
• Ścieżka równoległego przetwarzania kontekstu w jądrze KDA traciła precyzję w miarę wzrostu długości sekwencji, ponieważ tl.dot domyślnie używał TF32 mimo danych wejściowych FP32, potęgując błąd zaokrągleń wraz z długością kontekstu. Poprawka przypina precyzję danych wejściowych do tf32x3, z awaryjnym przełączeniem na ieee na platformach bez obsługi TF32. Ten przypadek jest najciekawszy z trzech, ponieważ to jedyne twierdzenie w relacji, które wykracza poza własną infrastrukturę Zhipu: zmiana została scalona w upstreamie Flash Linear Attention jako PR #1180, co sprawdziliśmy i potwierdziliśmy, że zostało scalone 27 sierpnia 2026 r.
• Transfer KV nie nakładał się na szeregowanie DeepEP. Ani wewnątrzwęzłowa operacja dispatch, ani wewnątrzwęzłowa operacja combine nie zwalniały GIL-a Pythona w używanej wersji DeepEP, przez co wątek transferu utknął za nimi; anglojęzyczne i chińskojęzyczne omówienia tego samego materiału podawały wynikowy narzut odpowiednio jako powyżej 20% i powyżej 30%. Po poprawce Zhipu twierdzi, że różnica względem jego punktu odniesienia obejmującego wyłącznie prefill spadła poniżej 1%.
• Jądro dekodowania obliczało ponownie tę samą normalizację i bramkowanie FP32 cztery razy, raz na kafelek wymiaru V. Podział pracy związanej z dzieleniem skrócił czas działania jądra o 9,6%, a scalenie kafelków w jeden blok wątków — dzięki czemu normalizacja uruchamia się raz — dało przyspieszenie 1,71×.
Wokół tych poprawek znajdują się zmiany strukturalne: ReplaySSM, który wymienia obliczenia na pamięć na chipie, ponieważ akceleratory mają jej mniej niż GPU, dla których pierwotnie napisano ten stos; równoległość tensorowa wewnątrz węzła, aby złagodzić tę samą presję; mieszane buforowanie INT8, FP8 i BF16 w celu zwiększenia pojemności; oraz zdezagregowana architektura Encode-Prefill-Decode, która planuje trzy etapy wnioskowania osobno, a nie jako jeden potok. Zhipu również uczciwie wymienia ograniczenia — ograniczona pamięć na chipie i przepustowość połączeń, niedojrzałe oprogramowanie, niekompletne pokrycie jąder i skąpa dokumentacja — i mówi, że nie osiągnęło rekurencyjnego samodoskonalenia, opisując wynik jako pętlę o minimalnej skali.
Czytaj tę relację sceptycznie, bo motywy są oczywiste. Zhipu nie powie, ile pracy wykonał agent, a ile inżynierowie, i nie ma zewnętrznego audytu wskaźnika przepustowości, dwutygodniowego harmonogramu ani rozmiaru klastra. Ujęcie gęstej informacji zwrotnej także jest w specyficzny sposób nastawione na własny interes: sprawia, że najbardziej imponująco brzmiące twierdzenie („nasz model sam się ulepszył”) opiera się na najtrudniejszych do sprawdzenia dowodach (wewnętrznej pętli, której nikt nie może zbadać). To, co powstrzymuje tę historię przed byciem czystym marketingiem, to fakt, że jej najbardziej konkretne twierdzenie jest falsyfikowalne i okazuje się prawdziwe — poprawka kernela tf32x3 naprawdę znajduje się w repozytorium upstream, datowana na 27 sierpnia, trzy tygodnie przed cyklem prasowym wokół niej.
Ile to kosztuje w rzeczywistych dolarach
Cennik pochodzi od Zhipu i jest prosty: 0,15 USD za milion tokenów wejściowych, 0,50 USD za milion tokenów wyjściowych oraz 0,03 USD za milion tokenów wejściowych z pamięci podręcznej. Taka jest cena katalogowa na dziś. Promocja premierowa z 50% zniżką trwała do 9 września 2026 r. i nie została przedłużona, więc kwoty 0,075 / 0,25 / 0,015 USD, które szeroko krążyły pod koniec sierpnia, nie są już dostępne w API samego dostawcy. Na tle publikowanych stawek GLM-5.3 wynoszących 1,40 / 4,40 USD, Flash nadal wypada na około jednej dziesiątej ceny katalogowej — zniżka była bonusem ponad cenę, która i tak była sednem sprawy, a nie samą ceną. Artificial Analysis wylicza mieszaną stawkę na około 0,10 USD za milion tokenów przy mieszance 7:2:1 trafień w pamięć podręczną / tokenów wejściowych / tokenów wyjściowych i podaje prędkość generowania na około 117 tokenów na sekundę, opisując ją jako wyraźnie szybką, choć AA zaznacza, że dane o prędkości odnoszą się do własnego API modelu, a nie do testu przeprowadzonego przez AA.
Szersza historia kosztowa Zhipu jest powodem, dla którego cena może utrzymać się na tym poziomie. W wynikach półrocznych opublikowanych 31 sierpnia firma podała, że koszt wnioskowania na jednostkę tokena w jej krajowej flocie 100 000 akceleratorów spadł o 80% od początku 2026 r., a marża brutto API wzrosła z -0,4% do 24,6% w wyniku skali, cen i tańszego serwowania. To dane spółki raportującej akcjonariuszom i nie są przez nas audytowane; traktuj je jako kierunkowo jasne, a nie precyzyjne. Powyższy opis serwowania jest mechanizmem stojącym za tym twierdzeniem — mniej zbędnych przebiegów jądra, mniejsze obciążenie pamięci, lepsze nakładanie się — co jest bardziej wiarygodną historią niż sam procent, nawet jeśli to właśnie procent będzie cytowany.
Twierdzenia o wydajności względem flagowca pozostają bez zmian: obliczenia attention spadły 3,0x, a pamięć podręczna KV spadła 4,4x względem GLM-5.3, według danych producenta, przy czym Zhipu przyznaje, że jego pamięć podręczna KV pozostaje nieco większa niż pamięć podręczna KV DeepSeek V4 Flash i Kimi K3. Twierdzenie ogłoszone przy premierze o 3-krotnej poprawie wydajności serwowania end-to-end na krajowych chipach jest obecnie podawane jako 3,2x, mierzone od pierwszego uruchomienia do pełnego ruchu produkcyjnego. Obie liczby pochodzą od Zhipu, a dwa doniesienia, które je zawierają, dzieli trzy tygodnie — nic z tego nie zostało odtworzone poza firmą.
Dlaczego to ujawnienie ma znaczenie — i gdzie się podziała kluczowa liczba
Oto korekta, która ma największe znaczenie dla każdego, kto czytał relacje z premiery i zapamiętał tę liczbę. Materiały Zhipu podają, że GLM-5.3-Flash osiąga 57 w Artificial Analysis Intelligence Index, dorównując Claude Opus 4.8. Artificial Analysis opublikowało od tego czasu własny pomiar tego modelu w Intelligence Index v4.3 i wynosi on 42 — wobec 47 dla GPT-5.6 Sol (max) w tej samej wersji. Liczba 57 nigdy nie była niezależnym wynikiem; pochodziła od Zhipu, a niezależny pomiar plasuje model około pięć punktów poniżej pasma sąsiadującego z czołówką i znacznie poniżej wyniku reklamowanego przez dostawcę. W tym samym aktualnym indeksie sam GLM-5.3 osiąga 45, więc liczba 60 dla flagowego modelu, która pojawiła się w naszej relacji z premiery, nie odpowiada już temu, co Artificial Analysis publikuje dziś. Różnica 15 punktów między deklaracją a pomiarem nie jest różnicą wynikającą z zaokrąglenia i jest najbardziej użyteczną rzeczą, jaką czytelnik może wynieść z tej aktualizacji — z jednym zastrzeżeniem, które dodaje poniższa sekcja, ponieważ drugi niezależny pomiar w tej historii wskazuje przeciwny kierunek.
To, co przetrwa tę korektę, jest węższe, ale wciąż realne. GLM-5.3-Flash to model multimodalny o otwartych wagach z kontekstem 1M oraz natywnym wejściem obrazu i wideo w cenie katalogowej wynoszącej około jednej dziesiątej ceny jego flagowego bliźniaka — połączenie bez bezpośredniego odpowiednika ze strony amerykańskich laboratoriów czołowych, których porównywalne modele multimodalne kosztują znacznie więcej i są udostępniane jako zamknięte. Własne ujęcie Zhipu — „inteligencja czołowa, koszt flash” — to część, która ucierpiała: przy zmierzonym wyniku 42 to mocny model budżetowy, a nie czołowy za przecenę. Niezależny pomiar stawia go również komfortowo powyżej mediany dla modeli o otwartych wagach podobnej wielkości, co jest prawdziwym osiągnięciem dla modelu z 18B aktywnymi parametrami i jedną dziesiątą kosztu wnioskowania — to po prostu inne osiągnięcie niż sugerowały relacje z premiery.
Druga niezależna liczba — i wypadła na korzyść modelu.
Jeśli wynik Artificial Analysis spuścił GLM-5.3-Flash o szczebel niżej, ten idzie w drugą stronę — i jest to najdziwniejszy fakt w tej historii. ExploitBench, stworzony na Carnegie Mellon, nie pyta, czy model potrafi zcrashować cel. Ocenia wspinaczkę: dotarcie do podatnego kodu, wywołanie błędu, zbudowanie prymitywów wielokrotnego użytku, a na końcu pełne przejęcie przepływu sterowania z wykonaniem dowolnego kodu, oceniane mechanicznie względem produkcyjnego V8 z włączoną piaskownicą bezpieczeństwa. Generality Labs uruchomiło GLM-5.3-Flash na 41 błędach z budżetem wynoszącym 1 miliard tokenów na błąd zamiast zwykłego limitu 300 tur w benchmarku, argumentując, że tury są słabym przybliżeniem tego, co nabywca faktycznie wydaje, a dolary są uczciwym ograniczeniem. GLM-5.3-Flash osiągnął pełne wykonanie dowolnego kodu w 13 z 41 przypadków oraz średni wynik zdolności 64,8% maksimum drabiny. Trzy opublikowane przebiegi Claude Mythos Preview uzyskały 9, 10 i 11 na tej samej drabinie — średnio 10, czyli 62,2%. Własne sformułowanie Generality, wydrukowane pod wykresem, głosi, że GLM-5.3-Flash „może być na poziomie Mythos w cyberbezpieczeństwie” w tym pomiarze. Własny przebieg Anthropic w ExploitBench, opublikowany 29 września, podaje tę samą kolejność przy znacznie niższych wskaźnikach bezwzględnych — choć na flagowym GLM-5.3, a nie na Flashu: liczy exploity end-to-end na próbę, a nie postęp w drabinie, i plasuje GLM-5.3 na 50 z 410 wobec 56 z 410 dla Mythos Preview. Inna reguła liczenia, podobna kolejność — i właśnie dlatego wyniku ExploitBench nigdy nie należy cytować bez dołączonej reguły.
Powód, który ma znaczenie, to mianownik, który się pod tym kryje. W tym przebiegu tokeny wyjściowe GLM-5.3-Flash wyceniono na 0,25 USD za milion — czyli jego promocyjną stawkę startową z 50% zniżki, która od tego czasu wygasła — w porównaniu z historyczną stawką Claude Mythos Preview wynoszącą 125 USD za milion, co daje 500-krotną różnicę. Przy parytecie kosztów ten przebieg wydał 16,81 USD na podatność w porównaniu z 297,17 USD w przypadku Mythos i stąd właśnie bierze się liczba około 6%. Przeczytaj to twierdzenie uważnie, ponieważ wersja, która krąży, jest błędna. Nie chodzi o to, że GLM-5.3-Flash jest lepszym twórcą exploitów niż Claude Mythos Preview. Chodzi o to, że dolar tokenów GLM-5.3-Flash kupuje mniej więcej to samo, co dolar tokenów Mythos w tym konkretnym zadaniu, i że możesz pozwolić sobie na znacznie więcej dolarów tych pierwszych.
Własne zastrzeżenia Generality są warte więcej niż nagłówek. Mówią wprost, że pojedyncze uruchomienie nie ustala parytetu w całej domenie cyber, że kontaminacja jest kwestią otwartą — możliwe, że w jakiś sposób trenowano przeciwko ExploitBench — oraz że cztery z 41 próbek zwróciły błąd i zostały ocenione poprzez przeniesienie ostatniego zaobserwowanego wyniku do przodu, co jeśli już, to zaniża model. Opublikowali również uzupełnienie 28 września, które komplikuje całe porównanie. Przepuszczając GLM-5.3-Flash przez siedem różnych środowisk agentowych przy budżecie 250 milionów tokenów, na dziesięciu próbkach wybranych tak, by obejmowały zakres trudności, te same wagi uzyskały 10,6 w środowisku Codex — powyżej referencyjnego wyniku 10,02 Claude Mythos Preview — oraz 6,2 w środowisku Claude Code, poniżej nawet oryginalnej konfiguracji benchmarku z ograniczeniem liczby tur wynoszącym 6,4. Środowisko zmieniło wynik w większym stopniu niż porównanie modeli, a autorzy twierdzą, że podzbiór dziesięciu próbek prawdopodobnie nie jest reprezentatywny. To, że wykres szeroko krążył 2 października z argumentem, że skalowanie obliczeń w czasie testu zaciera różnice między poziomami modeli, jest twierdzeniem o branży, a nie ustaleniem z oceny: to, co ustaliła ocena, to że tani otwarty model, otrzymawszy budżet zamiast limitu tur, może dorównać specjaliście od exploitów z czołowego laboratorium na jednej drabinie.
To już nie historia jednego laboratorium. W opublikowanej 29 września ocenie własnego zespołu Frontier Red Team Anthropic uruchomiono GLM-5.3-Flash — mniejszego brata — w sesji z człowiekiem w pętli: po przekazaniu publicznych szczegółów załatanej luki w Chrome oraz jednej innej, bez istotnych wskazówek, model połączył je w niezawodny exploit na ARM64, który ominął wzmocnienie uwierzytelniania wskaźników, w ciągu 20 minut uwagi człowieka i ośmiu godzin pracy modelu — 20,40 USD według stawek API Zhipu. Ta sama ocena jest źródłem wspomnianej wyżej liczby 50 z 410 w ExploitBench, a ta jej część mierzyła GLM-5.3, flagowy model o 743B parametrów, a nie Flasha — rozróżnienie, które w dużej mierze zatarło relacjonowanie raportu. Dwie niezależne strony, różne środowiska testowe, różne budżety, ten sam kierunek. Oba to również pojedyncze uruchomienia z jednego laboratorium i żadne nie jest wynikiem odtworzonym, a tylko uruchomienie Generality podaje kwotę w dolarach dla Flasha, a nie dla flagowca. Praktyczna interpretacja jest taka, jaką Anthropic podaje wprost: wagi można pobrać, abliteracja GLM-5.3-Flash zajęła około 600 godzin GPU, a model, którego uruchomienie kosztuje poniżej dolara za godzinę, stanowi inny rodzaj problemu z dostępnością niż model objęty programem weryfikacji.
Wypróbuj to i sprawdź, jak pasuje warstwa routingu.
Dostęp jest prosty. Własne API Zhipu udostępnia je w podanej powyżej cenie katalogowej, wagi na licencji MIT są na Hugging Face pod zai-org/GLM-5.3-Flash w FP8 i BF16, a produkty kodujące Zhipu — ZCode i GLM Coding Plan — zawierają go w pakiecie. W przypadku samodzielnego hostowania, zarówno vLLM, jak i SGLang go obsługują. Dwie praktyczne uwagi, jeśli pójdziesz tą drogą: cookbook SGLang zawiera ostrzeżenie o otwartej zmianie, że wejście wizyjne może być po cichu odrzucane w kompilacjach transformers przed 5.13, co nie zgłosi błędu i po prostu da ci odczyt tylko tekstowy żądania obrazu; a ścieżka AMD nadal nie jest gotowym przepisem. Pierwotny PR umożliwiający gfx950 z dnia premiery (sgl-project/sglang #37653) został zamknięty bez scalenia 6 września i zastąpiony przez szerszy zestaw pull requestów gfx950 day-zero — mHC przez AITER, indekser k-pool DSA, obsługa FP8 i MXFP4 — z których kilka było nadal otwartych 17 września. Włączanie na sprzęcie klasy MI350X jest w toku, nie zostało jeszcze wydane, a nadal nie ma niezależnego wyniku przepustowości AMD.
Po stronie routingu sytuacja zmieniła się od premiery: GLM-5.3-Flash znajduje się teraz w ofercie OrcaRouter, obok reszty linii GLM. przekazujemy cennik katalogowy dostawcy dalej z marżą 0% i bez dopłaty routera, co jest dokładnie tym mechanizmem, który ma znaczenie w przypadku modelu, którego cena właśnie się zmieniła — wygasający rabat po stronie Zhipu to cena, którą płacisz tutaj, tego samego dnia, bez drugiej umowy do renegocjacji i bez zmian w kodzie. To przekazywanie cen działa w obie strony i warto powiedzieć to wprost: wygasła promocja to realny wzrost ceny na twoim rachunku i następuje tutaj w tym samym momencie, w którym następuje u źródła. Jeśli rozważasz Flasha w porównaniu z GLM-5.3 lub innym budżetowym modelem, oba są dostępne za jednym kluczem z automatycznym przełączaniem awaryjnym między dostawcami, co jest tanim sposobem na wypróbowanie modelu, którego niezależne wyniki wciąż się ustalają, bez stawiania na nim ścieżki produkcyjnej. To także właściwy kształt dla powyższego wyniku i to z bardziej dosadnego powodu niż wygoda: te same wagi uzyskały 10,6 lub 6,2 w tym samym benchmarku w zależności od tego, który scaffold agenta je napędzał, więc to, co kupujący faktycznie testuje, to kombinacja scaffoldu i modelu, a podmiana modelu za stałym scaffoldem pod jednym kluczem jest tańsza niż opowiedzenie się za którymkolwiek z nich.

Co obejrzeć dalej
Cztery rzeczy przesądzą o reszcie tej historii. Po pierwsze, czy 42 się przesunie: model jest szeroko używany publicznie od sierpnia, więc jeśli wewnętrzna ocena Zhipu i harness AA nie zgadzają się z powodów strukturalnych — rozliczanie tokenów rozumowania, rozwlekłość, ocena, której dostawca nadał dużą wagę — powinno to się ujawnić przy aktualizacji indeksu, a nie jako jednorazowa rozbieżność. Po drugie, czy wynik exploitu się powtarza. Generality Labs przepuściło 41 błędów jednokrotnie przez własny harness i mówi o tym wprost; kontynuacja testów na harnessie pokazuje, że ten sam zestaw wag daje wynik różniący się o cztery punkty wyłącznie wskutek wyboru harnessu, więc liczbą, która by to rozstrzygnęła, jest ponowne uruchomienie tych 41 błędów przez drugi zespół, z budżetem ustalonym w dolarach i niezmienionym harnessem. Po trzecie, czy relacja o krajowych układach scalonych doczeka się drugiego źródła. Zhipu to jedyna strona mogąca podać rozmiar klastra, dwutygodniowy harmonogram i 3,2x, a jedyne niezależnie weryfikowalne twierdzenie w tej relacji — scalona poprawka jądra — jest niewielkie. Po czwarte, cena: zniżka zniknęła, a ciekawe pytanie brzmi, czy powróci jako promocja, gdy Zhipu będzie potrzebować wolumenu, czy też stawka cennikowa jest teraz dolną granicą.
Wątek przewodni jest taki, że GLM-5.3-Flash ma udowodnić dwie różne rzeczy naraz — że tani model może być wystarczająco dobry oraz że chińskie akceleratory mogą obsługiwać go na skalę — a ujawnienie z 17 września jest odpowiedzią Zhipu na drugie pytanie, dostarczoną przez model, który pomógł ją napisać. Do pierwszego pytania przypisano teraz dwie niezależne liczby i wskazują one w przeciwnych kierunkach: 42 w indeksie inteligencji, znacznie poniżej nagłówkowej liczby dostawcy, oraz przebieg exploita, który plasuje się na poziomie specjalisty z czołowego laboratorium przy jednej dwudziestej kosztu. Obie mogą być prawdziwe jednocześnie, a to w luce między nimi — nie w którejkolwiek z tych liczb — w rzeczywistości podejmuje się decyzje.
Porównane w tym artykule1
Wykryto na podstawie tego artykułu · Benchmarki: Artificial Analysis · aktualizowane codziennie
