GLM-5.3-Flash Svelato — L'anonimo "Ox Alpha" era in realtà il modello multimodale di frontiera open di Zhipu. Illustrazione rigenerata.
Guides & Insights

GLM-5.3-Flash, cinque settimane dopo: un 42 indipendente, una run di exploit di livello Mythos e l'agente GLM che ha ricostruito il proprio stack di serving

Autore

Rowan Sterling

Data di pubblicazione

Ultimi modelli · 20Vedi tutti i modelli →
Benchmark: Artificial Analysis · aggiornato ogni giorno
Torna a tutti gli articoli

GLM-5.3-Flash serve traffico di produzione da cinque settimane, e il 17 settembre 2026 Zhipu AI ha detto qualcosa su dove: l'azienda ha rivelato che ogni richiesta di produzione per GLM-5.3-Flash ora gira su una flotta di oltre 100.000 acceleratori AI cinesi di produzione nazionale, che è passata dal primo avvio su quell'hardware a sostenere l'intero carico di lavoro in produzione in meno di due settimane, e che il throughput end-to-end è aumentato di 3,2 volte nello stesso arco di tempo. La parte che è arrivata più lontano è chi ha svolto il lavoro. Gran parte di esso non è stata fatta dal team infrastruttura, ma da un agente guidato da GLM-5.3 stesso, che leggeva i collo di bottiglia, proponeva correzioni e scriveva codice per il sistema di inferenza, con gli ingegneri che definivano gli obiettivi, costruivano l'ambiente di feedback e revisionavano tutto ciò che toccava la semantica numerica, la concorrenza o il rischio di produzione. GLM-5.3-Flash è il modello multimodale da 320 miliardi totali e 18 miliardi attivi (320B-A18B) che Zhipu ha lanciato e reso open source il 26 agosto 2026 — l'anonimo "Ox Alpha" rivelato dall'azienda quel giorno — e il suo fratello maggiore GLM-5.3 è il flagship da 743B con cui è stato confrontato sul prezzo. Nessuno dei tre numeri nella comunicazione di oggi proviene da noi o da chiunque altro: sono di Zhipu. Anche il flagship non è più l'unico confronto che conta: su ExploitBench, una valutazione indipendente di quanto un modello riesca a scalare una vera catena di exploit per Chrome, GLM-5.3-Flash è ora misurato allo stesso livello di Claude Mythos Preview, il modello di frontiera chiuso che il suo sviluppatore ha rilasciato solo a difensori verificati, a una frazione del costo per tentativo.

Questa è la buona notizia, ed è reale, ma è dichiarata dal fornitore. Altre tre cose si sono mosse da quando questo post è apparso per la prima volta il giorno del lancio, e due di esse vanno nella direzione opposta. Artificial Analysis ha ormai pubblicato la propria misurazione del modello, e il suo numero non è quello di Zhipu. Lo sconto di lancio che rendeva questo il modello capace più economico sul mercato è scaduto puntualmente il 9 settembre e non è stato prorogato. E un organismo di valutazione indipendente, Generality Labs, ha pubblicato la propria esecuzione di ExploitBench in cui GLM-5.3-Flash ha ottenuto un punteggio superiore alla media di tre esecuzioni di Claude Mythos Preview sulla stessa scala — a circa sei centesimi per dollaro. Per chiunque abbia messo questo modello tra i preferiti a fine agosto come "quello economico", oggi l'aritmetica è diversa da com'era, e il titolo onesto è misto: l'economia del servizio è migliorata davvero, il prezzo è salito perché è terminata una promozione, il dato di intelligenza tanto citato non ha superato il primo contatto con un sistema di valutazione indipendente, e il confronto di capacità che è andato a favore del modello è una singola esecuzione non sottoposta a revisione, che i suoi stessi autori dicono non vada sovrainterpretata.

Zhipu è l'unica fonte per la dimensione del cluster, la tempistica di due settimane e il fattore 3,2x — non esiste alcun controllo indipendente di nessuno di essi, e l'azienda stessa dichiara di non aver raggiunto l'auto-miglioramento ricorsivo, descrivendo il risultato come un ciclo su scala minima anziché la cosa autentica. Ciò che si può verificare, l'abbiamo verificato: l'unico artefatto concreto nel resoconto che vive al di fuori delle mura di Zhipu — una correzione di precisione in un kernel Flash Linear Attention — è realmente stato integrato upstream, e lo abbiamo confermato. Dove una cifra riportata di seguito proviene da Zhipu, viene detto. Dove proviene da Artificial Analysis, viene detto invece questo. Dove proviene da Generality Labs — il gruppo di valutazione della sicurezza dietro i numeri dell'exploit in questo post — viene detto anche questo, insieme alle avvertenze che i suoi autori stessi hanno allegato: una singola esecuzione, 41 bug, un metodo autopubblicato, nessuna riproduzione da parte di terzi e una questione di contaminazione che sollevano di propria iniziativa. Dove un numero è di Anthropic — le uniche cifre qui che provengono da un laboratorio con un interesse competitivo nella risposta — il corpo del testo dice quale modello ha effettivamente misurato, perché non tutti sono questo.

Cosa è stato effettivamente spedito

GLM-5.3-Flash è un modello mixture-of-experts da 320B totali / 18B attivi con 45 livelli, il che porta il suo footprint attivo a poco più della metà dei circa 32B di GLM-5.2. La capacità di punta è la modalità: accetta nativamente input testuali, immagini e video — il primo modello GLM-5 a farlo — invece di instradare la visione attraverso un adattatore separato. Il contesto arriva a 1 milione di token, e Zhipu afferma che il costo di servizio a contesto lungo si attesta a circa un terzo di quello di GLM-5.3.

Sull'architettura, Zhipu lo descrive come il primo modello di frontiera open source ad abbinare attenzione ibrida sparsa+lineare a Manifold-Constrained Hyper-Connections (mHC) per lo scaling e a un meccanismo IndexPool che comprime quattro vettori chiave dell'indexer in un unico pool ponderato per ridurre la latenza sui contesti lunghi. Il pre-addestramento è stato eseguito su un corpus multimodale da 30 trilioni di token. Nulla di tutto ciò è verificato in modo indipendente — è Zhipu che descrive il proprio modello — ma le affermazioni sull'efficienza di serving sono abbastanza specifiche da poter essere testate ora che i pesi si trovano davanti allo stack di inferenza open source, e il resoconto del 17 settembre aggiunge il primo quadro dettagliato di come il lato serving sia stato effettivamente costruito.

La scheda tecnica del giorno del lancio, a colpo d'occhio:

• Parametri — 320B totali / 18B attivi, 45 layer, MoE.

• Modalità — input nativo di testo, immagini e video; output di testo.

• Finestra di contesto — fino a 1.000.000 di token.

• Licenza — MIT, pesi aperti su Hugging Face dal giorno del lancio.

• Prezzo — $0,15 / $0,50 per milione di token (input / output), $0,03 per milione di input in cache.

A generated single-model scoreboard titled 'GLM-5.3-Flash — the scoreboard' with rows for AA Index 57 (vendor-reported), Active params 18B, Context 1M tokens, Modality text/image/video, Open weights MIT live now, and Price ~$0.14/$0.44 per 1M (discount $0.07/$0.22); footer notes benchmarks are vendor-reported and pricing is derived from Zhipu's stated ratios.

Quella scheda è un'istantanea del giorno di lancio, e due delle sue righe sono cambiate dal 26 agosto. Il dato dell'AA Index è ancora un'asserzione di Zhipu ed è ora contraddetto da misurazioni indipendenti — ne parleremo più avanti. Il prezzo scontato che mostra non è più disponibile; la promozione è terminata il 9 settembre. I conteggi dei parametri, la finestra di contesto, la licenza e la modalità sono fatti attuali invariati, e sono ciò a cui l'immagine serve principalmente.

La settimana di Ox Alpha, e cosa stava davvero testando il giveaway gratuito

La rivelazione ha posto fine a una settimana di speculazioni. Il 20 agosto, un modello anonimo è apparso su una piattaforma API di terze parti per l'IA con una finestra di contesto da 1 milione di token, input di testo/immagine/video e un prezzo pari a zero, ed è rapidamente diventato il modello più chiamato nelle classifiche settimanali di quella piattaforma. La community ne ha ricostruito l'impronta riconducendola alla famiglia GLM di Zhipu nel giro di 48 ore — lo stesso schema "anonimo e poi rivendicato" che aveva già portato a identificare modelli di altri laboratori cinesi — e gli analisti hanno in molti ipotizzato una variante Flash di GLM-5.3. L'annuncio del 26 agosto ha confermato l'ipotesi: la settimana gratuita era un test intenzionale, e l'azienda afferma che l'esecuzione anonima ha mosso più di 62 trilioni di token in sei giorni sulle piattaforme di coding in cui era offerto, il tutto servito da chip cinesi nazionali.

Quell'ultima clausola all'epoca sembrava una nota a piè di pagina. Si è rivelata essere il punto. La settimana gratuita non era principalmente uno stunt di marketing né tantomeno un test di carico del modello; era un test di carico della flotta di acceleratori sottostante, condotto su una scala in cui un fallimento sarebbe stato pubblico e gratuito. Tre settimane dopo Zhipu descrive la stessa flotta come quella che trasporta il 100% del traffico di produzione del modello.

A screenshot of the Z.ai blog page for the GLM-5.3-Flash launch, titled 'GLM-5.3-Flash: Frontier Intelligence, Flash Cost', describing the 320B-total / 18B-active model as the first natively multimodal model in the GLM-5 series, at one-tenth the price, approaching Claude Opus 4.8 on coding benchmarks.

La logica dei prezzi di quella settimana regge ancora, con una correzione. Un modello regalato a 0 $ per una settimana e poi lanciato a un decimo del prezzo del modello di punta con un ulteriore 50% di sconto è stato una mossa deliberata di creazione di mercato nella fascia economica, e la dicitura "a tempo limitato" era sempre la parte da tenere d'occhio. L'avevamo segnalato come qualcosa su cui si poteva fare marcia indietro. La marcia indietro è avvenuta come previsto — il che vale la pena dire chiaramente, perché la scadenza dello sconto è l'unico cambiamento in questa storia che compare su una fattura.

Lo stack di serving che un agente ha ricostruito

Il resoconto tecnico del 17 settembre di Zhipu è la prima descrizione dettagliata di come GLM-5.3-Flash viene servito su silicio cinese, e la sua tesi centrale è che un modello ha contribuito a ottimizzare il sistema che lo esegue. L'azienda chiama il meccanismo dense feedback: test di correttezza, log di esecuzione, tracce, microbenchmark e metriche end-to-end sono stati collegati in modo che un agente potesse convalidare localmente un'ipotesi invece di attendere un deployment completo e un load test dopo ogni modifica. Perché ciò funzionasse, secondo Zhipu il feedback doveva essere locale, economico e verificabile oggettivamente — vincolato a uno specifico kernel o percorso di codice, abbastanza veloce per iterare, e vero o falso senza intervento umano nel ciclo.

Con quel ciclo in atto, l'agente ha individuato e corretto tre cose che l'azienda ha descritto in dettaglio:

• Un percorso parallelo per contesto nel kernel KDA perdeva precisione man mano che le sequenze crescevano, perché tl.dot usava TF32 come impostazione predefinita nonostante input FP32, amplificando l'errore di arrotondamento con la lunghezza del contesto. La correzione fissa la precisione dell'input a tf32x3, con un fallback a ieee sulle piattaforme senza supporto TF32. Questa è la più interessante delle tre, perché è l'unica affermazione nel resoconto che esce dall'infrastruttura di Zhipu stessa: la modifica è stata integrata upstream in Flash Linear Attention come PR #1180, che abbiamo verificato e confermato integrata il 27 agosto 2026.

• Il trasferimento KV non si sovrapponeva allo scheduling di DeepEP. Né il dispatch intranodo né il combine intranodo rilasciavano il GIL di Python nella versione di DeepEP in uso, il che bloccava il thread di trasferimento dietro di essi; i resoconti in inglese e in cinese dello stesso articolo collocavano il sovraccarico risultante rispettivamente al di sopra del 20% e al di sopra del 30%. Dopo la correzione, Zhipu afferma che il divario rispetto alla sua baseline di solo prefill è sceso sotto l'1%.

• Un kernel di decodifica ricalcolava quattro volte la stessa normalizzazione FP32 e lo stesso gating, una volta per tile della dimensione V. Suddividere il lavoro di divisione ha ridotto il tempo del kernel del 9,6%, e unire i tile in un unico blocco di thread — così la normalizzazione viene eseguita una sola volta — ha prodotto un'accelerazione di 1,71x.

Attorno a quelle correzioni si trovano i cambiamenti strutturali: ReplaySSM, che scambia calcolo con memoria on-chip perché gli acceleratori hanno meno di quest'ultima rispetto alle GPU per cui lo stack era originariamente scritto; parallelismo tensoriale intra-nodo per alleviare la stessa pressione; caching misto INT8, FP8 e BF16 per estendere la capacità; e un'architettura disaggregata Encode-Prefill-Decode che pianifica le tre fasi di inferenza separatamente anziché come un'unica pipeline. Zhipu nomina anche onestamente i vincoli — memoria on-chip e larghezza di banda di interconnessione limitate, software immaturo, copertura incompleta dei kernel e documentazione scarna — e afferma di non aver raggiunto l'auto-miglioramento ricorsivo, descrivendo il risultato come un ciclo a scala minima.

Leggi il resoconto con scetticismo, perché gli incentivi sono evidenti. Zhipu non dirà quanto lavoro abbia svolto l'agente rispetto a quanto ne abbiano svolto gli ingegneri, e non esiste alcuna verifica esterna della cifra di throughput, della tempistica di due settimane o della dimensione del cluster. Anche l'inquadramento del feedback denso è interessato in un modo specifico: fa sì che l'affermazione che suona più impressionante ("il nostro modello ha migliorato se stesso") si basi sulle prove meno verificabili (un ciclo interno che nessuno può ispezionare). Ciò che impedisce alla storia di essere puro marketing è che la sua affermazione più concreta è falsificabile e si rivela vera: la correzione del kernel tf32x3 è davvero nel repository upstream, datata 27 agosto, tre settimane prima del ciclo mediatico che la circonda.

Quanto costa, in dollari reali

Il tariffario è di Zhipu ed è semplice: $0,15 per milione di token di input, $0,50 per milione di token di output e $0,03 per milione di token di input in cache. Questo è il prezzo di listino a oggi. La promozione di lancio con il 50% di sconto è durata fino al 9 settembre 2026 e non è stata prorogata, quindi i numeri $0,075 / $0,25 / $0,015 che hanno ampiamente circolato a fine agosto non sono più disponibili sull'API del fornitore stesso. Rispetto ai $1,40 / $4,40 pubblicati di GLM-5.3, il Flash si attesta ancora a circa un decimo a listino — lo sconto era un bonus in aggiunta a un prezzo che era già il punto, non il prezzo stesso. Artificial Analysis calcola una tariffa media ponderata di circa $0,10 per milione di token su un mix 7:2:1 di cache-hit/input/output, e indica una velocità di output di circa 117 token al secondo, che descrive come notevolmente veloce, anche se AA osserva che le cifre sulla velocità descrivono l'API di prima parte del modello anziché un test eseguito da AA.

La narrazione più ampia sui costi di Zhipu è il motivo per cui il prezzo può restare a quel livello. Nei suoi risultati semestrali, pubblicati il 31 agosto, l'azienda ha dichiarato che il costo di inferenza per token sulla sua flotta domestica da 100.000 acceleratori è diminuito dell'80% dall'inizio del 2026, e che il margine lordo delle API è passato da -0,4% a 24,6% in conseguenza di scala, prezzi e serving più economico. Sono cifre aziendali fornite da una società che fa reporting agli azionisti, e non sono verificate da noi; consideratele come indicazioni direzionali chiare più che come dati precisi. Il resoconto sul serving sopra riportato è il meccanismo alla base dell'affermazione — meno passaggi ridondanti del kernel, minore pressione sulla memoria, migliore sovrapposizione — il che è una storia più credibile di una percentuale nuda e cruda, anche se è la percentuale a essere citata.

Le affermazioni sull'efficienza rispetto al modello di punta restano invariate: calcolo dell'attenzione ridotto di 3,0 volte e cache KV ridotta di 4,4 volte rispetto a GLM-5.3, secondo quanto riportato dal fornitore, con Zhipu che ammette che la sua cache KV rimane leggermente più grande di quella di DeepSeek V4 Flash e Kimi K3. La dichiarazione fatta al lancio di un miglioramento end-to-end del servizio di 3 volte sui chip nazionali ora è indicata come 3,2 volte, misurato dal primo avvio fino al traffico di produzione completo. Entrambi i numeri sono di Zhipu, e i due resoconti che li riportano distano tre settimane l'uno dall'altro — nulla di quanto qui riportato è stato riprodotto al di fuori dell'azienda.

Perché la rivelazione conta — e dove è finito il numero principale

Ecco la correzione che conta di più per chiunque abbia letto la copertura del lancio e abbia tenuto a mente il numero. I materiali di Zhipu collocano GLM-5.3-Flash a 57 sull'Artificial Analysis Intelligence Index, eguagliando Claude Opus 4.8. Artificial Analysis ha da allora pubblicato la propria misurazione del modello su Intelligence Index v4.3, e riporta 42 — contro 47 per GPT-5.6 Sol (max) sulla stessa versione. Il 57 non è mai stato un dato indipendente; era di Zhipu, e la misurazione indipendente colloca il modello circa cinque punti sotto la fascia adiacente alla frontiera e ben al di sotto del dato di punta del fornitore. Sullo stesso indice attuale, GLM-5.3 stesso misura 45, quindi la cifra di 60 per il modello di punta che è apparsa nella nostra copertura del lancio non corrisponde più a ciò che Artificial Analysis pubblica oggi. Il divario di 15 punti tra dichiarazione e misurazione non è una differenza di arrotondamento, ed è la cosa più utile in assoluto che un lettore può trarre da questo aggiornamento — con una precisazione che la sezione seguente aggiunge, perché la seconda misurazione indipendente in questa storia punta nella direzione opposta.

Ciò che sopravvive a quella correzione è più ristretto, ma pur sempre reale. GLM-5.3-Flash è un modello multimodale a pesi aperti con contesto da 1M e input nativo di immagini e video a circa un decimo del prezzo di listino del suo modello gemello di punta — una combinazione che non ha equivalente diretto tra i laboratori di frontiera statunitensi, i cui modelli multimodali comparabili costano sostanzialmente di più e vengono distribuiti in forma chiusa. L'inquadramento dello stesso Zhipu, "intelligenza di frontiera, costo flash", è la parte che ha subito il colpo: con un punteggio misurato di 42 è un forte modello economico, non un modello di frontiera a sconto. Una misurazione indipendente lo colloca anche comodamente al di sopra della mediana dei modelli a pesi aperti di dimensioni simili, il che è un risultato concreto per un modello con 18B attivi e un decimo del costo di inferenza — è semplicemente un risultato diverso da quello che la copertura del lancio lasciava intendere.

L'altro numero indipendente — ed è andato a favore del modello

Se il risultato di Artificial Analysis ha ridimensionato GLM-5.3-Flash, questo fa l'opposto, ed è il fatto più strano della storia. ExploitBench, sviluppato alla Carnegie Mellon, non si chiede se un modello sia in grado di mandare in crash un target. Valuta la scalata: raggiungere il codice vulnerabile, innescare il bug, costruire primitive riutilizzabili e infine il dirottamento completo del flusso di controllo con esecuzione arbitraria di codice, valutato meccanicamente contro V8 di produzione con la sandbox di sicurezza attiva. Generality Labs ha testato GLM-5.3-Flash su 41 bug con un budget di 1 miliardo di token per bug, invece del consueto limite di 300 turni del benchmark, sostenendo che i turni sono un pessimo proxy di ciò che un acquirente spende realmente e che i dollari sono il vincolo onesto. GLM-5.3-Flash ha raggiunto l'esecuzione arbitraria di codice completa su 13 dei 41, e un punteggio medio di capacità pari al 64,8% del massimo della scala. Le tre esecuzioni pubblicate di Claude Mythos Preview hanno totalizzato 9, 10 e 11 sulla stessa scala — una media di 10, ovvero 62,2%. La formulazione di Generality stessa, stampata sotto il grafico, è che GLM-5.3-Flash «potrebbe essere a livello di Mythos nel cyber» su questa misurazione. L'esecuzione di ExploitBench di Anthropic stessa, pubblicata il 29 settembre, riporta lo stesso ordinamento a tassi assoluti molto più bassi — anche se sul modello di punta GLM-5.3, non sul Flash: conta gli exploit end-to-end per tentativo anziché i progressi sulla scala, e colloca GLM-5.3 a 50 su 410 contro i 56 su 410 di Mythos Preview. Regola di conteggio diversa, ordinamento simile — ed è esattamente per questo che una cifra di ExploitBench non dovrebbe mai essere citata senza la regola allegata.

La ragione che conta è il denominatore che ci sta sotto. Il run ha prezzato i token di output di GLM-5.3-Flash a $0,25 per milione — la sua tariffa di lancio scontata del 50%, che nel frattempo è scaduta — contro lo storico $125 per milione di Claude Mythos Preview, un divario di 500 volte. A parità di costo, il run ha speso $16,81 per vulnerabilità contro i $297,17 di Mythos, ed è da lì che deriva la cifra del 6% circa. Leggi con attenzione l'affermazione, perché la versione che circola è quella sbagliata. Non è che GLM-5.3-Flash sia uno sviluppatore di exploit migliore di Claude Mythos Preview. È che un dollaro di token GLM-5.3-Flash compra all'incirca quello che compra un dollaro di token Mythos in questo specifico compito, e che puoi permetterti molti più dollari di quelli di GLM-5.3-Flash.

Le avvertenze della stessa Generality valgono più del titolo. Dicono chiaramente che una singola esecuzione non stabilisce la parità sul cyber nel suo complesso, che la contaminazione è una questione aperta — è possibile che sia stato addestrato su ExploitBench in qualche modo — e che quattro dei 41 campioni hanno dato errore e sono stati valutati riportando avanti l'ultimo risultato osservato, il che, semmai, sottostima il modello. Hanno anche pubblicato un approfondimento successivo il 28 settembre che complica l'intero confronto. Eseguendo GLM-5.3-Flash attraverso sette diversi harness per agenti con un budget di 250 milioni di token, su dieci campioni selezionati per coprire l'intera gamma di difficoltà, gli stessi pesi hanno ottenuto 10,6 con l'harness Codex — sopra il riferimento di 10,02 di Claude Mythos Preview — e 6,2 con l'harness Claude Code, al di sotto persino della configurazione originale del benchmark a turni limitati, pari a 6,4. L'harness ha spostato il punteggio più di quanto abbia fatto il confronto tra modelli, e gli autori affermano che il sottoinsieme di dieci campioni probabilmente non è rappresentativo. Il fatto che il grafico sia circolato ampiamente il 2 ottobre con l'argomentazione che lo scaling del calcolo in fase di test stia cancellando i divari tra i livelli dei modelli è un'affermazione sull'industria, non un risultato della valutazione: ciò che la valutazione ha rilevato è che un modello aperto ed economico, se gli viene dato budget invece di un limite di turni, può raggiungere lo specialista di exploit di un laboratorio di frontiera su una scala.

Non è più la storia di un solo laboratorio. La valutazione del Frontier Red Team della stessa Anthropic, pubblicata il 29 settembre, ha eseguito GLM-5.3-Flash — il fratello minore — in una sessione human-in-the-loop: consegnati i dettagli pubblici di una falla Chrome già corretta più un'altra, senza indicazioni significative, il modello li ha concatenati in un exploit ARM64 affidabile che aggirava l'hardening dell'autenticazione dei puntatori, in 20 minuti di attenzione umana e otto ore di lavoro del modello — 20,40 dollari alle tariffe API di Zhipu. La stessa valutazione è la fonte del dato 50 su 410 di ExploitBench citato sopra, e quella parte misurava GLM-5.3, il flagship da 743B, non il Flash — una distinzione che la copertura mediatica del rapporto ha in gran parte appiattito. Due parti indipendenti, harness diversi, budget diversi, stessa direzione. Entrambe sono anche singole esecuzioni di laboratorio e nessuna delle due è un risultato riprodotto, e solo l'esecuzione di Generality riporta una cifra in dollari per il Flash anziché per il flagship. La lettura pratica è quella che Anthropic afferma apertamente: i pesi sono scaricabili, abliterare GLM-5.3-Flash ha richiesto circa 600 ore GPU, e un modello che costa meno di un dollaro l'ora da eseguire è un tipo diverso di problema di disponibilità rispetto a uno dietro un programma di verifica.

Provalo e come si inserisce il livello di routing.

L'accesso è semplice. L'API di Zhipu stessa lo serve alla tariffa di listino sopra indicata, i pesi con licenza MIT sono su Hugging Face all'indirizzo zai-org/GLM-5.3-Flash in FP8 e BF16, e i prodotti per la codifica di Zhipu — ZCode e il GLM Coding Plan — lo includono. Per il self-hosting, sia vLLM che SGLang lo supportano. Due note pratiche se si sceglie quella strada: il cookbook di SGLang contiene un avviso di modifica aperta secondo cui l'input visivo può essere eliminato silenziosamente sulle build di transformers precedenti alla 5.13, il che non genererà un errore e fornirà semplicemente una lettura solo testuale di una richiesta di immagine; e il percorso AMD non è ancora una ricetta. La PR originale di abilitazione gfx950 del giorno di lancio (sgl-project/sglang #37653) è stata chiusa senza essere unita il 6 settembre e sostituita da un insieme più ampio di pull request gfx950 day-zero — mHC tramite AITER, indicizzatore DSA k-pool, serving FP8 e MXFP4 — diverse delle quali erano ancora aperte il 17 settembre. L'abilitazione su hardware di classe MI350X è in corso, non ancora rilasciata, e non esiste ancora un dato indipendente sul throughput AMD.

Sul fronte del routing la situazione è cambiata dal lancio: GLM-5.3-Flash è ora nel roster di OrcaRouter, insieme al resto della linea GLM. Noi trasmettiamo il prezzo di listino del provider con 0% di ricarico e nessun sovrapprezzo del router, che è esattamente il meccanismo che conta per un modello il cui prezzo si è appena mosso — lo sconto che scade dalla parte di Zhipu è il prezzo che paghi qui, lo stesso giorno, senza un secondo contratto da rinegoziare e senza modifiche al codice. Questo pass-through taglia in entrambe le direzioni, e vale la pena dirlo esplicitamente: una promozione scaduta è un vero aumento di prezzo sulla tua fattura, e avviene qui nello stesso momento in cui avviene a monte. Se stai soppesando il Flash rispetto a GLM-5.3 o a un altro modello economico, entrambi stanno dietro un'unica chiave con failover automatico tra provider, che è il modo economico di provare un modello i cui punteggi indipendenti sono ancora in fase di assestamento senza puntarci un percorso di produzione. È anche la forma giusta per il risultato di cui sopra, e per una ragione più schietta della convenienza: gli stessi pesi hanno ottenuto 10,6 o 6,2 sullo stesso benchmark a seconda di quale harness di agenti li guidasse, quindi ciò che un acquirente testa davvero è una combinazione di scaffold e modello, e scambiare il modello dietro uno scaffold fisso sotto un'unica chiave costa meno che impegnarsi per l'uno o per l'altro.

A screenshot of the Hugging Face model card for zai-org/GLM-5.3-Flash showing the MIT license badge, the Text Generation tag, and the 320B total / 18B active parameter counts.

Cosa guardare dopo

Quattro cose decidono il resto di questa storia. Primo, se il 42 si muoverà: il modello è ampiamente in uso pubblico da agosto, quindi se la valutazione interna di Zhipu e l'harness di AA sono in disaccordo per una ragione strutturale — conteggio dei token di ragionamento, verbosità, una valutazione a cui il fornitore ha attribuito molto peso — ciò dovrebbe emergere con la revisione dell'indice, anziché come uno scarto una tantum. Secondo, se il risultato dell'exploit è riproducibile. Generality Labs ha eseguito 41 bug una volta, sul proprio harness, e lo afferma; il follow-up sull'harness mostra che gli stessi pesi si spostano di quattro punti già solo per la scelta dell'harness, quindi il numero che lo chiarirebbe è un secondo team che riesegue i 41 con il budget fissato in dollari e l'harness tenuto costante. Terzo, se il resoconto sul silicio domestico ottiene una seconda fonte. Zhipu è l'unica parte in grado di dichiarare la dimensione del cluster, la tempistica di due settimane e il 3,2x, e l'unica affermazione verificabile in modo indipendente al suo interno — il fix del kernel integrato — è di piccola portata. Quarto, il prezzo: lo sconto è sparito, e la domanda interessante è se tornerà come promozione quando Zhipu avrà bisogno di volumi, o se il prezzo di listino è ormai il minimo.

Il filo conduttore è che a GLM-5.3-Flash viene chiesto di dimostrare due cose diverse contemporaneamente — che un modello economico può essere abbastanza buono, e che gli acceleratori cinesi possono servirlo su larga scala — e la divulgazione del 17 settembre è la risposta di Zhipu alla seconda domanda, fornita da un modello che ha contribuito a scriverla. Alla prima domanda sono ora associati due numeri indipendenti, e puntano in direzioni opposte: un 42 sull'indice di intelligenza, ben al di sotto del dato di punta del fornitore, e un'esecuzione di exploit che si colloca allo stesso livello dello specialista di un laboratorio di frontiera a un ventesimo del costo. Entrambe le cose possono essere vere contemporaneamente, e il divario tra loro — non l'uno o l'altro numero — è il punto in cui le decisioni vengono effettivamente prese.

Confrontati in questo articolo1

Rilevato da questo articolo · Benchmark: Artificial Analysis · aggiornato ogni giorno