Una hero card per Ox Alpha, il modello di frontiera anonimo, che mostra un chip del modello a forma di punto interrogativo con input di testo, immagini e video che fluiscono dentro e blocchi di token che fluiscono fuori, con tre pillole che riportano 'Contesto 1M token', 'Gratis per una settimana' e 'Produttore sconosciuto', e il logo OrcaRouter composito nell'angolo in basso a destra.
Guides & Insights

Ox Alpha Svelato: Z.AI lo Rilascia Open-Weight come GLM-5.3-Flash

Autore

Magnus Corvin

Data di pubblicazione

Ultimi modelli · 20Vedi tutti i modelli →
Benchmark: Artificial Analysis · aggiornato ogni giorno
Torna a tutti gli articoli

La sera di mercoledì 26 agosto, il mistero si è concluso come le analisi forensi avevano previsto. Z.AI — il laboratorio di Pechino dietro la serie GLM — ha rilasciato come prodotto open-weight il modello che aveva testato sotto una maschera, con il nome GLM-5.3-Flash, esattamente il sotto-nome su cui le analisi forensi del tokenizer e i mercati predittivi avevano convergito. Ox Alpha, il modello anonimo che è in cima alle classifiche di utilizzo da quando è emerso il 20 agosto, è ora un modello pubblicato e auto-ospitabile: licenza MIT, 320 miliardi di parametri totali con 18 miliardi attivi per token, finestra di contesto di 1.048.576 token e input di testo/immagine/video come pubblicizzato nell'inserzione, oltre ai pesi su Hugging Face. La rivelazione ha anche risolto il più grande enigma della settimana anonima — come un modello di cui nessuno era proprietario potesse gestire 100.000 miliardi di token al giorno: Z.AI afferma che il serving è stato eseguito interamente su circa 100.000 chip AI cinesi di produzione nazionale, la prima volta che il silicio cinese ha sostenuto traffico globale su scala frontier. Quella capacità aveva anche dato vita all'ipotesi sbagliata più popolare della settimana — a quella scala, molti osservatori, incoraggiati da post criptici dei ricercatori di Google DeepMind, sostenevano che Ox Alpha dovesse essere Gemini in esecuzione su hardware NVIDIA; la rivelazione ha corretto anche questo. La stessa notte, Alibaba ha rilasciato Qwen3.8-Flash-Next, un'anteprima open-weight della sua architettura Qwen4 — in una sola sera, due release open-weight di classe frontier dai laboratori cinesi. I quattro modelli anonimi rilasciati prima di Ox Alpha sono stati infine tutti rivendicati da laboratori cinesi: GLM-5 di Zhipu AI, MiMo-V2-Pro di Xiaomi, Lingxi Ling-2.6-flash di Ant Group e LongCat-2.0 di Meituan. Ox Alpha non è più un esperimento esclusivo della piattaforma; è un modello che gli sviluppatori possono auto-ospitare.

Ogni cifra in questo pezzo è un'affermazione dell'operatore, un dato proveniente dalla scheda della piattaforma, un annuncio pubblico o un rilevamento della community. I numeri DeepSWE sono misurazioni della community del ricercatore indipendente Ben Davis — un'esecuzione completa di 113 attività, non una voce ufficiale di classifica, anche se il dato di ~63% ora si allinea strettamente al punteggio DeepSWE v1.1 di 63,4 riportato dal fornitore Z.AI. La questione dell'identità è chiusa: il 26 agosto Z.AI ha rilasciato Ox Alpha come modello a pesi aperti con il nome GLM-5.3-Flash — licenza MIT, 320B parametri totali con 18B attivi — confermando il sub-nome su cui le analisi forensi di tokenizer e video-encoder avevano convergito. Architettura, numero di parametri e prezzi sono ora pubblicati dall'azienda; ciò che rimane dichiarato dal fornitore piuttosto che verificato in modo indipendente è la suite di benchmark e l'affermazione di Z.AI secondo cui il servizio della settimana anonima è stato eseguito su circa 100.000 chip AI domestici cinesi a un costo per token paragonabile all'hardware NVIDIA mainstream — un'affermazione aziendale che molte testate hanno ora ripetuto, non un dato sottoposto a revisione. L'ipotesi iniziale di Gemini — generata dalla capacità di 100T token/giorno e incoraggiata da post criptici dei ricercatori di Google DeepMind — era sbagliata, e il rilascio l'ha risolta. Il giudizio di qualità attribuito all'analista teortaxesTex — e la sua suggestione che un Ox Alpha ulteriormente addestrato potrebbe essere il cavallo di battaglia per un GLM 5.5 più forte — è una valutazione personale dell'analista tratta da un post social, non una misurazione indipendente né una dichiarazione di Zhipu. La demo di animazione in loop descritta di seguito è anch'essa un report della community — un post di uno sviluppatore su X, ripreso nei forum di sviluppatori cinesi — non una dichiarazione di capacità del fornitore, e l'operatore non ha annunciato alcuna funzionalità del genere.

Cosa sappiamo — e cosa non sappiamo

La versione veloce:

• L'operatore descrive Ox Alpha come "un modello all'avanguardia costruito per una codifica efficiente, lavoro agentico sostenuto e uso produttivo nel mondo reale" — un modello di ragionamento pensato per l'ingegneria del software a lungo orizzonte e per flussi di lavoro che combinano testo e contesto visivo.

• Dispone di una finestra di contesto di 1.048.576 token (1M), un limite di output di 131.072 token e accetta input di testo, immagini e video — la prima delle release anonime a pubblicizzare l'input video, una capacità che la release GLM-5.3-Flash conferma come nativa e non come un'aggiunta posticcia.

• È stato gratuito per una settimana: $0 per milione di token in ingresso e in uscita, con l'operatore che dichiarava "limiti di velocità generosi, utilizzo quasi illimitato" e 100 bilioni di token al giorno di capacità di servizio — capacità che la rivelazione avrebbe poi detto essere stata fornita su circa 100.000 chip cinesi domestici.

• Confermato: il 26 agosto Z.AI ha rilasciato Ox Alpha come modello open-weight con il nome GLM-5.3-Flash — licenza MIT, 320B di parametri totali con 18B attivi — l'esatto sotto-nome, il tokenizer, il video-encoder e l'analisi forense dei codici di errore, oltre ai mercati di previsione, su cui erano converguti. L'analista indipendente teortaxesTex lo valuta approssimativamente al livello di GLM-5.3, vision a parte, e suggerisce che un Ox Alpha ulteriormente addestrato potrebbe essere il motore dietro un GLM 5.5 molto più forte.

• La lettura flash-multimodale ora ha una demo alle spalle: alla richiesta di generare un'animazione in loop di un pellicano in bicicletta che apre un telefono sul quale viene riprodotta la stessa animazione, Ox Alpha ha risposto con un'animazione in loop auto-contenuta in un singolo file HTML/SVG — una demo della community, non una dichiarazione del fornitore.

• I dati di attività iniziali sulla piattaforma mostrano già traffico di produzione reale, tra cui un agente di codifica di Nous Research e l'editor Zed.

• L'azienda ora l'ha rilasciato — il 26 agosto Z.AI ha pubblicato Ox Alpha come GLM-5.3-Flash a pesi aperti sotto licenza MIT, ponendo fine in un colpo solo alle domande su identità, specifiche e prezzo: 320B parametri totali con 18B attivi, nativamente multimodale, con un prezzo di listino Z.AI di $0,15 in entrata / $0,50 in uscita per milione di token e una promozione di lancio del 50% dichiarata valida solo fino al 9 settembre — una data ormai passata da otto giorni, con la tariffa scontata ancora quella applicata. Z.AI ha inoltre rivelato che il servizio della settimana anonima a 100T token al giorno girava su circa 100.000 chip cinesi domestici, un primato per quella scala. Ciò che la rivelazione non includeva è un benchmark indipendente — il punteggio del modello è riportato dal fornitore — quindi il numero indipendente più rappresentativo resta la prova completa DeepSWE di Ben Davis su 113 task a circa il 63%, alla pari con GPT-5.6 Sol mid.

Cos'è Ox Alpha

La scheda della piattaforma descrive Ox Alpha come "un modello di ragionamento progettato per la programmazione, il lavoro agentico continuativo e i carichi di lavoro in produzione — ingegneria del software su lunghi orizzonti temporali, ragionamento complesso e flussi di lavoro che combinano testo e contesto visivo." Si tratta di un posizionamento specifico: è costruito per cicli agentici di lunga durata e per il codice, non per la chat generale. Il contesto da 1M è l'indizio rivelatore — è spazio sufficiente per una sessione agentica di più ore o per un repository di grandi dimensioni — e il limite di output di 131K consente generazioni singole molto lunghe. Supporta il tool calling, il function calling e l'output JSON strutturato, che è il resto della checklist agentica.

A single-column scoreboard for Ox Alpha listing: context window 1M (1,048,576) tokens, max output 131,072 tokens, input text/image/video, independent benchmarks none yet, price free for one week, throughput 56 tokens/s (P50, platform-measured), with a footer reading 'Operator + platform-reported; no independent scores yet', and the OrcaRouter logo in the bottom-right corner.

L'ingresso video è l'elemento più distintivo della scheda tecnica. Nessuno dei precedenti modelli anonimi lo pubblicizzava, e un modello in grado di accettare fotogrammi video oltre a testo e immagini è pensato per una classe di carico di lavoro diversa rispetto ai rilasci ottimizzati per la chat che lo hanno preceduto. È anche, come l'analisi forense avrebbe poi dimostrato, uno dei segnali di identità più forti che un modello possa portare con sé. Tutto questo — la descrizione, le specifiche, i dati sulla velocità — proveniva dall'operatore e dalla scheda della piattaforma. Il rilascio di GLM-5.3-Flash ha confermato le specifiche principali (320B-A18B, multimodale nativo); i dati su velocità e capacità restano dichiarazioni del fornitore.

La storia multimodale ha ottenuto una demo concreta questa settimana. Lo sviluppatore Chetaslua — le cui sonde lato server fanno parte della traccia di fingerprinting — ha pubblicato un test in cui ha chiesto a Ox Alpha di creare un loop di un pellicano che va in bicicletta e apre un telefono che riproduce la stessa animazione: un loop autoreferenziale dentro il loop. Il suo report mostra il modello che produce un'animazione HTML/SVG in un unico file — un pellicano con zampe a due segmenti che pedala davvero, velocità delle ruote sincronizzata con la velocità al suolo, sfondo parallasse e il momento culminante del telefono nel loop. I forum di sviluppatori cinesi hanno eseguito separatamente i propri prompt sul pellicano in bicicletta e discusso il risultato, quindi la demo non è una singola affermazione non verificabile. Poiché l'output è codice, è coerente con la specifica della piattaforma di solo output testuale: comprensione multimodale e generazione creativa di codice che lavorano insieme, non sintesi video nativa. La conclusione di Chetaslua — che questo è il frutto della multimodalità e che con essa arriverà un modello open-source capace — è una sua previsione personale, non una dichiarazione del fornitore; l'operatore non ha annunciato nulla.

L'offerta gratuita per una settimana

La promozione era aggressiva. Gratuita per la settimana in cui è stata attiva, con "limiti di velocità generosi, utilizzo quasi illimitato" e una presunta capacità dichiarata di 100 trilioni di token al giorno, con la nota dell'operatore che invitava gli utenti a "vedere cosa si può fare." Presa alla lettera, 100T token al giorno collocherebbero questo operatore tra i più grandi fornitori di inferenza in assoluto — l'affermazione sembra meno una specifica tecnica e più una sfida da stress-test, il che si inserisce nel modello noto: i rilasci anonimi sono il modo in cui un laboratorio ottiene traffico reale su scala frontier senza mettere il proprio nome sulla porta. La lettura confermata ha reso l'affermazione sulla scala concreta, non solo più facile da giustificare: Z.AI ha rivelato che il servizio da 100T token/giorno girava su circa 100.000 chip AI domestici cinesi — la prima volta che un rilascio di classe frontier è stato servito a quella scala senza hardware NVIDIA. Questa rivelazione resta comunque un'affermazione dell'azienda, ora ripetuta da più testate ma non verificata in modo indipendente, e porta con sé una seconda, più sfumata asserzione del fornitore: Z.AI sostiene che il costo per token sul cluster domestico sia paragonabile a quello delle GPU NVIDIA mainstream.

Il rovescio della medaglia di "gratis per una settimana" era che il prezzo successivo rimaneva sconosciuto — la rivelazione ha risposto a questo. Il prezzo di listino pubblicato da Z.AI per GLM-5.3-Flash è di $0,15 per milione di token in input, $0,50 per milione di token in output e $0,03 per milione di token in input in cache. Una promozione di lancio con il 50% di sconto era stata annunciata come valida fino al 9 settembre 2026, riducendo la tariffa a $0,075 / $0,25. Otto giorni dopo quella data, la tariffa scontata è ancora quella applicata: riletta il 17 settembre 2026, la pagina del modello z-ai/glm-5.3-flash indica l'input a $0,075, l'output a $0,25 e le letture da cache a $0,0173 per milione di token, senza alcuna etichetta promozionale. Rispetto ai $1,40 / $4,40 di listino di GLM-5.3, si tratta di circa un ventesimo. La conseguenza pratica è che la data di fine del 9 settembre è obsoleta anziché vincolante — uno sviluppatore che pianifica il budget su $0,15 / $0,50 lo sta pianificando su una cifra che nessuno paga attualmente. Ciò che le pagine dei prezzi non chiariscono è il perché. La lista dei modelli di Z.AI stessa riporta ancora $0,15 / $0,50 per GLM-5.3-Flash, quindi se la promozione sia stata prorogata, resa permanente o semplicemente lasciata attiva non è qualcosa che possiamo documentare; la tariffa scontata è il fatto osservato a questa data, e la causa resta aperta.

Il primo benchmark completo — e si colloca alla pari con GPT-5.6 Sol mid.

Ox Alpha non ha ancora una voce nei tracker indipendenti come Artificial Analysis o LMArena — la parola "frontier" è dell'operatore stesso, e i dati benchmark che Z.AI ha pubblicato con il rilascio di GLM-5.3-Flash (DeepSWE v1.1 63.4, AutomationBench 48.8, un Artificial Analysis Intelligence Index di 57) sono dichiarati dal fornitore, non punteggi indipendenti. Quello che è cambiato dal lancio è che i numeri misurati dalla community stanno iniziando a circolare — e il quadro si è ristretto. Su Kingbench, le prime esecuzioni collocano Ox Alpha a 87.5, appena sotto il 91.25 di GLM-5.3. Su DeepSWE, il ricercatore indipendente Ben Davis ha prima eseguito un sottoinsieme di 10 attività e riportato un Pass@1 dell'80%, davanti a Claude Fable 5 (65%), GLM-5.3 e Grok 4.6 (62%), e GPT-5.6 Sol (52%). Da allora ha completato un'esecuzione completa sull'intero set DeepSWE di 113 attività, e il risultato corretto è circa il 63% — più o meno in linea con GPT-5.6 Sol mid. Il sottoinsieme all'80% era il numero che attirava l'attenzione, ma dieci attività sono meno del 9% del benchmark; lo stesso Davis ha indicato il dato dell'intero set come quello che "ha molto più senso". Questi sono dati misurati dalla community, non un benchmark del fornitore e non un punteggio ufficiale di leaderboard — ma l'esecuzione completa è il numero più rappresentativo che chiunque abbia ottenuto dal modello, e ora si allinea strettamente con il punteggio DeepSWE v1.1 di 63.4 dichiarato da Z.AI — un utile controllo incrociato, anche se il numero dell'azienda è un'affermazione più che una misurazione.

Un confronto conta più ora di quanto non facesse al lancio. DeepSeek V4 Pro 0813 — la build GA del modello di punta di DeepSeek, rilasciata il 13 agosto — riporta un DeepSWE di 62,7 sulla propria scheda di benchmark, contro il 12,8 del precedente DeepSeek V4 Pro Preview. Entrambe le cifre sono dichiarate dal fornitore e, al momento della stesura, non sono state riprodotte da un laboratorio indipendente. Se letto insieme al ~63% del run community full-set di GLM-5.3-Flash e al 63,4 di Z.AI su DeepSWE v1.1, il 62,7 di DeepSeek colloca le due più note dichiarazioni cinesi sugli agenti di coding nella stessa fascia di punteggi, poco sopra i 60. Il divario di dieci punti che sembrava il biglietto da visita di Ox Alpha è stato misurato contro DeepSeek V4 Flash 0731, il modello piccolo più economico; contro il modello di punta di DeepSeek, GLM-5.3-Flash si attesta alla pari, non dieci punti avanti.

L'altra lezione riguarda il numero stesso. L'analista teortaxesTex — che tiene traccia di queste stime dalla settimana anonima — osserva che anche il primo rapporto su Ox Alpha dava un 80% DeepSWE: si trattava del vistoso sottoinsieme di 10 task di Davis, e il risultato finale sull'intero set di 113 task era del 63%. Con il 62.7 ufficiale di DeepSeek V4 Pro 0813 nella stessa fascia, la sua osservazione è che nulla si è ancora avvicinato a un 80% legittimamente riprodotto — la cifra dell'80% continua a comparire all'inizio della vita pubblica di un modello e continua ad assestarsi sui 60 bassi una volta eseguito l'intero set. Questa è la sua lettura da analista, non una misurazione, ma è la lente giusta per il prossimo titolo DeepSWE, incluso qualsiasi riguardante GLM-5.3-Flash stesso.

A screenshot of the Artificial Analysis models leaderboard as of August 21, 2026, showing the Intelligence section led by Claude Opus 5 and Claude Fable 5, the largest context-window highlights, and the output-speed rankings — a frontier leaderboard Ox Alpha has no independent score on yet.

Esiste anche l'utilizzo. I dati di attività della piattaforma mostrano traffico di produzione reale già nelle prime ore — inclusi Hermes Agent, il progetto di coding agentico di Nous Research, e l'editor Zed. Entrambi sono esattamente i casi d'uso per cui il modello è pensato: «lavoro agentico sostenuto e coding». Non è un punteggio, ma è un segnale: sviluppatori con carichi di lavoro reali hanno deciso che valeva la pena collegare una scommessa anonima, gratuita e di livello frontier. Prima che il run completo di DeepSWE arrivasse, quella prima adozione era l'unica prova esistente; il dato del ~63% sull'intero set fornisce ora al modello un punto di riferimento per valutarla.

Le clausole in piccolo sulla conservazione dei dati

L'annuncio della settimana gratuita vanta la "zero data retention". La scheda del modello sulla piattaforma racconta una storia più sfumata: prompt e completamenti vengono conservati dal fornitore ma non utilizzati per l'addestramento, secondo i termini del modello stealth della piattaforma. La differenza conta se stai per incollare codice proprietario in una finestra da 1 milione di token posseduta da un fornitore rimasto anonimo finché Z.AI non si è fatta avanti il 26 agosto. Tratta la "zero data retention" come marketing finché Z.AI non pubblica termini che lo dicano espressamente — e instrada qualsiasi cosa tu non voglia che venga registrata attraverso un modello separato e attribuibile.

Il playbook del modello anonimo

Ox Alpha è la quinta uscita anonima in sei mesi, e le precedenti quattro si sono risolte allo stesso modo — un debutto anonimo, un'esplosione di traffico gratuito, poi un'azienda che si fa avanti:

• Pony Alpha (febbraio 2026) — confermato da Zhipu AI circa cinque giorni dopo il lancio come GLM-5, il suo fiore all'occhiello MoE da 744 miliardi di parametri.

• Hunter Alpha (11 marzo) — un modello gratuito con mille miliardi di parametri e un contesto di 1M, diventato la storia speculativa della primavera, ampiamente ritenuto DeepSeek V4; rivelatosi come MiMo-V2-Pro di Xiaomi, con il compagno Healer Alpha identificato come MiMo-V2-Omni.

• Elephant Alpha (aprile) — un modello di testo gratuito incentrato sull'efficienza che Ant Group ha rivendicato come Lingxi Ling-2.6-flash circa due settimane dopo la sua comparsa.

• Owl Alpha (fine aprile) — un modello incentrato sugli agenti con chiamata nativa degli strumenti e un contesto di ~1M che Meituan ha confermato come LongCat-2.0 il 30 giugno, il primo modello da mille miliardi di parametri addestrato e servito interamente su chip cinesi domestici.

• Ox Alpha (20 agosto) — rivelato il 26 agosto come GLM-5.3-Flash, un modello open-weight da 320B-A18B con licenza MIT; identità, licenza e specifiche erano tutte ufficiali lo stesso giorno in cui è caduta la maschera.

A two-column scorecard titled 'The anonymous models — and their reveals', listing Pony Alpha revealed as GLM-5 by Zhipu AI, Hunter Alpha as MiMo-V2-Pro by Xiaomi, Elephant Alpha as Lingxi Ling-2.6-flash by Ant Group, Owl Alpha as LongCat-2.0 by Meituan, and Ox Alpha marked '??? — unclaimed', with a footer noting reveals per each lab's public announcement and Ox Alpha unclaimed as of August 21, 2026, and the OrcaRouter logo in the bottom-right corner.

Perché lanciare un buon modello dietro una maschera? La lettura standard, che il ciclo Hunter Alpha ha reso concreta, è che l'anonimato rimuove il bias del brand dalle valutazioni, e l'uso gratuito raccoglie via crowdsourcing dati di valutazione del mondo reale su scala di frontiera mentre tutti discutono su chi sia il proprietario. Come ha detto un'analisi del pattern: "la mancanza di un brand è il marketing." Il vantaggio extra è la velocità: un modello anonimo può raggiungere un pubblico globale di sviluppatori in poche ore senza un evento di lancio, e il mistero stesso diventa la distribuzione.

Chi è Ox Alpha?

Fino al rilascio del 26 agosto, nessuna azienda ne aveva rivendicato la paternità e Zhipu AI non aveva detto nulla — ma la situazione delle prove concrete è cambiata entro 48 ore dal debutto del modello, e le analisi forensi che seguono spiegano perché la rivelazione — come GLM-5.3-Flash — sia arrivata con così poca sorpresa. Il dato sulla capacità ha inizialmente giocato contro le analisi: 100 trilioni di token al giorno sembravano la firma di un laboratorio di prim'ordine su silicio NVIDIA, e la teoria che Ox Alpha fosse un nuovo Gemini — incoraggiata da post criptici dei ricercatori di Google DeepMind — aveva un reale slancio fino a quando l'evidenza del tokenizer, e poi il rilascio della stessa Z.AI, non l'hanno chiusa. Il segnale più forte è il tokenizer. Uno strumento di fingerprinting creato dalla comunità, modelprint, ha eseguito nove sonde infrastrutturali contro Ox Alpha e ha scoperto che corrispondeva a GLM-5.3 di Z.ai su sei, con tutti e quattro i conteggi tokenizzatori normalizzati corrispondenti alla famiglia GLM, mentre il miglior candidato non-GLM otteneva due su quattro. Il ricercatore indipendente Ben Davis ha riportato che i conteggi dei token di Ox Alpha corrispondevano esattamente a GLM-5.3 su 25 prompt di test, con una sola differenza costante di +75 token che ha attribuito a un wrapper nascosto. La corrispondenza del tokenizer è il segnale di identità più difficile da falsificare — un modello non può cambiare il modo in cui segmenta il testo senza un riaddestramento.

Il percorso video è la seconda firma. Il consumo di token video di Ox Alpha corrispondeva esattamente a quello di GLM-5V-Turbo in quattro campioni controllati — le stesse meccaniche di campionamento dei fotogrammi, di scalatura della durata e di risoluzione — mentre MiMo v2.5, Qwen 3.8 Max e GLM-4.6V divergevano tutti. Questo è un forte indizio: la gestione video è radicata nel modello, non un componente aggiuntivo. Il resto dello stack di impronte digitali concorda con la stessa lettura: Ox Alpha rifiuta l'input audio come fa GLM-5V, condivide il caratteristico codice di errore "1301" di GLM, emette uno stile di output simile (circa 1,3 emoji ogni 1.000 caratteri), presenta la stessa configurazione ristretta di parametri e API che appariva nella scheda GLM-5.3 della piattaforma due giorni prima del lancio di Ox Alpha, e ha un limite di conoscenza vicino al novembre 2025.

L'identificazione ha un precedente nel playbook di Zhipu: Pony Alpha, la release anonima di febbraio, si è rivelata essere GLM-5, rivendicata circa cinque giorni dopo il lancio. L'interpretazione degli analisti che circolava questa settimana — che Ox Alpha sia GLM-5.3, presumibilmente il modello Flash — è stata ripresa da Pliny the Liberator, che ha detto che il suo agente aveva confermato "Ox-alpha è di Zai, famiglia GLM-5.X". L'analista indipendente teortaxesTex fa la stessa valutazione sulla qualità e aggiunge un'osservazione sui tempi: stima Ox Alpha all'incirca al livello di GLM-5.3, visione a parte, e trova che il turnaround sia l'aspetto più sorprendente — comprimere il GLM-5.3 solo testo e distribuirlo con una visione funzionante entro pochi giorni dal lancio del 14 agosto. Questa è la valutazione di un singolo analista, non un punteggio indipendente, e sostiene che dovrebbe far riflettere sulla narrazione della "Cina che rilascia modelli appena sfornati". Il suo ultimo post sovrappone a quella lettura un'ipotesi sulla roadmap: il ciclo di aggiornamento di GLM-5 potrebbe essere breve; Ox Alpha è abbastanza vicino a GLM-5.3 che usarlo come subagente ha poco senso — "basta eseguire ox @4" è la sua abbreviazione per eseguire il modello direttamente; e un Ox Alpha ulteriormente addestrato avrebbe molto senso come cavallo da lavoro, nelle sue parole una "bestia da soma", per un GLM 5.5 molto più forte. Questa è la speculazione di un analista su una roadmap, non una dichiarazione di Zhipu. La questione del sotto-nome, al contrario, è risolta: il 26 agosto Z.AI ha rilasciato Ox Alpha come GLM-5.3-Flash. La complicazione che una volta teneva l'etichetta Flash sul lato "presunto" — GLM-5.3 lanciato il 14 agosto come modello solo testo, mentre Ox Alpha pubblicizza input video — è esattamente ciò che la release ha risolto: GLM-5.3-Flash è un modello distinto, nativamente multimodale, non lo stesso modello solo testo. Teorie alternative — il team MiMo di Xiaomi, DeepSeek — sono state avanzate e in gran parte scartate sulla base delle prove del tokenizer e dei video, e la release chiude definitivamente la questione della famiglia. L'argomento di Davis per interessarsi all'etichetta Flash si è rivelato essere quello pratico: poiché Ox Alpha è davvero GLM-5.3-Flash che opera a un livello medio di GPT-5.6 Sol, ora può essere eseguito localmente — i pesi sono su Hugging Face, e SGLang, vLLM e TokenSpeed lo servono — il che trasforma un modello di coding frontier di fascia media in una spesa hardware una tantum invece che in un costo per token per chiunque sia disposto a ospitarlo.

La cornice geopolitica è quella degli analisti, non quella dell'evidenza: «Questo esercita una pressione ancora più immensa sui Frontier Labs statunitensi, e il divario con la Cina si sta riducendo». Questa è un'interpretazione di ciò che un modello libero di livello Zhipu, eseguito su scala di frontiera, significa per l'ordine competitivo — e la divulgazione dei dettagli hardware le offre un vantaggio che gli analisti non avevano. Servire 100 trilioni di token al giorno su circa 100.000 chip nazionali è la prima dimostrazione su larga scala che uno stack cinese senza silicio NVIDIA possa sostenere il traffico di inferenza di frontiera — lo scenario contro cui l'amministratore delegato di NVIDIA, Jensen Huang, aveva messo in guardia nel podcast Dwarkesh questa primavera, quando sosteneva che i controlli sulle esportazioni avrebbero accelerato lo stack cinese indipendente da NVIDIA e che un modello di frontiera che girasse al meglio su hardware nazionale cinese sarebbe stato un «esito orribile» per gli Stati Uniti. La cifra sulla parità dei costi di Z.AI è ancora una dichiarazione del fornitore, ma l'evento in sé è reale. Quella stessa sera ha reso concreto il punto anche sul fronte dei modelli: mentre Z.AI rilasciava GLM-5.3-Flash, Alibaba ha pubblicato Qwen3.8-Flash-Next, la sua anteprima a pesi aperti dell'architettura Qwen4. Due rilasci cinesi a pesi aperti di classe frontier in una sola notte sono la forma concreta di ciò che gli osservatori hanno definito «una grande giornata per l'open source cinese».

Dovresti svilupparlo questa settimana?

La settimana gratuita è finita, ma il test resta economico: la tariffa effettivamente applicata il 17 settembre è di $0,075 in / $0,25 out per milione di token, non il prezzo di listino di $0,15 / $0,50 — la promozione di lancio al 50% che era stata annunciata in scadenza il 9 settembre è ancora in vigore otto giorni dopo. Se svolgi lavoro agentico su orizzonti lunghi, scrivi codice su contesti lunghi o gestisci pipeline ad alto contenuto video, è esattamente l'intersezione in cui si posiziona Ox Alpha — e con i pesi aperti puoi eseguire il test sul tuo hardware invece che dipendere dal beneplacito di una piattaforma anonima. Due avvertenze. Primo, l'etichetta "frontier" resta un'affermazione: il punteggio di GLM-5.3-Flash è dichiarato dal fornitore, e l'unico dato indipendente solido — il run DeepSWE di Davis al ~63% — è forte ma molto lontano dall'80% virale del primo sottoinsieme di 10 task. Secondo, il prezzo di $0 aveva una finestra temporale, e la rivelazione ha prezzato ciò che viene dopo — economico per la capacità, ma non più gratuito. Ciò che il rilascio a pesi aperti elimina è la dipendenza: i file sono fuori, quindi il modello può essere self-hosted invece che noleggiato. Questa è la forma di un test, non di una dipendenza.

Il modo sicuro in produzione per eseguire un test del genere è una catena di fallback: il modello sperimentale risponde quando è in salute, e la richiesta passa a un modello collaudato nel momento in cui si blocca, va in errore o scompare. È a questo che serve un livello di routing. La rivelazione rende banale la scelta del fallback: Ox Alpha è GLM-5.3-Flash, e il modello stesso è attivo su OrcaRouter con il suo vero nome a 0,075 $ in / 0,25 $ out per milione di token, con letture dalla cache a 0,0173 $ — la tariffa di lancio con il 50% di sconto che era stata dichiarata valida fino al 9 settembre e che, al 17 settembre, è ancora il prezzo sulla pagina invece della cifra di listino di 0,15 $ / 0,50 $. Viene passato attraverso con markup 0%, una sola API per oltre 200 modelli, con failover automatico così che un picco di traffico nella settimana di lancio non diventi un tuo disservizio. Metti alla prova il nuovo modello in prima linea con un fallback collaudato dietro di esso nella catena; quando un prezzo cambia, il numero che vedi su OrcaRouter è il numero che paghi, lo stesso giorno. Oppure salta del tutto l'API — i pesi sono aperti, quindi anche l'auto-hosting di GLM-5.3-Flash dietro la stessa catena è sul tavolo.

Cosa guardare

Sei cose racconteranno il resto della storia. Il benchmark indipendente: il punteggio di GLM-5.3-Flash è dichiarato dal fornitore, l'esecuzione DeepSWE di Davis al ~63% è l'unico dato indipendente solido finora, il 62,7 ufficiale di DeepSeek V4 Pro 0813 ora si colloca nella stessa fascia, e una voce su Artificial Analysis o LMArena — o un confronto diretto indipendente — sarebbe il controllo definitivo per stabilire se "frontier" è un fatto o uno slogan. La traiettoria dei prezzi: alla domanda sul regime stabile, le prove finora disponibili danno una risposta — la promozione del 50% era dichiarata in scadenza il 9 settembre, eppure il 17 settembre la tariffa scontata di $0,075 / $0,25 è ancora quella applicata, quindi è la cifra promozionale, non il prezzo di listino di $0,15 / $0,50, il numero su cui fare il budget; ciò che resta irrisolto è la causa, dato che il prezzo di listino di Z.AI stessa non si è mosso. L'affermazione sull'hardware: Z.AI dice che la settimana anonima è stata eseguita su circa 100.000 chip nazionali a parità di costo con NVIDIA — il primo test pubblico su larga scala è se l'affermazione regge a un esame indipendente, e se lo stack nazionale diventa lo standard predefinito per la linea GLM. Il calcolo dell'adozione: se il traffico da primato sulla piattaforma che Ox Alpha ha attirato sotto maschera si traduce in distribuzioni self-hosted e API ora che ha un nome, una licenza e un prezzo. Il seguito: se GLM-5.3-Flash fa di Ox Alpha un trampolino di lancio — l'indizio di teortaxesTex è che una versione ulteriormente addestrata diventa il cavallo di battaglia di un GLM 5.5 molto più forte, il che renderebbe questa release la base del prossimo GLM. E la reazione: con Qwen3.8-Flash-Next arrivato la stessa notte e una rivelazione sui chip nazionali alle spalle, la pressione è sui laboratori di frontiera statunitensi — e sul dibattito sui controlli alle esportazioni — perché rispondano; state a vedere se un rapido inseguimento, una mossa sui prezzi o una risposta politica arriva dall'altra parte del divario.

Il verdetto onesto: Ox Alpha è stato un esperimento insolitamente economico in entrambe le direzioni. La piattaforma ha testato se un modello anonimo di classe frontier a $0 potesse conquistare traffico di produzione reale in una settimana — ci è riuscito, in modo abbastanza convincente che Z.AI non solo si è fatta avanti il sesto giorno, ma ha rilasciato i pesi come modello aperto la stessa notte. Ora puoi testare se il modello merita un posto nel tuo stack, senza il rischio dell'anonimato: GLM-5.3-Flash è un modello con un nome, con licenza MIT, che puoi ospitare autonomamente a un prezzo pubblicato, e anche la domanda sull'hardware ha ricevuto una risposta — Z.AI afferma che il serving da 100T token/giorno girava su circa 100.000 chip cinesi domestici, dichiarato dall'azienda ma ormai ampiamente riportato. Quello che resta da scoprire è se "frontier" sopravvive a una misurazione indipendente, se l'affermazione di Z.AI sulla parità di costo dei chip domestici regge su larga scala, perché la promo di lancio al 50% è ancora il prezzo applicato otto giorni dopo la data di fine dichiarata del 9 settembre, e se la rivelazione presenta GLM-5.3-Flash come il cavallo di battaglia per un GLM 5.5 più forte, come suggerisce teortaxesTex. Esegui l'esperimento, ma eseguilo con un fallback sotto.

Confrontati in questo articolo4

Rilevato da questo articolo · Benchmark: Artificial Analysis · aggiornato ogni giorno