
Ox Alpha: La scheda tecnica completa per il modello stealth ora disponibile come GLM-5.3-Flash
- typesafeNUOVOTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 per 1M di token · 316 tok/s
- openaiNUOVOOpenAI: GPT-6 Luna2026-09-2237Intelligenza
- openaiNUOVOOpenAI: GPT-6 Sol2026-09-2248Intelligenza
- anthropicNUOVOAnthropic: Claude Opus 5.52026-09-2258Intelligenza
- grokNUOVOGrok 4.72026-09-2146Intelligenza
- OrcaNUOVOOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 per 1M di token · 196 tok/s
- orcaNUOVOOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 per 1M di token · 1327 tok/s
- deepseekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligenza
- openaiOpenAI: GPT-6 Astra2026-09-0453Intelligenza77Codice
- googleGoogle: Gemini 3.8 Flash2026-09-0241Intelligenza76Codice
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Intelligenza76Codice
- anthropicAnthropic: Claude Fable 5.12026-09-0153Intelligenza82Codice
- tencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 per 1M di token
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1M di token · 111 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligenza72Codice
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 per 1M di token · 221 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Intelligenza75Codice
- obsidianQwen3.8 27B2026-08-1534Intelligenza68Codice
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Intelligenza69Codice
- grokSpaceXAI: Grok 4.62026-08-1244Intelligenza77Codice
Ox Alpha è il nome anonimo sotto cui GLM-5.3-Flashè stato presentato in anteprima; è stato rivelato il 26 agosto 2026, e non è un modello che si possa chiamare oggi. La scheda di anteprima che portava il nome Ox Alpha non lo rende più disponibile; il modello sottostante ha una pagina del fornitore, pesi con licenza MIT, un listino prezzi pubblicato e una superficie API documentata, tutto di Z.ai. Questa pagina è il riferimento per quel modello — l'involucro, le modalità, il listino prezzi, la superficie degli endpoint, ogni cifra di benchmark pubblicata con la revisione o l'harness a essa associati e, poiché l'alias restituisce ancora un risultato di ricerca scarno e confuso, una dichiarazione chiara di ciò che non è documentato da nessuna parte. Tutto quanto segue è stato letto il 2026-09-28 dalla documentazione del modello e dalla pagina dei prezzi di Z.ai, dalla model card di Z.ai su Hugging Face, da Artificial Analysis e dal nostro catalogo; le cifre pubblicate dal fornitore e le cifre misurate da una parte indipendente sono etichettate separatamente, e nulla qui è dedotto da una somiglianza.
A cosa si riferisce oggi il nome Ox Alpha
L'alias è stato ritirato, e il fornitore è quello che lo ha ritirato. La documentazione di Z.ai per GLM-5.3-Flash afferma che il modello è stato testato anonimamente con il nome ox-alpha prima del rilascio, per raccogliere feedback degli utenti, e che la versione anonima è diventata il modello più popolare di quella settimana. Gli ancoraggi databili sono brevi e specifici: l'inserzione stealth mostrava Ox Alpha come rilasciato il 20 agosto 2026, e la rivelazione è avvenuta il 26 agosto — la stessa data riportata dalla pagina di documentazione di Z.ai e la stessa data di rilascio che il nostro catalogo registra per z-ai/glm-5.3-flash.
Da ciò discendono due cose, ed entrambe contano per un lettore che ha cercato quel nome.
• L'alias non è una route. Il nostro catalogo restituisce "model not found" per una ricerca stealth/ox-alpha, consultato il 2026-09-28. Non c'è nulla da chiamare con quel nome, perché il prodotto del fornitore porta il nome del fornitore.
• Non esiste nemmeno alcun repository di pesi di proprietà del fornitore sotto lo pseudonimo. Cercando ox-alpha su Hugging Face si ottengono caricamenti della community creati durante la finestra stealth alla fine di agosto 2026, più un repository contenente solo la model card del 27 settembre 2026 che non include pesi e rimanda al rilascio ufficiale di Z.ai. Il nome di un repository è un'etichetta scelta da chi lo carica; non è la documentazione di nulla. L'organizzazione di Z.ai stessa pubblica il modello come zai-org/GLM-5.3-Flash, con il repository creato il 2026-08-25 in UTC.
La questione del provider che ha dominato la settimana anonima è chiusa, e si è chiusa nel modo più ordinario: un laboratorio si è fatto avanti e ha messo il proprio nome sul modello. Ciò che resta è una specifica, ed è di questo che si occupa questa pagina. La storia della scoperta — il fingerprinting che ha preceduto la rivelazione, la discendenza di modelli anonimi a cui appartiene e la divulgazione dell'hardware di serving che l'ha accompagnata — si trova in il nostro articolo precedente sull'indagine su Ox Alpha, e questa pagina non riapre nulla di tutto ciò.
L'inviluppo, così come documentato dal fornitore

Queste sono cifre riportate da Z.ai, lette dalla pagina di documentazione ufficiale del fornitore il 2026-09-28, e tre delle quattro dimensioni complessive sono corroborate in modo indipendente — la scheda del modello di Artificial Analysis riporta gli stessi 320B totali, 18B attivi, contesto da 1.000.000 di token e licenza MIT, e la nostra scheda di catalogo riporta i limiti di contesto e di output.
• Finestra di contesto — 1.000.000 di token (documentazione Z.ai; Artificial Analysis; la nostra scheda di catalogo, che riporta 1.000.000)
• Output massimo — 128K token (documentazione Z.ai); la nostra scheda registra 128.000
• Input — testo, immagine, video e file (documentazione Z.ai, consultata il 2026-09-28); la nostra scheda elenca testo, immagine e video, e non dichiara l'input di file
• Output — solo testo, su ogni fonte
• Parametri — 320B totali con 18B attivati per token (documentazione Z.ai e scheda del modello; Artificial Analysis registra indipendentemente 320B e 18B)
Licenza — MIT, con pesi pubblicati su Hugging Face (scheda modello del fornitore; Artificial Analysis classifica il modello come open weights con licenza permissiva)
• Architettura — un ibrido di attenzione sparsa e lineare, che Z.ai descrive come il primo modello di frontiera open source a combinare le due, riducendo il calcolo dell'attenzione di 3,01× e la KV cache di 4,44× rispetto a GLM-5.3, oltre a un passaggio IndexPool che comprime quattro vettori chiave dell'indicizzatore in uno in contesti lunghi, e Manifold-Constrained Hyper-Connections per l'efficienza di scalabilità. Tutto dichiarato dal fornitore; non esiste un audit architetturale indipendente da citare.
• Pre-training — un corpus multimodale da 30 trilioni di token (secondo Z.ai). Il fornitore non pubblica alcuna cifra totale di calcolo per l'addestramento né una ripartizione dei parametri per livello oltre alla cifra di riferimento 320B/18B.
Una rivendicazione d'insieme si è ridimensionata dal lancio, e la documentazione attuale è quella da citare. La divulgazione sull'hardware di serving che circolava in agosto indicava la capacità della settimana anonima in circa 100.000 chip cinesi di produzione nazionale. La documentazione di Z.ai come si legge oggi afferma che il modello è stato servito "su decine di migliaia di acceleratori sviluppati a livello nazionale", con un miglioramento end-to-end del serving di 3× rispetto alla baseline dello stesso fornitore sullo stesso hardware e un costo per token che il fornitore descrive come comparabile a quello delle GPU NVIDIA mainstream. Decine di migliaia è ciò che dice ora la pagina; la cifra maggiore è quella dell'epoca del lancio. Entrambe sono dichiarazioni dell'azienda, nessuna delle due è stata verificata in modo indipendente, e la direzione della revisione è al ribasso.
Il listino, e perché il numero erogato è quello che conta
La pagina dei prezzi di Z.ai riporta GLM-5.3-Flash a 0,15 $ per milione di token di input, 0,03 $ per milione di token di input in cache e 0,50 $ per milione di token di output, e il livello gemello FlashX a 0,37 / 0,075 / 1,25 $. Questo è il prezzo di listino del fornitore, letto dalla pagina del fornitore stesso il 28/09/2026.
La tariffa effettivamente applicata sulla nostra rotta oggi è inferiore, e questo è il punto pratico della sezione. Consultato il 2026-09-28, la scheda OrcaRouter per z-ai/glm-5.3-flash prezza l'input a $0.075 per milione di token, l'output a $0.25 per milione e le letture dalla cache a $0.0173 per milione. Si tratta della metà della tariffa di listino del fornitore, sullo stesso modello, nello stesso giorno — la cifra scontata anziché quella di copertina, senza alcuna etichetta promozionale sulla scheda. La nostra precedente trattazione di questo modello rilevava lo stesso scarto dopo la chiusura della finestra promozionale dichiarata; l'osservazione vale ancora oggi, e continuiamo a non riuscire a risalire alla ragione, perciò riportiamo il numero servito e lasciamo aperta la causa.
L'input in cache è il punto in cui le tre fonti divergono visibilmente, il che è un utile promemoria che un "$0.03" in una tabella non è necessariamente un prezzo che qualcuno paga. La pagina del fornitore dice $0.03 per milione di token di input in cache; la scheda del modello di Artificial Analysis riporta un prezzo in caso di cache hit di $0.026; la nostra route serve le letture dalla cache a $0.0173. Tutti e tre rilevati il 2026-09-28 o poco prima, tutti e tre riportati dal fornitore o dalla piattaforma. Citiamo la cifra di listino del fornitore come cifra di listino e la cifra servita come ciò che viene effettivamente addebitato a chi chiama.
Esegui il calcolo su un job rappresentativo di un agente — 100.000 token di input e 10.000 token di output, nessun cache hit:
• Al prezzo di listino del fornitore — 100.000 token × $0,15/1M = $0,015, più 10.000 × $0,50/1M = $0,005, quindi $0,020 per chiamata
• Alla tariffa a cui la nostra route serve oggi — $0.0075 più $0.0025, quindi $0.010 per chiamata, esattamente la metà
È proprio questo il motivo per cui conviene controllare il prezzo applicato anziché il prezzo di listino prima di dimensionare un workload: su un agente a lungo orizzonte che esegue migliaia di chiamate al giorno, la differenza tra quei due numeri è la differenza tra due budget. OrcaRouter riporta il prezzo di listino del provider con un ricarico dello 0%, ed è per questo che lo sconto attivato dal fornitore compare sulla nostra scheda tariffaria invece di essere assorbito da qualche parte nel mezzo.
Modalità e superficie degli endpoint
Il fornitore documenta un'unica forma di interfaccia e due codici modello: glm-5.3-flash e glm-5.3-flashx, entrambi serviti tramite l'API Chat Completion. Le immagini vengono inserite come blocco di contenuto con tipo image_url nell'array del contenuto del messaggio, accettando un URL — che il fornitore consiglia — oppure un data URL base64, e più blocchi immagine possono essere inviati in un singolo messaggio. Lo streaming è supportato e Z.ai consiglia di abilitare stream e tool_stream insieme per le richieste in streaming. La chiamata di strumenti, la cache del contesto e l'output JSON strutturato sono tutte funzionalità documentate; il thinking è supportato ma, come spiega la sezione successiva, non è opzionale.
FlashX è un livello di servizio separato dello stesso modello, non una capacità separata: Z.ai lo documenta a 200 token al secondo e dichiara che non è ancora disponibile sul GLM Coding Plan. Non è il livello che il nostro catalogo offre, e non è ciò che descrivono le cifre in questa pagina.
Sulla nostra route, la superficie dell'endpoint è più ristretta e vale la pena indicarla con esattezza. La scheda di z-ai/glm-5.3-flash espone POST /v1/chat/completions — solo chat completions, senza un secondo endpoint di protocollo — e accetta reasoning, reasoning_effort, include_reasoning, tools, tool_choice, response_format, stream, temperature, top_p, max_tokens e stop. I chip delle capacità sulla scheda sono vision, tools, JSON e reasoning. Il contesto è di 1.000.000 di token e l'output massimo di 128.000, in linea con la documentazione del fornitore.
Sforzo e riflessione: le impostazioni che determinano ogni numero dei benchmark
Questa è la parte della specifica che più cambia il modo in cui interpreti i punteggi, e il fornitore la documenta in modo preciso. GLM-5.3-Flash accetta un parametro reasoning_effort con tre livelli — low, high e max — e il valore predefinito è max se non ne passi nessuno, o se ne passi uno diverso da low o high. Il thinking non può essere disattivato: il fornitore dichiara che thinking.type supporta solo enabled. Il flag clear_thinking del template di chat è impostato su false per impostazione predefinita, e Z.ai consiglia di passarlo esplicitamente come true per gli scenari di chat. Le impostazioni di campionamento consigliate dal fornitore sono temperature 1 e top_p 0.95, e afferma senza mezzi termini che la riproduzione di benchmark e classifiche dovrebbe mantenere l'impostazione predefinita di max effort.
Leggi insieme questi due fatti e la conseguenza per chiunque confronti numeri è inevitabile: un punteggio citato senza un livello di effort non è una misurazione completa, perché le impostazioni low, high e max sono punti operativi diversi dello stesso modello, e quella predefinita è la più costosa delle tre. La nostra scheda espone reasoning e reasoning_effort tra i suoi parametri supportati, quindi l'impostazione è raggiungibile tramite la route, non solo tramite il fornitore.
La scheda benchmark, con la revisione allegata
Z.ai pubblica una tabella di benchmark per GLM-5.3-Flash, ed è interamente basata su dati dichiarati dal fornitore — il registro indipendente di Artificial Analysis non riproduce queste righe. Le cifre principali del fornitore per coding e agentic sono DeepSWE v1.1 a 63,4 contro il 46,2 di GLM-5.2, e AutomationBench v1.0.6 a 48,8 contro il 26,2 di GLM-5.2. Il resto del foglio, così come il nostro catalogo lo riporta con Z.ai come fonte dichiarata: Humanity's Last Exam with tools 55,3, Agents' Last Exam 26,3, NL2Repo 56,3, Chartography with tools 78, CharXiv reasoning with tools 89,4, e sul fronte vision MMVU 80,5, MVBench 77,8 e BabyVision 53,4.
Due righe di fornitori meritano che le loro note a piè di pagina siano riportate nella frase, perché sono quelle che un lettore è più propenso a citare senza di esse. La valutazione di coding interna di Z.ai, Z.ai Code Bench v1.0, colloca GLM-5.3-Flash a 29,0 con il massimo sforzo contro Claude Opus 4.8 a 29,5 — un quasi pareggio sull'harness dello stesso fornitore, eseguito su Claude Code 2.1.207, riportato dal fornitore. Non si tratta di un confronto indipendente né di un confronto a sforzo equiparato eseguito da una terza parte; è Z.ai che confronta il proprio modello con un concorrente sulla propria valutazione. E il fornitore cita un Artificial Analysis Intelligence Index di 57 a 0,045 $ per attività, indicando la revisione come v4.1.1.
L'ultimo dato va tenuto distinto da ciò che Artificial Analysis pubblica oggi, perché i due non si possono affiancare come se indicassero uno spostamento. La pagina di Artificial Analysis dedicata a GLM-5.3-Flash, consultata il 2026-09-28, riporta un Intelligence Index di 41.8 su Index v4.3.2, registrato a max effort. La v4.3.2 include dieci valutazioni — AA-Briefcase v1.1, GDPval-AA v2.1, AutomationBench-AA, Terminal-Bench 4.0, SciCode, Humanity's Last Exam, GDP.pdf, CritPt, AA-Omniscience e AA-LCR v1.1 — mentre la v4.1.1 no. Due revisioni dell'indice, due insiemi di compiti, due numeri. Nessuno dei due è sbagliato; non sono la stessa misurazione, e citare il 57 accanto al 41.8 come se il modello si fosse mosso sarebbe un errore in entrambe le direzioni.
Ciò che il registro indipendente corrobora è il perimetro delle specifiche, più che i punteggi: Artificial Analysis registra in modo indipendente 320B parametri totali, 18B attivati, una finestra di contesto di 1.000.000 di token, licenza MIT, pesi aperti e una data di rilascio del 26/08/2026, e riporta i prezzi del fornitore di 0,15 $ in input e 0,50 $ in output per milione di token, con un prezzo di 0,026 $ in caso di cache hit. Laddove il fornitore pubblica un punteggio e la parte indipendente no, lo diciamo; laddove la parte indipendente conferma una specifica, quella è la categoria di fatto più solida in questa pagina.
Qui non c'è alcun confronto diretto omogeneo, e dirlo è più utile che produrne uno. Nessuno ha pubblicato una prova di GLM-5.3-Flash contro Claude Opus 4.8, GPT-6 Sol o Grok 4.7 a uno sforzo dichiarato su un harness condiviso — il confronto di Z.ai è sul proprio banco di prova, a sforzo massimo, contro l'impostazione predefinita di un concorrente. Finché ciò non cambia, il confronto onesto tra questo modello e qualunque altro si basa su prezzo, envelope e superficie degli endpoint, che sono le tre cose in questa pagina che tutti possono leggere dagli stessi numeri.
Ciò che non è documentato, detto chiaramente
Una pagina di riferimento per un modello con una superficie informativa limitata è utile solo se è onesta riguardo alle lacune, e questa ne presenta diverse.
• Nessun knowledge cutoff del fornitore. La documentazione di Z.ai e la model card di Hugging Face non ne indicano alcuno, e il registro di Artificial Analysis lascia il campo nullo. Le stime provenienti dalla finestra stealth sono frutto del lavoro della comunità, non un dato del fornitore, e questa pagina non ne riporta alcuna come se lo fosse.
• Nessuna nota a piè di pagina relativa all'harness per la maggior parte della scheda del benchmark. La scheda del modello riporta invece note a piè di pagina per l'esecuzione con strumenti di HLE — temperatura 1,0, top_p 0,95, una lunghezza massima di generazione di 163.840 token, valutazione fino a un contesto di 300.000 token con una strategia di gestione del contesto e GPT-5.6 Luna a sforzo medio come modello giudice — e per NL2Repo e DeepSWE, che secondo il fornitore sono stati eseguiti con l'harness mini-swe-agent. Le righe rimanenti sono percentuali secche, senza alcun harness o sforzo associato.
• Nessuna spiegazione della differenza di prezzo per l'input memorizzato nella cache. Tre valori per la stessa quantità sullo stesso modello, e nessuna fonte indica perché differiscano.
• Nessun benchmark indipendente del periodo di servizio anonimo. La scheda stealth non c'è più; qualunque cosa misurasse non può essere misurata di nuovo, e nessuna terza parte ha pubblicato un'esecuzione contro l'alias mentre era attivo.
• Nessun confronto con terze parti a pari sforzo, per la ragione indicata sopra.
• Nessuna conferma da parte del fornitore del numero di chip dell'epoca del lancio. La documentazione parla di decine di migliaia di acceleratori nazionali; la cifra di 100.000 non compare nella pagina.
È ufficiale: ciò che il nostro catalogo offre, verificato oggi.

Il modello alla base di Ox Alpha è attivo nel nostro catalogo con il suo nome, verificato oggi anziché dato per scontato. Una lettura dell'API dei modelli di OrcaRouter per z-ai/glm-5.3-flash in data 28 settembre 2026 ha restituito la scheda completa: contesto da 1.000.000 di token, output massimo di 128.000, input testo, immagine e video con output testo, i chip di capacità vision, tools, JSON e reasoning, una data di rilascio 26 agosto 2026, non deprecato e non rimosso dall'elenco, al prezzo di $0,075 per milione di token di input, $0,25 per milione di token di output e $0,0173 per milione di token di input in cache, sul singolo endpoint POST /v1/chat/completions.
La nostra misurazione di sette giorni nel playground su quella scheda, per lo stesso periodo, riporta 61,8 token di output al secondo, un tempo p50 al primo token di 7,39 secondi e un tasso di errore dell'1,47%. Sono dati first-party relativi al nostro serving, non cifre dei fornitori né benchmark indipendenti, ed è per questo che sono gli unici dati di velocità presenti in questa pagina.
L'alias stesso non è presente nella route. Se sei arrivato qui dopo aver cercato Ox Alpha, il modello da chiamare è z-ai/glm-5.3-flash, e la forma della richiesta è quella descritta sopra. Si trova sulla stessa chiave di tutto il resto del catalogo — una sola API su oltre 200 modelli, il prezzo del fornitore passato senza alcun ricarico aggiuntivo, e failover automatico se un fornitore si blocca, così un modello che stai provando non deve per forza essere un modello da cui dipende il tuo percorso di produzione.

Una precisazione su cos'è questa pagina, dato che un lettore che arriva dal nome stesso del modello la merita. Questa è una pagina di riferimento per un modello già presente nel catalogo, non un resoconto di lancio: GLM-5.3-Flash è del 26 agosto 2026, e il suo posto qui si fonda sul fatto che il nome Ox Alpha continua a essere cercato senza una pagina dedicata su cui atterrare, non sulla freschezza dell'uscita. La data sopra serve a datare il modello, non come notizia. Ciò che cambierebbe questa pagina è una di quattro cose: un benchmark indipendente eseguito con uno sforzo di ragionamento dichiarato, un knowledge cutoff dichiarato dal fornitore, una variazione della tariffa applicata, o una decisione di Z.ai di dichiarare quale fosse effettivamente il numero di chip dell'epoca del lancio. Finché una di queste non arriva, la specifica sopra è tutto ciò che il fornitore documenta, e le lacune elencate nella sezione precedente sono parte della risposta tanto quanto lo sono i numeri.
Confrontati in questo articolo2
Rilevato da questo articolo · Benchmark: Artificial Analysis · aggiornato ogni giorno
