
Qwen 4 Max vs GLM-5.3: pesi aperti, licenze personalizzate e il tier che viene effettivamente distribuito
- OrcaNUOVOOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 per 1M di token
- orcaNUOVOOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 per 1M di token
- deepseekNUOVODeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligenza
- openaiOpenAI: GPT-6 Astra2026-09-0453Intelligenza77Codice
- googleGoogle: Gemini 3.8 Flash2026-09-0241Intelligenza76Codice
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Intelligenza76Codice
- anthropicAnthropic: Claude Fable 5.12026-09-0153Intelligenza82Codice
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1M di token
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligenza72Codice
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 per 1M di token
- z-aiZ.ai: GLM 5.32026-08-1845Intelligenza75Codice
- obsidianQwen3.8 27B2026-08-1534Intelligenza68Codice
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Intelligenza69Codice
- grokSpaceXAI: Grok 4.62026-08-1244Intelligenza77Codice
- metaMeta: Muse Spark 1.22026-08-0540Intelligenza72Codice
- qwenQwen: Qwen3.8 Max2026-08-0345Intelligenza76Codice
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3134Intelligenza69Codice
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 per 1M di token
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
Qwen 4 Max è stato presentato in anteprima alla conferenza Yunqi di Hangzhou il 22 settembre 2026 come modello di punta di una linea di quattro modelli che comprende anche Qwen 4 Flash, Qwen 4 Plus e un livello Qwen 4 27B open-weight. GLM-5.3 di Z.ai è in catalogo dal 18 agosto 2026, solo testo, con una finestra di contesto di 1 milione di token e un tetto di output di 128.000 token, a 1,26 $ per milione di token in input e 3,96 $ per milione di token in output sul nostro catalogo, rispetto alle tariffe di listino di 1,40 $ e 4,40 $ pubblicate da Z.ai. Entrambi i laboratori provengono dalla tradizione open-weight ed entrambi ora vendono modelli di fascia frontier tramite API ospitate, quindi la solita contrapposizione chiuso-aperto qui non si applica. L'asse che invece si applica è quello che nessuno mette in una tabella comparativa: ciò che la licenza permette effettivamente, e quale fascia in ciascuna famiglia sia quella con cui ti è consentito fare qualcosa di interessante.
Due laboratori, due risposte alla stessa domanda
Alibaba e Z.ai sono i due editori di pesi aperti più coerenti tra i laboratori adiacenti alla frontiera, e sono giunti a posizioni diverse su quanta parte di quell'apertura sopravviva nel livello di punta.
La generazione Qwen 3.8 di Alibaba ha pubblicato i pesi del suo modello più grande — Qwen3.8-2.4T-A95B, in BF16 e FP8 — il 12 agosto 2026. Li ha pubblicati con una licenza Qwen personalizzata, non Apache 2.0. Questa distinzione è il punto centrale: i pesi esistono, il che significa che il fine-tuning, la quantizzazione e il self-hosting sono possibili in un modo che non lo saranno mai per un modello chiuso, ma i termini sono quelli di Alibaba e non sono l'opzione predefinita permissiva che la frase «pesi aperti» tende a implicare.
La linea GLM di Z.ai proviene da un laboratorio con una tradizione di pesi aperti, e il modello di punta non fa più eccezione. I pesi di GLM-5.3 sono stati pubblicati il 28 agosto 2026 — il modello di punta da 743 miliardi di parametri, in 141 shard safetensors — con una licenza personalizzata che Z.ai ha scritto appositamente, anziché sotto MIT. I termini sono all'incirca una concessione MIT con una condizione di revisione di sicurezza allegata per le aziende che offrono modelli come servizio al di sopra di una soglia di fatturato elevata. Si noti cosa significa per la famiglia: GLM-5.2 e GLM-5.3-Flash hanno licenza MIT, mentre il modello di punta no.
Come elencato, GLM-5.3 è un modello solo testo con una finestra di contesto pubblicata, un limite massimo di output pubblicato e uso degli strumenti, modalità JSON e ragionamento documentati.
Metti i due fianco a fianco e il contrasto pratico è questo:
• Pesi flagship — Qwen 3.8 flagship pubblicato con una licenza Qwen personalizzata rispetto ai pesi di GLM-5.3 pubblicati il 28 agosto 2026 con una licenza Z.ai personalizzata
• Prezzo di input — Qwen3.8-Max $2,00 per 1 mln di token rispetto a GLM-5.3 $1,26 per 1 mln di token sul nostro catalogo, $1,40 nel listino di Z.ai stesso
• Prezzo di output — Qwen3.8-Max $6,00 per 1M token rispetto a GLM-5.3 $3,96 per 1M token sul nostro catalogo, $4,40 sul listino proprio di Z.ai
• Contesto — Qwen3.8-Max 1M token contro GLM-5.3 1M token
• Limite di output — Qwen3.8-Max 128K token rispetto a GLM-5.3 128K token
• Modalità — Qwen3.8-Max input di testo, immagini e video rispetto a GLM-5.3 solo testo, documentato come tale
• Etichette di capacità — Qwen3.8-Max visione, strumenti, JSON e ragionamento rispetto a GLM-5.3 strumenti, JSON e ragionamento
• Qwen 4 Max — annunciato il 22 settembre 2026, nessun prezzo, nessun contesto, nessun peso, nessuna data rispetto a GLM-5.3 che è stato rilasciato e serve traffico
La riga multimodale è ciò che paga il divario di prezzo. Il modello di punta di Qwen accetta input di immagini e video e fa pagare $2,00 in input e $6,00 in output; GLM-5.3 accetta testo e fa pagare $1,26 e $3,96. Se il tuo carico di lavoro è testuale, stai pagando un sovrapprezzo per il codificatore visivo che non invochi mai, e questa è la ragione più concreta per cui uno specialista solo testo batte un modello di punta multimodale sul costo per il lavoro testuale.

È il livello 27B a deciderlo.
Qwen 4 Max è la notizia principale e il tier 27B è la vera storia. Ogni generazione di Qwen ha distribuito il suo piccolo tier open con termini che permettono alle persone di fare cose, e le prove a valle sono inequivocabili: entro pochi giorni dall'arrivo dei pesi di Qwen 3.8 27B, l'ecosistema aveva prodotto conversioni MLX, quantizzazioni NVFP4 e fine-tune senza censura, nessuno dei quali richiedeva il permesso di qualcuno. Questo è ciò che offre un rilascio permissivo di un modello piccolo, ed è una forma di distribuzione che nessuna API ospitata può eguagliare.
Il livello di punta è un'altra questione. Un modello da 2,4 trilioni di parametri pubblicato con una licenza personalizzata è aperto nel senso che i byte sono scaricabili e chiuso nel senso che ciò che puoi farne è definito dall'editore. Entrambe le cose sono vere allo stesso tempo, e l'annuncio di Qwen 4 non ha cambiato né l'una né l'altra. Se il livello Qwen 4 27B segue il modello dei suoi predecessori, sarà la versione che conta per il maggior numero di persone, ed è anche la versione con la data di consegna più prevedibile, perché i piccoli livelli aperti sono la cosa più facile da completare sulla roadmap.
Il che riporta il confronto a qualcosa di utilizzabile. GLM-5.3 è un modello ospitato a un prezzo pubblicato con un set di capacità documentato, ed è disponibile ora. Qwen 4 Max è un nome di fascia. Se vuoi che l'argomentazione sull'apertura sia concreta anziché filosofica, il modello da aspettare è il 27B, non il Max.
Il livello di routing è il punto in cui la questione della licenza smette di contare.
Esiste una versione di questa decisione che evita del tutto la questione della licenza, e vale la pena ammettere onestamente che si tratta di un'opzione reale, non di un compromesso. Se la tua esigenza è chiamare un modello anziché possederne uno, la licenza sui pesi è irrilevante e i termini che contano sono il prezzo, la latenza e il comportamento in caso di errore.
OrcaRouter include GLM-5.3 come z-ai/glm-5.3 a $1,26 in input e $3,96 in output per milione di token — al di sotto degli $1,40 e $4,40 pubblicati da Z.ai, con la pagina del modello che mostra quei prezzi di listino accanto alla tariffa a cui fatturiamo, e senza alcun ricarico aggiunto su ciò che paghiamo al provider. Lo stesso endpoint compatibile con OpenAI include la famiglia Qwen 3.8, Qwen3.8-Max, Qwen3.8-Flash e Qwen3.8-27B, insieme a quasi 200 altri modelli, con failover automatico quando un percorso del provider si degrada e un DSL di routing che ti permette di esprimere esplicitamente la politica di sostituzione anziché modificare una stringa di modello nel codice dell'applicazione. Quando un fornitore cambia la sua tariffa, la modifica arriva sulla tua chiave lo stesso giorno, perché non esiste uno strato di margine dietro cui possa rimanere bloccata.
Ciò che OrcaRouter non include è Qwen 4 Max o qualsiasi livello di Qwen 4. Il catalogo non ha alcuna voce per la famiglia, che è lo stato corretto per un modello annunciato su un palco e non ancora distribuito. Qwen 4 Max sarà raggiungibile, quando lo sarà, tramite l'API del fornitore stesso e diverse piattaforme di terze parti. Fino ad allora, il modello Qwen di questo confronto che puoi effettivamente chiamare è Qwen3.8-Max, e si trova sullo stesso catalogo di GLM-5.3 — il che rende la versione live di questo raffronto una decisione di politica di routing anziché di approvvigionamento.

Che cosa decide realmente la questione della licenza
GLM-5.3 è più economico su entrambi i fronti, la sua finestra di contesto e il suo tetto di output corrispondono a quelli del modello di punta di Qwen, i suoi limiti di modalità sono documentati anziché lasciati all'inferenza, e oggi sta già servendo traffico. Qwen 4 Max ha uno slot a una conferenza e un nome di fascia, e l'unica parte della roadmap di Qwen 4 con una consegna prevedibile è la fascia 27B.
La decisione che sopravvive al lancio non è quale modello sia migliore. È se hai bisogno di possedere la cosa. Se hai bisogno di ospitarlo in autonomia, metterlo a punto o modificarlo, i pesi di punta di entrambi i laboratori arrivano con termini che dovresti leggere prima di costruirci un business, e la piccola fascia aperta è dove le opzioni permissive sono vissute storicamente. Se hai bisogno di chiamare un modello, GLM-5.3 è oggi la risposta più economica per il lavoro sui testi, Qwen3.8-Max è la risposta se hai bisogno di input immagini o video, ed entrambi sono a un endpoint e una fattura di distanza. Torna sulla questione dei modelli di punta quando Alibaba pubblicherà una model card, e leggi la licenza prima della tabella dei benchmark.

Confrontati in questo articolo2
Rilevato da questo articolo · Benchmark: Artificial Analysis · aggiornato ogni giorno
