Una card del titolo principale per "Qwen 4 Max vs GLM-5.3" con il sottotitolo "Pesi aperti, licenze personalizzate e il livello che viene effettivamente distribuito", tre badge a pillola che recitano "$1,26 e $3,96", "solo testo vs multimodale" e "il 27B è quello da tenere d'occhio", una riga di piè di pagina che recita "Alibaba ha annunciato il 22 settembre 2026; GLM-5.3 elencato il 18 agosto 2026", e il logo OrcaRouter nell'angolo in basso a destra.
Engineering & Research

Qwen 4 Max vs GLM-5.3: pesi aperti, licenze personalizzate e il tier che viene effettivamente distribuito

Autore

Gideon Frost

Data di pubblicazione

Ultimi modelli · 20Vedi tutti i modelli
Benchmark: Artificial Analysis · aggiornato ogni giorno
Torna a tutti gli articoli

Qwen 4 Max è stato presentato in anteprima alla conferenza Yunqi di Hangzhou il 22 settembre 2026 come modello di punta di una linea di quattro modelli che comprende anche Qwen 4 Flash, Qwen 4 Plus e un livello Qwen 4 27B open-weight. GLM-5.3 di Z.ai è in catalogo dal 18 agosto 2026, solo testo, con una finestra di contesto di 1 milione di token e un tetto di output di 128.000 token, a 1,26 $ per milione di token in input e 3,96 $ per milione di token in output sul nostro catalogo, rispetto alle tariffe di listino di 1,40 $ e 4,40 $ pubblicate da Z.ai. Entrambi i laboratori provengono dalla tradizione open-weight ed entrambi ora vendono modelli di fascia frontier tramite API ospitate, quindi la solita contrapposizione chiuso-aperto qui non si applica. L'asse che invece si applica è quello che nessuno mette in una tabella comparativa: ciò che la licenza permette effettivamente, e quale fascia in ciascuna famiglia sia quella con cui ti è consentito fare qualcosa di interessante.

Due laboratori, due risposte alla stessa domanda

Alibaba e Z.ai sono i due editori di pesi aperti più coerenti tra i laboratori adiacenti alla frontiera, e sono giunti a posizioni diverse su quanta parte di quell'apertura sopravviva nel livello di punta.

La generazione Qwen 3.8 di Alibaba ha pubblicato i pesi del suo modello più grande — Qwen3.8-2.4T-A95B, in BF16 e FP8 — il 12 agosto 2026. Li ha pubblicati con una licenza Qwen personalizzata, non Apache 2.0. Questa distinzione è il punto centrale: i pesi esistono, il che significa che il fine-tuning, la quantizzazione e il self-hosting sono possibili in un modo che non lo saranno mai per un modello chiuso, ma i termini sono quelli di Alibaba e non sono l'opzione predefinita permissiva che la frase «pesi aperti» tende a implicare.

La linea GLM di Z.ai proviene da un laboratorio con una tradizione di pesi aperti, e il modello di punta non fa più eccezione. I pesi di GLM-5.3 sono stati pubblicati il 28 agosto 2026 — il modello di punta da 743 miliardi di parametri, in 141 shard safetensors — con una licenza personalizzata che Z.ai ha scritto appositamente, anziché sotto MIT. I termini sono all'incirca una concessione MIT con una condizione di revisione di sicurezza allegata per le aziende che offrono modelli come servizio al di sopra di una soglia di fatturato elevata. Si noti cosa significa per la famiglia: GLM-5.2 e GLM-5.3-Flash hanno licenza MIT, mentre il modello di punta no.

Come elencato, GLM-5.3 è un modello solo testo con una finestra di contesto pubblicata, un limite massimo di output pubblicato e uso degli strumenti, modalità JSON e ragionamento documentati.

Metti i due fianco a fianco e il contrasto pratico è questo:

• Pesi flagship — Qwen 3.8 flagship pubblicato con una licenza Qwen personalizzata rispetto ai pesi di GLM-5.3 pubblicati il 28 agosto 2026 con una licenza Z.ai personalizzata

• Prezzo di input — Qwen3.8-Max $2,00 per 1 mln di token rispetto a GLM-5.3 $1,26 per 1 mln di token sul nostro catalogo, $1,40 nel listino di Z.ai stesso

• Prezzo di output — Qwen3.8-Max $6,00 per 1M token rispetto a GLM-5.3 $3,96 per 1M token sul nostro catalogo, $4,40 sul listino proprio di Z.ai

• Contesto — Qwen3.8-Max 1M token contro GLM-5.3 1M token

• Limite di output — Qwen3.8-Max 128K token rispetto a GLM-5.3 128K token

• Modalità — Qwen3.8-Max input di testo, immagini e video rispetto a GLM-5.3 solo testo, documentato come tale

• Etichette di capacità — Qwen3.8-Max visione, strumenti, JSON e ragionamento rispetto a GLM-5.3 strumenti, JSON e ragionamento

• Qwen 4 Max — annunciato il 22 settembre 2026, nessun prezzo, nessun contesto, nessun peso, nessuna data rispetto a GLM-5.3 che è stato rilasciato e serve traffico

La riga multimodale è ciò che paga il divario di prezzo. Il modello di punta di Qwen accetta input di immagini e video e fa pagare $2,00 in input e $6,00 in output; GLM-5.3 accetta testo e fa pagare $1,26 e $3,96. Se il tuo carico di lavoro è testuale, stai pagando un sovrapprezzo per il codificatore visivo che non invochi mai, e questa è la ragione più concreta per cui uno specialista solo testo batte un modello di punta multimodale sul costo per il lavoro testuale.

A two-column scoreboard titled "Qwen 4 Max vs GLM-5.3 - the scoreboard". Left column Qwen 4 Max: Status Max announced, no date; Input price $2.00 per 1M tokens; Output price $6.00 per 1M tokens; Modality text, image, video in; Flagship weights custom Qwen licence; Output ceiling 128K tokens. Right column GLM-5.3: Status shipping since Aug 18 2026; Input price $1.26 per 1M tokens; Output price $3.96 per 1M tokens; Modality text-only; Flagship weights custom Z.ai licence, Aug 28 2026; Output ceiling 128K tokens. Footer reads "GLM-5.3 pricing from its catalogue listing; Qwen3.8-Max figures from its published model card, September 22 2026.", with the OrcaRouter logo bottom-right.

È il livello 27B a deciderlo.

Qwen 4 Max è la notizia principale e il tier 27B è la vera storia. Ogni generazione di Qwen ha distribuito il suo piccolo tier open con termini che permettono alle persone di fare cose, e le prove a valle sono inequivocabili: entro pochi giorni dall'arrivo dei pesi di Qwen 3.8 27B, l'ecosistema aveva prodotto conversioni MLX, quantizzazioni NVFP4 e fine-tune senza censura, nessuno dei quali richiedeva il permesso di qualcuno. Questo è ciò che offre un rilascio permissivo di un modello piccolo, ed è una forma di distribuzione che nessuna API ospitata può eguagliare.

Il livello di punta è un'altra questione. Un modello da 2,4 trilioni di parametri pubblicato con una licenza personalizzata è aperto nel senso che i byte sono scaricabili e chiuso nel senso che ciò che puoi farne è definito dall'editore. Entrambe le cose sono vere allo stesso tempo, e l'annuncio di Qwen 4 non ha cambiato né l'una né l'altra. Se il livello Qwen 4 27B segue il modello dei suoi predecessori, sarà la versione che conta per il maggior numero di persone, ed è anche la versione con la data di consegna più prevedibile, perché i piccoli livelli aperti sono la cosa più facile da completare sulla roadmap.

Il che riporta il confronto a qualcosa di utilizzabile. GLM-5.3 è un modello ospitato a un prezzo pubblicato con un set di capacità documentato, ed è disponibile ora. Qwen 4 Max è un nome di fascia. Se vuoi che l'argomentazione sull'apertura sia concreta anziché filosofica, il modello da aspettare è il 27B, non il Max.

Il livello di routing è il punto in cui la questione della licenza smette di contare.

Esiste una versione di questa decisione che evita del tutto la questione della licenza, e vale la pena ammettere onestamente che si tratta di un'opzione reale, non di un compromesso. Se la tua esigenza è chiamare un modello anziché possederne uno, la licenza sui pesi è irrilevante e i termini che contano sono il prezzo, la latenza e il comportamento in caso di errore.

OrcaRouter include GLM-5.3 come z-ai/glm-5.3 a $1,26 in input e $3,96 in output per milione di token — al di sotto degli $1,40 e $4,40 pubblicati da Z.ai, con la pagina del modello che mostra quei prezzi di listino accanto alla tariffa a cui fatturiamo, e senza alcun ricarico aggiunto su ciò che paghiamo al provider. Lo stesso endpoint compatibile con OpenAI include la famiglia Qwen 3.8, Qwen3.8-Max, Qwen3.8-Flash e Qwen3.8-27B, insieme a quasi 200 altri modelli, con failover automatico quando un percorso del provider si degrada e un DSL di routing che ti permette di esprimere esplicitamente la politica di sostituzione anziché modificare una stringa di modello nel codice dell'applicazione. Quando un fornitore cambia la sua tariffa, la modifica arriva sulla tua chiave lo stesso giorno, perché non esiste uno strato di margine dietro cui possa rimanere bloccata.

Ciò che OrcaRouter non include è Qwen 4 Max o qualsiasi livello di Qwen 4. Il catalogo non ha alcuna voce per la famiglia, che è lo stato corretto per un modello annunciato su un palco e non ancora distribuito. Qwen 4 Max sarà raggiungibile, quando lo sarà, tramite l'API del fornitore stesso e diverse piattaforme di terze parti. Fino ad allora, il modello Qwen di questo confronto che puoi effettivamente chiamare è Qwen3.8-Max, e si trova sullo stesso catalogo di GLM-5.3 — il che rende la versione live di questo raffronto una decisione di politica di routing anziché di approvvigionamento.

A screenshot of the OrcaRouter model page for GLM 5.3 (z-ai/glm-5.3, English UI), showing the 1M token context badge, the model ID z-ai/glm-5.3, a 128K maximum output, text input, the Tools, JSON and Reasoning tags, the listing date 2026-08-18 credited to Z.ai, a p50 time-to-first-token of 4.41s, the OpenAI-compatible code samples against api.orcarouter.ai/v1, and the opening of the model description calling GLM-5.3 Z.ai's latest flagship for complex software engineering and long-horizon agentic tasks.

Che cosa decide realmente la questione della licenza

GLM-5.3 è più economico su entrambi i fronti, la sua finestra di contesto e il suo tetto di output corrispondono a quelli del modello di punta di Qwen, i suoi limiti di modalità sono documentati anziché lasciati all'inferenza, e oggi sta già servendo traffico. Qwen 4 Max ha uno slot a una conferenza e un nome di fascia, e l'unica parte della roadmap di Qwen 4 con una consegna prevedibile è la fascia 27B.

La decisione che sopravvive al lancio non è quale modello sia migliore. È se hai bisogno di possedere la cosa. Se hai bisogno di ospitarlo in autonomia, metterlo a punto o modificarlo, i pesi di punta di entrambi i laboratori arrivano con termini che dovresti leggere prima di costruirci un business, e la piccola fascia aperta è dove le opzioni permissive sono vissute storicamente. Se hai bisogno di chiamare un modello, GLM-5.3 è oggi la risposta più economica per il lavoro sui testi, Qwen3.8-Max è la risposta se hai bisogno di input immagini o video, ed entrambi sono a un endpoint e una fattura di distanza. Torna sulla questione dei modelli di punta quando Alibaba pubblicherà una model card, e leggi la licenza prima della tabella dei benchmark.

A screenshot of the OrcaRouter model page for Qwen3.8 Max (qwen/qwen3.8-max, English UI), showing the 1M token context badge, the model ID qwen/qwen3.8-max, text plus image plus video input with text output, the Vision, Tools, JSON, Reasoning and Thinking capability tags, the listing date 2026-08-03, a p50 time-to-first-token of 3.29s, and the model description naming Qwen3.8-Max Alibaba's newest flagship and highest-capability tier to date.

Confrontati in questo articolo2

Rilevato da questo articolo · Benchmark: Artificial Analysis · aggiornato ogni giorno