
GPT-6 Luna vs GLM-5.3: il modello open-weight che non puoi ancora scaricare
- OrcaNUOVOOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 per 1M di token
- orcaNUOVOOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 per 1M di token
- deepseekNUOVODeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligenza
- openaiOpenAI: GPT-6 Astra2026-09-0453Intelligenza77Codice
- googleGoogle: Gemini 3.8 Flash2026-09-0241Intelligenza76Codice
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Intelligenza76Codice
- anthropicAnthropic: Claude Fable 5.12026-09-0153Intelligenza82Codice
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1M di token
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligenza72Codice
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 per 1M di token
- z-aiZ.ai: GLM 5.32026-08-1845Intelligenza75Codice
- obsidianQwen3.8 27B2026-08-1534Intelligenza68Codice
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Intelligenza69Codice
- grokSpaceXAI: Grok 4.62026-08-1244Intelligenza77Codice
- metaMeta: Muse Spark 1.22026-08-0540Intelligenza72Codice
- qwenQwen: Qwen3.8 Max2026-08-0345Intelligenza76Codice
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3134Intelligenza69Codice
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 per 1M di token
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
GLM-5.3 è il modello migliore. Ottiene 45 sull'Artificial Analysis Intelligence Index al massimo sforzo, contro il GPT-6 Luna che ne ottiene 37, eguaglia Mythos 5 su alcune valutazioni di cybersicurezza secondo Z.ai ed è il modello open-weights leader in diverse classifiche composite. Inoltre, al momento, è un'API che noleggi anziché un modello che possiedi: Z.ai ha ritardato il rilascio dei pesi di circa due settimane per preoccupazioni legate alla cybersicurezza, e il download che dovrebbe rappresentare il punto centrale di un flagship open-weights non è ancora disponibile.
Quel ritardo è la storia di questa sfida, e cambia l’aritmetica in un modo che le tabelle dei prezzi non colgono. GPT-6 Luna è arrivato il 22 settembre 2026 a $0,10 per milione di token di input e $0,50 per milione di output, generalmente disponibile, senza vincoli. GLM-5.3 è arrivato il 18 agosto 2026 a $1,40 e $4,40 — quattordici volte la tariffa di input di Luna e quasi nove volte la sua tariffa di output — con i suoi pesi non rilasciati. Quindi il confronto non è tra aperto e chiuso. È un modello chiuso che puoi chiamare oggi a un decimo del costo contro un modello aperto che puoi solo chiamare oggi, prezzato come se stessi comprando la cosa che non puoi ancora avere.
Due modelli, a un mese di distanza, due accordi molto diversi
GPT-6 Luna è il modello di fascia piccola della generazione GPT-6 di OpenAI, distribuito insieme a GPT-6 Sol a $2,00/$10,00 e al di sotto del modello di punta GPT-6 Astra a $10,00/$50,00. Dispone di una finestra di contesto di 1.050.000 token, un limite di output di 128.000 token, input testuale e immagini e una scala di ragionamento che va da none a low, medium, high, xhigh e max — con medium come valore predefinito. OpenAI lo definisce il modello più efficiente della famiglia per attività mirate e ad alto volume, e il listino prezzi lo conferma: l'input in cache a $0,01 per milione è un decimo di una tariffa non in cache già bassa.
GLM-5.3 è l'attuale modello di punta di Z.ai per l'ingegneria del software complessa e il lavoro agentico a lungo termine, rilasciato il 18 agosto 2026. È text-in, text-out, dispone di una finestra di contesto di 1M token con un limite di output di 128.000 token, e il ragionamento è sempre attivo: non esiste una modalità senza ragionamento. Z.ai descrive un miglioramento di circa il 50% nell'esperienza di programmazione rispetto a GLM-5.2 e lo posiziona per la programmazione su scala repository e l'ingegneria autonoma a più fasi. I pesi, quando arriveranno, saranno la funzionalità di punta; oggi è l'API a essere attiva.
Cosa dicono effettivamente le due schede tariffarie
Una riga per dimensione, entrambi i lati su ciascuna:
• Input per 1 milione — GPT-6 Luna $0.10 vs GLM-5.3 $1.40
• Output per 1M — GPT-6 Luna 0,50 $ vs GLM-5.3 4,40 $
• Input in cache — GPT-6 Luna $0,01 per 1M contro GLM-5.3 $0,26 per 1M, uno sconto dell'81% sulla propria tariffa di input
• AA Intelligence Index — GPT-6 Luna 37 al massimo sforzo vs GLM-5.3 45 al massimo sforzo
• Punteggio con sforzo predefinito — GPT-6 Luna 29 con il suo default medio rispetto al ragionamento sempre attivo di GLM-5.3, misurato al massimo
• Token di output nell'esecuzione dell'indice — GPT-6 Luna 150M vs GLM-5.3 210M, rispetto a una mediana della classifica di 140M
• Costo per eseguire l'indice — GPT-6 Luna $122,39 vs GLM-5.3 $2.503,48
• Costo per attività di indicizzazione — GPT-6 Luna circa $0,07 contro GLM-5.3 circa $0,68
• Contesto e output — GPT-6 Luna 1.050.000 in / 128.000 out vs GLM-5.3 1M in / 128.000 out
• Clausola per contesto lungo — GPT-6 Luna: input e cache 2x, output 1.5x oltre 272K di input, richiesta intera rispetto a GLM-5.3; nessuna clausola equivalente sulla scheda pubblicata
• Interruttore di disattivazione del ragionamento — GPT-6 Luna da none a max vs GLM-5.3 sempre attivo, nessuna modalità senza ragionamento
• Pesi — GPT-6 Luna chiuso, solo API vs GLM-5.3 aperto per impegno, rilascio posticipato

La tassa di verbosità è il numero che decide questo
Il divario di otto punti nell'indice è reale e il divario di prezzo è maggiore, e nessuno dei due è il dato che conta di più. Quello che conta è il numero di token di output per attività completata, perché è lì che un vantaggio di capacità di otto punti o si ripaga da solo o no.
Il run dell'indice di Artificial Analysis è il confronto controllato più pulito disponibile: la stessa suite, lo stesso harness, eseguiti su entrambi i modelli. GLM-5.3 ha generato 210 milioni di token in output per completarlo. GPT-6 Luna ne ha generati 150 milioni. Rispetto a una mediana della classifica di 140 milioni, entrambi sono prolissi: GLM-5.3 di una metà in più rispetto alla mediana, GPT-6 Luna di circa un decimo. Ma la direzione di questa differenza si amplifica a sfavore del modello di Z.ai sul prezzo: emette il 40% di token in più e fa pagare 8,8 volte tanto per ciascuno.
Mettendo insieme i due, il costo per ogni attività di indice completata risulta di circa $0,68 per GLM-5.3 contro circa $0,07 per GPT-6 Luna — un divario di circa dieci volte, più ampio del rapporto grezzo del listino prezzi, perché il modello più costoso è anche quello più prolisso. Questa è la forma onesta di questo abbinamento. GLM-5.3 ti dà otto punti indice per dieci volte il costo per lavoro completato, e se sia un buon acquisto dipende interamente dal fatto che il tuo carico di lavoro sia uno in cui otto punti fanno la differenza tra funzionare e non funzionare.
Per molto traffico di produzione non lo è. Per un agente di coding che lavora su un repo al limite di ciò che il modello è in grado di fare, spesso lo è, e nessun vantaggio di prezzo colma un divario di capacità su un compito che fallisce.
Perché i pesi aperti cambiano la risposta, e perché il ritardo la riporta indietro
L'argomento standard a favore di un modello di punta open-weights è che il prezzo per token è temporaneo. Si affitta finché il proprio volume non giustifica l'acquisto, poi si scarica il modello e il costo marginale di un token diventa l'elettricità. Secondo quest'argomento, il prezzo di $1,40/$4,40 di GLM-5.3 non è davvero quattordici volte $0,10 di GPT-6 Luna — è un prezzo ponte sulla via verso lo zero, e la tariffa più economica del modello chiuso è un noleggio senza via d'uscita.
Quell'argomentazione è corretta, ed è attualmente sospesa. Z.ai ha trattenuto i pesi per circa due settimane a causa di riscontri sulla sicurezza informatica, il che significa che la rampa di uscita che giustifica il sovrapprezzo non esiste ancora. Finché non esisterà, GLM-5.3 è un'API a consumo con un costo per attività dieci volte superiore a quello di un modello che è quattro punti indice dietro di esso nella classifica generale e un punto dietro in quella di programmazione — e l'acquirente sta pagando prezzi da pesi aperti per un accesso a pesi chiusi.
C'è un punto di secondo ordine che vale la pena menzionare. Il ritardo non è uno scandalo; è un fornitore che prende sul serio un risultato relativo alle capacità, e un modello che individua bene le vulnerabilità è esattamente il tipo di modello che un laboratorio dovrebbe stare attento a rilasciare come file scaricabile. Ma significa che la data di rilascio dei pesi è ora la data più importante in assoluto in questo confronto, e non è pubblicata. Un team che sceglie tra questi due modelli su un orizzonte di dodici mesi sta scegliendo tra un modello i cui termini possono cambiare il mese prossimo e un modello i cui termini non possono — e solo uno dei due è prezzato di conseguenza.
La superficie di migrazione è piccola
Entrambi i modelli espongono una superficie di chat completions compatibile con OpenAI, entrambi hanno una finestra di contesto di classe 1M ed entrambi limitano l'output a 128.000 token, quindi un port tra di essi è più vicino a una modifica di configurazione che a una riscrittura. Le differenze che si faranno davvero sentire sono comportamentali, non strutturali.
La clausola sul contesto lungo di GPT-6 Luna è quella costosa: le richieste superiori a 272.000 token di input vengono fatturate al doppio delle tariffe di input e cache e a 1,5 volte la tariffa di output per l'intera richiesta, quindi una chiamata da 300.000 token costa il doppio di quanto costerebbe lo stesso lavoro suddiviso in due. La scheda pubblicata di GLM-5.3 non contiene alcuna clausola equivalente, il che, su richieste singole davvero grandi, riduce considerevolmente il divario di prezzo e può invertirlo su un lavoro con output intensivo.
La configurazione del ragionamento funziona in senso opposto. GLM-5.3 ragiona sempre attivo e non offre alcun modo per disattivarlo, il che è un vincolo rigido per qualsiasi cosa sensibile alla latenza — un classificatore o un router non può usarlo. GPT-6 Luna offre none, low, medium, high, xhigh e max, e il valore predefinito è medium, dove totalizza 29 invece di 37. Quel singolo parametro è la differenza tra l'essere otto punti indice dietro il modello di Z.ai e sedici punti dietro, e un team che migra senza impostarlo esplicitamente sta usando la seconda configurazione credendo di aver comprato la prima.
GLM-5.3 è su OrcaRouter al prezzo di listino di Z.ai, con una tariffazione pass-through che fa ricadere una variazione delle tariffe del fornitore dalla nostra parte lo stesso giorno, invece di aspettare che un rivenditore rinegozi — cosa che conta più del solito per un modello il cui numero di riferimento dovrebbe cambiare quando arrivano i pesi. GPT-6 Luna non è nel nostro catalogo al momento in cui scriviamo e si raggiunge tramite l'API di OpenAI. Un team che li usa entrambi, che è la configurazione razionale in questo caso dato quanto i due siano diversi ai margini, usa una chiave per GLM-5.3 insieme a qualunque cosa già utilizzi per OpenAI, e sposta il traffico tra un classificatore da cinque centesimi e un agente di coding su scala repository cambiando una route invece di un deployment.

La chiamata
Usa GPT-6 Luna per tutto ciò che viene consumato dai programmi e ad alto volume. Classificazione, estrazione, instradamento, riepilogo in massa, il ciclo interno di un agente. A 0,10 $/0,50 $, con l'input in cache a un centesimo e Batch a metà della tariffa standard, costa un ordine di grandezza in meno per attività completata rispetto a GLM-5.3 e il divario di otto punti nell'indice non sarà visibile nella tua valutazione. Imposta esplicitamente il parametro effort e mantieni le tue chiamate lunghe sotto i 272.000 token.
Prendi GLM-5.3 quando il compito è quello difficile e la risposta conta più della fattura. Ingegneria del software su scala di repository, lavoro autonomo a più passaggi, qualsiasi cosa in cui otto punti di indice siano la differenza tra il completamento e il fallimento di un compito. La verbosità è una vera tassa e il costo del compito dieci volte superiore è reale, ma un modello che finisce è più economico di un modello che deve essere riprovato.
E tenete d'occhio i pesi. Il giorno in cui Z.ai pubblica il download di GLM-5.3 è il giorno in cui il fatto centrale di questo confronto cambia, ed è l'unica data su questa pagina che non è ancora segnata sul calendario.

Confrontati in questo articolo2
Rilevato da questo articolo · Benchmark: Artificial Analysis · aggiornato ogni giorno
