
GPT-6 vs GLM 5.3: uno dei due lo puoi scaricare, e il divario di prezzo è più piccolo del divario nell'indice
- openaiNUOVOOpenAI: GPT-6.1 Sol2026-09-2952Intelligenza
- anthropicNUOVOAnthropic: Claude Sonnet 5.52026-09-2856Intelligenza
- typesafeNUOVOTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 per 1M di token · 128 tok/s
- OpenAIOpenAI: GPT-6 Luna2026-09-2238Intelligenza
- OpenAIOpenAI: GPT-6 Sol2026-09-2248Intelligenza
- AnthropicAnthropic: Claude Opus 5.52026-09-2258Intelligenza
- xAIGrok 4.72026-09-2146Intelligenza
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 per 1M di token · 60 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 per 1M di token · 320 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligenza
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Intelligenza77Codice
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Intelligenza76Codice
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Intelligenza76Codice
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Intelligenza82Codice
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 per 1M di token · 54 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1M di token · 356 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligenza72Codice
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 per 1M di token · 232 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Intelligenza75Codice
- obsidianQwen3.8 27B2026-08-1534Intelligenza68Codice
Il motivo per mettere GPT-6 contro GLM 5.3 non è la tabella dei benchmark. È che GLM 5.3 è l'unico modello in questa fascia di prezzo di cui puoi portarti a casa i pesi, mentre GPT-6 è una generazione chiusa i cui tre membri sono raggiungibili solo tramite API. Questa differenza decide più questioni di approvvigionamento di qualunque delta di indice, ed è anche il motivo per cui i due punteggi non sono direttamente comparabili — ed è la parte su cui sbagliano la maggior parte dei confronti pubblicati di questa coppia.
I due lati, precisamente
GLM 5.3 è il modello di punta di Z.ai, rilasciato il 18 agosto 2026, con i pesi pubblicati circa una settimana dopo. È un modello solo testo — nessun input di immagini — con una finestra di contesto di 1.000.000 di token e un tetto di output di 128.000 token, listato da Z.ai a 1,40 $ per milione di token in input e 4,40 $ per milione in output, con una tariffa di 0,234 $ per milione per l'input in cache. Viene servito con l'id del modello z-ai/glm-5.3.
GPT-6 è una generazione più che un modello. GPT-6 Astra, GPT-6 Sol e GPT-6 Luna sono tre id a tre fasce di prezzo, tutti rilasciati il 22 settembre 2026, tutti multimodali sul lato input (testo, immagine e file), tutti con una finestra di contesto vicina a 1.050.000 token e un tetto di output di 128.000 token. Non esiste openai/gpt-6 come endpoint. Quando qualcuno dice "GPT-6" in una conversazione sui prezzi, quasi sempre intende GPT-6 Sol, la fascia intermedia a $2,00 / $10,00 — quindi è il membro che questo confronto usa ovunque serva un singolo id.
• Pesi — GLM 5.3 aperto, scaricabile e self-hostable; GPT-6 chiuso, solo API
• Modalità di input — GLM 5.3 solo testo; tutti e tre i tier di GPT-6 accettano testo, immagini e file
• Prezzo di input — GLM 5.3 1,40 $ per milione vs GPT-6 Sol 2,00 $ per milione
• Prezzo di output — GLM 5.3 4,40 $ per milione vs GPT-6 Sol 10,00 $ per milione
• Input in cache — GLM 5.3 0,234 $ per milione vs GPT-6 Sol 0,20 $ per milione
• Contesto — GLM 5.3 1.000.000 di token vs GPT-6 Sol 1.050.000 di token
• Scaglione per richieste lunghe — GLM 5.3 non ne ha sulla sua scheda pubblicata; GPT-6 Sol ricalcola il prezzo dell'intera richiesta oltre 272.000 token di input a 4,00 $ / 15,00 $
• Licenza — GLM 5.3 è distribuito con la licenza open di Z.ai; GPT-6 non ha alcun file di licenza perché non c'è nulla da licenziare
Nota l'avvertenza sulla riga del prezzo, perché è reale e questo blog ci è già incappato: una pagina di modello di OrcaRouter non è sempre allineata al listino prezzi del fornitore stesso, e su GLM 5.3 nello specifico il nostro catalogo riporta $1.26 / $3.96 mentre la cifra pubblicata da Z.ai è $1.40 / $4.40. Dove i due non concordano, cita il numero del fornitore nel testo — che è ciò che fanno i punti elenco qui sopra — e leggi la cifra della pagina come valore proprio della pagina. Entrambi sono legittimi; semplicemente non sono lo stesso numero.
Perché il confronto degli indici necessita di un'etichetta di avvertenza
Ecco la trappola. Nell'Indice di Intelligenza di Artificial Analysis, GLM 5.3 ottiene 44,8 e GPT-6 Sol ottiene 47,6 — 2,8 punti di distanza. Sembra quasi un pareggio tra un modello chiuso e uno aperto a circa un quinto del prezzo di output, ed è la frase su cui si fermano la maggior parte dei confronti di questa coppia.
Non è una sottrazione valida. Artificial Analysis classifica i modelli open-weights solo rispetto ad altri modelli open-weights della stessa classe di dimensione, e i modelli proprietari all'interno di una fascia proprietaria usando un rapporto di prezzo input-output combinato di 3:1. Il 44,8 di GLM 5.3 è un punteggio open-weights. Il 47,6 di GPT-6 Sol è un punteggio della fascia proprietaria. Si collocano su scale diverse, e il divario tra loro non è una misura della capacità. La stessa avvertenza vale per le due cifre riportate nelle voci di catalogo di OrcaRouter, da cui provengono entrambi i numeri sopra indicati.
Quello che puoi confrontare lungo quella linea è la contabilità dei costi e le tariffe, e secondariamente le righe che sono la stessa valutazione eseguita allo stesso modo. Leggi su entrambe le pagine:
• AA Coding Index — GLM 5.3 74.8 vs GPT-6 Sol 60.0
• GPQA Diamond — GLM 5.3 91.7
• Humanity's Last Exam — GLM 5.3 42.3 vs GPT-6 Sol 47.9
• Terminal-Bench 2.1 — GLM 5.3 83.9
• Terminal-Bench 4.0 — GLM 5.3 41.9 vs GPT-6 Sol 43.9
• τ-bench banking — GLM 5.3 50.3
• SciCode — GLM 5.3 59.0 vs GPT-6 Sol 57.6
• Recall su contesto lungo — GLM 5.3 79.7 vs GPT-6 Sol 83.7
Leggila come una forma, più che come una differenza di punteggio: GLM 5.3 è forte nelle valutazioni agentiche e di coding — τ-bench banking e SciCode pendono entrambi dalla sua parte, e il suo Coding Index è molto al di sopra di quello di Sol — mentre GPT-6 Sol detiene le righe del richiamo su contesto lungo e di Humanity's Last Exam. Nessuna di queste due letture è un verdetto. Sono due insiemi diversi di punti di forza, misurati da una terza parte, su un modello che puoi scaricare e un modello che non puoi.
Quanto valgono davvero i pesi aperti, qui
Il motivo per cui preoccuparsi della licenza di GLM 5.3 non è l'ideologia. È che tre cose specifiche smettono di essere decisioni del fornitore una volta che i pesi sono tuoi.
La prima è la residenza. Un GLM 5.3 self-hosted viene eseguito dove lo si installa, e nessun accordo sul trattamento dei dati disciplina ciò che lascia la tua rete. GPT-6 non ha un'opzione equivalente: l'unico modo per richiamarlo è tramite un'API, e i dati finiscono in un luogo che non controlli. Per un carico di lavoro soggetto a regolamentazione, spesso è proprio questa la decisione che conta, ed è una decisione che l'indice non cattura mai.
Il secondo è la curva del prezzo. Un listino prezzi API è un numero del fornitore che il fornitore può modificare; le tariffe GPT-6 pubblicate sono dichiarate dal fornitore come permanenti anziché promozionali, ma questa è una dichiarazione di intenti, non un contratto. I pesi posseduti hanno un costo fisso che smette di scalare con i token, e il punto di intersezione è una funzione del tuo volume anziché della decisione di prezzo di chiunque. Ecco perché il listino $1.40 / $4.40 non è davvero il confronto — il confronto è $1.40 / $4.40 rispetto al tuo hardware ammortizzato sul tuo traffico.
Il terzo è la modalità di guasto. Un modello ospitato può essere deprecato, soggetto a limiti di frequenza o degradato da una modifica al servizio. GLM 5.3 è invocabile dal 18 agosto con un checkpoint pubblico alle spalle; se Z.ai cambia qualcosa con cui non sei d'accordo, il checkpoint rispetto al quale hai validato è ancora su disco.
Anche il costo di quella libertà è reale, e vale la pena dirlo chiaramente. GLM 5.3 è solo testo, quindi un carico di lavoro che immette screenshot o PDF nel modello non ha alcun percorso sul lato dei pesi aperti di questo confronto. Servire da soli contesti da 1.000.000 di token non è un esercizio da laptop. E il modello che scarichi è il modello di cui sei responsabile: valutazione, filtraggio di sicurezza, uptime e aggiornamenti diventano tutti tuoi, il che è un vero budget di ingegneria che il prezzo dell'API non include.
Dove GPT-6 merita il premium
Per contro, la tesi a favore del lato chiuso è più esile di quanto il suo prezzo suggerisca, ma non è priva di sostanza.
L'input multimodale è quello concreto. Tutti e tre i livelli di GPT-6 accettano immagini e file nativamente, mentre GLM 5.3 non accetta né gli uni né gli altri. Una pipeline che legge un grafico, uno screenshot o un documento scansionato e ne ragiona nella stessa chiamata non può essere costruita su GLM 5.3 così come pubblicato.
Il richiamo su contesti lunghi è il secondo. GPT-6 Sol supera GLM 5.3 su quella riga di quattro punti, ed è la riga che determina se un contesto molto ampio è davvero utilizzabile o solo accettato. Una finestra da 1.000.000 di token che perde la parte centrale del documento è una finestra più ampia di una da 100.000 token che non lo fa.
E la generazione ha più di un punto di prezzo. La scheda Sol da $2,00 / $10,00 è quella solitamente confrontata con GLM 5.3, ma GPT-6 Luna si colloca a $0,10 / $0,50 — sotto la tariffa di input di GLM 5.3 di un ordine di grandezza e sotto la sua tariffa di output di quasi nove volte — e GPT-6.1 Sol, rilasciato il 29 settembre, ottiene 51,8 sullo stesso indice al prezzo di Sol. Se la domanda è puramente "il token competente più economico", la generazione GPT-6 ha una risposta che GLM 5.3 non ha.

Eseguendoli insieme, che è la risposta su cui converge la maggior parte dei team
La conclusione pratica di questo confronto è che non è esclusivo. GLM 5.3 ha attirato volumi molto ingenti — il catalogo OrcaRouter ha registrato circa 1,9 miliardi di token instradati verso di esso in una finestra di sette giorni, contro circa 2,1 milioni per GPT-6 Sol — ed è questo l'aspetto di un modello a pesi aperti con una tariffa di output bassa quando i team gli affidano lavoro in blocco. Il traffico di GPT-6 nella stessa finestra è concentrato sui livelli superiori, dove il lavoro è del tipo che richiede l'input multimodale o il modello premium.
Entrambe sono route attive nello stesso catalogo su OrcaRouter: un'unica API davanti a oltre 200 modelli, chiamata tramite un endpoint compatibile con OpenAI, con il prezzo di listino del fornitore passato direttamente a un ricarico dello 0%, così una variazione di prezzo del fornitore è attiva dalla nostra parte lo stesso giorno anziché al tuo prossimo ciclo di fatturazione. Questo conta più del solito in questo particolare confronto, perché l'intera questione del prezzo di GLM 5.3 ha un elemento variabile — la cifra del catalogo e quella del fornitore già divergono di circa il 10% — e una route pass-through significa che ti viene fatturato il numero del fornitore invece di un ricarico che lo nasconde.
Il DSL di routing è ciò che rende esplicita la separazione: inviare il grosso del traffico di classificazione ed estrazione, solo testuale, a GLM 5.3 e il lavoro multimodale o di long-recall a un tier GPT-6, per richiesta anziché per trimestre, e lasciare che il failover automatico copra entrambi i lati. La questione open-weights vs API smette di essere un impegno architetturale tutto-o-niente e diventa una regola di routing che puoi cambiare la settimana prossima.

Il verdetto, che è una domanda sui tuoi vincoli
Se puoi fare self-hosting, se ti serve throughput solo testuale su larga scala o se hai un requisito di residenza dei dati che un'API non può soddisfare, GLM 5.3 è la risposta e la differenza di prezzo è abbastanza ampia da finanziare il lavoro di serving. Se ti serve l'input di immagini e file, se il richiamo su contesto lungo è cruciale o se non hai alcuna intenzione di gestire un modello in autonomia, GPT-6 è la risposta e il sovrapprezzo compra qualcosa di specifico, non un marchio.
Ciò che nessuna delle due risposte è: "GPT-6 ottiene 2,8 punti in più". Quella sottrazione non è disponibile, perché le due cifre provengono da gruppi di riferimento diversi nella stessa classifica — e un confronto basato su di essa citerebbe un numero come se misurasse qualcosa che non misura. Le schede tariffarie sono comparabili. La posizione sulle licenze è comparabile, nel senso che è nettamente diversa. Le righe dell'indice non lo sono.

Confrontati in questo articolo2
Rilevato da questo articolo · Benchmark: Artificial Analysis · aggiornato ogni giorno
