Titolo generato che riporta «GPT-6 vs GLM 5.3», con un chip che riporta «GLM 5.3: pesi aperti, rilasciato il 2026-08-18» e un chip che riporta «GPT-6: pesi chiusi, distribuito il 2026-09-22», e un piè di pagina che riporta «I peer group AA differiscono: i punteggi dei modelli a pesi aperti e di quelli proprietari non sono sottraibili.» Il logo OrcaRouter è compositato nell'angolo in basso a destra.
Guides & Insights

GPT-6 vs GLM 5.3: uno dei due lo puoi scaricare, e il divario di prezzo è più piccolo del divario nell'indice

Autore

Magnus Corvin

Data di pubblicazione

Ultimi modelli · 20Vedi tutti i modelli →
Benchmark: Artificial Analysis · aggiornato ogni giorno
Torna a tutti gli articoli

Il motivo per mettere GPT-6 contro GLM 5.3 non è la tabella dei benchmark. È che GLM 5.3 è l'unico modello in questa fascia di prezzo di cui puoi portarti a casa i pesi, mentre GPT-6 è una generazione chiusa i cui tre membri sono raggiungibili solo tramite API. Questa differenza decide più questioni di approvvigionamento di qualunque delta di indice, ed è anche il motivo per cui i due punteggi non sono direttamente comparabili — ed è la parte su cui sbagliano la maggior parte dei confronti pubblicati di questa coppia.

I due lati, precisamente

GLM 5.3 è il modello di punta di Z.ai, rilasciato il 18 agosto 2026, con i pesi pubblicati circa una settimana dopo. È un modello solo testo — nessun input di immagini — con una finestra di contesto di 1.000.000 di token e un tetto di output di 128.000 token, listato da Z.ai a 1,40 $ per milione di token in input e 4,40 $ per milione in output, con una tariffa di 0,234 $ per milione per l'input in cache. Viene servito con l'id del modello z-ai/glm-5.3.

GPT-6 è una generazione più che un modello. GPT-6 Astra, GPT-6 Sol e GPT-6 Luna sono tre id a tre fasce di prezzo, tutti rilasciati il 22 settembre 2026, tutti multimodali sul lato input (testo, immagine e file), tutti con una finestra di contesto vicina a 1.050.000 token e un tetto di output di 128.000 token. Non esiste openai/gpt-6 come endpoint. Quando qualcuno dice "GPT-6" in una conversazione sui prezzi, quasi sempre intende GPT-6 Sol, la fascia intermedia a $2,00 / $10,00 — quindi è il membro che questo confronto usa ovunque serva un singolo id.

• Pesi — GLM 5.3 aperto, scaricabile e self-hostable; GPT-6 chiuso, solo API
• Modalità di input — GLM 5.3 solo testo; tutti e tre i tier di GPT-6 accettano testo, immagini e file
• Prezzo di input — GLM 5.3 1,40 $ per milione vs GPT-6 Sol 2,00 $ per milione
• Prezzo di output — GLM 5.3 4,40 $ per milione vs GPT-6 Sol 10,00 $ per milione
• Input in cache — GLM 5.3 0,234 $ per milione vs GPT-6 Sol 0,20 $ per milione
• Contesto — GLM 5.3 1.000.000 di token vs GPT-6 Sol 1.050.000 di token
• Scaglione per richieste lunghe — GLM 5.3 non ne ha sulla sua scheda pubblicata; GPT-6 Sol ricalcola il prezzo dell'intera richiesta oltre 272.000 token di input a 4,00 $ / 15,00 $
• Licenza — GLM 5.3 è distribuito con la licenza open di Z.ai; GPT-6 non ha alcun file di licenza perché non c'è nulla da licenziare

Nota l'avvertenza sulla riga del prezzo, perché è reale e questo blog ci è già incappato: una pagina di modello di OrcaRouter non è sempre allineata al listino prezzi del fornitore stesso, e su GLM 5.3 nello specifico il nostro catalogo riporta $1.26 / $3.96 mentre la cifra pubblicata da Z.ai è $1.40 / $4.40. Dove i due non concordano, cita il numero del fornitore nel testo — che è ciò che fanno i punti elenco qui sopra — e leggi la cifra della pagina come valore proprio della pagina. Entrambi sono legittimi; semplicemente non sono lo stesso numero.

Perché il confronto degli indici necessita di un'etichetta di avvertenza

Ecco la trappola. Nell'Indice di Intelligenza di Artificial Analysis, GLM 5.3 ottiene 44,8 e GPT-6 Sol ottiene 47,6 — 2,8 punti di distanza. Sembra quasi un pareggio tra un modello chiuso e uno aperto a circa un quinto del prezzo di output, ed è la frase su cui si fermano la maggior parte dei confronti di questa coppia.

Non è una sottrazione valida. Artificial Analysis classifica i modelli open-weights solo rispetto ad altri modelli open-weights della stessa classe di dimensione, e i modelli proprietari all'interno di una fascia proprietaria usando un rapporto di prezzo input-output combinato di 3:1. Il 44,8 di GLM 5.3 è un punteggio open-weights. Il 47,6 di GPT-6 Sol è un punteggio della fascia proprietaria. Si collocano su scale diverse, e il divario tra loro non è una misura della capacità. La stessa avvertenza vale per le due cifre riportate nelle voci di catalogo di OrcaRouter, da cui provengono entrambi i numeri sopra indicati.

Quello che puoi confrontare lungo quella linea è la contabilità dei costi e le tariffe, e secondariamente le righe che sono la stessa valutazione eseguita allo stesso modo. Leggi su entrambe le pagine:

• AA Coding Index — GLM 5.3 74.8 vs GPT-6 Sol 60.0
• GPQA Diamond — GLM 5.3 91.7
• Humanity's Last Exam — GLM 5.3 42.3 vs GPT-6 Sol 47.9
• Terminal-Bench 2.1 — GLM 5.3 83.9
• Terminal-Bench 4.0 — GLM 5.3 41.9 vs GPT-6 Sol 43.9
• τ-bench banking — GLM 5.3 50.3
• SciCode — GLM 5.3 59.0 vs GPT-6 Sol 57.6
• Recall su contesto lungo — GLM 5.3 79.7 vs GPT-6 Sol 83.7

Leggila come una forma, più che come una differenza di punteggio: GLM 5.3 è forte nelle valutazioni agentiche e di coding — τ-bench banking e SciCode pendono entrambi dalla sua parte, e il suo Coding Index è molto al di sopra di quello di Sol — mentre GPT-6 Sol detiene le righe del richiamo su contesto lungo e di Humanity's Last Exam. Nessuna di queste due letture è un verdetto. Sono due insiemi diversi di punti di forza, misurati da una terza parte, su un modello che puoi scaricare e un modello che non puoi.

Quanto valgono davvero i pesi aperti, qui

Il motivo per cui preoccuparsi della licenza di GLM 5.3 non è l'ideologia. È che tre cose specifiche smettono di essere decisioni del fornitore una volta che i pesi sono tuoi.

La prima è la residenza. Un GLM 5.3 self-hosted viene eseguito dove lo si installa, e nessun accordo sul trattamento dei dati disciplina ciò che lascia la tua rete. GPT-6 non ha un'opzione equivalente: l'unico modo per richiamarlo è tramite un'API, e i dati finiscono in un luogo che non controlli. Per un carico di lavoro soggetto a regolamentazione, spesso è proprio questa la decisione che conta, ed è una decisione che l'indice non cattura mai.

Il secondo è la curva del prezzo. Un listino prezzi API è un numero del fornitore che il fornitore può modificare; le tariffe GPT-6 pubblicate sono dichiarate dal fornitore come permanenti anziché promozionali, ma questa è una dichiarazione di intenti, non un contratto. I pesi posseduti hanno un costo fisso che smette di scalare con i token, e il punto di intersezione è una funzione del tuo volume anziché della decisione di prezzo di chiunque. Ecco perché il listino $1.40 / $4.40 non è davvero il confronto — il confronto è $1.40 / $4.40 rispetto al tuo hardware ammortizzato sul tuo traffico.

Il terzo è la modalità di guasto. Un modello ospitato può essere deprecato, soggetto a limiti di frequenza o degradato da una modifica al servizio. GLM 5.3 è invocabile dal 18 agosto con un checkpoint pubblico alle spalle; se Z.ai cambia qualcosa con cui non sei d'accordo, il checkpoint rispetto al quale hai validato è ancora su disco.

Anche il costo di quella libertà è reale, e vale la pena dirlo chiaramente. GLM 5.3 è solo testo, quindi un carico di lavoro che immette screenshot o PDF nel modello non ha alcun percorso sul lato dei pesi aperti di questo confronto. Servire da soli contesti da 1.000.000 di token non è un esercizio da laptop. E il modello che scarichi è il modello di cui sei responsabile: valutazione, filtraggio di sicurezza, uptime e aggiornamenti diventano tutti tuoi, il che è un vero budget di ingegneria che il prezzo dell'API non include.

Dove GPT-6 merita il premium

Per contro, la tesi a favore del lato chiuso è più esile di quanto il suo prezzo suggerisca, ma non è priva di sostanza.

L'input multimodale è quello concreto. Tutti e tre i livelli di GPT-6 accettano immagini e file nativamente, mentre GLM 5.3 non accetta né gli uni né gli altri. Una pipeline che legge un grafico, uno screenshot o un documento scansionato e ne ragiona nella stessa chiamata non può essere costruita su GLM 5.3 così come pubblicato.

Il richiamo su contesti lunghi è il secondo. GPT-6 Sol supera GLM 5.3 su quella riga di quattro punti, ed è la riga che determina se un contesto molto ampio è davvero utilizzabile o solo accettato. Una finestra da 1.000.000 di token che perde la parte centrale del documento è una finestra più ampia di una da 100.000 token che non lo fa.

E la generazione ha più di un punto di prezzo. La scheda Sol da $2,00 / $10,00 è quella solitamente confrontata con GLM 5.3, ma GPT-6 Luna si colloca a $0,10 / $0,50 — sotto la tariffa di input di GLM 5.3 di un ordine di grandezza e sotto la sua tariffa di output di quasi nove volte — e GPT-6.1 Sol, rilasciato il 29 settembre, ottiene 51,8 sullo stesso indice al prezzo di Sol. Se la domanda è puramente "il token competente più economico", la generazione GPT-6 ha una risposta che GLM 5.3 non ha.

A generated two-column comparison scoreboard titled "GPT-6 Sol vs GLM 5.3 — the scoreboard". The left column, GPT-6 Sol, reads Weights closed, Input $2.00, Output $10.00, AA Intelligence 47.6, AA Coding 60.0, Long-context recall 83.7. The right column, GLM 5.3, reads Weights open, Input $1.40, Output $4.40, AA Intelligence 44.8, AA Coding 74.8, Long-context recall 79.7. A footer line reads "AA ranks open-weights and proprietary models on different peer scales; the two Intelligence figures are not subtractable." The OrcaRouter logo is composited in the bottom-right corner.

Eseguendoli insieme, che è la risposta su cui converge la maggior parte dei team

La conclusione pratica di questo confronto è che non è esclusivo. GLM 5.3 ha attirato volumi molto ingenti — il catalogo OrcaRouter ha registrato circa 1,9 miliardi di token instradati verso di esso in una finestra di sette giorni, contro circa 2,1 milioni per GPT-6 Sol — ed è questo l'aspetto di un modello a pesi aperti con una tariffa di output bassa quando i team gli affidano lavoro in blocco. Il traffico di GPT-6 nella stessa finestra è concentrato sui livelli superiori, dove il lavoro è del tipo che richiede l'input multimodale o il modello premium.

Entrambe sono route attive nello stesso catalogo su OrcaRouter: un'unica API davanti a oltre 200 modelli, chiamata tramite un endpoint compatibile con OpenAI, con il prezzo di listino del fornitore passato direttamente a un ricarico dello 0%, così una variazione di prezzo del fornitore è attiva dalla nostra parte lo stesso giorno anziché al tuo prossimo ciclo di fatturazione. Questo conta più del solito in questo particolare confronto, perché l'intera questione del prezzo di GLM 5.3 ha un elemento variabile — la cifra del catalogo e quella del fornitore già divergono di circa il 10% — e una route pass-through significa che ti viene fatturato il numero del fornitore invece di un ricarico che lo nasconde.

Il DSL di routing è ciò che rende esplicita la separazione: inviare il grosso del traffico di classificazione ed estrazione, solo testuale, a GLM 5.3 e il lavoro multimodale o di long-recall a un tier GPT-6, per richiesta anziché per trimestre, e lasciare che il failover automatico copra entrambi i lati. La questione open-weights vs API smette di essere un impegno architetturale tutto-o-niente e diventa una regola di routing che puoi cambiare la settimana prossima.

Screenshot of the OrcaRouter model page for z-ai/glm-5.3, showing the Z.ai vendor label, a 2026-08-18 catalogue release date, a context of 1M tokens, a 128K maximum output, text-only input, Tools, JSON and Reasoning badges, and a rate strip reading $1.26 per million input tokens, $3.96 per million output tokens, a 4.54 s median time to first token, a 10.00 s p95, and 1,903.6M tokens routed in seven days.

Il verdetto, che è una domanda sui tuoi vincoli

Se puoi fare self-hosting, se ti serve throughput solo testuale su larga scala o se hai un requisito di residenza dei dati che un'API non può soddisfare, GLM 5.3 è la risposta e la differenza di prezzo è abbastanza ampia da finanziare il lavoro di serving. Se ti serve l'input di immagini e file, se il richiamo su contesto lungo è cruciale o se non hai alcuna intenzione di gestire un modello in autonomia, GPT-6 è la risposta e il sovrapprezzo compra qualcosa di specifico, non un marchio.

Ciò che nessuna delle due risposte è: "GPT-6 ottiene 2,8 punti in più". Quella sottrazione non è disponibile, perché le due cifre provengono da gruppi di riferimento diversi nella stessa classifica — e un confronto basato su di essa citerebbe un numero come se misurasse qualcosa che non misura. Le schede tariffarie sono comparabili. La posizione sulle licenze è comparabile, nel senso che è nettamente diversa. Le righe dell'indice non lo sono.

Screenshot of the OrcaRouter model page for openai/gpt-6-sol, showing the OpenAI vendor label, a 2026-09-22 catalogue release date, a 1,050,000-token context window (shown as 1.05M-token context in the model blurb), a 128K maximum output, text, image and file input, and a rate strip reading $2.00 per million input, $10.00 per million output, a 6.79 s median time to first token, a 10.00 s p95, and 2.1M tokens routed in seven days.

Confrontati in questo articolo2

Rilevato da questo articolo · Benchmark: Artificial Analysis · aggiornato ogni giorno