
GPT-6.1 Sol vs GLM-5.3: i pesi sono stati rilasciati, e il conto non si è mosso
- openaiNUOVOOpenAI: GPT-6.1 Sol2026-09-2952Intelligenza
- anthropicNUOVOAnthropic: Claude Sonnet 5.52026-09-2856Intelligenza
- typesafeNUOVOTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 per 1M di token · 161 tok/s
- OpenAIOpenAI: GPT-6 Luna2026-09-2238Intelligenza
- OpenAIOpenAI: GPT-6 Sol2026-09-2248Intelligenza
- AnthropicAnthropic: Claude Opus 5.52026-09-2258Intelligenza
- xAIGrok 4.72026-09-2146Intelligenza
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 per 1M di token · 79 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 per 1M di token · 320 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligenza
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Intelligenza77Codice
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Intelligenza76Codice
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Intelligenza76Codice
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Intelligenza82Codice
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 per 1M di token · 53 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1M di token · 301 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligenza72Codice
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 per 1M di token · 232 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Intelligenza75Codice
- obsidianQwen3.8 27B2026-08-1534Intelligenza68Codice
OpenAI ha rilasciato GPT-6.1 Sol il 29 settembre 2026 al keynote del DevDay, e Z.ai ha rilasciato GLM-5.3 sei settimane prima, il 18 agosto 2026, per poi trattenere il checkpoint per una settimana. Quel blocco è finito: zai-org/GLM-5.3 è su Hugging Face dal 25 agosto, un checkpoint BF16/FP8 di circa 753 miliardi di parametri, di cui circa 40 miliardi attivi per token, e da allora ha superato 1,4 milioni di download. Quindi la domanda che la maggior parte dei confronti si pone da agosto — è un modello aperto o un noleggio? — ha una risposta, e la risposta non ha cambiato l'aritmetica. Sulla classifica indipendente, GPT-6.1 Sol ottiene 51,8 e costa 0,72 $ per attività dell'indice completata; GLM-5.3 ottiene 44,8 e costa 2,01 $. Ora puoi possedere il modello più economico per token e pagare comunque quasi tre volte tanto per ogni lavoro portato a termine.
Cosa è realmente ciascun modello
GPT-6.1 Sol è il modello GPT-6 di fascia media di OpenAI, un gradino sotto il modello di punta GPT-6 Astra e sopra il modello economico GPT-6 Luna. Ha una finestra di contesto di 1.050.000 token, un tetto di output di 128.000 token e una data di cutoff delle conoscenze del 30 aprile 2026, e accetta testo, immagini e file come input. Il ragionamento va da basso a massimo con un valore predefinito di medio; i valori nessuno e minimo che GPT-6 Sol accettava ora restituiscono un errore, a cui la stessa guida alla migrazione di OpenAI risponde dicendo agli sviluppatori di sostituire con basso. Costa 2,00 $ per milione di token di input e 10,00 $ per milione di token di output, con input in cache a 0,10 $.
GLM-5.3 è l'attuale flagship di Z.ai per l'ingegneria del software e il lavoro agentico a lungo orizzonte, costruito sulla stessa base mixture-of-experts di GLM-5.2, con i miglioramenti che derivano dal post-training anziché da un modello più grande. È text-in, text-out — nessuna visione, a qualsiasi prezzo — con una finestra da 1M di token, un tetto di output di 128.000 token e il thinking attivo in modo permanente. Non esiste una modalità non-reasoning, il che è un vincolo stringente per una chiamata sensibile alla latenza. Z.ai lo indica a 1,40 $ in input e 4,40 $ in output per milione di token, con l'input in cache a 0,26 $; il nostro catalogo lo riporta a 1,26 $ e 3,96 $ con una lettura della cache a 0,234 $, quindi la scheda del fornitore è il dato più prudente ed è quello da cui partire per argomentare.
Il tariffario, e la riga che lo inverte
Una riga per dimensione, entrambi i lati su ciascuna:
• Input — GPT-6.1 Sol 2,00 $ per 1M vs GLM-5.3 1,40 $ per 1M; GLM è più economico del 30%
• Output — GPT-6.1 Sol 10,00 $ per 1M vs GLM-5.3 4,40 $ per 1M; GLM è più economico del 56%
• Input in cache — GPT-6.1 Sol 0,10 $ per 1M vs GLM-5.3 0,26 $ per 1M; l'ordine si inverte, Sol è 2,6× più economico
• Clausola per contesto lungo — GPT-6.1 Sol riprezza l'intera richiesta oltre 272.000 token di input a 2× input e cache e 1,5× output vs GLM-5.3 nessuna clausola equivalente sulla scheda pubblicata
• Contesto e output — 1.050.000 in / 128.000 out vs 1M in / 128.000 out; una differenza del 5%, irrilevante
• Modalità — testo, immagini e file in input, testo in output vs solo testo
• Livello minimo di ragionamento — GPT-6.1 Sol basso, medio (predefinito), alto, xhigh, max vs GLM-5.3 sempre attivo, nessun livello minimo a cui scendere
• Pesi — chiuso, solo API vs aperto, scaricabile, FP8
• Punteggio indipendente, Artificial Analysis v4.3.2 a sforzo massimo — 51,8 vs 44,8
• Costo indipendente per attività dell'indice — 0,72 $ vs 2,01 $
• Token di output per l'esecuzione dell'indice — 67 milioni vs 210 milioni
<img src="2.png" alt="Un tabellone di confronto a due colonne generato, intitolato 'GPT-6.1 Sol vs GLM-5.3 - il tabellone'. Colonna sinistra 'GPT-6.1 Sol': righe che riportano 'Indice di intelligenza: 51,8', 'Costo per attività dell'indice: $0,72', 'Prezzo input: $2,00 per 1M', 'Prezzo output: $10,00 per 1M', 'Token di output nell'esecuzione dell'indice: 67M', 'Pesi: chiusi'. Colonna destra 'GLM-5.3': righe che riportano 'Indice di intelligenza: 44,8', 'Costo per attività dell'indice: $2,01', 'Prezzo input: $1,40 per 1M', 'Prezzo output: $4,40 per 1M', 'Token di output nell'esecuzione dell'indice: 210M', 'Pesi: aperti su Hugging Face'. Un piè di pagina riporta 'Dati indipendenti secondo Artificial Analysis v4.3.2 al massimo sforzo; prezzi di listino dei fornitori.' Il logo OrcaRouter si trova nell'angolo in basso a destra." /> È quell'ultima coppia a decidere questo confronto, e non è un effetto sottile.

Il problema dei 210 milioni di token
Artificial Analysis esegue la stessa suite di dieci valutazioni su ogni modello presente nella classifica e pubblica i conteggi dei token alla base di ogni punteggio. GLM-5.3 ha generato circa 210 milioni di token di output completando l’esecuzione. GPT-6.1 Sol ne ha generati 67 milioni. Se confrontati con la classe di confronto di ciascun modello nella classifica, i 210 milioni di GLM-5.3 si collocano al di sopra di una mediana di classe di circa 140 milioni, mentre i 67 milioni di Sol si collocano ben al di sotto della mediana di circa 81 milioni della classe ammiraglia in cui è valutato. Poiché l’output è la voce costosa di ogni listino prezzi, lo sconto dichiarato del 56% di GLM-5.3 sulla voce di output non regge al confronto con la misurazione: emette 3,1 volte i token a 0,44 volte il prezzo, e 3,1 × 0,44 fa 1,37 — GLM-5.3 è il modello più costoso su questo carico di lavoro, nonostante un listino prezzi sostanzialmente più economico.
Il dato sul costo per attività fornito dal board stesso conferma la direzione e l'ordine di grandezza. 2,01 $ contro 0,72 $ fa 2,8×, un divario più ampio di quanto implichi il solo rapporto tra token, perché GLM-5.3 paga di più anche sulle voci di input e di cache per attività. Vale la pena essere precisi su cosa questo dimostra e cosa non dimostra: la run dell'indice è composta da dieci valutazioni fisse, e la verbosità su di esse non è la stessa cosa della verbosità sul proprio traffico. Ma per un acquirente, i token sono ciò che viene fatturato, e la forma della differenza è identica su qualsiasi insieme di attività in cui il modello debba produrre una risposta lunga.
L'offset parziale è la voce relativa all'input in cache. La lettura della cache di GLM-5.3 è di $0,26 rispetto a una base di $1,40, e quella di GPT-6.1 Sol è di $0,10 rispetto a una base di $2,00 — Sol vince di un fattore 2,6 su una tariffa che domina qualsiasi carico di lavoro con un prefisso stabile. Se il tuo traffico è un ampio corpus fisso con una risposta di un paragrafo, GLM-5.3 è semplicemente l'opzione più economica e dovresti sceglierla. Se il tuo traffico assomiglia al traffico per cui entrambi questi modelli sono stati costruiti — cicli di agenti, modifiche su scala repository, output generati lunghi — il vantaggio dell'input in cache si riduce a rumore rispetto a un rapporto di token di 3×.
Dove finiscono i numeri dei fornitori
I dati di lancio di Z.ai sono solidi e, come sempre, non replicati. Terminal-Bench 2.1 a 88,2, DeepSWE v1.1 a 66,9, CyberGym a 84,5, ExploitBench a 54,4, AutomationBench a 48,2, GDPval-AA v2 a 1769 Elo. L'unico dato che vale la pena leggere due volte è Terminal-Bench 3.0 a 28,3 — il benchmark successore, e la correzione all'88,2 su quello più vecchio. Un modello può essere eccellente sul benchmark che il suo post-training mirava a ottimizzare e ordinario sulla generazione successiva dello stesso benchmark.
I numeri di lancio di OpenAI per GPT-6.1 Sol sono interamente incentrati sul costo per attività completata anziché sul punteggio grezzo: DeepSWE v1.1 batte il miglior risultato di GPT-6 Sol di 6,4 punti percentuali con uno sforzo di ragionamento inferiore, AutomationBench 1.0.6 a 2,2 punti sopra Claude Opus 5.5 a sforzo medio, OSWorld 2.0 in crescita di sette punti rispetto a GPT-6 Sol a sforzo massimo, Terminal-Bench Science 0.1 più che raddoppia GPT-6 Sol a meno della metà del costo per attività. Da notare che questi sono di OpenAIl'harness con le proprie impostazioni sul proprio set di benchmark selezionato, e che nessuno di essi è stato riprodotto in modo indipendente.
La sovrapposizione tra i set pubblicati dai due fornitori è scarsa, e l'unico confronto diretto disponibile è sullo stesso benchmark: Z.ai riporta 66,9 su DeepSWE v1.1, OpenAI riporta 68,8 per GPT-6 Sol — il modello che 6.1 sostituisce — e un miglioramento di 6,4 punti per 6.1 Sol rispetto al proprio predecessore. Due punti di distanza nel confronto riportato dai fornitori, e circa sei nel delta di OpenAI stesso. È quasi un confronto controllato, e dice ciò che dice il board indipendente: quasi parità di capacità, un ampio divario su quanto costa portare a termine il lavoro.
Un'API, o due contratti
Entrambi i modelli sono su OrcaRouter, che è la parte insolita di questo abbinamento. GPT-6.1 Sol è approdato nel catalogo al prezzo di listino di OpenAI il giorno del rilascio — 2,00 $ e 10,00 $ per milione di token, input in cache a 0,10 $, con lo scaglione dei 272.000 token a 4,00 $ e 15,00 $ trasferito esattamente come lo elenca il fornitore — e GLM-5.3 gli sta accanto a 1,26 $ e 3,96 $, con la lettura della cache a 0,234 $. A nessuno dei due viene aggiunto nulla: la piattaforma fa passare invariato il prezzo di listino del fornitore, motivo per cui un taglio di prezzo del fornitore compare dalla nostra parte lo stesso giorno, anziché dopo che un rivenditore ha rinegoziato.

Questo conta di più per questa coppia specifica che per la maggior parte delle altre. La decisione tra i due non è «quale sia migliore» — è una soglia sulla lunghezza del tuo output, e si sposterà la prima volta che Z.ai affina il suo listino prezzi o OpenAI cambia il confine del tier 6.1. Tenere entrambi dietro un'unica chiave, con failover automatico tra i due e una regola di instradamento che modifichi nella configurazione anziché in un deployment, è ciò che ti consente di testare quella soglia su traffico reale invece di discuterne. Se la linea cache di Sol vince sul tuo carico di lavoro, instrada su di essa; se le lunghezze delle tue risposte restano brevi e la tariffa piatta di GLM-5.3 senza scogliera di contesto vince il segmento, instrada invece su quella — la stessa chiave, nessun secondo contratto, nessuna seconda fattura.

Quale, se devi scegliere oggi
• Output generati lunghi, loop agentici, lavoro a forte componente di output — GPT-6.1 Sol, e il margine è quasi triplo una volta applicati i conteggi dei token. È qui che la scheda tariffaria mente e la misurazione no.
• Prefisso stabile, risposta breve — GLM-5.3. Le sue tariffe per input in cache e per input sono davvero migliori e la verbosità non ha mai modo di mordere.
• Qualsiasi richiesta oltre i 272.000 token di input — GLM-5.3, perché GPT-6.1 Sol riprezza l'intera richiesta a quella soglia e la scheda di GLM-5.3 non ha uno scatto equivalente.
• Qualsiasi cosa con un'immagine o un documento come input visivo — GPT-6.1 Sol. GLM-5.3 è solo testo e qui non c'è partita.
• Inferenza all'interno del proprio perimetro, o una copertura contro il cambiamento dei termini di un fornitore — GLM-5.3, e ora il download esiste invece di essere promesso. Metti a budget l'hardware: il checkpoint è un artefatto FP8 di grandi dimensioni e l'auto-hosting è una decisione di capitale, non una decisione API.
• Chiamate sensibili alla latenza — nessuno dei due senza cautela. GLM-5.3 non ha modo di disattivare il ragionamento; GPT-6.1 Sol ha un minimo a low, e il suo tempo al primo token sulla classifica indipendente ha misurato 332 secondi contro una mediana della classifica di 3,7.
Confrontati in questo articolo3
Rilevato da questo articolo · Benchmark: Artificial Analysis · aggiornato ogni giorno
