
GLM 5.3 Prime: gli stessi pesi di GLM-5.3, a esattamente il doppio della tariffa di listino
- openaiNUOVOOpenAI: GPT-6 Luna2026-09-2237Intelligenza
- openaiNUOVOOpenAI: GPT-6 Sol2026-09-2248Intelligenza
- anthropicNUOVOAnthropic: Claude Opus 5.52026-09-2258Intelligenza
- grokNUOVOGrok 4.72026-09-2146Intelligenza
- OrcaNUOVOOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 per 1M di token · 177 tok/s
- orcaNUOVOOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 per 1M di token · 1323 tok/s
- deepseekNUOVODeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligenza
- openaiOpenAI: GPT-6 Astra2026-09-0453Intelligenza77Codice
- googleGoogle: Gemini 3.8 Flash2026-09-0241Intelligenza76Codice
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Intelligenza76Codice
- anthropicAnthropic: Claude Fable 5.12026-09-0153Intelligenza82Codice
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1M di token · 108 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligenza72Codice
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 per 1M di token · 220 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Intelligenza75Codice
- obsidianQwen3.8 27B2026-08-1534Intelligenza68Codice
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Intelligenza69Codice
- grokSpaceXAI: Grok 4.62026-08-1244Intelligenza77Codice
- metaMeta: Muse Spark 1.22026-08-0540Intelligenza72Codice
- qwenQwen: Qwen3.8 Max2026-08-0345Intelligenza76Codice
GLM 5.3 Prime costa 2,80 $ per milione di token in input e 8,80 $ per milione di token in output. GLM-5.3, il modello su cui si basa, costa 1,40 $ e 4,40 $. Non è una differenza di arrotondamento né un margine promozionale: è esattamente 2,0× su entrambe le voci, ed è l'unica cosa su cui i due prodotti divergono. GLM 5.3 Prime non è un nuovo modello. Porta con sé i pesi di GLM-5.3, quelli che Z.ai ha aperto il 25 agosto 2026, dietro uno stack di serving più veloce. GLM-5.3 stesso è stato annunciato il 14 agosto 2026 ed è arrivato all'API il 18 agosto. Nulla del modello sottostante è cambiato quando l'ID Prime è apparso a fine settembre. Ciò che è cambiato è che qualcuno gli ha messo un secondo prezzo.
Se stai leggendo questo perché una lista di modelli ti ha mostrato un nome poco familiare accanto a uno familiare, la risposta breve è: stai guardando un tier di serving, non un rilascio. La risposta più lunga vale due minuti, perché l’aritmetica è insolitamente pulita e la provenienza è insolitamente torbida.
Che cos'è un livello "Prime", in un paragrafo
Un livello di servizio è un secondo ID prodotto puntato sugli stessi pesi, ottimizzato per il throughput invece che per il costo. Non ottieni un modello più grande, un contesto più lungo, una modalità di ragionamento migliore o una superficie di strumenti più ampia. Ottieni token in uscita più velocemente, e paghi questo privilegio su ogni token invece che sul tempo reale che hai risparmiato. Questo compromesso è reale e talvolta corretto — un ciclo di agente a più passaggi che effettua dieci chiamate sequenziali trae davvero beneficio dal fatto che ogni chiamata ritorni prima — ma è un acquisto di latenza, non un acquisto di capacità, e dovrebbe essere prezzato come tale.
La descrizione del fornitore per GLM 5.3 Prime dice direttamente la parte che di solito si tace: è «la variante ad alta velocità di GLM-5.3 di Z.ai, ereditandone tutte le capacità e offrendo al contempo 1,5–2× il throughput di output grazie all'accelerazione dell'inferenza». Capacità complete. Stessa finestra di contesto di 1.000.000 di token. Stesso limite di output di 131.072 token. Testo in input, testo in output. Ragionamento obbligatorio, con basso, alto e massimo livelli di impegno e massimo come impostazione predefinita — identico al modello di base.
Il listino prezzi, fianco a fianco
• Input — GLM 5.3 Prime $2,80 per 1M vs GLM-5.3 $1,40 per 1M
• Output — GLM 5.3 Prime $8,80 per 1M vs GLM-5.3 $4,40 per 1M
• Input in cache — GLM 5.3 Prime $0,56 per 1M vs GLM-5.3 $0,26 per 1M
• Moltiplicatore — 2,0× su tutte e tre le voci, in entrambe le direzioni
• Contesto — 1.000.000 token su entrambi
• Output massimo — 131.072 token su entrambi
• Ragionamento — obbligatorio su entrambi, stessi tre livelli di impegno, stesso valore predefinito
La voce della cache è quella che la gente trascura. Una lettura dalla cache è il token meno caro che potrai mai comprare da un modello di frontiera, ed è dove i carichi di lavoro degli agenti spendono davvero il loro budget — il prompt di sistema, le definizioni degli strumenti e il transcript in crescita vengono riletti a ogni turno. Raddoppiare la tariffa della cache raddoppia la voce più grande in una lunga sessione di un agente, il che significa che il premio effettivo su un carico di lavoro reale è più vicino a 2× di quanto suggerisca lo scarto di facciata sui token di input freschi. Se speravi che la corsia veloce fosse più economica in pratica perché usi la cache in modo aggressivo, non lo è.
Chi lo sta vendendo davvero?
È qui che la scheda diventa interessante, ed è qui che un lettore attento dovrebbe rallentare. La documentazione di Z.ai, la sua panoramica dei modelli e la sua pagina dei prezzi pubblicata non elencano alcuno SKU Prime. Cerca glm-5.3-prime tra gli ID dei modelli del fornitore e non ottieni nulla. Il livello di velocità di Z.ai è un prodotto completamente diverso, su una linea del tutto diversa — GLM-5.3-FlashX, che si colloca nella famiglia Flash più economica, è stato lanciato il 18 settembre 2026 e ha un prezzo di $0,37 e $1,25 per milione di token.
Quindi Prime è un prodotto lato piattaforma costruito sui pesi di Z.ai. Due dettagli indicano di quale piattaforma si tratti. Il primo è la formulazione "1.5–2× output throughput", che è la stessa dicitura che un importante provider cloud usa per la propria modalità di servizio accelerata — una modalità che si abilita cambiando l'ID del modello, con capacità e limiti di utilizzo esplicitamente invariati. Il secondo è che l'elenco nomina esattamente un fornitore upstream dietro l'endpoint. Un singolo fornitore dietro uno SKU di fascia veloce non è come viene servito un modello open-weights; è come appare dall'esterno un deployment accelerato della piattaforma stessa.
Niente di tutto ciò rende GLM 5.3 Prime un prodotto scadente. Lo rende un prodotto con un solo fornitore, il che è una questione di resilienza che dovresti porti prima di instradare il traffico di produzione attraverso di esso.
Quanto vale la promessa di velocità

Il valore di 1,5–2× è un'affermazione di throughput misurata nelle condizioni del fornitore stesso, e il throughput è la metrica più sensibile a tali condizioni. I token di output al secondo su una cache calda con un prompt breve e un cluster inattivo non sono il numero che vede un agente a contesto lungo. Una misurazione indipendente del modello base colloca GLM-5.3 a circa 61 token di output al secondo e GLM-5.3-Flash a circa 46, su un set in cui la media della classe è 67 — quindi la variante più economica è anche quella più lenta, che è l'opposto di quanto suggeriscono i nomi. Quelli sono valori mediani su un set di valutazione standardizzato, non picchi.
C'è anche un costo più sottile. Il valore predefinito di reasoning effort su entrambi gli ID è max, ovvero l'impostazione che produce le catene di pensiero più lunghe. Qui velocità e verbosità tirano in direzioni opposte: un tier veloce che ragiona anche alla massima lunghezza può comunque risultare lento end-to-end su un problema difficile, perché il collo di bottiglia è il numero di token che il modello decide di generare, non la velocità con cui li genera. Se il vostro carico di lavoro è incentrato sul ragionamento, scendete a high o low prima di pagare 2× per l'accelerazione — sarà il livello di effort a incidere sulla vostra latenza più di quanto faccia il tier di serving.
Tre modi per acquistare lo stesso modello

GLM-5.3 ora esiste in tre forme acquistabili, e non sono tre modelli:
• GLM-5.3 a $1,40 / $4,40 — la scheda tariffaria di base, capacità completa, la versione con pesi aperti pubblicati che puoi ospitare da solo
• GLM 5.3 Prime a $2,80 / $8,80 — gli stessi pesi tramite uno stack accelerato, un unico fornitore a monte, nessun peso coinvolto
• GLM-5.3-FlashX a $0,37 / $1,25 — non è affatto GLM-5.3, ma il livello di velocità sulla famiglia Flash più economica, e di gran lunga il modo più conveniente per acquistare latenza
Quella terza riga è quella su cui vale la pena soffermarsi. Se ciò che vuoi davvero sono token più veloci e sei flessibile su quale GLM usare per ottenerli, FlashX offre l'accelerazione su un modello che costa già circa un decimo del modello di punta, per meno della metà di quanto costa il modello di punta non accelerato. Prime ha senso solo se hai specificamente bisogno della qualità di ragionamento di GLM-5.3 e se ne hai specificamente bisogno prima.
Dove si colloca questo dalla nostra parte

Dobbiamo essere chiari su una cosa: OrcaRouter non ospita GLM 5.3 Prime, e non ospitiamo nemmeno GLM-5.3-FlashX. Entrambe le pagine dei modelli restituiscono un 404 sul nostro sito. Se vuoi il tier accelerato, dovrai acquistarlo dalla piattaforma che lo vende, oppure dall'API del fornitore stesso per il modello base.
Quello che ospitiamo è GLM-5.3 e GLM-5.3-Flash, al prezzo di listino del fornitore senza alcun ricarico da parte nostra — gli stessi $1,40 e $4,40 che vedi sul listino prezzi di Z.ai, applicati così come sono invece che riprezzati. Questo conta più di quanto sembri per un modello il cui prezzo è cambiato due volte in sei settimane. Poiché non aggiungiamo uno spread, una variazione di prezzo del fornitore è attiva dalla nostra parte lo stesso giorno in cui lo è dalla loro, senza una migrazione o un ticket di supporto. Entrambi gli ID stanno dietro un'unica chiave API insieme ad altri 200+ modelli, quindi un test A/B tra GLM-5.3 e GLM-5.3-Flash è un cambio di nome del modello su una riga invece che un secondo contratto, e il failover automatico ti copre se un singolo fornitore upstream si degrada — che è il rischio specifico che comporta un livello fast con un solo fornitore.
Dovresti pagare il 2×?
Pagalo se un essere umano o un servizio a monte è bloccato in attesa della risposta, se il carico di lavoro è vincolato dalla latenza anziché dal throughput e se hai già confermato che lo sforzo di ragionamento è il vero responsabile della tua latenza. Non pagarlo se stai eseguendo generazione in batch durante la notte, se il tuo volume è abbastanza alto che un sovrapprezzo di 2× sui token supera il tempo reale che risparmi, o se speravi che il livello fosse silenziosamente un modello migliore. Non lo è. È GLM-5.3 con un cronometro in funzione, e il cronometro fattura a token.
L'inquadramento onesto per l'intera famiglia GLM-5.3 in questo momento è che Z.ai ha rilasciato un modello ad agosto e il mercato ha passato settembre a riconfezionarlo a quattro prezzi diversi. GLM 5.3 Prime è il più costoso di quei pacchetti. È anche quello con la traccia documentale più scarna, perché l'azienda il cui nome è sui pesi non lo elenca. Non è un motivo per evitarlo. È un motivo per sapere esattamente cosa si sta acquistando prima di metterlo su un percorso di produzione.
Confrontati in questo articolo1
Rilevato da questo articolo · Benchmark: Artificial Analysis · aggiornato ogni giorno
