
Claude Haiku 5.5 vs GLM-5.3-FlashX: pagare 2,5 volte tanto per gli stessi pesi, e se ne vale la pena
- openaiNUOVOOpenAI: GPT-6.1 Sol2026-09-2952Intelligenza
- anthropicNUOVOAnthropic: Claude Sonnet 5.52026-09-2856Intelligenza
- typesafeTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 per 1M di token · 128 tok/s
- OpenAIOpenAI: GPT-6 Luna2026-09-2238Intelligenza
- OpenAIOpenAI: GPT-6 Sol2026-09-2248Intelligenza
- AnthropicAnthropic: Claude Opus 5.52026-09-2258Intelligenza
- xAIGrok 4.72026-09-2146Intelligenza
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 per 1M di token · 57 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 per 1M di token · 320 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligenza
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Intelligenza77Codice
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Intelligenza76Codice
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Intelligenza76Codice
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Intelligenza82Codice
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 per 1M di token · 56 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1M di token · 345 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligenza72Codice
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 per 1M di token · 230 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Intelligenza75Codice
- obsidianQwen3.8 27B2026-08-1534Intelligenza68Codice
La cosa più utile da sapere su GLM-5.3-FlashX prima di confrontarlo con Claude Haiku 5.5 è che esegue gli stessi pesi di GLM-5.3-Flash e che chiamarlo costa 2,5 volte tanto. Z.ai ha lanciato FlashX sulla propria API il 18 settembre 2026, a $0,37 per milione di token di input e $1,25 per milione di token di output, contro $0,15 e $0,50 per il modello base da cui deriva. Del modello non è cambiato nulla; ciò che è cambiato è dove viene eseguito e quanto velocemente viene promesso che giri lì. Capire questo abbinamento è tutto qui, perché significa che non si tratta di un confronto tra due livelli di capacità — è un confronto tra una fascia di prezzo e una fascia di servizio, e Haiku 5.5 si colloca nel mezzo di questa discussione partendo da una direzione completamente diversa.
Due modelli, quattro prezzi, una soglia
Allinea le quattro schede tariffarie rilevanti e la forma della decisione diventa più chiara di quanto non sia con una singola coppia qualsiasi:
• Claude Haiku 5.5, sotto i 100.000 token — 0,10 $ input, 0,50 $ output per milione (listino Anthropic)
• Claude Haiku 5.5, oltre 100.000 token — 0,50 $ input, 2,50 $ output per milione (listino Anthropic)
• GLM-5.3-Flash — $0,15 input, $0,50 output per milione (listino Z.ai)
• GLM-5.3-FlashX — 0,37 $ input, 1,25 $ output per milione (listino Z.ai)
• Contesto — 1 milione di token su tutti e quattro (pubblicati dal fornitore)
• Pesi aperti — GLM-5.3-Flash e FlashX ereditano i pesi del modello base, distribuiti con licenza MIT; Claude Haiku 5.5 è chiuso (pubblicato dal fornitore)
• Punteggio indipendente — GLM-5.3-Flash ha registrato 41.807 nell'Artificial Analysis Intelligence Index; Claude Haiku 5.5 ha registrato 43.395 (Artificial Analysis)
La prima cosa da notare è che il prezzo di FlashX coincide quasi esattamente con la fascia a contesto lungo di Claude Haiku 5.5: $0,37 contro $0,50 in input, $1,25 contro $2,50 in output. Non è una coincidenza del mercato; è quanto costa un livello di servizio premium quando il modello sottostante è di fascia media e il fornitore fa pagare il throughput invece della capacità. La seconda è che GLM-5.3-FlashX è la versione costosa di un modello rispetto al quale il nuovo Haiku di Anthropic è più economico a contesto breve e paragonabile a contesto lungo. La terza è che tutti e quattro i numeri rientrano, tra loro, entro un fattore di cinque, che è una banda molto più stretta di quanto implichi l'idea di «modello economico contro modello costoso» della maggior parte dei confronti testa a testa.

Cos'è davvero FlashX
GLM-5.3-FlashX non è un nuovo modello. È GLM-5.3-Flash servito sull'infrastruttura proprietaria di Z.ai, pubblicizzato fino a 200 token di output al secondo al picco rispetto alla velocità misurata del modello base, e prezzato a 2,5 volte il listino del modello base. La proposta di Z.ai è semplice: stesse risposte, più risposte al secondo, e paghi il serving anziché i pesi. Per un carico di lavoro vincolato al throughput — classificazione in batch, estrazione ad alto volume, qualsiasi attività in cui il vincolo sia la latenza anziché il costo — è una cosa coerente da vendere e una cosa coerente da comprare.
Quello che non è è un aggiornamento delle capacità, e il prezzo lo riflette onestamente: se FlashX fosse un modello migliore, Z.ai non sarebbe in grado di far pagare separatamente i pesi del modello base. Il 2,5x è un sovrapprezzo per il serving. Se valga la pena pagarlo è una questione che riguarda il collo di bottiglia del tuo carico di lavoro, e ha una risposta diversa per una pipeline vincolata dalla latenza rispetto a una vincolata dai costi.
Artificial Analysis non ha una pagina separata per FlashX al momento in cui scriviamo, cosa che vale la pena dichiarare apertamente anziché nascondere: il dato indipendente che la classifica pubblica per GLM-5.3-Flash — 41,807 sull'Intelligence Index, 52,14 token di output al secondo misurati, 0,328 su Terminal-Bench Hard — è un dato relativo al modello base, non alla versione servita a 2,5x. La dichiarazione di throughput del fornitore stesso per FlashX è un valore di picco e auto-dichiarato. Nessun soggetto indipendente ha pubblicato il throughput di FlashX stesso, quindi qualsiasi confronto tra la velocità misurata di Haiku 5.5 e quella di FlashX è un confronto con un numero che Z.ai ha fornito sul proprio serving.
Il moltiplicatore 2,5x di Z.ai non è l'unica cosa che rende FlashX costoso rispetto alla sua base. Poiché i pesi di base sono rilasciati con licenza MIT e ospitati da terze parti, un carico di lavoro che necessita davvero di un throughput superiore a quello fornito dall'endpoint di un singolo fornitore può spesso ottenerlo distribuendolo su più fornitori degli stessi pesi a un prezzo pari o vicino a quello base, invece di pagare il livello premium di un unico fornitore. Questa è una vera alternativa con cui il listino di FlashX si trova a competere, e Z.ai lo sa — ed è presumibilmente per questo che la proposta fa leva sul throughput di picco anziché sull'unicità.

Dove Haiku 5.5 e FlashX si dividono
Metti i due a confronto sulle dimensioni che determinano un carico di lavoro reale e la separazione è abbastanza netta da poter scegliere:
• Prezzo sotto i 100K di contesto — Haiku 5.5 $0.10 / $0.50 vs FlashX $0.37 / $1.25; Haiku vince su entrambi i fronti
• Prezzo per contesto oltre 100K — Haiku 5.5 $0.50 / $2.50 vs FlashX $0.37 / $1.25; FlashX vince su entrambi i fronti
• Throughput — picco dichiarato dal fornitore di 200 tok/s per FlashX rispetto al serving pubblicato da Anthropic per Haiku 5.5, che non pubblicizza un picco di quel tipo
• Indice indipendente — Haiku 5.5 43.395 vs GLM-5.3-Flash 41.807 (Artificial Analysis; nessun valore indipendente per FlashX stesso)
• Pesi — FlashX eredita pesi aperti con licenza MIT; Haiku 5.5 è chiuso e disponibile solo via API
• Self-hosting — possibile per FlashX tramite i pesi aperti; non possibile per Haiku 5.5
• Set di funzionalità per strumenti/agenti — selettore regolabile dell'effort su Haiku 5.5, assente sulla linea GLM Flash
La cella interessante è la seconda. Claude Haiku 5.5 è un modello cinque volte più economico di GLM-5.3-FlashX sulle richieste brevi e leggermente più costoso di quest'ultimo su quelle lunghe, perché il listino prezzi di Haiku sale di 5x a 100.000 token, mentre FlashX applica una tariffa unica. Se il tuo traffico è per lo più breve, l'Haiku è la scelta ovvia già solo sul prezzo. Se è per lo più lungo, FlashX non compete affatto con il prezzo della fascia breve dell'Haiku — compete con la fascia lunga dell'Haiku, e vince quel confronto di circa un terzo.
Il confronto delle capacità è più serrato di quanto piacerebbe a entrambi i fornitori. 41,807 contro 43,395 sullo stesso indice indipendente è un divario inferiore al quattro per cento, ben dentro il rumore della maggior parte delle valutazioni a livello applicativo e fin troppo piccolo per giustificare da solo una scelta. Nessuno dei due modelli domina l'altro sul ragionamento generale; la decisione viene presa sul listino prezzi e sul throughput, non su quale dei due sia più intelligente.

La differenza di licenza è una vera differenza
Il fatto che FlashX sia open-weight in origine conta più del divario di prezzo su un asse: può essere self-hosted e può essere servito da chiunque. Claude Haiku 5.5 non può essere né l'uno né l'altro. Per un team con un requisito di conformità che impone che l'inferenza avvenga sul proprio hardware, o con un volume costante sufficiente a rendere l'ammortamento di una GPU più economico del pagamento per token, la linea GLM è l'unica delle due che risponde minimamente alla domanda. Per tutti gli altri — la maggioranza, che vuole un modello dietro un'API e preferirebbe non gestire il livello di serving — la licenza è una nota a piè di pagina e il prezzo è l'argomento.
Significa anche che i due modelli hanno modalità di guasto diverse quando un provider ha una giornata storta. Un modello chiuso servito solo dal suo fornitore e dai partner cloud di quel fornitore va giù quando questi vanno giù. Un modello aperto con diversi host indipendenti può essere sottoposto a failover tra di essi, a condizione che qualcosa esegua il failover. Questa è una differenza operativa reale ed è il tipo di cosa che emerge solo nel giorno in cui conta.
Instradando entrambi senza un secondo contratto
Se la decisione di cui sopra non si riduce a un unico vincitore per il vostro traffico — cosa che di solito non accade, perché i due modelli si battono a vicenda su metà diverse del listino prezzi — la domanda pratica è come gestirli entrambi senza mantenere due integrazioni. OrcaRouter serve z-ai/glm-5.3-flash a $0,15 e $0,50 per milione al prezzo di listino del fornitore, insieme a qwen/qwen3.8-flash e al resto di un catalogo di oltre 200 modelli, con una sola chiave e una sola fattura. Una variazione di prezzo di Anthropic su Claude Haiku 5.5, o una mossa di Z.ai sulla linea Flash, viene trasferita a markup zero lo stesso giorno invece di rincorrere il listino del rivenditore, così i numeri sopra restano i numeri che pagate davvero.
Non serviamo Claude Haiku 5.5 e non serviamo GLM-5.3-FlashX: nessuno dei due è nel nostro catalogo; per quelli, rivolgetevi direttamente ad Anthropic e Z.ai. Quello che serviamo è GLM-5.3-Flash, il modello di base sotto FlashX, che è la scelta giusta per i molti carichi di lavoro in cui il sovrapprezzo di servizio di 2,5 volte compra una capacità che nessuno ha chiesto. Quando un percorso di produzione dipende davvero da uno dei due modelli che non ospitiamo, il nostro failover è il meccanismo per provarlo senza puntare l'intero percorso su di esso: indirizzate la richiesta verso di esso, mantenete un modello funzionante come fallback e lasciate che il livello di routing decida quale dei due risponde.
Quale scegliere?
Sotto i 100.000 token per richiesta, Claude Haiku 5.5 vince sul prezzo ed è abbastanza vicino a FlashX in termini di capacità che la scelta è netta. Oltre i 100.000 token, GLM-5.3-FlashX costa meno del livello long-context di Haiku 5.5 ed è il modello a cui ricorrere se la dimensione della richiesta è una proprietà del compito anziché una scelta — anche se il GLM-5.3-Flash base costa ancora meno, e l'unico motivo per pagare il 2,5x è se hai specificamente bisogno del throughput pubblicizzato di FlashX.
L'inquadramento da scartare è che uno di questi sia l'opzione economica e l'altro l'opzione prestazionale. Sono entrambi modelli di fascia media con listini prezzi fissi e ben pubblicati, e la variabile interessante non è quale sia migliore, ma per quale metà del vostro traffico ciascuno dei due costi meno. Ricavate prima la distribuzione delle dimensioni delle vostre richieste; il confronto prezzi a due colonne qui sopra vi dirà il resto.
Confrontati in questo articolo1
Rilevato da questo articolo · Benchmark: Artificial Analysis · aggiornato ogni giorno
