Una hero card intitolata 'Parità assoluta a 0.32828' con Claude Haiku 5.5 e GLM 5.3 Flash ai due lati del numero, una riga che riporta Terminal Bench 4.0 0.32828, una riga Indice che riporta 43.40 contro 41.81, e il sottotitolo 'Stesso numero, macchine diverse'.
Guides & Insights

Claude Haiku 5.5 vs GLM 5.3 Flash: perfettamente alla pari sul benchmark citato da entrambi i fornitori

Autore

Rowan Sterling

Data di pubblicazione

Ultimi modelli · 20Vedi tutti i modelli →
Benchmark: Artificial Analysis · aggiornato ogni giorno
Torna a tutti gli articoli

Run Claude Haiku 5.5 and GLM 5.3 Flash through Terminal Bench 4.0 and you get the same number: 0.32828 for both. Not close — identical, to five decimal places, on the benchmark that the vendor leads with in its own launch materials and that Z.ai's launch materials lead with too. For two models built on entirely different stacks, by vendors in different countries, released six weeks apart, that is a coincidence worth stopping on.

È anche il numero sbagliato su cui basare la decisione. I due modelli si distinguono nettamente in tutti gli altri ambiti, e lo schema di questa separazione è abbastanza insolito da cambiare il modo in cui interpreti le dichiarazioni principali di entrambi i fornitori. Uno dei due vince l'indice composito e il valore del costo per attività. L'altro vince quasi tutto ciò che assomiglia a un'implementazione reale.

Non sono separati per capacità. Sono separati per forma.

Inizia con l'unico numero che dice "questi sono della stessa classe di modello".

• SciCode — 0,5498 per Claude Haiku 5.5 rispetto a 0,5162 per GLM 5.3 Flash. Due punti ad Anthropic, su un benchmark in cui due punti sono rumore.

• Terminal Bench 4.0 — 0.32828 contro 0.32828. Un pareggio, esattamente.

• Finestra di contesto — un milione di token per entrambi.

• Prezzo di output, prima fascia — 0,50 $ per milione di token per entrambi.

Quattro righe, quattro quasi corrispondenze. Se ti fermassi qui, concluderesti che questi modelli sono intercambiabili e sceglieresti in base al prezzo. Questa conclusione sarebbe sbagliata, e il prossimo gruppo di righe ne è la ragione.

Laddove divergono, la direzione è coerente

Le righe che effettivamente li separano non sono sparse. Si raggruppano in due gruppi, e ciascun modello possiede un gruppo in esclusiva.

Il gruppo agentico appartiene a GLM 5.3 Flash. Il punteggio parziale di AutomationBench è pari a 0.6037 per GLM 5.3 Flash contro 0.3541 per Claude Haiku 5.5 — un divario di 25 punti, la maggiore differenza singola tra questi due modelli su qualsiasi misurazione condivisa. Tau-Bench Banking registra 0.4722 per GLM 5.3 Flash; Claude Haiku 5.5 non ha alcun dato pubblicato su quella riga. GPQA registra 0.9121 per GLM 5.3 Flash; anche in questo caso non c'è un valore Anthropic con cui confrontarsi. Sulle misure che indicano se un modello è in grado di tenere insieme un compito multi-step e di usare gli strumenti in modo affidabile all'interno di un dominio strutturato, il modello di Z.ai è in vantaggio con un margine che fa impallidire la differenza dell'indice composito che va nella direzione opposta.

Il gruppo relativo a composito e costi appartiene a Claude Haiku 5.5. L'Intelligence Index v4.3.2 di Artificial Analysis riporta 43,40 contro 41,81 — 1,59 punti, ed è il numero che ogni riassunto di questo confronto cita. Il costo per attività Index completata riporta 0,21 $ contro 0,25 $. Il tempo effettivo per attività Index riporta 424,6 secondi contro 1.035,4 secondi: il modello di Anthropic termina in meno della metà del tempo.

Questa è la forma della scelta. Claude Haiku 5.5 è più veloce, costa meno per lavoro completato ed è più in alto nell'aggregato. GLM 5.3 Flash è più affidabile nella specifica classe di lavoro per cui si acquistano i modelli economici.

A two-column scoreboard titled 'Claude Haiku 5.5 vs GLM 5.3 Flash - the scoreboard' with rows Terminal Bench 4.0 0.32828 against 0.32828, SciCode 0.5498 against 0.5162, Humanity's Last Exam 0.4439 against 0.3985, AutomationBench 0.3541 against 0.6037, Index v4.3.2 43.40 against 41.81 and cost per task $0.21 against $0.25, footed 'Both figures per Artificial Analysis v4.3.2; Terminal Bench 4.0 is an exact tie.'

Qual è quello a cui credere?

Nessuno dei due, di per sé — e il disaccordo stesso è l'informazione.

Un Intelligence Index è una combinazione ponderata tra le categorie di ragionamento, scienza, programmazione e agentiche. È progettato per rispondere a "all'incirca quanto è capace questo modello" con un unico numero, e lo fa. Ciò che non può fare è dirti se un vantaggio di 1,59 punti proviene dalle categorie in cui risiede il tuo carico di lavoro o da quelle che non tocca mai. Qui, il vantaggio deriva sostanzialmente da righe come SciCode e Humanity's Last Exam — 0,5498 contro 0,5162, e 0,4439 contro 0,3985 — mentre un deficit di 25 punti si trova su AutomationBench con il segno opposto.

Un team che sviluppa un assistente di programmazione su un ciclo da terminale noterà il vantaggio di SciCode. Un team che sviluppa un agente che deve completare dall'inizio alla fine un flusso di lavoro bancario noterà il divario di AutomationBench, e lo noterà ogni singolo giorno. I due team guardano lo stesso indice e dovrebbero giungere a conclusioni opposte.

La mossa pratica è leggere il punteggio composito come un filtro, non come una classifica. Se due modelli si collocano entro circa due punti indice l'uno dall'altro, il punteggio composito vi ha detto che sono nella stessa fascia e non vi ha detto nulla su quale scegliere. A quel punto, le uniche righe che vale la pena leggere sono quelle che corrispondono al vostro carico di lavoro — e se un fornitore non ha pubblicato una riga che vi serve, l'assenza stessa è un dato, non una lacuna da colmare con supposizioni.

La riga del tokenizer che nessuno mette nella tabella di confronto

La documentazione stessa di Anthropic contiene una frase che cambia ogni confronto di prezzi che coinvolge Claude Haiku 5.5, ed è facile lasciarsela sfuggire. Il modello usa il tokenizer più recente, condiviso con Claude 4.7 e versioni successive, che conteggia lo stesso testo come circa il 30% di token in più rispetto al modello che sostituisce.

Confrontatelo con il listino prezzi e l'aritmetica diventa meno lusinghiera di quanto suggerisca il prezzo di copertina. La tariffa di input di Claude Haiku 5.5 è di $0,10 per milione di token contro gli $0,15 di GLM 5.3 Flash — un vantaggio di 1,5×. Se servono il 30% di token in più per lo stesso prompt, il vantaggio effettivo su un testo identico si restringe considerevolmente, anche se non svanisce. Le tariffe di output sono identiche a $0,50 nel primo livello, quindi l'effetto del tokenizer si applica senza nulla che lo compensi.

Il risultato misurato è la versione onesta dell'affermazione: secondo i calcoli della stessa Artificial Analysis, Claude Haiku 5.5 ha generato 162.164 token di output per attività dell'Indice contro 68.673 per GLM 5.3 Flash — 2,4 volte tanto — e nonostante ciò si è attestato a 0,21 $ per attività completata contro 0,25 $. Il vantaggio di tariffa sopravvive alla verbosità, e quel che ne resta è inferiore a quanto dice il listino prezzi.

Solo per uno dei due le tariffe sono indicate come fisse. Il prezzo di Claude Haiku 5.5 sale oltre i 100.000 token di prompt, arrivando a 0,50 $ per l'input e 2,50 $ per l'output; GLM 5.3 Flash non ha una soglia equivalente pubblicata. Per la maggior parte del traffico di chat e di assistenza al codice, quel salto di fascia non entra mai in gioco. Per il lavoro su documenti lunghi o con agenti a contesto ampio, invece, entra in gioco costantemente, e a quel punto il confronto si ribalta ben oltre quanto lascino intendere i numeri della prima fascia.

A capture of Anthropic's models-overview documentation table headed 'Lifecycle and reference', listing Claude Fable 5.1, Claude Opus 5.5, Claude Sonnet 5.5 and Claude Haiku 5.5 with context windows, maximum outputs, prices per million tokens, latency and default effort, and showing Claude Haiku 5.5 as 'This model' at 1M context, 128K maximum output and 'From $0.10/$0.50'.

La linea che lo decide prima che lo faccia qualsiasi numero

Tutto quanto sopra presuppone che tu possa scegliere liberamente tra questi due modelli. Una grande percentuale di team non può farlo, e il motivo è una singola riga della scheda tecnica che la discussione sui benchmark tende a seppellire.

GLM 5.3 Flash è a pesi aperti, rilasciato con licenza MIT, con 320 miliardi di parametri totali e 18 miliardi attivi. Può essere scaricato, ospitato autonomamente, sottoposto a fine-tuning, quantizzato, fissato a una versione ed eseguito all'interno di un ambiente tenant che controlli. Claude Haiku 5.5 è proprietario e disponibile solo tramite API, senza numero di parametri pubblicato, senza licenza e senza repository.

Se il tuo documento dei requisiti dice che il modello deve essere eseguito sul tuo hardware, o che uno specifico checkpoint deve restare invocabile per i prossimi tre anni, questo confronto è finito prima ancora di leggere la colonna del prezzo. Non è un tecnicismo. È la ragione più comune per cui i team finiscono su un modello open-weights di fascia media, ed è il motivo per cui un vantaggio di 25 punti su AutomationBench non è l'unica cosa che spinge verso Z.ai.

Vale anche al contrario, e la stessa onestà si applica. Anthropic pubblica un impegno di dismissione per Claude Haiku 5.5 non prima di ottobre 2027, e mantiene il modello su un'API first-party con una system card e un set di valutazione documentato. Un rilascio open-weights non è automaticamente più durevole: ereditì l'onere operativo insieme ai pesi, e un file di licenza non è un contratto di supporto. Quale dei due vuoi è una questione che riguarda il tuo team, non i modelli.

Entrambe le parti su un unico tasto, se vuoi risolverla empiricamente

GLM 5.3 Flash è nel catalogo OrcaRouter al prezzo di listino di Z.ai con 0% di ricarico, passato direttamente anziché miscelato, quindi la tariffa sopra indicata è la tariffa che compare in fattura e qualsiasi modifica apportata da Z.ai ricade dalla nostra parte lo stesso giorno. Claude Haiku 5.5 non è nel nostro catalogo — è raggiungibile tramite l'API di Anthropic stessa — ed è meglio dichiararlo piuttosto che lasciarlo implicito.

Ciò che il catalogo rende davvero facile è la forma di test che questo confronto richiede concretamente. Il disaccordo tra l'indice composito e le righe agentiche è un'ipotesi sul tuo carico di lavoro, e l'unico modo per risolverlo è eseguire entrambi i modelli sulla stessa traccia. Con GLM 5.3 Flash sulla rotta e una tratta Anthropic sull'altro lato dello stesso gateway, diventa un cambio di configurazione anziché due integrazioni — un'unica API per oltre 200 modelli, una sola chiave, failover automatico sotto, e il DSL di routing quando vuoi suddividere il traffico per classe di attività e leggere il costo su un'unica fattura.

A capture of the OrcaRouter model page for GLM 5.3 Flash under z-ai/glm-5.3-flash, showing a 1M-token context window, 128K maximum output, text, image and video input, benchmarks published by Z.ai on 2026-08-26, the description of its 320B total and 18B active parameters, and a price strip of $0.15 input, $0.50 output and $0.030 cache read per million tokens.

Il verdetto, formulato come i numeri lo sostengono

Se il tuo lavoro è testo in ingresso, testo in uscita, i tuoi prompt restano dentro la prima fascia di prezzo e paghi per token su volumi reali, qui Claude Haiku 5.5 è il modello migliore: composito più alto, più economico per attività completata e più del doppio più veloce per attività. Il risultato di punta del terminal-benchmark è un pareggio e non dovrebbe essere usato per decidere alcunché.

Se il tuo lavoro è un agente che deve completare un flusso di lavoro in più passaggi senza supervisione, GLM 5.3 Flash è in vantaggio di 25 punti sull'unico benchmark condiviso che misura esattamente questo, ed è il più economico dei due da modificare perché puoi disporre dei pesi.

Il pareggio a 0,32828 è l'immagine giusta per questa coppia, ma non perché i modelli siano equivalenti. È l'unica riga in cui due modelli che non hanno quasi nient'altro in comune finiscono per caso sulla stessa cifra — e trattare quella cifra come sintesi del confronto è il modo in cui una decisione di approvvigionamento viene presa sul numero meno informativo della tabella.