
Claude Haiku 5.5 puntava alla fascia Flash cinese. Solo la metà di quell'affermazione regge al vaglio.
- openaiNUOVOOpenAI: GPT-6.1 Sol2026-09-2952Intelligenza
- anthropicNUOVOAnthropic: Claude Sonnet 5.52026-09-2856Intelligenza
- typesafeNUOVOTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 per 1M di token · 128 tok/s
- OpenAIOpenAI: GPT-6 Luna2026-09-2238Intelligenza
- OpenAIOpenAI: GPT-6 Sol2026-09-2248Intelligenza
- AnthropicAnthropic: Claude Opus 5.52026-09-2258Intelligenza
- xAIGrok 4.72026-09-2146Intelligenza
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 per 1M di token · 60 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 per 1M di token · 320 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligenza
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Intelligenza77Codice
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Intelligenza76Codice
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Intelligenza76Codice
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Intelligenza82Codice
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 per 1M di token · 54 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1M di token · 356 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligenza72Codice
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 per 1M di token · 232 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Intelligenza75Codice
- obsidianQwen3.8 27B2026-08-1534Intelligenza68Codice
Un lettore che scrive in cinese ha avanzato questa settimana un'argomentazione incisiva: Claude Haiku 5.5 sembra costruito per conquistare il mercato cinese di fascia media, perché batte DeepSeek V4.1 Flash e GLM 5.3 Flash sul prezzo e ottiene punteggi superiori a GLM 5.3 Flash su Terminal Bench 4.0 e sull'Artificial Analysis Intelligence Index. È una lettura più acuta della maggior parte dei commenti sul lancio. Si tratta anche di due affermazioni che indossano un unico cappotto, e non hanno lo stesso grado di verità.
Anthropic ha rilasciato Claude Haiku 5.5 il 7 ottobre 2026 — un lancio pubblico completo con un annuncio datato, una system card e un listino prezzi pubblicato. Questo dà all'affermazione qualcosa che i commenti di mercato di seconda mano raramente ottengono: numeri che puoi verificare.
L'audit di seguito rileva che una metà è più forte di quanto abbia detto il lettore e che l'altra metà è sbagliata sul benchmark specifico che cita. Vale la pena conoscere entrambi i risultati, perché puntano in direzioni opposte.
L'affermazione, formulata con precisione
Ridotto ai suoi elementi, l'argomento si compone di tre parti.
• Prezzo — Claude Haiku 5.5 costa meno di DeepSeek V4.1 Flash e meno di GLM 5.3 Flash.
• Punteggio indipendente — si colloca circa un punto al di sopra di GLM 5.3 Flash nell'Artificial Analysis Intelligence Index.
• Benchmark di coding — ottiene anche un punto in più rispetto a GLM 5.3 Flash su Terminal Bench 4.0.
Due di questi sono verificabili rispetto a tabelle pubblicate e reggono, con aggiustamenti. Il terzo è verificabile rispetto alla stessa tabella e risulta diverso da come descritto.

La parte sul prezzo: vera, e sottostimata in una direzione, sovrastimata in un’altra
La tariffa pubblicata da Anthropic per Claude Haiku 5.5 è di $0,10 per milione di token di input e $0,50 per milione di token di output fino a un prompt di 100.000 token, salendo a $0,50 e $2,50 oltre tale soglia. Le letture dell'input in cache costano $0,01 e le scritture $0,125. La finestra di contesto è di un milione di token; l'output massimo è di 128.000.
GLM 5.3 Flash, di Z.ai, è listato a $0,15 e $0,50, con input in cache a $0,026. DeepSeek V4.1 Flash è listato a $0,30 e $1,20, con input in cache a $0,006.
Sulla tariffa principale, il lettore ha ragione. Un output da 0,50 $ corrisponde esattamente a GLM 5.3 Flash, mentre si colloca ben al di sotto di quello di DeepSeek. È un posizionamento che appare deliberato: eguagliare l'output del rivale più economico, batterlo sull'input e lasciare che sia il rapporto a parlare.
Dove la tesi migliora è nel costo misurato per attività completata. Sull'Intelligence Index v4.3.2 di Artificial Analysis, il costo per l'intero lavoro risulta di 0,21 $ per Claude Haiku 5.5, 0,25 $ per GLM 5.3 Flash e 0,27 $ per DeepSeek V4.1 Flash. Il listino prezzi dice che Claude Haiku 5.5 costa 1,5 volte meno di GLM 5.3 Flash sull'input; la misurazione dice che il lavoro completato costa circa un sesto in meno. Resta comunque il più economico dei tre — solo non con il margine che il prezzo di listino lascia intendere.
Il motivo è quello che quasi tutti i confronti di prezzo trascurano. Claude Haiku 5.5 è prolisso. Artificial Analysis ha registrato 162.164 token di output per esso durante l'esecuzione dell'Index, contro 68.673 per GLM 5.3 Flash e 88.574 per DeepSeek V4.1 Flash. La documentazione di Anthropic aggiunge un secondo effetto: il modello usa il tokenizer più recente condiviso con Claude 4.7 e versioni successive, quindi lo stesso testo viene conteggiato con circa il 30% di token in più rispetto al modello che sostituisce. Una tariffa più economica applicata a più token è una tariffa più economica applicata a più token.
Una complicazione che emerge solo su una fattura instradata: il nostro stesso catalogo elenca DeepSeek V4.1 Flash a $0,15 per l'input e $0,60 per l'output, con un moltiplicatore 2× applicato durante due finestre giornaliere, 01:00–04:00 e 06:00–10:00 UTC. Per diciotto ore al giorno questa è la tariffa base; per sei ore al giorno la tariffa di output è $1,20. Il traffico batch che può essere pianificato al di fuori di quelle finestre ottiene un prezzo DeepSeek sensibilmente migliore di quanto suggerisca la tariffa di listino pubblicizzata dal fornitore, mentre il traffico interattivo no. Se stai modellando davvero questo confronto, il calendario conta tanto quanto il listino.

La metà del punteggio: "circa un punto" è 1,6
Sull'Artificial Analysis Intelligence Index v4.3.2, Claude Haiku 5.5 è misurato a 43,40 nella sua configurazione Max. GLM 5.3 Flash è misurato a 41,81. DeepSeek V4.1 Flash si attesta a 39,46.
Quindi la metà della tesi relativa all'indice è direzionalmente corretta e arrotonda per difetto: il divario è di 1,59 punti, non di uno. È un vero vantaggio su un indice che arriva ai sessanta, ed è il numero che viene citato in ogni riepilogo di questo confronto.
Quello che non è è un'affermazione sui benchmark sottostanti. Entrambi i fornitori pubblicano i propri set di valutazione, e non sono gli stessi set — Anthropic riporta GDPval-AA v2.1, OSWorld 2.1, Terminal-Bench 4.0 e FrontierCode per Claude Haiku 5.5; Z.ai riporta la propria suite per GLM 5.3 Flash. La classifica indipendente è l'unica riga di confronto alla pari disponibile, ed è esattamente per questo che si fa così tanto affidamento sul divario dell'indice e che la sezione successiva conta.
La metà dedicata alla programmazione: questa è un pareggio netto, non una vittoria.
Terminal Bench 4.0, secondo la misurazione indipendente condivisa, registra 0,32828 per Claude Haiku 5.5 e 0,32828 per GLM 5.3 Flash. Identico fino alla quinta cifra decimale.
Quello è il numero più citabile in assoluto in questo confronto, e l'affermazione al riguardo è sbagliata. La probabile fonte di confusione è la riga adiacente: il modello completo GLM-5.3, il fratello non-Flash, ottiene 0,4192 sullo stesso benchmark. Se hai visto "GLM" e "Terminal Bench" in una stessa frase accanto a un numero un punto sopra Claude Haiku 5.5, quello è il fratello, non la versione Flash.
Le altre tre righe che Artificial Analysis pubblica per entrambi i modelli sono più interessanti del pareggio e non indicano una direzione unica:
• SciCode — 0,5498 per Claude Haiku 5.5 contro 0,5162 per GLM 5.3 Flash. Un vantaggio di 3,4 punti per Anthropic.
• Humanity's Last Exam — 0,4439 contro 0,3985. Un vantaggio di 4,5 punti per Anthropic.
• AutomationBench, punteggio parziale — 0,3541 contro 0,6037. Un vantaggio di 25 punti per GLM 5.3 Flash, e di gran lunga il divario più ampio del set.
Quell'ultima riga è quella a cui i team di procurement terranno maggiormente, perché l'automazione agentica è l'ambito in cui i modelli di fascia media vengono effettivamente implementati. Su una misura della capacità del modello di portare a termine un'attività a più passaggi, il modello open-weights meno costoso da eseguire vince con un margine che fa impallidire la differenza di 1,6 punti nell'indice nella direzione opposta.
La velocità si divide allo stesso modo del prezzo, anzi in misura ancora maggiore. Artificial Analysis ha misurato 424,6 secondi per attività dell'Index per Claude Haiku 5.5 contro 1035,4 secondi per GLM 5.3 Flash. Il modello di Anthropic arriva in meno della metà del tempo effettivo, che su un ciclo di agenti è un numero operativo più importante del tasso di token.
Ciò che l'affermazione omette del tutto
Il confronto è impostato come una storia di prezzo e punteggio, che salta silenziosamente la dimensione in cui i due modelli sono meno simili. GLM 5.3 Flash è a pesi aperti, pubblicato con licenza MIT, con 320 miliardi di parametri totali e 18 miliardi attivi. DeepSeek V4.1 Flash è parimenti a pesi aperti, con 552 miliardi totali e 16 miliardi attivi. Claude Haiku 5.5 è proprietario, solo API, senza un numero di parametri pubblicato e senza repository.
Per molti acquirenti non è una nota a piè di pagina; è la prima riga del documento dei requisiti. Un team che deve eseguire inferenza nella propria tenancy, fare fine-tuning o mantenere fissa una versione del modello per anni non sta affatto scegliendo tra questi tre in base ai punti dell'indice — due dei tre sono esclusi prima ancora che si legga la colonna del prezzo. L'inquadramento del lettore è un'osservazione di posizionamento di mercato ed è equa; capita solo che la differenza strutturale vada contro il modello che l'inquadramento difende.
Eseguire il confronto da soli
GLM 5.3 Flash e DeepSeek V4.1 Flash sono entrambi nel catalogo OrcaRouter al prezzo di listino del provider con 0% di markup, il che rende il lato cinese di questo confronto qualcosa che puoi chiamare oggi invece di simulare in un foglio di calcolo. Poiché la tariffa viene passata così com’è invece di essere combinata, una variazione di prezzo del fornitore arriva dalla nostra parte lo stesso giorno in cui arriva dalla loro — e la finestra DeepSeek basata sul calendario descritta sopra è visibile nello stesso blocco di prezzi su cui faresti routing. Una chiave, un SDK, failover automatico sotto, e il DSL di routing se preferisci esprimere un tetto di costo nella route piuttosto che nel codice dell’applicazione.
Claude Haiku 5.5 non è nel nostro catalogo. È raggiungibile tramite l'API di Anthropic, ed è meglio dirlo chiaramente piuttosto che lasciarlo implicito.

Cosa ha capito bene il lettore, e cosa farne
L'istinto è giusto. Se volessi far sembrare costosa l'ondata di modelli cinesi di fascia media economici e capaci, questa è più o meno la carta che giocheresti: eguagliare la tariffa di output del rivale più economico, dimezzare la sua tariffa di input, arrivare 1,6 punti indice davanti e lasciare che sia il dato del prezzo per attività completata a sostenere la tesi. Claude Haiku 5.5 lo fa, e lo fa essendo più del doppio più veloce per attività rispetto al modello che prende di mira.
Ciò che il lettore ha sbagliato è più circoscritto e più interessante. Terminal Bench 4.0 non è una vittoria; è un pareggio esatto. Il vantaggio di prezzo, quando si fattura l'intero lavoro invece che il token, è circa un sesto anziché l'1,5× suggerito dal listino. E l'unico benchmark in cui i due modelli sono più distanti è quello agentico, dove GLM 5.3 Flash è in vantaggio di 25 punti.
Quindi la versione onesta dell'argomentazione è questa: Claude Haiku 5.5 è pensato per la fascia flash cinese, vince quel confronto sull'indice composito, sul costo per attività completata e sulla latenza, non lo vince sull'automazione agentica né sull'apertura, e il vantaggio specifico nei benchmark di programmazione che faceva sembrare decisiva l'argomentazione non esiste.
Confrontati in questo articolo2
Rilevato da questo articolo · Benchmark: Artificial Analysis · aggiornato ogni giorno
