
Claude Haiku 5.5 vs Qwen3.8-Flash-Next: il modello open-weight non è quello economico
- openaiNUOVOOpenAI: GPT-6.1 Sol2026-09-2952Intelligenza
- anthropicNUOVOAnthropic: Claude Sonnet 5.52026-09-2856Intelligenza
- typesafeTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 per 1M di token · 111 tok/s
- OpenAIOpenAI: GPT-6 Luna2026-09-2238Intelligenza
- OpenAIOpenAI: GPT-6 Sol2026-09-2248Intelligenza
- AnthropicAnthropic: Claude Opus 5.52026-09-2258Intelligenza
- xAIGrok 4.72026-09-2146Intelligenza
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 per 1M di token · 55 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 per 1M di token · 347 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligenza
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Intelligenza77Codice
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Intelligenza76Codice
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Intelligenza76Codice
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Intelligenza82Codice
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 per 1M di token · 60 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1M di token · 377 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligenza72Codice
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 per 1M di token · 231 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Intelligenza75Codice
- obsidianQwen3.8 27B2026-08-1534Intelligenza68Codice
L'istinto è che un modello a pesi aperti della fascia flash di Alibaba batta sul prezzo un modello chiuso di fascia small di Anthropic, e sui due numeri di listino in effetti lo fa: Qwen3.8-Flash-Next viene erogato a 0,15 $ per milione di token in input e 0,47 $ per milione in output sull'API di Alibaba stessa, contro 0,10 $ e 0,50 $ per Claude Haiku 5.5. Se però li si mette entrambi alla prova sulla stessa suite di benchmark, l'ordine si inverte. Artificial Analysis misura Claude Haiku 5.5 a sforzo Max a 0,21 $ per ogni attività dell'Intelligence Index portata a termine; Qwen3.8-Flash-Next costa 0,37 $ sulla stessa misura, per un punteggio inferiore di tre punti. Il listino più conveniente appartiene al modello con il conto più salato, e il motivo è lo stesso che decide la maggior parte di questi confronti: il tariffario non è il prezzo, e il modello a pesi aperti si guadagna da vivere da qualche altra parte, non certo su una bolletta API gestita. Quel "da qualche altra parte" è il vero oggetto di questo confronto.
Che cosa è ciascuno
I due sono arrivati a sei settimane di distanza l'uno dall'altro e non sono lo stesso tipo di artefatto.
• Claude Haiku 5.5 — un modello a pesi chiusi rilasciato il 7 ottobre 2026, su Claude API, Amazon Bedrock, Google Cloud, Microsoft Foundry e Claude Platform su AWS. Contesto da 1M di token, fino a 128.000 token di output sulla Messages API sincrona, thinking adattivo con un selettore di effort da Low a Max e un valore predefinito medium, data di cutoff delle conoscenze a giugno 2026 e una struttura tariffaria a scaglioni che cambia a 100.000 token.
• Qwen3.8-Flash-Next — un modello mixture-of-experts a pesi aperti rilasciato il 26 agosto 2026 con licenza qwen-community-1.0, descritto da Alibaba come un'anteprima sperimentale dell'architettura che sarà alla base di Qwen4. Memorizza 125B parametri del modello principale più una tabella di embedding n-gram separata da 51B — circa 176B prima di un modulo di previsione multi-token da 4B — e attiva 6B per token, con 512 esperti, routing top-10 e 48 livelli. È nativamente 262.144 token di contesto, estendibile a 1M con YaRN, e accetta input di testo, immagini e video.
• Qwen3.8-Flash — la controparte commerciale erogata come servizio, anch'essa attiva dal 26 agosto 2026 su QwenCloud di Alibaba a $0,16 per milione di token in input e $0,47 per milione in output, con un contesto predefinito di 1M token. Vale la pena tenerla separata da Flash-Next: uno è un checkpoint che puoi scaricare e ispezionare, l'altro è un endpoint gestito a pagamento.
La distinzione tra gli ultimi due è l'intera ragione per cui questo confronto è interessante. Claude Haiku 5.5 e Qwen3.8-Flash-Next competono su ben poco, perché solo uno dei due può essere eseguito sul proprio hardware.
Il becco misurato, che punta nella direzione opposta
Tutti i seguenti valori indipendenti provengono da Artificial Analysis sull'Intelligence Index v4.3.2. Le schede tariffarie di Anthropic e Alibaba riportano i prezzi pubblicati dai rispettivi fornitori.
• Intelligence Index — Claude Haiku 5.5 a sforzo Massimo 43, secondo su 182 modelli. Qwen3.8-Flash-Next 40, sesto su 117 nella sua classe. Tre punti di distacco, a favore di Anthropic.
• Costo per attività — $0,21 contro $0,37. Il modello più costoso per token costa il 43% in meno per attività completata.
• Token di output nell'esecuzione dell'Index — 440 milioni per Claude Haiku 5.5 e 240 milioni per Qwen3.8-Flash-Next, entrambi rispetto a una mediana di 100 milioni. Il modello Qwen è lo scrittore più efficiente e resta comunque il task più costoso, il che dice che il divario non sta solo nel volume di token ma nel mix di input e nella valutazione che applica il valutatore.
• Velocità di output — 241,9 token al secondo contro 56,0. Claude Haiku 5.5 è più di quattro volte più veloce sulla stessa misurazione, e il suo tempo al primo token di 295 secondi in quella prova è un artefatto del pensiero a Max effort più che un dato di rete; il tempo al primo token di Qwen3.8-Flash-Next è di 2,53 secondi.
• Struttura della rate card — Haiku 5.5 passa da 0,10 $ e 0,50 $ a 0,50 $ e 2,50 $ a 100.000 token. Qwen3.8-Flash rimane fisso a 0,16 $ e 0,47 $ indipendentemente dalla lunghezza, il che è un vantaggio reale sui prompt lunghi e l'unico punto in cui l'argomento del prezzo di listino sopravvive al contatto con un documento lungo.
• Tokenizzatore — Claude Haiku 5.5 utilizza il tokenizer più recente condiviso con Claude 4.7 e versioni successive, quindi lo stesso testo viene conteggiato come circa il 30% in più di token rispetto al precedente Haiku. Ciò gonfia i prompt verso il limite di 100.000 token; è documentazione di Anthropic stessa, e va a sfavore del modello proprio nel caso dei prompt lunghi in cui la tariffa fissa di Qwen sembra migliore.
Quindi la forma dello scambio è questa: paghi di più per token, ottieni una risposta più veloce e leggermente più intelligente che costa meno per attività completata, con un salto di tariffa da tenere d'occhio sugli input lunghi. Oppure paghi meno per token e ottieni un modello più lento che costa di più per attività completata, con una tariffa fissa e una finestra nativa di 262.144 token.


Dove i pesi aperti cambiano davvero l'aritmetica
Tutto quanto sopra mette a confronto due API gestite, e questo è il confronto che Qwen3.8-Flash-Next non è stato progettato per vincere. Il suo argomento è che non deve essere affittato.
• Supporto al serving dal day-zero. SGLang ha pubblicato una pagina cookbook e un'immagine dedicata; vLLM ha una build dedicata mentre la pull request per il supporto all'architettura è ancora aperta. NVIDIA ha convalidato entrambe, insieme a TensorRT LLM, su un rack GB300 NVL72, e NeMo copre il fine-tuning.
• Il requisito hardware minimo è basso per un checkpoint da 176B. La tabella di embedding n-gram da 51B può risiedere nella memoria host anziché nella VRAM, perché i suoi indirizzi di lookup sono noti in anticipo e possono essere prefetchati. Questo è ciò che consente al modello di girare su cluster DGX Spark e workstation 4×RTX PRO 6000, e le quantizzazioni della community pubblicate in giornata — build a 1 bit che stanno in 75GB di RAM a circa l'80% della precisione completa — lo collocano su hardware che un piccolo team possiede.
• Il fine-tuning è disponibile. Non nel senso di un'API di tuning ospitata: i pesi sono tuoi, sotto una licenza community con le solite condizioni, e l'architettura è documentata in un rapporto tecnico che pubblica le ablazioni e i risultati negativi.
• La finestra è più piccola di quanto sembri. 262.144 token nativamente, estensibili a 1M con YaRN — contro 1M nativi su Claude Haiku 5.5, senza alcun caveat sul rope-scaling. Nei carichi di lavoro su documenti lunghi, dove la tariffa fissa di Qwen sembra più allettante, il modello che riesce davvero a contenere il documento è l'altro.
• I benchmark sono dichiarati dal fornitore. La tabella di Alibaba stessa colloca Flash-Next davanti a DeepSeek-V4-Flash-0731 su DeepSWE 1.1 (58,7 contro 54,4), SWE-bench Pro (62,0 contro 56,0) e GPQA Diamond (91,7 contro 90,8), e dietro di esso su NL2Repo-Bench (48,1 contro 54,2) — generazione di codice a livello di repository, l'unica dimensione agentica in cui il modello più piccolo non tiene il passo. Nessuno di questi dati è stato riprodotto da terzi, e il modello ha sei settimane.
Questo è il confine onesto tra i due. Claude Haiku 5.5 è un servizio a consumo con un tetto di qualità fisso e nessuna superficie operativa. Qwen3.8-Flash-Next è un artefatto la cui curva dei costi si piega verso il prezzo dell'elettricità e il cui tetto di qualità è quello che riesci a servire, più il rischio di una tabella di benchmark non riprodotta e di un'architettura ancora in fase di assorbimento da parte dei runtime.
Il modo realistico di decidere
Tre domande bastano a risolverlo, e solo la prima riguarda i benchmark.
Hai delle GPU, o le vorresti? In caso contrario, lo scenario self-host è teorico e il confronto con le soluzioni gestite di cui sopra è tutto ciò che conta — e pende a favore di Claude Haiku 5.5 per costo per attività, velocità e punteggio, con l'avvertenza che il suo passo da 100.000 token penalizza i prompt lunghi. Se invece hai acceleratori che restano al di sotto di un obiettivo di utilizzo, Qwen3.8-Flash-Next è uno dei pochi modelli aperti in cui una decodifica con 6B di parametri attivi è davvero economica da eseguire su larga scala, e la cifra di $0.37 per attività smette di essere il numero rilevante.
Quanto è lungo il prompt medio? Questo è l'unico punto in cui l'argomento del prezzo di listino regge. Sotto i 100.000 token — dopo un tokenizzatore che gonfia di circa il 30% — Claude Haiku 5.5 è più economico su ogni metrica. Al di sopra, il prezzo fisso di $0,16 e $0,47 è la carta migliore, e il suo vantaggio si amplia con la lunghezza proprio fino alla finestra nativa di 262.144 token, oltre la quale l'estensione YaRN è un diverso problema di ingegneria.
Qual è la tolleranza del carico di lavoro alla variabilità della latenza? 241,9 token di output al secondo contro 56,0 è un divario ampio, e un deployment self-hosted vi aggiunge l'accodamento. Un agente di supporto in tempo reale o che pilota il browser — i carichi di lavoro che Anthropic indica per questo livello — percepirà la differenza.
Per chiunque voglia rispondere alla seconda e alla terza domanda invece di ragionarci sopra, lo strumento più economico è un endpoint condiviso. Qwen3.8-Flash-Next non è ancora nel catalogo di OrcaRouter, e nemmeno Claude Haiku 5.5; il fratello Qwen che instradiamo è Qwen3.8-Flash, al prezzo di listino del provider, con lo 0% di markup applicato in pass-through, che è l'equivalente servito più vicino al modello di questo confronto e la baseline giusta per un test di costo su prompt lunghi. Sul fronte Anthropic, Claude Haiku 4.5, Claude Sonnet 5.5 e Claude Opus 5.5 sono tutti richiamabili oggi dalla stessa chiave, quindi un esperimento di prezzo su due generazioni è una configurazione anziché un secondo contratto — e poiché il prezzo è in pass-through anziché misto, un taglio del fornitore su una delle due gambe si vede dalla nostra parte lo stesso giorno in cui viene annunciato. Il failover automatico è ciò che rende l'esperimento sicuro da eseguire su traffico reale: un modello in anteprima o una tabella di benchmark non riprodotta è esattamente il caso in cui conviene puntare una rotta su qualcosa di nuovo mentre dietro resta un modello affidabile.
Cosa cambierebbe la risposta
Due cose, entrambe verificabili. La prima è la valutazione indipendente di Qwen3.8-Flash-Next su un harness che esegue anche Claude Haiku 5.5 — la tabella del fornitore è contro DeepSeek, e il 40 della classifica indipendente è un singolo posizionamento. Un punteggio di coding a livello di repository è la riga da tenere d'occhio, perché NL2Repo è l'ambito in cui il modello ha già dimostrato di restare indietro. La seconda è se il lavoro sul runtime si concretizza: il supporto vLLM è ancora in fase di merge tramite pull request aperte, e finché non lo sarà, il self-hosting di questa architettura è un esercizio per team a cui piace questo genere di cose, più che un percorso supportato.
Fino ad allora il riepilogo è breve. Qwen3.8-Flash-Next è il modello più interessante da possedere e quello più costoso da noleggiare. Claude Haiku 5.5 è l'endpoint gestito più economico, più veloce e con punteggi più alti, con un tariffario che penalizza tutto ciò che è lungo. Scegli in base a se stai acquistando token o acquistando un checkpoint — e se stai acquistando token, nota che il modello open-weight non è lo sconto che avevi dato per scontato.

