Una scheda del titolo generata che recita "Claude Haiku 5.5 vs Qwen3.8-Flash-Next" con il sottotitolo "Il modello open-weight non è quello economico", una barra etichettata "Costo per attività completata dell'Intelligence Index" contrassegnata $0.21 per Claude Haiku 5.5 e $0.37 per Qwen3.8-Flash-Next, e una riga a piè di pagina che recita "Cifre indipendenti per Artificial Analysis; prezzi per Anthropic e Alibaba." Il vero logo OrcaRouter è composto in basso a destra.
Guides & Insights

Claude Haiku 5.5 vs Qwen3.8-Flash-Next: il modello open-weight non è quello economico

Autore

Rowan Sterling

Data di pubblicazione

Ultimi modelli · 20Vedi tutti i modelli →
Benchmark: Artificial Analysis · aggiornato ogni giorno
Torna a tutti gli articoli

L'istinto è che un modello a pesi aperti della fascia flash di Alibaba batta sul prezzo un modello chiuso di fascia small di Anthropic, e sui due numeri di listino in effetti lo fa: Qwen3.8-Flash-Next viene erogato a 0,15 $ per milione di token in input e 0,47 $ per milione in output sull'API di Alibaba stessa, contro 0,10 $ e 0,50 $ per Claude Haiku 5.5. Se però li si mette entrambi alla prova sulla stessa suite di benchmark, l'ordine si inverte. Artificial Analysis misura Claude Haiku 5.5 a sforzo Max a 0,21 $ per ogni attività dell'Intelligence Index portata a termine; Qwen3.8-Flash-Next costa 0,37 $ sulla stessa misura, per un punteggio inferiore di tre punti. Il listino più conveniente appartiene al modello con il conto più salato, e il motivo è lo stesso che decide la maggior parte di questi confronti: il tariffario non è il prezzo, e il modello a pesi aperti si guadagna da vivere da qualche altra parte, non certo su una bolletta API gestita. Quel "da qualche altra parte" è il vero oggetto di questo confronto.

Che cosa è ciascuno

I due sono arrivati a sei settimane di distanza l'uno dall'altro e non sono lo stesso tipo di artefatto.

• Claude Haiku 5.5 — un modello a pesi chiusi rilasciato il 7 ottobre 2026, su Claude API, Amazon Bedrock, Google Cloud, Microsoft Foundry e Claude Platform su AWS. Contesto da 1M di token, fino a 128.000 token di output sulla Messages API sincrona, thinking adattivo con un selettore di effort da Low a Max e un valore predefinito medium, data di cutoff delle conoscenze a giugno 2026 e una struttura tariffaria a scaglioni che cambia a 100.000 token.

• Qwen3.8-Flash-Next — un modello mixture-of-experts a pesi aperti rilasciato il 26 agosto 2026 con licenza qwen-community-1.0, descritto da Alibaba come un'anteprima sperimentale dell'architettura che sarà alla base di Qwen4. Memorizza 125B parametri del modello principale più una tabella di embedding n-gram separata da 51B — circa 176B prima di un modulo di previsione multi-token da 4B — e attiva 6B per token, con 512 esperti, routing top-10 e 48 livelli. È nativamente 262.144 token di contesto, estendibile a 1M con YaRN, e accetta input di testo, immagini e video.

• Qwen3.8-Flash — la controparte commerciale erogata come servizio, anch'essa attiva dal 26 agosto 2026 su QwenCloud di Alibaba a $0,16 per milione di token in input e $0,47 per milione in output, con un contesto predefinito di 1M token. Vale la pena tenerla separata da Flash-Next: uno è un checkpoint che puoi scaricare e ispezionare, l'altro è un endpoint gestito a pagamento.

La distinzione tra gli ultimi due è l'intera ragione per cui questo confronto è interessante. Claude Haiku 5.5 e Qwen3.8-Flash-Next competono su ben poco, perché solo uno dei due può essere eseguito sul proprio hardware.

Il becco misurato, che punta nella direzione opposta

Tutti i seguenti valori indipendenti provengono da Artificial Analysis sull'Intelligence Index v4.3.2. Le schede tariffarie di Anthropic e Alibaba riportano i prezzi pubblicati dai rispettivi fornitori.

• Intelligence Index — Claude Haiku 5.5 a sforzo Massimo 43, secondo su 182 modelli. Qwen3.8-Flash-Next 40, sesto su 117 nella sua classe. Tre punti di distacco, a favore di Anthropic.

• Costo per attività — $0,21 contro $0,37. Il modello più costoso per token costa il 43% in meno per attività completata.

• Token di output nell'esecuzione dell'Index — 440 milioni per Claude Haiku 5.5 e 240 milioni per Qwen3.8-Flash-Next, entrambi rispetto a una mediana di 100 milioni. Il modello Qwen è lo scrittore più efficiente e resta comunque il task più costoso, il che dice che il divario non sta solo nel volume di token ma nel mix di input e nella valutazione che applica il valutatore.

• Velocità di output — 241,9 token al secondo contro 56,0. Claude Haiku 5.5 è più di quattro volte più veloce sulla stessa misurazione, e il suo tempo al primo token di 295 secondi in quella prova è un artefatto del pensiero a Max effort più che un dato di rete; il tempo al primo token di Qwen3.8-Flash-Next è di 2,53 secondi.

• Struttura della rate card — Haiku 5.5 passa da 0,10 $ e 0,50 $ a 0,50 $ e 2,50 $ a 100.000 token. Qwen3.8-Flash rimane fisso a 0,16 $ e 0,47 $ indipendentemente dalla lunghezza, il che è un vantaggio reale sui prompt lunghi e l'unico punto in cui l'argomento del prezzo di listino sopravvive al contatto con un documento lungo.

• Tokenizzatore — Claude Haiku 5.5 utilizza il tokenizer più recente condiviso con Claude 4.7 e versioni successive, quindi lo stesso testo viene conteggiato come circa il 30% in più di token rispetto al precedente Haiku. Ciò gonfia i prompt verso il limite di 100.000 token; è documentazione di Anthropic stessa, e va a sfavore del modello proprio nel caso dei prompt lunghi in cui la tariffa fissa di Qwen sembra migliore.

Quindi la forma dello scambio è questa: paghi di più per token, ottieni una risposta più veloce e leggermente più intelligente che costa meno per attività completata, con un salto di tariffa da tenere d'occhio sugli input lunghi. Oppure paghi meno per token e ottieni un modello più lento che costa di più per attività completata, con una tariffa fissa e una finestra nativa di 262.144 token.

A screenshot of OrcaRouter's model page for qwen/qwen3.8-flash, showing the model card and its list pricing of $0.15 per million input tokens and $0.47 per million output tokens, captured in English.A screenshot of the Artificial Analysis model page for Claude Haiku 5.5 at maximum effort, showing an Intelligence Index of 43 on v4.3.2 at rank 2 of 182 models, a 1,000,000-token context window, 241.9 output tokens per second at rank 8 of 182, a cost of $0.21 per Intelligence Index task, and 440 million output tokens against a 100 million median.

Dove i pesi aperti cambiano davvero l'aritmetica

Tutto quanto sopra mette a confronto due API gestite, e questo è il confronto che Qwen3.8-Flash-Next non è stato progettato per vincere. Il suo argomento è che non deve essere affittato.

• Supporto al serving dal day-zero. SGLang ha pubblicato una pagina cookbook e un'immagine dedicata; vLLM ha una build dedicata mentre la pull request per il supporto all'architettura è ancora aperta. NVIDIA ha convalidato entrambe, insieme a TensorRT LLM, su un rack GB300 NVL72, e NeMo copre il fine-tuning.

• Il requisito hardware minimo è basso per un checkpoint da 176B. La tabella di embedding n-gram da 51B può risiedere nella memoria host anziché nella VRAM, perché i suoi indirizzi di lookup sono noti in anticipo e possono essere prefetchati. Questo è ciò che consente al modello di girare su cluster DGX Spark e workstation 4×RTX PRO 6000, e le quantizzazioni della community pubblicate in giornata — build a 1 bit che stanno in 75GB di RAM a circa l'80% della precisione completa — lo collocano su hardware che un piccolo team possiede.

• Il fine-tuning è disponibile. Non nel senso di un'API di tuning ospitata: i pesi sono tuoi, sotto una licenza community con le solite condizioni, e l'architettura è documentata in un rapporto tecnico che pubblica le ablazioni e i risultati negativi.

• La finestra è più piccola di quanto sembri. 262.144 token nativamente, estensibili a 1M con YaRN — contro 1M nativi su Claude Haiku 5.5, senza alcun caveat sul rope-scaling. Nei carichi di lavoro su documenti lunghi, dove la tariffa fissa di Qwen sembra più allettante, il modello che riesce davvero a contenere il documento è l'altro.

• I benchmark sono dichiarati dal fornitore. La tabella di Alibaba stessa colloca Flash-Next davanti a DeepSeek-V4-Flash-0731 su DeepSWE 1.1 (58,7 contro 54,4), SWE-bench Pro (62,0 contro 56,0) e GPQA Diamond (91,7 contro 90,8), e dietro di esso su NL2Repo-Bench (48,1 contro 54,2) — generazione di codice a livello di repository, l'unica dimensione agentica in cui il modello più piccolo non tiene il passo. Nessuno di questi dati è stato riprodotto da terzi, e il modello ha sei settimane.

Questo è il confine onesto tra i due. Claude Haiku 5.5 è un servizio a consumo con un tetto di qualità fisso e nessuna superficie operativa. Qwen3.8-Flash-Next è un artefatto la cui curva dei costi si piega verso il prezzo dell'elettricità e il cui tetto di qualità è quello che riesci a servire, più il rischio di una tabella di benchmark non riprodotta e di un'architettura ancora in fase di assorbimento da parte dei runtime.

Il modo realistico di decidere

Tre domande bastano a risolverlo, e solo la prima riguarda i benchmark.

Hai delle GPU, o le vorresti? In caso contrario, lo scenario self-host è teorico e il confronto con le soluzioni gestite di cui sopra è tutto ciò che conta — e pende a favore di Claude Haiku 5.5 per costo per attività, velocità e punteggio, con l'avvertenza che il suo passo da 100.000 token penalizza i prompt lunghi. Se invece hai acceleratori che restano al di sotto di un obiettivo di utilizzo, Qwen3.8-Flash-Next è uno dei pochi modelli aperti in cui una decodifica con 6B di parametri attivi è davvero economica da eseguire su larga scala, e la cifra di $0.37 per attività smette di essere il numero rilevante.

Quanto è lungo il prompt medio? Questo è l'unico punto in cui l'argomento del prezzo di listino regge. Sotto i 100.000 token — dopo un tokenizzatore che gonfia di circa il 30% — Claude Haiku 5.5 è più economico su ogni metrica. Al di sopra, il prezzo fisso di $0,16 e $0,47 è la carta migliore, e il suo vantaggio si amplia con la lunghezza proprio fino alla finestra nativa di 262.144 token, oltre la quale l'estensione YaRN è un diverso problema di ingegneria.

Qual è la tolleranza del carico di lavoro alla variabilità della latenza? 241,9 token di output al secondo contro 56,0 è un divario ampio, e un deployment self-hosted vi aggiunge l'accodamento. Un agente di supporto in tempo reale o che pilota il browser — i carichi di lavoro che Anthropic indica per questo livello — percepirà la differenza.

Per chiunque voglia rispondere alla seconda e alla terza domanda invece di ragionarci sopra, lo strumento più economico è un endpoint condiviso. Qwen3.8-Flash-Next non è ancora nel catalogo di OrcaRouter, e nemmeno Claude Haiku 5.5; il fratello Qwen che instradiamo è Qwen3.8-Flash, al prezzo di listino del provider, con lo 0% di markup applicato in pass-through, che è l'equivalente servito più vicino al modello di questo confronto e la baseline giusta per un test di costo su prompt lunghi. Sul fronte Anthropic, Claude Haiku 4.5, Claude Sonnet 5.5 e Claude Opus 5.5 sono tutti richiamabili oggi dalla stessa chiave, quindi un esperimento di prezzo su due generazioni è una configurazione anziché un secondo contratto — e poiché il prezzo è in pass-through anziché misto, un taglio del fornitore su una delle due gambe si vede dalla nostra parte lo stesso giorno in cui viene annunciato. Il failover automatico è ciò che rende l'esperimento sicuro da eseguire su traffico reale: un modello in anteprima o una tabella di benchmark non riprodotta è esattamente il caso in cui conviene puntare una rotta su qualcosa di nuovo mentre dietro resta un modello affidabile.

Cosa cambierebbe la risposta

Due cose, entrambe verificabili. La prima è la valutazione indipendente di Qwen3.8-Flash-Next su un harness che esegue anche Claude Haiku 5.5 — la tabella del fornitore è contro DeepSeek, e il 40 della classifica indipendente è un singolo posizionamento. Un punteggio di coding a livello di repository è la riga da tenere d'occhio, perché NL2Repo è l'ambito in cui il modello ha già dimostrato di restare indietro. La seconda è se il lavoro sul runtime si concretizza: il supporto vLLM è ancora in fase di merge tramite pull request aperte, e finché non lo sarà, il self-hosting di questa architettura è un esercizio per team a cui piace questo genere di cose, più che un percorso supportato.

Fino ad allora il riepilogo è breve. Qwen3.8-Flash-Next è il modello più interessante da possedere e quello più costoso da noleggiare. Claude Haiku 5.5 è l'endpoint gestito più economico, più veloce e con punteggi più alti, con un tariffario che penalizza tutto ciò che è lungo. Scegli in base a se stai acquistando token o acquistando un checkpoint — e se stai acquistando token, nota che il modello open-weight non è lo sconto che avevi dato per scontato.

A generated two-column scoreboard titled 'Claude Haiku 5.5 vs Qwen3.8-Flash-Next — the scoreboard'. Left column Claude Haiku 5.5: weights, closed and API-only; input price $0.10 per million up to 100,000 tokens; output price $0.50 per million up to 100,000 tokens; native context 1,000,000 tokens; independent score 43 on Intelligence Index v4.3.2 at Max effort, rank 2 of 182; cost per task $0.21; measured output speed 241.9 tokens per second. Right column Qwen3.8-Flash-Next: weights, open under the qwen-community-1.0 license; served price $0.16 per million input and $0.47 per million output, flat; native context 262,144 tokens, extensible to 1M with YaRN; independent score 40, rank 6 of 117; cost per task $0.37; measured output speed 56.0 tokens per second. A footer line reads 'Vendor pricing per Anthropic and Alibaba; independent figures per Artificial Analysis.' The real OrcaRouter logo is composited bottom-right.