Una hero card intitolata "Claude Haiku 5.5 vs Qwen3.8-Flash-Next", che mostra Claude Haiku 5.5 a $0.10 in input e $0.50 in output con una context window da 1M contro Qwen3.8-Flash-Next a $0.15 in input e $0.47 in output con una context window da 256K, una riga centrale che recita "3:1 blend $0.20 vs $0.23", e una riga in basso che recita "Index v4.3.2 - 43.40 vs 39.82 - $0.21 vs $0.37 per task".
Engineering & Research

Claude Haiku 5.5 vs Qwen3.8-Flash-Next: tre centesimi di differenza per token, settantotto per lavoro completato

Autore

Elias Hawthorne

Data di pubblicazione

Ultimi modelli · 20Vedi tutti i modelli →
Benchmark: Artificial Analysis · aggiornato ogni giorno
Torna a tutti gli articoli

Metti i due listini prezzi uno accanto all'altro e sembrano usciti dalla stessa riunione. Claude Haiku 5.5 costa $0.10 in input e $0.50 in output. Qwen3.8-Flash-Next costa $0.15 in input e $0.47 in output. Il modello del fornitore è un terzo più economico sull'input e più caro del sei per cento sull'output. Nessuno dei due fornitori ha creato quella forma per caso, e nessuno dei due ha pubblicato una nota di confronto che spiegasse cosa intendevano ottenere — ma l'aritmetica di un carico di lavoro misto 3:1 rende leggibile l'intento, e rende la coppia la corrispondenza di prezzo più vicina in tutto questo livello.

Qui finisce la somiglianza. Claude Haiku 5.5 è un modello API chiuso lanciato il 2026-10-07 con una finestra di un milione di token e un output massimo di 128.000 token. Qwen3.8-Flash-Next è un modello a pesi aperti da 180 miliardi di parametri con 6 miliardi di parametri attivi, con pesi su Hugging Face sotto la Qwen Community License 1.0, e una finestra di contesto dichiarata sulla quale la configurazione del suo stesso checkpoint e la classifica indipendente non concordano del tutto. Rilasciato il 2026-08-26, non è né nuovo né esotico per chiunque costruisca in questa fascia.

I due sono prezzati insieme di proposito. Ciò che i tariffari non possono dirti è che sono progettati per lavori diversi, e che quello che su un foglio di calcolo sembra più economico è quello che costa di più da gestire.

L'aritmetica che svela il prezzo

Combinando le due tariffe con un rapporto input-output comune di 3:1 — il rapporto attorno a cui si assesta la maggior parte del traffico di chat e di assistenza al codice — si ottengono 0,20 $ per milione di token per Claude Haiku 5.5 e 0,23 $ per milione per Qwen3.8-Flash-Next. Il modello di Anthropic costa circa il 13% in meno su questa combinazione, un divario più piccolo di quanto lasci intendere la colonna dell'input e più grande di quanto faccia quella dell'output.

Inverti il rapporto e la posizione cambia. A 1:1, i due sono $0.30 e $0.31 per milione — un pareggio entro l'errore di arrotondamento. A 1:3, con predominanza dell'output, Claude Haiku 5.5 si attesta a $0.40 e Qwen3.8-Flash-Next a $0.39, una vittoria di un centesimo per Qwen e l'unico rapporto in cui il modello di Anthropic non è il più economico dei due.

Quindi non esiste un'unica risposta onesta alla domanda «quale costa meno», e qualsiasi confronto che ne offra una sta scegliendo un rapporto al posto del lettore. Ciò che è difendibile è questo: la scheda di Claude Haiku 5.5 è tarata sul traffico a prevalenza di input, quella di Qwen3.8-Flash-Next è tarata sul traffico a prevalenza di output, e i tre centesimi per milione di token che li separano a un rapporto 3:1 sono il punto più vicino a cui si sia mai arrivati nell'eguagliare la cifra di Anthropic in questa fascia. Si tratta di un posizionamento deliberato, qualunque cosa dicano i materiali di lancio.

Il nostro catalogo elenca Qwen3.8-Flash-Next a $0,15 per l'input e $0,47 per l'output per milione di token, con una tariffa di $0,0184 per l'input in cache. I $0,15 e $0,47 sono gli stessi valori che Artificial Analysis registra come prezzo di listino del provider, che è ciò che l'accordo di pass-through dovrebbe produrre.

Quanto costa davvero una giornata di volume reale

Prendi una pipeline che elabora 10 milioni di token di input e 2 milioni di token di output al giorno. Si tratta di un carico di lavoro di produzione ridotto, comodamente all'interno della prima fascia di prezzo con lunghezze tipiche dei prompt.

• Costo dell'input — 1,00 $ al giorno su Claude Haiku 5.5, 1,50 $ al giorno su Qwen3.8-Flash-Next.

• Costo di output — 1,00 $ al giorno su Claude Haiku 5.5, 0,94 $ al giorno su Qwen3.8-Flash-Next.

• Totale giornaliero — $2,00 contro $2,44. A quella scala, circa $160 all'anno di differenza, ovvero circa 3,7 centesimi per milione di token.

Ora applica i due adeguamenti che il tariffario omette, e la direzione si inverte.

In primo luogo, Claude Haiku 5.5 utilizza il tokenizer più recente condiviso con Claude 4.7 e versioni successive, che, secondo la documentazione di Anthropic stessa, conta lo stesso testo come circa il 30% di token in più rispetto al modello che sostituisce. Se il tuo input è prosa inglese del tipo su cui sono stati misurati quei conteggi di token, la tariffa effettiva per l'input non è $0,10 — è più vicina a $0,13 per un milione di parole equivalenti di testo, il che la colloca a due centesimi da Qwen3.8-Flash-Next anziché a un terzo al di sotto di quest'ultimo.

Secondo, e più rilevante: Claude Haiku 5.5 è verboso. Artificial Analysis ha registrato 162.164 token di output per Claude Haiku 5.5 durante l'esecuzione dell'Intelligence Index, contro 107.884 per Qwen3.8-Flash-Next. Se quel rapporto si mantiene sul tuo carico di lavoro invece che sul rapporto astratto di 3:1, la voce di output sopra non è più $1,00 contro $0,94 e diventa qualcosa di più vicino a $1,50 contro $0,94 — e il totale giornaliero si ribalta a favore di Qwen.

Nessuno dei due adeguamenti è decisivo da solo. Insieme, sono la differenza tra i due modelli che distano un errore di arrotondamento e Qwen3.8-Flash-Next che è sensibilmente più economico da gestire, e l'unico modo per sapere quale caso si applica è contare i token sul proprio traffico anziché ragionare sulla scheda tariffaria.

A two-column scoreboard titled 'Claude Haiku 5.5 vs Qwen3.8-Flash-Next - the scoreboard' with rows Index v4.3.2 43.40 against 39.82, cost per task $0.21 against $0.37, time per task 424.6s against 1,524.3s, Terminal Bench 4.0 0.3283 against 0.2525, AutomationBench 0.3541 against 0.5591 and context 1M tokens against 256K tokens, footed 'Board figures per Artificial Analysis v4.3.2; context and price per vendor documentation.'

Dove la tariffa flat smette di sembrare flat

Il prezzo di Claude Haiku 5.5 presenta un gradino, mentre quello di Qwen3.8-Flash-Next no.

• Prezzo — Claude Haiku 5.5 $0.10 input / $0.50 output per milione di token fino a 100.000 token di prompt, poi $0.50 / $2.50 oltre; Qwen3.8-Flash-Next $0.15 / $0.47 fissi.

• Input in cache — 0,01 $ in lettura e 0,125 $ in scrittura per Claude Haiku 5.5; 0,016 $ in lettura e 0,23 $ in scrittura per Qwen3.8-Flash-Next.

• Contesto — un milione di token per Claude Haiku 5.5. Per Qwen3.8-Flash-Next il numero dipende da chi lo chiedi: Qwen pubblica una finestra di un milione di token, la configurazione del checkpoint stesso limita gli embedding di posizione a 262.144, e Artificial Analysis registra la configurazione valutata a 256.000.

• Output massimo — 128.000 token per Claude Haiku 5.5; 131.072 nella nostra scheda di catalogo per Qwen3.8-Flash-Next.

• Modalità di input — testo e immagini per Claude Haiku 5.5; testo per Qwen3.8-Flash-Next.

• Rilascio — 2026-10-07 per Claude Haiku 5.5, 2026-08-26 per Qwen3.8-Flash-Next.

• Pesi — proprietari, solo API per Claude Haiku 5.5; pesi aperti con licenza Qwen Community License 1.0 per Qwen3.8-Flash-Next.

Tre di quelle righe vanno in direzioni opposte rispetto al titolo sul prezzo, e il gradino della lunghezza del prompt è il più netto. Sotto i 100.000 token di prompt, Claude Haiku 5.5 è il modello più economico su entrambe le voci di tariffa. Al di sopra, la tariffa di input di Anthropic si quintuplica e Qwen3.8-Flash-Next mantiene un vantaggio di 3,3× sull'input e di 5,3× sull'output. La soglia coincide all'incirca con il punto in cui le finestre di contesto divergono comunque — un milione di token per un modello, 262.144 per l'altro — quindi una pipeline che necessita della finestra lunga è anche la pipeline che paga la tariffa di secondo livello per ottenerla.

Non è una critica al prezzo; tariffe a scaglioni legate alla lunghezza del prompt sono un modo normale di far pagare un modello a contesto lungo. È un avvertimento sul confronto. Un testa a testa eseguito con prompt da 8.000 token descrive una coppia di prezzi. Gli stessi due modelli con prompt da 400.000 token sono una coppia del tutto diversa, e quello meno caro nel secondo caso era quello più caro nel primo.

Cosa dicono le tabelle dei fornitori qui sotto

Nessuno dei due fornitori ha eseguito la suite di valutazione dell'altro, quindi il quadro condiviso è limitato alle righe che Artificial Analysis ha misurato su entrambi.

• Intelligence Index v4.3.2 — 43,40 per Claude Haiku 5.5 (Max) contro 39,82 per Qwen3.8-Flash-Next. Un vantaggio di 3,57 punti per Anthropic, il più ampio divario composito di questa serie.

• Costo per attività Index completata — 0,21 $ contro 0,37 $ sulla stessa board.

• Tempo attività — 424,6 secondi contro 1.524,3 secondi.

• Terminal Bench 4.0 — 0,3283 contro 0,2525. Claude Haiku 5.5 di 7,6 punti.

• SciCode — 0,5498 contro 0,5058. Claude Haiku 5.5 di 4,4 punti.

• Humanity's Last Exam — 0,4439 contro 0,3804. Claude Haiku 5.5 di 6,4 punti.

• AutomationBench, punteggio parziale — 0,3541 contro 0,5591. Qwen3.8-Flash-Next di 20,5 punti.

Sei righe ad Anthropic, alcune delle quali ampie, e una riga a Qwen con un margine di 20 punti. La configurazione è la stessa che attraversa tutta questa fascia di prezzo: il modello piccolo di Anthropic è più forte nel ragionamento, nella scienza e nel costo e nella latenza per ottenere una risposta, e più debole nel portare a termine un compito in più passaggi. Qwen3.8-Flash-Next è l'opposto.

Il divario tra la riga del composito e quella dell'agentico qui è insolitamente ampio — 3,57 punti in una direzione, 20,5 nell'altra — il che rende questa la coppia meno ambigua della fascia su quell'asse. Se il tuo lavoro è una singola domanda difficile a cui si risponde una volta sola, Claude Haiku 5.5 è in vantaggio su ogni misura che noterai. Se il tuo lavoro è un agente che deve portare a termine il compito, Qwen3.8-Flash-Next è in vantaggio sull'unica riga che lo prevede, e di un margine superiore di cinque volte al divario del composito.

A capture of the Artificial Analysis model page for Claude Haiku 5.5 (Max), showing its standing chips of Intelligence #21/182, Speed #91/182, Cost #46/182 and Verbosity #62/182, the rates $0.10 in and $0.50 out with a 90% cache discount, a cost of $0.21 per task, 440M generated tokens, and the summary line that Claude Haiku 5.5 scores 43 on the Intelligence Index against a median of 13.

I 180 miliardi di parametri che puoi tenere

L'elemento che decide questo confronto per molti team non è affatto nella tabella dei benchmark.

Qwen3.8-Flash-Next è un modello sparse mixture-of-experts, 180 miliardi di parametri totali e 6 miliardi attivi — un rapporto che mantiene contenuto il calcolo speso per token rispetto alla capacità totale del modello. È pubblicato con la Qwen Community License 1.0, che Artificial Analysis classifica come licenza commerciale anziché permissiva; vale la pena leggere questa distinzione prima di pianificare su di essa, perché una licenza community non è MIT e comporta termini propri su redistribuzione e scala. Può essere scaricato, ospitato in autonomia, fissato a un checkpoint, quantizzato e sottoposto a fine-tuning, soggetto a quei termini.

Claude Haiku 5.5 non può essere nessuna di queste cose. È proprietario, disponibile solo tramite API, senza un numero di parametri pubblicato, senza licenza e senza repository. Anthropic si impegna a mantenerlo invocabile fino a una data non anteriore al 2027-10-07, che è una garanzia reale e specifica — ma una garanzia sulla disponibilità è un prodotto diverso dai pesi stessi.

La conseguenza pratica vale in entrambe le direzioni, e vale la pena dirla chiaramente anziché come un'arringa a favore dell'una o dell'altra parte. I team che hanno bisogno di inferenza all'interno del proprio tenancy, di un checkpoint fisso con cui fare un diff, o della possibilità di fare fine-tuning su dati di dominio non stanno scegliendo tra questi due modelli in base ai punti di un indice. Stanno scegliendo Qwen3.8-Flash-Next, perché l'altra opzione non offre ciò di cui hanno bisogno a nessun prezzo. I team che hanno bisogno di un endpoint gestito con una system card pubblicata, un set di valutazione documentato e un impegno alla dismissione stanno scegliendo la direzione opposta, e i pesi non sono una funzionalità che avrebbero utilizzato.

Gestire il lato flat-rate

Una nota sul nome. Il consiglio indipendente classifica questo modello come Qwen3.8-Flash-Next; il nostro catalogo elenca la stessa release con il più breve nome del fornitore Qwen3.8 Flash, agli identici $0.15 / $0.47 con una tariffa di $0.0184 per l'input in cache, e punta il suo repository ai pesi Hugging Face pubblicati il 2026-08-26. Dove le cifre riportate di seguito provengono da Artificial Analysis, esse appartengono alla voce che chiama Qwen3.8-Flash-Next. I due sono lo stesso modello; il consiglio porta semplicemente il più lungo dei suoi nomi.

Qwen3.8-Flash-Next è nel catalogo OrcaRouter al prezzo di listino del provider con 0% di markup, passato tal quale anziché aggregato — quindi gli $0,15 e $0,47 qui sopra sono le tariffe in fattura, e un cambiamento da parte di Qwen arriva da noi lo stesso giorno anziché a un successivo riprezzamento. Anche Claude Sonnet 5.5 e Claude Opus 5.5 sono nel catalogo, il che rende il percorso di escalation da un modello piccolo a un livello intermedio di Anthropic una configurazione di routing anziché una seconda integrazione. Una sola API per oltre 200 modelli, una sola chiave, failover automatico sotto, e il DSL di routing quando il tetto di costo appartiene alla route anziché al codice dell'applicazione.

Claude Haiku 5.5 non è nel catalogo. È raggiungibile tramite l'API di Anthropic, e la parte Anthropic di questo confronto non è qualcosa che offriamo oggi — meglio dirlo che lasciare l'ambiguità.

A capture of the OrcaRouter model page for Qwen3.8 Flash under qwen/qwen3.8-flash, showing a maximum output of 131K, text, image and video input, benchmarks published by Qwen on 2026-08-26, and a price strip reading $0.15 input and $0.47 output per million tokens.

Quale dei due, e su quali basi

Se il tuo traffico è a forte componente di input, i tuoi prompt restano sotto i 100.000 token e paghi per volumi reali, Claude Haiku 5.5 è il modello più economico su entrambe le linee tariffarie e quello con il punteggio più alto in sei delle sette misurazioni condivise — con l'avvertenza che la differenza del 30% nel tokenizer e la verbosità contribuiscono entrambe a erodere uno sconto che sulla carta sembra maggiore di quanto non sia in fattura.

Se il tuo traffico è a forte componente di output, o i tuoi prompt sono abbastanza lunghi da superare la soglia di Anthropic, o ti serve la tariffa fissa per le previsioni, Qwen3.8-Flash-Next costa meno — a volte di un fattore cinque sull'output oltre lo scaglione — ed è il modello che vince la riga di completamento agentico con 20 punti di vantaggio.

Se ti servono i pesi, non c'è paragone, e il prezzo non entra mai in gioco.

Le due schede sono entro tre per milione di token l'una dall'altra su un mix 3:1, una differenza abbastanza contenuta da far sì che non debba essere la tariffa a decidere. A decidere è in quale di quei tre paragrafi ci si trova, e questa è una questione che riguarda la vostra pipeline, non l'uno o l'altro modello.