
Claude Haiku 5.5 vs Qwen3.8 27B: una vittoria netta sulle API, e perché i pesi aperti esistono ancora
- openaiNUOVOOpenAI: GPT-6.1 Sol2026-09-2952Intelligenza
- anthropicNUOVOAnthropic: Claude Sonnet 5.52026-09-2856Intelligenza
- typesafeNUOVOTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 per 1M di token · 127 tok/s
- OpenAIOpenAI: GPT-6 Luna2026-09-2238Intelligenza
- OpenAIOpenAI: GPT-6 Sol2026-09-2248Intelligenza
- AnthropicAnthropic: Claude Opus 5.52026-09-2258Intelligenza
- xAIGrok 4.72026-09-2146Intelligenza
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 per 1M di token · 58 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 per 1M di token · 320 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligenza
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Intelligenza77Codice
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Intelligenza76Codice
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Intelligenza76Codice
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Intelligenza82Codice
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 per 1M di token · 54 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1M di token · 350 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligenza72Codice
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 per 1M di token · 232 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Intelligenza75Codice
- obsidianQwen3.8 27B2026-08-1534Intelligenza68Codice
La maggior parte dei confronti in questa serie si riduce a un compromesso. Questo no, e l'assenza di un compromesso è di per sé il risultato. Claude Haiku 5.5, rilasciato il 7 ottobre 2026, batte Qwen3.8 27B, il modello dense da 27B con pesi aperti del 14 agosto 2026, sul punteggio di intelligenza composito, sul costo per token, sul costo per attività completata, sulla finestra di contesto, sul tetto di risposta, sul coding agentico e sulle righe di ragionamento scientifico — e lo fa da un'unica API proprietaria che non richiede hardware. L'unica riga che Qwen3.8 27B vince nettamente è l'input video, e l'altra è una licenza.
Non è un motivo per scartare il modello, perché una licenza Apache-2.0 e una modalità video non sono premi di consolazione. È un motivo per essere precisi su perché qualcuno dovrebbe scegliere il lato open-weights, e per smettere di far finta che la discussione riguardi i benchmark.
I numeri su cui entrambi i modelli sono stati effettivamente eseguiti
Per milione di token in dollari statunitensi. Le tariffe del fornitore provengono dalla propria documentazione sui prezzi; le misurazioni condivise sono Artificial Analysis Intelligence Index v4.3.2, rilevate il 2026-10-08, entrambe nella loro configurazione di sforzo più elevata pubblicata.

• Input — Claude Haiku 5.5 $0.10 fino a 100.000 token e $0.50 oltre; Qwen3.8 27B $0.50 alla tariffa di terze parti registrata dal consiglio.
• Output — Claude Haiku 5.5 $0.50 fino a 100.000 token e $2.50 oltre; Qwen3.8 27B $3.00.
• Input in cache — Claude Haiku 5.5 $0,01 e $0,05, uno sconto del 90%; Qwen3.8 27B $0,10, uno sconto dell'80%.
• Punteggio indipendente — 43,40 per Claude Haiku 5.5 (Max) contro 33,70 per Qwen3.8 27B (Xhigh). Un divario di 9,70 punti, il più ampio di questo lotto.
• Costo per attività completata — 0,21 $ contro 1,01 $, nella stessa esecuzione di valutazione. Un divario di 4,7 volte, anche il più ampio qui.
• Contesto e output — 1M token e un tetto di risposta di 128.000 token per Claude Haiku 5.5; un contesto di 256K token per Qwen3.8 27B.
• Modalità — entrambi accettano testo e immagini e restituiscono testo. Qwen3.8 27B aggiunge l'input video; Claude Haiku 5.5 no.
• Pesi — Qwen3.8 27B è un modello denso con 27B di parametri sotto Apache 2.0, scaricabile. Claude Haiku 5.5 è proprietario e disponibile solo tramite API.

Perché il divario per attività è quattro volte il divario per token
La tabella delle tariffe mostra già un divario di 5x in input e di 6x in output a favore del fornitore, quindi la direzione non è in dubbio. Ciò che vale la pena leggere è che la cifra per attività è inferiore a quella per token, il che è l'opposto di quanto è accaduto negli altri confronti di questo lotto, e la ragione è istruttiva.
Claude Haiku 5.5 emette 162.164 token di output per attività dell'Intelligence Index — 129.047 di ragionamento e 33.118 di risposta. Qwen3.8 27B ne emette 66.797, ripartiti in 47.711 di ragionamento e 19.087 di risposta. Il modello del fornitore spende 2,4 volte tanti token per attività, quindi il suo vantaggio di 6,4x in termini di velocità di output si riduce a 4,7x per attività. È comunque 4,7x. Semplicemente non è il numero pubblicizzato dalla scheda tariffaria.
La matematica della miscela è un modo più chiaro per coglierne la forma. Su una miscela 7:2:1 a forte prevalenza di input — il peso che il traffico di produzione ha effettivamente nella maggior parte dei casi — Claude Haiku 5.5 arriva a 0,077 $ per milione di token contro 0,470 $ di Qwen3.8 27B. Su una miscela 1:1 è 0,30 $ contro 1,75 $. Il salto dei 100 token del fornitore è l'unica cosa che riesca mai a colmare questo divario: superatolo, i contatori di Claude Haiku 5.5 diventano 0,50 $ e 2,50 $ sull'intera richiesta, e i due modelli si incontrano all'incirca allo stesso prezzo — a quel punto stai pagando per nulla un premio di 9,7 punti di punteggio.
Dove la scheda del fornitore e il consiglio indipendente non concordano
Questo è il set di righe su cui vale la pena soffermarsi, perché la model card dello stesso Qwen3.8 27B appare considerevolmente più forte di quanto non facciano le misurazioni indipendenti, e la differenza è proprio il motivo per cui un'affermazione come "un modello da 27B che rivaleggia con modelli molto più grandi" necessita di una seconda fonte.
I dati pubblicati dal fornitore stesso, come registrati sulla nostra pagina di catalogo dedicata al modello, includono 90,3 su LiveCodeBench v6, 89,2 su GPQA Diamond, 84,3 su OSWorld-Verified e 79,0 su QwenSWEBench. Si tratta di dati dichiarati dal fornitore e non replicati, e descrivono un modello competitivo ben al di sopra della sua classe.
Nella run indipendente di Artificial Analysis, Qwen3.8 27B ottiene 0.0556 su Terminal-Bench 4.0, 0.4664 su SciCode, 0.3392 su Humanity's Last Exam e 1423.21 su GDPval-AA v2.1. Metti il 0.0556 accanto all'84.3 che la scheda del fornitore riporta su OSWorld e la forma del disaccordo è chiara: sul lavoro agentico su computer e terminale, il board indipendente colloca questo modello più o meno dove dovrebbe stare un modello dense da 27B, mentre la scheda del fornitore no.
Due righe però vanno nel senso opposto, e vale la pena enunciarle per lo stesso motivo. Qwen3.8 27B ottiene 0,4824 su AutomationBench contro lo 0,3541 di Claude Haiku 5.5 — una vittoria indipendente di 12,8 punti sulla cosa più vicina a un benchmark di automazione aziendale che ciascuna delle due classifiche abbia. È un numero reale proveniente dalla stessa esecuzione, sulla riga più affine a ciò per cui la gente implementa davvero i modelli piccoli.
La lettura onesta non è «il fornitore ha gonfiato tutto». È che una model card misura i compiti che i suoi autori hanno scelto, il comitato indipendente misura un insieme fisso, e i punti di forza di Qwen3.8 27B sono nella lista del fornitore e non in quella del comitato.
L'economia cambia quando possiedi l'hardware
Ogni tariffa indicata sopra è un prezzo API, e per Qwen3.8 27B si tratta del quadro sbagliato.
Questo è un modello dense da 27B con licenza Apache 2.0. Entra su un singolo acceleratore moderno alla quantizzazione che la maggior parte dei team accetterebbe, il che significa che il costo marginale di un token smette di essere il contatore di un fornitore e diventa il tuo utilizzo. Ecco perché il prezzo per chiamarlo varia da host a host in un modo che nessuno dei due modelli proprietari in questo confronto potrebbe mai fare: il listino registra una tariffa di terze parti di $0,50 in input e $3,00 in output, e il catalogo OrcaRouter lo riporta a $0,33 in input e $2,40 in output senza alcuna voce di lettura cache, perché eseguiamo i pesi sulla nostra infrastruttura invece di rivendere l'endpoint di qualcun altro.
Per un team che paga già per le GPU, il confronto non è 0,21 $ contro 1,01 $ per attività. È la tariffa fatturata dal fornitore rispetto al costo incrementale di una richiesta su hardware di vostra proprietà, e questi sono numeri diversi. Questo è l'argomento a favore del fronte dei pesi aperti, ed è l'unico che sopravvive al contatto con la tabella di benchmark.
C'è una seconda conseguenza, meno ovvia, del fatto che la licenza sia Apache 2.0: il modello può essere distribuito all'interno di un prodotto, sottoposto a fine-tuning sul proprio traffico, bloccato su una revisione specifica e verificato tramite audit fino ai pesi. Niente di tutto questo è disponibile a qualunque prezzo da un modello proprietario basato esclusivamente su API e, per i carichi di lavoro regolamentati, è spesso il vincolo decisivo più che una preferenza.

Chiamare uno dei due
Qwen3.8 27B is on the OrcaRouter catalogue as qwen/qwen3.8-27b at $0.33 and $2.40 per million tokens, self-hosted on our own infrastructure, with the OpenAI-compatible endpoint at https://api.orcarouter.ai/v1. Run against our own traffic over the last week it returns a median 1,837 ms to first token at 319 output tokens per second — a fast model, measured on our playground rather than a standardised harness, so treat that as a serving figure and not a benchmark. Video, image and text input, 262K-token context, native tool calling, structured outputs and a reasoning mode are all supported on the same key as everything else on the catalogue.
Claude Haiku 5.5 non è nel catalogo. È raggiungibile direttamente tramite l'API del fornitore e tramite AWS, Azure e le principali piattaforme cloud, e questa è l'affermazione accurata. Ciò che il catalogo offre dalla gamma del fornitore è Claude Sonnet 5.5 e Claude Opus 5.5, il che rende il percorso di escalation da un piccolo modello self-hosted a un modello agentico ospitato di fascia media un cambio di routing anziché una seconda integrazione — il failover automatico resta alla base in entrambi i casi.
Il verdetto, che è insolitamente sbilanciato
Come chiamata API su testo o immagini, Claude Haiku 5.5 vince questo confronto su ogni riga che non riguarda le licenze. Nove virgola sette punti indice, 4,7 volte più economico per attività completata, quattro volte la finestra di contesto, il doppio del limite di risposta e un prezzo da cinque a sei volte inferiore nel regime dei prompt brevi. Non esiste alcun argomento sulla forma del carico di lavoro che salvi Qwen3.8 27B sul prezzo, perché lo svantaggio del fornitore — l'uso intensivo di token in output — vale molto meno del suo vantaggio tariffario.
Ciò che lo salva è tutto ciò che il prezzo API non cattura: una licenza che consente la ridistribuzione, pesi che si possono tenere e fissare, input video e un percorso self-hosted in cui il costo per token è il tuo hardware invece della scheda del fornitore. Se stai cercando il modo più economico per classificare, estrarre, riassumere e instradare testo, Claude Haiku 5.5 è la risposta e il divario non è nemmeno lontanamente vicino. Se stai cercando un modello che puoi mettere dentro il tuo prodotto, sul tuo hardware, sotto il tuo audit, allora il divario nei benchmark ha smesso di essere la questione già da diversi paragrafi.
Confrontati in questo articolo1
Rilevato da questo articolo · Benchmark: Artificial Analysis · aggiornato ogni giorno
