
Qwen3.8-27B vs Qwen 3.8: stessa generazione, una GPU contro un rack
- deepseekNUOVODeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligenza
- openaiNUOVOOpenAI: GPT-6 Astra2026-09-0453Intelligenza77Codice
- googleNUOVOGoogle: Gemini 3.8 Flash2026-09-0241Intelligenza76Codice
- qwenNUOVOQwen: Qwen3.8 Max (0902)2026-09-0240Intelligenza72Codice
- anthropicNUOVOAnthropic: Claude Fable 5.12026-09-0153Intelligenza82Codice
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1M di token
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligenza72Codice
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 per 1M di token
- z-aiZ.ai: GLM 5.32026-08-1845Intelligenza75Codice
- obsidianQwen3.8 27B2026-08-1534Intelligenza68Codice
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Intelligenza69Codice
- grokSpaceXAI: Grok 4.62026-08-1244Intelligenza77Codice
- metaMeta: Muse Spark 1.22026-08-0540Intelligenza72Codice
- qwenQwen: Qwen3.8 Max2026-08-0340Intelligenza72Codice
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135Intelligenza69Codice
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 per 1M di token
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2451Intelligenza78Codice
- googleGoogle: Gemini 3.6 Flash2026-07-2134Intelligenza69Codice
Questa settimana Alibaba ha messo Qwen3.8-27B sulla corsia di inferenza rapida di Cerebras — la prima volta che il 27B dense ha un'opzione hosted davvero veloce — e Artificial Analysis ha finalmente indicizzato entrambi i lati di questo confronto. Qwen3.8-27B ottiene 34 sull'AA Intelligence Index. Qwen 3.8, ovvero il core aperto che la maggior parte delle persone intende quando scrive il nome senza suffisso, ottiene 40. Questi due numeri rimettono in gioco un confronto che la copertura del lancio di agosto aveva dovuto basare interamente sulla parola del fornitore.
Il modello dietro "Qwen 3.8" come nome a sé stante è Qwen3.8-2.4T-A95B: i pesi mixture-of-experts da 2,4 trilioni di parametri che Alibaba ha pubblicato con una licenza personalizzata. Qwen3.8-27B è il membro dense della stessa generazione — circa 27 miliardi di parametri, Apache 2.0, dimensionato per una singola GPU. Condividono il nome della famiglia, la lunghezza di contesto nativa di 262K e una finestra di lancio. Tutto il resto è un esercizio di opposti: uno lo puoi possedere, l'altro lo puoi solo noleggiare. Ecco a cosa serve davvero ciascuno, ora che entrambi hanno numeri indipendenti.
La stessa generazione, forme opposte
Qwen3.8-27B è un modello denso — 27B parametri (28B contando l'encoder visivo), 64 strati, uno stack di attenzione ibrido composto da 48 strati di attenzione lineare Gated DeltaNet a fronte di 16 strati di attenzione completa. È grazie a questo ibrido che un 27B può gestire 262.144 token di contesto nativo. Qwen3.8-2.4T-A95B è l'architettura di punta: 2,4T di parametri totali, circa 95B attivi per token, 92 strati con 512 esperti per strato, e 69 di questi 92 strati in attenzione lineare. Stesso trucco, con un'impronta novanta volte maggiore.
• Architettura — Qwen3.8-27B: 27B denso, ogni token lo attiva interamente. Qwen3.8-2.4T-A95B: MoE da 2,4T totali / ~95B attivi.
• Contesto — entrambi con 262K nativi; l'estensione a 1M del 27B è disponibile solo hosted, il 2.4T raggiunge ~984K misurati.
• Input — Qwen3.8-27B: testo, immagine e video. Qwen3.8-2.4T-A95B: solo testo, thinking forzatamente attivo.
• Licenza — Qwen3.8-27B: Apache 2.0. Qwen3.8-2.4T-A95B: licenza personalizzata Qwen3.8-Max.
• Pesi — Qwen3.8-27B: 55,6 GB BF16, quantizzabile in una build Q4 da ~16 GB. Qwen3.8-2.4T-A95B: ~2,4 TB BF16, un rack di GPU, non un desktop.
• Dove li incontri — Qwen3.8-27B: self-hosted o noleggiato a buon mercato. Qwen3.8-2.4T-A95B: noleggiato, perché nessuno di buon senso possiede il rack.
Numeri indipendenti, finalmente
Ogni articolo di August vs su Qwen3.8-27B riportava la stessa avvertenza: "non ci sono ancora punteggi indipendenti". Ora non è più vero. Artificial Analysis ha misurato entrambi i modelli a partire da questa settimana, e la forma dei dati è davvero interessante.
Nell'Intelligence Index, Qwen3.8-2.4T-A95B ottiene 40, classificandosi 4° su 113 nella sua categoria. Qwen3.8-27B ottiene 34 — il che lo colloca primo su 140 modelli nella sua categoria di dimensioni 4–40B a pesi aperti, una prestazione davvero solida per un modello denso da 27B. Entrambi sono lenti secondo misurazioni indipendenti: 39,0 token di output al secondo per il 27B e 38,1 per il 2.4T, rispetto a una mediana di categoria intorno a 90. Entrambi sono prolissi, con il 27B che genera circa 200M token di output attraverso le esecuzioni dell'indice rispetto a una mediana di categoria di 68M. Nessuno dei due è un modello di frontiera di punta; entrambi sono modelli da lavoro, e l'indice dice che il 2.4T è il modello da lavoro più forte con un margine netto.

I prezzi sul fronte indipendente raccontano la stessa storia in dollari. Artificial Analysis fissa il prezzo del 27B a $0,50 per milione di input e $3,00 per milione di output sulla build ospitata di Qwen Cloud (sconto cache del 90%), e quello del 2.4T a $2,00 / $6,00 (sconto cache dell'88%). Costo per task dell'Intelligence Index: $0,82 per il 27B contro $2,16 per il 2.4T. Il modello più piccolo è più economico da eseguire per unità di intelligenza — ed entrambi sono costosi rispetto alla loro classe di velocità perché entrambi sono modelli di ragionamento che consumano token di output.
Tutto il resto — SWE-bench Pro 61,7, DeepSWE 1.1 42,2, LiveCodeBench v6 90,3 per il 27B; l'86,6 di Terminal-Bench 2.1 e 67,7 di SWE-bench Pro del 2.4T — resta riportato dal fornitore, non riprodotto e indicato come tale in tutto questo pezzo. Gli indici AA sopra sono il livello minimo indipendente sotto tutto ciò.
Cosa cambia la quotazione di Cerebras
Il 12 settembre 2026, l'account Qwen ha annunciato che Qwen3.8-27B è ora in esecuzione su Cerebras, con la sua voce in catalogo attiva sotto il banner «Qwen 3.8 27B è ora disponibile su Cerebras PayGo». Cerebras lo quota a 0,99 $ per milione di token in input e 1,49 $ per milione in output sull'hardware di classe WSE che ha reso celebre l'azienda in fatto di velocità. Questo dà al 27B qualcosa che il core da 2,4T non ha mai avuto: una corsia veloce.

Questo è importante perché lento e verboso è stato l'unico vero difetto del 27B fin dall'inizio. Sull'harness indipendente fa 39 t/s; sulla nostra telemetria di serving ha viaggiato a ~154 token di output al secondo con una latenza p50 del primo token di 4,48 s — e ora un secondo provider compete su quello stesso asse. Il 2.4T, al contrario, non ha alcuna corsia veloce: a 38 t/s paghi prezzi di frontiera per una velocità di fascia media, e l'unico modo per aggirarlo è un cluster GPU noleggiato che esegue da te i pesi aperti.
Tre corsie per il 27B, una per il 2.4T
Da oggi il dense 27B è noleggiabile in tre modi, e la differenza di prezzo merita una lettura prima di scegliere:
• Canale self-hosted — Qwen3.8-27B è live su OrcaRouter a $0,33 / $2,40 per milione, eseguito sulla nostra infrastruttura. Input più economico sul mercato per questo modello, ~154 tok/s in output, contesto 262K.
• Linea vendor — build ospitata di Qwen Cloud, $0,50 / $3,00 per milione con contesto da 1M token e sconto del 90% sulla cache.
• Corsia veloce — Cerebras PayGo, $0,99 / $1,49 per milione, posizionato sulla velocità anziché sul prezzo.

Il core aperto 2.4T non ha uno spread equivalente. L'API di punta che serve la stessa architettura — Qwen3.8-Max — costa 2,00 $ / 6,00 $ per milione, e questo è il numero che resta valido che la si chiami Max o core aperto. Se invece si eseguono i pesi, l'economia passa all'hardware: il 2.4T richiede ~2,4 TB di pesi BF16 e un nodo multi-GPU, una decisione di capitale che nessuno prende alla leggera. Una GPU da 24 GB esegue la build Q4 del 27B a un costo marginale che si arrotonda a zero.
L'esempio pratico che decide per la maggior parte dei team: 100M di token in input e 20M in output al giorno. Con la tariffa di $2/$6 del 2.4T, sono circa $320 al giorno, ~$117.000 all'anno. Sul 27B, con il nostro $0.33/$2.40, sono circa $81 al giorno — e sulla copia self-hosted è il prezzo dell'elettricità. Il 2.4T ti offre un vero vantaggio di qualità, AA 40 contro 34. Se quel vantaggio valga una bolletta mensile a cinque cifre è l'intera domanda che questo abbinamento pone.
Dove divergono realmente
Oltre all'indice, tre differenze pratiche determinano quale si adatta a un determinato carico di lavoro.
L'input multimodale è il filtro più netto. Qwen3.8-27B legge testo, immagini e video — screenshot, grafici, documenti con figure, fotogrammi video finiscono tutti nella stessa finestra da 262K. Qwen3.8-2.4T-A95B è aggressivamente solo testo. Se il tuo input include qualsiasi elemento visivo, il 2.4T è squalificato indipendentemente dal suo indice più alto.
Il controllo del pensiero è secondario. La modalità di ragionamento del 27B può essere disattivata per richiesta, il che è importante per l'estrazione sensibile alla latenza, dove una catena di pensiero è puro overhead; espone anche reasoning_effort. Il core 2.4T non può disattivare il pensiero — ogni risposta si apre con un blocco think>, e paghi per quei token, che tu li voglia o no. L'API di punta risolve questo, ma il core aperto no.
Il licensing è al terzo posto, e su larga scala conta in silenzio. Apache 2.0 sul 27B è lo standard permissivo: modificare, ridistribuire, commercializzare, con inclusa la concessione di brevetto. Il 2.4T viene distribuito con una licenza personalizzata Qwen3.8-Max — permissiva nello spirito, ma sono i termini di Alibaba, non uno standard della community, e vale la pena leggere il file prima di costruirci sopra un prodotto.
Instradamento della decisione
Entrambe le parti di questo confronto sono raggiungibili tramite un'unica chiave OrcaRouter, ed è proprio questo che rende la domanda «quale scelgo» economica da risolvere empiricamente. Qwen3.8-27B è attivo come qwen/qwen3.8-27b al prezzo di listino del provider, senza alcun ricarico, e l'API di punta costruita sullo stesso core da 2,4T è attiva come qwen/qwen3.8-max a 2,00 $ / 6,00 $ per milione — la tariffa di Alibaba stessa, passata direttamente, così qualsiasi variazione di prezzo del fornitore è attiva qui lo stesso giorno.
Quella stessa architettura da 2,4T come pesi scaricabili non è qualcosa che forniamo — se vuoi il core aperto tramite un'API oggi, la corsia di punta è il modo pratico per raggiungerlo, e qwen/qwen3.8 è precablato per attivarsi nel momento in cui un provider serve i pesi aperti. Una regola di routing che invia il traffico visivo e sensibile alla latenza a qwen/qwen3.8-27b e la coda di ragionamento difficile a qwen/qwen3.8-max non costa nulla da configurare e esegue automaticamente il failover tra i provider. Una sola chiave, nessun secondo contratto, e la suddivisione è un cambio di configurazione anziché una riarchitettura — il modo più economico per verificare se i sei punti indice extra del 2,4T valgono per te 5,67 $ per milione di token di output.
Chi dovrebbe scegliere cosa
• Scegli Qwen3.8-27B se il tuo input include immagini o video, se vuoi il thinking che puoi disattivare, se possiedi una GPU da 24 GB o prevedi di acquistarla, oppure se la tua spesa per token raggiunge un volume tale che $0.33/$2.40 contro $2.00/$6.00 è l'intero argomento.
• Scegli Qwen 3.8 (il core 2.4T) se lavori solo con testo, vuoi il punteggio di ragionamento indipendente più forte della famiglia (AA 40) e la tariffa di $2/$6 — o il costo di esecuzione di un nodo GPU — rientra comodamente nel tuo budget.
• Scegli entrambi se il tuo traffico copre i due profili: instrada attraverso il gateway, lascia che il router divida per modalità e difficoltà, e cambia idea quando arriva il prossimo checkpoint o il prezzo di uno dei due modelli.
Il verdetto
Dietro il nome Qwen 3.8 ci sono sempre stati due prodotti che fingevano di essere un'unica famiglia, e ora entrambi hanno numeri indipendenti sui quali discutere. Qwen3.8-2.4T-A95B è il cervello più forte, solo testo, costoso e indiscutibilmente noleggiabile a $2/$6. Qwen3.8-27B è quello deployabile — multimodale, Apache 2.0, self-hostabile, e da questa settimana ha finalmente anche una corsia veloce. Il divario nell'indice è reale: 40 contro 34. Lo è anche il divario di prezzo: circa cinque volte il costo per token quando esegui il 2.4T come API. Per la maggior parte dei team la decisione non riguarda i sei punti dell'indice. Riguarda se stai comprando token o comprando hardware — e il 27B è l'unico dei due che ti permette di comprare l'hardware.
