Card del titolo principale per Qwen3.8-27B, il modello denso visione-linguaggio da 27 miliardi di parametri della linea Qwen3.8 di Alibaba, con il sottotitolo "27B dense - native vision-language - Apache 2.0" e tre chip di funzionalità che recitano "contesto di 262,144 token", "testo + immagine + video in ingresso" e "testo in uscita", con il logo OrcaRouter nell'angolo in basso a destra.
Guides & Insights

Qwen3.8-27B: il modello multimodale compatto nella gamma Qwen3.8 di Alibaba

Autore

Gideon Frost

Data di pubblicazione

Ultimi modelli · 20Vedi tutti i modelli →
Benchmark: Artificial Analysis · aggiornato ogni giorno
Torna a tutti gli articoli

Qwen3.8-27B è il membro denso a nodo singolo della generazione Qwe​n3.8 di Aliba​ba: un modello visione-linguaggio nativo da 27 miliardi di parametri, pubblicato su Hugging Face con licenza Apache 2.0, che accetta testo, immagini e video e restituisce testo con una finestra di contesto di 262.144 token. Questa è la pagina di riferimento per quel modello — la trattazione canonica di cosa sia, quanto costi chiamarlo e cosa possa fare — e vale la pena dire fin da subito perché esista una pagina per un modello i cui pesi sono comparsi per la prima volta ad agosto 2026 anziché negli ultimi sette giorni. Non stiamo riportando un lancio. Stiamo rispondendo a una domanda ricorrente: i lettori ci raggiungono per il nome "Qwen3.8-27B" migliaia di volte al mese, e finora nessuna nostra pagina possedeva quella risposta. Il rilascio del modello stesso, datato sulla scheda di Qwe​n e registrato come 2026-08-14 da Artificial Analysis, è un fatto che questa pagina usa per datare il modello, non un evento che riporta.

Leggilo come l'eccezione che è: in una lettura rigorosa su sette giorni, un modello di metà agosto 2026 non è recente, e questo elemento verrebbe scartato come notizia. La giustificazione qui è diversa. È una pagina di riferimento i cui numeri sono stati verificati rispetto alla model card di Qwe​n, al file di licenza del repository, alla rate card di Qwe​n Cloud e ad Artificial Analysis il 2026-09-28, e la cui ragione di esistere è la domanda di ricerca che abbiamo misurato in prima persona lo stesso giorno. Non è un secondo annuncio, e nessuno dovrebbe leggerlo come tale.

Dove si colloca 27B nella gamma Qwen3.8

La generazione Qwe​n3.8 non è un unico modello, e il suffisso di dimensione è il punto centrale del nome. Le note del repository di Qwe​n stesso relative all'intera famiglia rendono esplicita la suddivisione:

• Qwen3.8-27B — 27B parametri dense, input nativo di immagini e video, Apache 2.0. Il membro adatto al deployment: un modello dimensionato per girare su una singola GPU o un piccolo nodo, e l'oggetto di questa pagina.

• Qwen3.8-Max, basato su Qwen3.8-2.4T-A95B — 2,4 trilioni di parametri totali con 95B attivi, il modello della classe Qwen-Max che Alibaba ha aperto per la prima volta in questa generazione. Il suo repository adotta una licenza su misura qwen3.8-max anziché Apache 2.0.

• Qwen3.8-Flash-Next — l'anteprima sperimentale dell'architettura che, secondo Qwen, sarà alla base di Qwen4, rilasciata sotto la qwen-community-1.0 licenza. Il Qwen3.8-Flash ospitato è basato su di essa.

Quindi "27B" non è un livello di allestimento del modello Max; è la classe dimensionale che un singolo team può effettivamente servire. Ciò che Alibaba sostiene che erediti è la ricetta di addestramento: la scheda descrive Qwen3.8-27B come un modello che assimila i progressi della generazione nella programmazione, nel lavoro professionale, nella ricerca e nei compiti agentici a lungo orizzonte, comprimendoli in un checkpoint denso.

Scoreboard infographic titled 'Qwen3.8-27B - the scoreboard' with six rows: Parameters 27B dense (27.8B with vision), Context 262,144 native and 1M with YaRN, Modalities text + image + video in and text out, Licence Apache 2.0 with commercial use, Terminal Bench 2.1 of 73.0 marked vendor-reported, and AA Intelligence Index 33.7 marked independent, with a footer reading 'Qwen figures vendor-reported and unreproduced; AA figures per Artificial Analysis.' and the OrcaRouter logo in the bottom-right corner.

L'architettura che Qwen pubblica

Ogni valore riportato di seguito proviene dalla model card su Qwe​n/Qwen3.8-27B, che è la documentazione ufficiale del fornitore:

• Parametri — 27B come pubblicizzato. I metadati safetensors del repository stesso totalizzano 27.781.427.952 parametri in BF16 su 18 shard, quindi circa 27,8B una volta conteggiata anche la torre di visione. Qui non c'è alcun mixture-of-experts: tutti i parametri sono attivi su ogni token.

• Forma — 64 strati, dimensione nascosta 5.120, dimensione intermedia feed-forward 17.408, embedding dei token e output LM 248.320 (con padding).

• Attenzione ibrida — il layout che Qwen stampa è 16 × (3 × (Gated DeltaNet → FFN) → 1 × (Gated Attention → FFN)): tre blocchi di attenzione lineare per ogni blocco di attenzione completa, un rapporto di 3:1. Gated DeltaNet esegue 48 teste di attenzione lineare per V e 16 per QK con dimensione di testa 128; Gated Attention esegue 24 teste di query contro 4 teste KV con dimensione di testa 256, con una dimensione rotatoria di 64. È questo rapporto a rendere sostenibile una finestra di 262K su un modello da 27B, ed è la stessa linea di discendenza che Qwen3.8-Flash-Next estende con l'attenzione sparsa.

• Predizione multi-token — la scheda indica che il modello è addestrato con MTP su più passaggi, il trucco del drafting che velocizza la generazione negli stack di serving compatibili con MTP.

• Controllo del pensiero — la modalità pensiero è attiva per impostazione predefinita e può essere disattivata per richiesta. reasoning_effort accetta xhigh (predefinito), medium o low, e preserve_thinking è attivo per impostazione predefinita, così le tracce di ragionamento si conservano tra i turni invece di essere rigenerate.

Finestra di contesto e limite di output

La scheda indica 262.144 token nativamente, estensibili a 1.000.000 con scaling RoPE (YaRN). Le linee guida di serving di Qwe​n stesso per lunghe esecuzioni agentiche, all'interno di quel limite di 1M, prevedono di consentire fino a 262.144 token per il contenuto di ragionamento e fino a 131.072 token per la risposta finale — il tetto è una configurazione di serving, non una proprietà fissa del checkpoint.

Vale la pena tenere separate due finestre, perché è facile confonderle. I pesi aperti funzionano nativamente a 262.144; la versione hosted su Qwen Cloud, che la model card descrive come ancora in arrivo ("il servizio arriverà presto"), è elencata nella pagina del modello di Qwen Cloud con 1M di contesto, 991K di input massimo, 131K di output massimo e un budget massimo di ragionamento di 262K. La scheda tecnica del prodotto hosted non è la scheda tecnica del checkpoint.

Modalità: cosa entra e cosa esce

L'input è testo, immagine e video; l'output è solo testo. La scheda definisce Qwen3.8-27B "un modello visione-linguaggio nativo che comprende immagini e video" e il suo codice di esempio passa tutti e tre i tipi di input. Non c'è input audio, né generazione di immagini, né output vocale. La scheda del modello di Artificial Analysis per lo stesso checkpoint concorda sul perimetro — immagini, video e testo in input, testo in output — il che è una seconda lettura utile perché non è la pagina di Aliba​ba stessa.

Cosa permette realmente il rilascio di Apache 2.0

La licenza non è un riassunto su un post di un blog; il repository contiene il testo stesso della Apache License, Version 2.0, e i metadati della card dichiarano license: apache-2.0. Ciò che essa concede, leggendo il testo della licenza: una licenza di copyright perpetua, valida in tutto il mondo e libera da royalty, per riprodurre, preparare opere derivate, mostrare pubblicamente, sublicenziare e distribuire l'opera e le sue derivate, e una licenza sui brevetti da parte dei contributori — con l'uso commerciale tra gli scopi consentiti e nessuna restrizione di campo di utilizzo, nessuna soglia di numero di utenti e nessun accordo commerciale separato. Apache 2.0 è anche permissiva nel senso che conta per distribuire prodotti: i pesi derivati possono essere ridistribuiti con termini diversi, purché si conservino gli avvisi di licenza e di attribuzione e si dichiari cosa è stato modificato (Sezioni 4a–4c). La Sezione 6 non concede alcun diritto sul nome Qwe​n o sui marchi, quindi un fork Apache-2.0 non può commercializzarsi come Qwe​n.

Il confronto all'interno della famiglia è istruttivo, ed è visibile dai repository più che dalla copertura: il checkpoint 2.4T-A95B si definisce other con una licenza qwen3.8-max, e Qwen3.8-Flash-Next utilizza qwen-community-1.0. Il 27B è quello dei tre che arriva sotto semplice Apache 2.0.

La posizione di riferimento indipendente

Artificial Analysis ha eseguito il modello, e il suo risultato va tenuto separato dalla tabella di Alibaba stessa, perché i due rispondono a domande diverse. L'indice indipendente, misurato sulla xhigh configurazione:

• Intelligence Index 33.7 — Valore memorizzato di Artificial Analysis, che la sua pagina del modello visualizza arrotondato a 34. Vengono pubblicate due classifiche e misurano insiemi diversi: il riquadro di riepilogo di quella stessa pagina colloca il modello al 1º posto tra i 142 modelli nella sua classe dimensionale, nel confronto nella stessa classe descritto dal tooltip della pagina, mentre la riga del nostro catalogo, con fonte Artificial Analysis, registra 45º su 145, circa il 67º percentile. Nessuno dei due è una posizione in classifica rispetto allo stesso campo dell'altro, quindi non leggerli come un unico numero in due formati.

• Coding Index 68,1 — riportato nel nostro catalogo con artificialanalysis.ai come fonte indicata, classificato 35º su 138 nel pool di quell'indice. Il modello si posiziona più in alto sul coding che sull'intelligenza generale, il che è coerente con la struttura della tabella dello stesso fornitore.

• Scala dell'effort, stesso harness — ridurre lo sforzo di ragionamento sposta di molto l'indice: 33,7 con xhigh, 27,6 con medium, 26,2 con low, e 20,2 con il ragionamento del tutto disattivato. Si tratta di una differenza misurata di 13,5 punti, ed è l'argomento più concreto per tarare l'effort in base al carico di lavoro anziché al modello.

• Dove le due fonti concordano e divergono — su GPQA Diamond, la scheda di Aliba​ba riporta 89,2 e Artificial Analysis misura 90,5. Su Humanity's Last Exam la scheda riporta 30,8 e Artificial Analysis 33,9. Vicini, ma non lo stesso numero, e questo è normale: harness diversi, esecuzioni diverse. Un'avvertenza va messa nell'articolo, non in una nota a piè di pagina — nessuna terza parte ha pubblicato un confronto testa a testa tra Qwen3.8-27B e uno qualsiasi dei modelli nella tabella comparativa di Aliba​ba, eseguiti con sforzo equiparato su un harness equiparato, quindi ogni confronto tra modelli in questa pagina è un confronto tra misurazioni separate, non un risultato.

Screenshot of the Artificial Analysis model page for Qwen3.8 27B in its xhigh configuration showing a same-class comparison rank of 1 of 142 next to an Intelligence tile, 46.6 output tokens per second at rank 55 of 142, $0.50 per million input tokens and $3.00 per million output tokens, a 256k-token context window, 27B total parameters, an Apache 2.0 licence, an open-weights marker and a release month of August 2026, with the summary text reporting a score of 34 on the Artificial Analysis Intelligence Index.

Cosa riporta Qwen e come leggerlo

La model card riporta circa due dozzine di punteggi con colonne di confronto per Qwen3.6-27B, Qwen3.7-Plus, Muse Glimmer-30B e Opus4.6 Max. Tutto è dichiarato dal fornitore e non replicato — la valutazione di Aliba​ba stessa, stampata da Aliba​ba — e diverse righe usano un harness Claude Code giudicato da una build di GPT-5.4, come affermano le note a piè di pagina della model card. Le cifre principali del fornitore, su questa base:

• Coding agentico per terminale — Terminal Bench 2.1 (Terminus) 73,0, contro 63,4 di Qwen3.6-27B che sostituisce, con Opus4.6 Max in testa alla riga a 78,2.

• Codifica agentica — SWE-bench Pro 61,7, QwenSWEBench 79,0, DeepSWE 1.1 42,2, NL2Repo-Bench 42,3, LiveCodeBench v6 90,3. Wait — should I convert decimal points to commas? Italian uses commas for decimals. That's a reasonable localization. But risk: benchmark scores might be intended verbatim. Hmm. Localization engines typically do localize number formatting. I'll keep commas as Italian convention. Actually, careful — the instruction says preserve brand/product names, and URLs. Numbers formatting is fair game for localization. I'll go with commas. Hmm, but some might argue it introduces risk of misreading. I think Italian localization with commas is standard practice. I'll keep it.

• Agenti e lavoro d'ufficio — CoWorkBench 70,7, JobBench 33,4, Agents' Last Exam 42,9 per punteggio (Pass@1 20,4).

• Ragionamento generale — GPQA Diamond 89,2, HLE 30,8, IFBench 79,5. Opus4.6 Max guida entrambe le righe di ragionamento nella tabella del fornitore stesso, con 91,3 e 40,0.

• Visione e uso del computer — OSWorld-Verified 84.3, AndroidWorld 81.9, WebArena-Verified 64.8, OmniDocBench 1.5 91.1, RealWorldQA 85.9.

Il riassunto onesto di quella tabella è più ristretto di quanto la tabella non lasci intendere. Rispetto al suo predecessore diretto i miglioramenti sono ampi e costanti — QwenSWEBench 79,0 contro 49,3, DeepSWE 42,2 contro 13,3 — e questa è un'affermazione che riguarda una sola generazione di cambiamento della ricetta. Rispetto ai modelli di frontiera nelle colonne adiacenti vince alcune righe e ne perde altre, sui numeri di Aliba​ba stesso, per la scelta dell'harness fatta da Aliba​ba stesso.

Eseguendolo

I pesi sono 18 shard BF16 nel formato Transformers, e la scheda elenca Hugging Face Transformers, vLLM, SGLang e TokenSpeed come stack supportati. Abbiamo scritto separatamente i percorsi di distribuzione locale e quantizzazione e sono i posti giusti per quel dettaglio: Qwen3.8-27B su Ollama per un daemon locale, e la guida ai benchmark per il punteggio completo, incluso ciò che è cambiato rispetto a Qwen3.6-27B. Questa pagina resta sul modello stesso.

Qwen3.8-27B nel nostro catalogo

Oggi su OrcaRouter sono attive due schede, affiancate, ed entrambe sono state rilette il 2026-09-28 prima che questo paragrafo fosse scritto. qwen/qwen3.8-27bha un listino di $0,33 per milione di token in input e $2,40 per milione di token in output con la finestra completa da 262.144 token, input di testo, immagini e video, e le superfici di reasoning, strumenti, output strutturato e JSON esposte come parametri. Il suo gemello obsidian/Qwen3.8-27B — gli stessi pesi serviti in block-FP8 con la torre di visione mantenuta a piena precisione e, usando le parole della scheda stessa, "progettato per fornire risposte dirette e complete su un'ampia gamma di prompt" — ha un listino di $0,40 in input e $4,21 in output. Entrambi rispondono a chat completions e alla Responses API, quindi un lavoro di analisi di documenti o di screenshot può essere indirizzato verso l'uno o l'altro modello con una sola chiave e un solo endpoint, senza un secondo contratto e senza modifiche al codice.

Per dare un'idea della scala, il nostro playground ha fatto passare 105,1 milioni di token attraverso qwen/qwen3.8-27b negli ultimi sette giorni, con un tempo mediano al primo byte di 3,8 secondi e un tasso di errore del 3,3% nello stesso intervallo. Questi sono i nostri numeri di serving, non un giudizio sul modello.

Screenshot of the OrcaRouter model page for qwen/qwen3.8-27b showing a 262K-token context window, text, image and video input, text output, the vision, tools, JSON and reasoning badges, a 3.80-second p50 time to first token, 105.1M tokens served in seven days, and list pricing of $0.33 per million input tokens and $2.40 per million output tokens.

Le ricerche che portano qui

La domanda dietro questa pagina è dispersa e si trova appena fuori dal clic. Nei 28 giorni fino al 25 settembre 2026 la nostra proprietà ha totalizzato 8.931 impression e 273 clic su 69 grafie esatte distinte del nome del modello — "qwen3.8 27b", "qwen3.8-27b", "qwen 3.8 27b" e dozzine di altri modi di scrivere gli stessi tre token. La nostra posizione migliore sulle grafie più diffuse andava da 9,0 a 10,6. Sono posizioni che occupavamo per caso grazie ad altre pagine, ed è esattamente il problema che una pagina canonica risolve: al nono posto sei in pagina, ma nessuno clicca. L'unico ambito in cui il traffico converte è quello non in inglese — una grafia in lingua russa del nome si trova alla posizione 1,8 per noi e converte al 14,4%.

Niente di tutto ciò è una prova sul modello. È una prova di ciò che le persone digitano, ed è il motivo per cui esiste la pagina.

A conti fatti: un checkpoint denso da 27B con un layout di attenzione davvero inusuale, una licenza permissiva, comprensione video nativa, termini Apache-2.0 che consentono di distribuire un derivato, una posizione indipendente nel coding nel quarto superiore di ciò che Artificial Analysis misura, e una tabella del fornitore che è solida rispetto al predecessore e mista rispetto alla frontiera. La domanda aperta è quella a cui nessuno fuori da Alibaba può ancora rispondere — come si comporta in produzione il percorso hosted da 1M token, e se l'architettura Flash-Next approda in un modello di queste dimensioni.

Il core 2.4T-A95B dietro Qwen3.8-Max è disponibile sullo stesso catalogo: qwen/qwen3.8-max a $2,00 / $6,00 per milione di token, se il 27B non è la dimensione che ti serve.

Confrontati in questo articolo2

Rilevato da questo articolo · Benchmark: Artificial Analysis · aggiornato ogni giorno