Scheda titolo hero per la recensione di Qwen3.8-27B, intitolata 'Recensione di Qwen3.8-27B' con il sottotitolo 'L'open-weight 27B che è l'Opus di casa — testato contro l'hype', che mostra un badge open-weights, un badge Apache 2.0 e un set di icone GPU e server su uno sfondo bianco pulito con delicati accenti di gradiente blu.
Guides & Insights

Recensione di Qwen3.8-27B: il 27B open-weight che è "Opus at home" — messo alla prova contro l'hype

Autore

Alistair Wren

Data di pubblicazione

Ultimi modelli · 20Vedi tutti i modelli →
Benchmark: Artificial Analysis · aggiornato ogni giorno
Torna a tutti gli articoli

Qwen3.8 27B è il miglior 27B open-weights che puoi auto-ospitare in questo momento, e non è nemmeno lontanamente vicino. I pesi sono stati rilasciati il 14 agosto 2026 con licenza Apache 2.0: un modello denso da 27B (28B contando l'encoder visivo) con contesto nativo di 262K, input nativo per immagini e video, e punteggi di coding agentico riportati dal fornitore che si collocano a o sopra Cla​ude Opus 4.6 Max — SWE-bench Pro 61.7, DeepSWE 1.1 42.2, LiveCodeBench v6 90.3. Il prezzo annunciato è zero: scarica 55.6 GB ed eseguilo. Anche le avvertenze sono reali: i test indipendenti lo trovano circa tre volte più lento e più avido di token rispetto al suo predecessore, ogni benchmark sulla scheda è ancora riportato da Ali​baba, e il contesto da 1M è una funzionalità disponibile solo nella versione ospitata. Verdetto: se hai una GPU da 24 GB+ e vuoi una capacità vicina alla frontiera senza una bolletta a consumo, auto-ospitalo — ma sapendo esattamente dove i numeri sono deboli.

Prima il verdetto: dovresti usare Qwen3.8 27B?

Risposta breve — sì per i carichi di lavoro locali e privati; attendere i dati di terze parti prima di una decisione di acquisto. Qwen3.8 27B è il raro modello in cui i pesi aperti sono il prodotto e l'API è la comodità. Poiché la licenza è Apache 2.0, il prezzo per token è permanentemente zero una volta che hai l'hardware, e nulla di ciò che costruisci su di esso può essere rilicenziato o fatturato retroattivamente. Ciò a cui rinunci sono velocità, verifica e comodità.

Se utilizzi già Qwen3.6-27B e ne sei soddisfatto, l'upgrade è reale ma non è gratuito in termini di tempo effettivo. Se sei arrivato qui dal lancio di Qwen3.8-Max, questo è il membro più piccolo e auto-ospitabile della stessa generazione — uno strumento diverso per un lavoro diverso.

I fatti in breve, verificati il 15 agosto 2026

• Rilasciato — i pesi sono stati pubblicati il 14 agosto 2026 su Qwen/Qwen3.8-27B su Hugging Face, con mirror su ModelScope; la copertura che tiene conto dei fusi orari cita anche il 13 agosto, e il rilascio è avvenuto circa una settimana dopo l'annuncio della generazione Qwen3.8.

• Licenza — Apache 2.0: scaricare, modificare, ridistribuire, uso commerciale, con una concessione esplicita di brevetto. Permanente.

• Parametri — 27B denso (28B contando l'encoder visivo), 64 strati, dimensione nascosta 5.120, vocabolario 248.320.

• Architettura — attenzione ibrida: 48 layer di attenzione lineare Gated DeltaNet contro 16 layer completi di Gated Attention (un rapporto 3:1). È per questo che un modello denso da 27B può gestire 262K token di contesto nativo.

• Contesto — 262.144 token nativamente; estendibile a 1.000.000 tramite YaRN sulla versione ospitata.

• Input — immagine e video nativi accanto al testo; restituisce testo. L'encoder visivo è il motivo per cui il conteggio dei parametri indica 28B.

• Pensiero — modalità di ragionamento attiva per impostazione predefinita e disattivabile su richiesta; reasoning_effort (basso/medio/alto) e preserve_thinking per lunghe esecuzioni di agenti.

• Pesi — 55,6 GB di safetensors BF16 in 18 shard; sono inclusi anche FP8 e GGUFs della community.

Le specifiche sopra riportate provengono dalla scheda del modello e dalla configurazione di Hugging Face per Qwen3.8 27B, lette oggi. Le affermazioni sui benchmark sono riportate da Ali​baba; ad oggi nessun laboratorio indipendente le ha riprodotte.

Ciò in cui Qwen3.8 27B è davvero bravo

Il caso più convincente è l'ingegneria del software agentica. Ali​baba riporta un incremento di 3x su DeepSWE 1.1 rispetto al precedente 27B (42.2 vs 13.3) e un punteggio superiore a Cla​ude Opus 4.6 Max su SWE-bench Pro (61.7 vs 53.4). Quelli sono i numeri che gli hanno valso il soprannome "Opus at home" — un denso 27B che svolge lavoro di codifica vicino alla frontiera su hardware che una persona può davvero possedere.

Benchmark scoreboard card comparing Qwen3.8-27B with Qwen3.6-27B and Claude Opus 4.6 Max: SWE-bench Pro 61.7 vs 53.5 vs 53.4; DeepSWE 1.1 42.2 vs 13.3 vs n/a; LiveCodeBench v6 90.3 vs 83.9 vs 88.8; Terminal Bench 2.1 73.0 vs 63.4 vs 78.2; GPQA Diamond 89.2 vs 87.8 vs 91.3; OSWorld-Verified 84.3 vs 63.9 vs 72.7; QwenSWEBench 79.0 vs 49.3 vs 63.8; CoWorkBench 70.7 vs 61.0 vs 68.2. Footer: all figures Alibaba-reported, not yet independently reproduced.

Tre cose oltre ai numeri grezzi lo rendono un acquisto difendibile:

• Multimodale nativo. Immagini e video in ingresso, testo in uscita — un documento con diagrammi o una video guida non è un modello separato. I punteggi di ragionamento visivo (85.6 con la funzionalità chain-of-thought attivata, 94.6 matematica visiva, entrambi riportati dal fornitore) sono il punto in cui l'encoder visivo dà il suo contributo.

• 262K di contesto nativo. Compiti dell'agente a lungo orizzonte, grandi codebase e trascrizioni di più ore rientrano in un'unica finestra. Il design ibrido ad attenzione lineare mantiene il costo KV di quel contesto più basso rispetto a un modello puro a piena attenzione della stessa dimensione.

• Pesi gratuiti e permanenti. Questo è il senso stesso della categoria: un modello API chiuso è a noleggio; Qwen3.8 27B è di proprietà. A 4 bit gira su una scheda da 24 GB (classe RTX 3090/4090), e AMD ha fornito supporto Day-0 (fino a 24,5 token/s su un Ryzen AI Max+ 395 e 51,8 token/s su una Radeon AI PRO R9700, secondo il blog di AMD).

Dove la recensione si fa brutta: velocità, token e verifica

I test indipendenti finora sono l'ambiente di test di un singolo tester, non un laboratorio — ma è il miglior segnale che abbiamo. Eseguendo Qwen3.8 27B contro Qwen3.6-27B su dieci compiti del mondo reale (giudicati da GPT-5.5 tramite l'harness llmcompare), il 3.8 ha vinto nove su dieci e ha ottenuto in media 8.838 contro 6.862 — "uno degli incrementi di intelligenza più impressionanti" che il tester aveva visto. Ha anche usato quasi tre volte i token ed è stato considerevolmente più lento; un compito ha richiesto circa il 600% di tempo in più. Quindi il salto di qualità è reale, e così anche il prezzo in termini di tempo di esecuzione.

Altre quattro cose da usare contro di esso:

• Ancora nessun benchmark di terze parti. Ogni cifra principale in questo articolo è riportata da Ali​baba al 15 agosto. La scheda del fornitore è dettagliata, ma la riproduzione da parte di un laboratorio indipendente non è avvenuta. Se la tua decisione dipende da numeri verificati, attendili: i pesi saranno ancora lì.

• Il requisito minimo di VRAM è reale. BF16 richiede una GPU di classe 80 GB. Per farlo stare in una scheda da 24 GB devi usare la quantizzazione a 4 bit, e i report della community (thread di commenti su dev.to, giorni dopo il rilascio) dicono che le build quantizzate "perdono concentrazione dopo un contesto lungo." Pesi ufficiali se hai la VRAM; quantizzati se non l'hai.

• Il contesto di 1M è disponibile solo nella versione ospitata. I pesi aperti si limitano a 262K. La cifra estendibile a 1M è una funzionalità di Qwen Cloud ospitata, non qualcosa che una copia locale fa automaticamente.

• "Beats Opus" richiede precisazioni. I benchmark agentici premiano comportamenti specifici dell'harness, e un commento in cima al post di lancio su dev.to lo ha detto senza mezzi termini: "non battono opus nell'uso reale." Tratta la classifica come un limite superiore in una buona giornata, non come una promessa.

Come si colloca nella famiglia Qwe​n 3.8

• vs Qwen3.6-27B — la stessa classe di hardware e un contesto di 262K, ma un notevole salto di capacità a scapito di velocità ed efficienza dei token. Se esegui già la 3.6 e sei vincolato dal throughput, restare è una scelta difendibile.

• contro Qwen3-Coder-30B-A3B — il Coder è un MoE con circa 3,3 miliardi di parametri attivi che gira molto più velocemente (~90–110 token/s). Il 27B denso è più lento per token ma eredita i guadagni agentici della generazione; se i punteggi di ingegneria del software del 27B reggono a test indipendenti, il ruolo del Coder-30B si riduce.

• vs Qwen3.8-Max — il modello di punta MoE da 2.4T è un modello da data center (solo API, circa $2/$6 per milione di token secondo i resoconti pubblicati) con contesto da 1M e supporto video. Il 27B è quello distribuibile. Rispondono a domande diverse.

Costo: la questione tra locale e API, risolta.

Per un modello chiuso confronti i prezzi per token. Per Qwen3.8 27B il costo marginale dei token non costa nulla sul tuo hardware — il prezzo reale è la GPU iniziale e il tuo tempo. A 4 bit è una scheda da 24 GB; in BF16 è una macchina di classe 80 GB. Se devi solo valutare il modello, o non hai l'hardware, esiste la soluzione di hosting: OrcaRouter ora elenca Qwen3.8 27B con una fascia gratuita con limiti di frequenza che addebita $0 e risponde HTTP 429 oltre il suo tetto, più una fascia a pagamento a $0,33 per milione di token in input e $2,40 per milione di token in output (verificato il 15 agosto). La versione hostata di Qwe​n Cloud, con contesto da 1M, è contrassegnata come "in arrivo."

Cost comparison card for Qwen3.8-27B titled 'Self-host vs hosted — the real price': Apache 2.0 weights at $0 license plus your own GPU and electricity; a 4-bit GGUF of roughly 17 GB that fits a 24 GB card; BF16 at 55.6 GB needing an 80 GB-class GPU; a free rate-limited hosted tier at $0 with HTTP 429 past the cap; and a paid hosted tier at $0.33 input / $2.40 output per million tokens with a 262K context window. Footer: prices from the OrcaRouter model page, read August 15, 2026.

La lettura onesta: per un modello a pesi aperti, un provider è una comodità, non una dipendenza. Il livello gratuito è il modo più economico in assoluto per decidere se un download da 55,6 GB ne vale la pena. Ma una volta che hai deciso, i pesi sono ciò che conta — e sono gratuiti.

Come provarlo davvero

• Valutazione più rapida — prova il piano gratuito ospitato con limiti di frequenza; se risponde a ciò che ti serve, hai finito e non ti è costato nulla.

• Test reale sul tuo hardware — scarica un GGUF della community (la build Q4_K_M è di circa 17 GB e sta in una scheda da 24 GB) ed eseguilo in llama.cpp o Ollama. Passa il template chat Jinja oppure il modello ti risponde con i tag thought. Per la visione da un GGUF ti serve anche il file mmproj separato. Il nostro runbook per eseguire Qwen3.8 27B in locale ti guida passo dopo passo.

• Piena precisione — huggingface-cli download Qwen/Qwen3.8-27B su una GPU di classe 80 GB.

• Verifica cosa hai scaricato — controlla che l'editore sia l'organizzazione Qwe​n e valida gli shard rispetto a crc32.txt; repository simili sono comparsi prima del rilascio.

Quando questa recensione è sbagliata (e chi dovrebbe saltare Qwen3.8 27B)

• Non hai una GPU e non ne affitterai una. Il livello gratuito è soggetto a limiti di frequenza e quello a pagamento costa $0.33/$2.40 per milione — un piccolo modello API potrebbe servirti a un costo minore e in modo più affidabile. Questo modello è per chi vuole possedere l'inferenza.

• Ti serve un contratto di livello di servizio (SLA). Il piano ospitato ha solo pochi giorni; la pagina del modello OrcaRouter, letta oggi, mostra un tasso di errore del 33,3% negli ultimi sette giorni e una latenza p50 del primo token di 225 ms. È un modello nuovissimo sotto carico iniziale, non un contratto di produzione. Chi si auto-ospita dovrebbe fissare il commit del download e tenere un fallback.

• Ti servono benchmark verificati per una decisione di acquisto. I numeri forniti dai vendor sono utili a livello indicativo, ma non sono idonei per il procurement. Attendi una riproduzione indipendente.

• 262K di contesto open-weights non è sufficiente. L'estensione 1M oggi è disponibile solo in versione hosted.

• Il throughput è il tuo collo di bottiglia. Il riepilogo in blocco o i batch di grandi dimensioni faranno male: questo è un 27B denso che brucia circa 3 volte i token del suo predecessore. Per lavori in blocco a basso costo, vince un modello più piccolo o più veloce.

• Hai una scheda da 12 GB. I GGUF a 2 bit ci stanno con una perdita di qualità visibile; questo non è il modello per te.

Verdict infographic titled 'Use it if / Skip it if' for Qwen3.8-27B: left lane in soft blue labeled 'Use it if' with three items — '24 GB GPU', 'Free Apache 2.0 weights', '262K context + image/video'; right lane in soft gray labeled 'Skip it if' with three items — 'No GPU', 'Need an SLA', 'Need verified benchmarks'.

Il punto cruciale

Qwen3.8 27B è il modello open-weights 27B più potente disponibile oggi, ed è gratuito per sempre con licenza Apache 2.0. Se hai una GPU da 24 GB+ e vuoi coding agentico, contesto da 262K e input nativo di immagini/video senza bollette a consumo, questo è l'acquisto giusto. Le ragioni per aspettare sono altrettanto concrete: ti serve una conferma indipendente dai benchmark, un SLA, più di 262K di contesto open-weights, o una velocità di elaborazione superiore a quella che un 27B denso può offrirti. Il modello è uscito, i pesi sono reali e i numeri sono buoni — ricorda solo di chi sono quei numeri.