Scheda titolo hero per la recensione di Qwen3.8-27B, intitolata 'Recensione di Qwen3.8-27B' con il sottotitolo 'L'open-weight 27B che è l'Opus di casa — testato contro l'hype', che mostra un badge open-weights, un badge Apache 2.0 e un set di icone GPU e server su uno sfondo bianco pulito con delicati accenti di gradiente blu.
Guides & Insights

Recensione di Qwen3.8-27B: il 27B open-weight che è "Opus at home" — messo alla prova contro l'hype

Autore

Alistair Wren

Data di pubblicazione

Ultimi modelli · 20Vedi tutti i modelli
Benchmark: Artificial Analysis · aggiornato ogni giorno
Torna a tutti gli articoli

Qwen3.8 27B è il miglior 27B open-weights che puoi auto-ospitare in questo momento, e non è nemmeno lontanamente vicino. I pesi sono stati rilasciati il 14 agosto 2026 con licenza Apache 2.0: un modello denso da 27B (28B contando l'encoder visivo) con contesto nativo di 262K, input nativo per immagini e video, e punteggi di coding agentico riportati dal fornitore che si collocano a o sopra Cla​ude Opus 4.6 Max — SWE-bench Pro 61.7, DeepSWE 1.1 42.2, LiveCodeBench v6 90.3. Il prezzo annunciato è zero: scarica 55.6 GB ed eseguilo. Anche le avvertenze sono reali: i test indipendenti lo trovano circa tre volte più lento e più avido di token rispetto al suo predecessore, ogni benchmark sulla scheda è ancora riportato da Ali​baba, e il contesto da 1M è una funzionalità disponibile solo nella versione ospitata. Verdetto: se hai una GPU da 24 GB+ e vuoi una capacità vicina alla frontiera senza una bolletta a consumo, auto-ospitalo — ma sapendo esattamente dove i numeri sono deboli.

Prima il verdetto: dovresti usare Qwen3.8 27B?

Risposta breve — sì per i carichi di lavoro locali e privati; attendere i dati di terze parti prima di una decisione di acquisto. Qwen3.8 27B è il raro modello in cui i pesi aperti sono il prodotto e l'API è la comodità. Poiché la licenza è Apache 2.0, il prezzo per token è permanentemente zero una volta che hai l'hardware, e nulla di ciò che costruisci su di esso può essere rilicenziato o fatturato retroattivamente. Ciò a cui rinunci sono velocità, verifica e comodità.

Se utilizzi già Qwen3.6-27B e ne sei soddisfatto, l'upgrade è reale ma non è gratuito in termini di tempo effettivo. Se sei arrivato qui dal lancio di Qwen3.8-Max, questo è il membro più piccolo e auto-ospitabile della stessa generazione — uno strumento diverso per un lavoro diverso.

I fatti in breve, verificati il 15 agosto 2026

Rilasciato — i pesi sono stati pubblicati il 14 agosto 2026 su Qwen/Qwen3.8-27B su Hugging Face, con mirror su ModelScope; la copertura che tiene conto dei fusi orari cita anche il 13 agosto, e il rilascio è avvenuto circa una settimana dopo l'annuncio della generazione Qwen3.8.

Licenza — Apache 2.0: scaricare, modificare, ridistribuire, uso commerciale, con una concessione esplicita di brevetto. Permanente.

Parametri — 27B denso (28B contando l'encoder visivo), 64 strati, dimensione nascosta 5.120, vocabolario 248.320.

Architettura — attenzione ibrida: 48 layer di attenzione lineare Gated DeltaNet contro 16 layer completi di Gated Attention (un rapporto 3:1). È per questo che un modello denso da 27B può gestire 262K token di contesto nativo.

Contesto — 262.144 token nativamente; estendibile a 1.000.000 tramite YaRN sulla versione ospitata.

Input — immagine e video nativi accanto al testo; restituisce testo. L'encoder visivo è il motivo per cui il conteggio dei parametri indica 28B.

Pensiero — modalità di ragionamento attiva per impostazione predefinita e disattivabile su richiesta; reasoning_effort (basso/medio/alto) e preserve_thinking per lunghe esecuzioni di agenti.

Pesi — 55,6 GB di safetensors BF16 in 18 shard; sono inclusi anche FP8 e GGUFs della community.

Le specifiche sopra riportate provengono dalla scheda del modello e dalla configurazione di Hugging Face per Qwen3.8 27B, lette oggi. Le affermazioni sui benchmark sono riportate da Ali​baba; ad oggi nessun laboratorio indipendente le ha riprodotte.

Ciò in cui Qwen3.8 27B è davvero bravo

Il caso più convincente è l'ingegneria del software agentica. Ali​baba riporta un incremento di 3x su DeepSWE 1.1 rispetto al precedente 27B (42.2 vs 13.3) e un punteggio superiore a Cla​ude Opus 4.6 Max su SWE-bench Pro (61.7 vs 53.4). Quelli sono i numeri che gli hanno valso il soprannome "Opus at home" — un denso 27B che svolge lavoro di codifica vicino alla frontiera su hardware che una persona può davvero possedere.

Benchmark scoreboard card comparing Qwen3.8-27B with Qwen3.6-27B and Claude Opus 4.6 Max: SWE-bench Pro 61.7 vs 53.5 vs 53.4; DeepSWE 1.1 42.2 vs 13.3 vs n/a; LiveCodeBench v6 90.3 vs 83.9 vs 88.8; Terminal Bench 2.1 73.0 vs 63.4 vs 78.2; GPQA Diamond 89.2 vs 87.8 vs 91.3; OSWorld-Verified 84.3 vs 63.9 vs 72.7; QwenSWEBench 79.0 vs 49.3 vs 63.8; CoWorkBench 70.7 vs 61.0 vs 68.2. Footer: all figures Alibaba-reported, not yet independently reproduced.

Tre cose oltre ai numeri grezzi lo rendono un acquisto difendibile:

Multimodale nativo. Immagini e video in ingresso, testo in uscita — un documento con diagrammi o una video guida non è un modello separato. I punteggi di ragionamento visivo (85.6 con la funzionalità chain-of-thought attivata, 94.6 matematica visiva, entrambi riportati dal fornitore) sono il punto in cui l'encoder visivo dà il suo contributo.

262K di contesto nativo. Compiti dell'agente a lungo orizzonte, grandi codebase e trascrizioni di più ore rientrano in un'unica finestra. Il design ibrido ad attenzione lineare mantiene il costo KV di quel contesto più basso rispetto a un modello puro a piena attenzione della stessa dimensione.

Pesi gratuiti e permanenti. Questo è il senso stesso della categoria: un modello API chiuso è a noleggio; Qwen3.8 27B è di proprietà. A 4 bit gira su una scheda da 24 GB (classe RTX 3090/4090), e AMD ha fornito supporto Day-0 (fino a 24,5 token/s su un Ryzen AI Max+ 395 e 51,8 token/s su una Radeon AI PRO R9700, secondo il blog di AMD).

Dove la recensione si fa brutta: velocità, token e verifica

I test indipendenti finora sono l'ambiente di test di un singolo tester, non un laboratorio — ma è il miglior segnale che abbiamo. Eseguendo Qwen3.8 27B contro Qwen3.6-27B su dieci compiti del mondo reale (giudicati da GPT-5.5 tramite l'harness llmcompare), il 3.8 ha vinto nove su dieci e ha ottenuto in media 8.838 contro 6.862 — "uno degli incrementi di intelligenza più impressionanti" che il tester aveva visto. Ha anche usato quasi tre volte i token ed è stato considerevolmente più lento; un compito ha richiesto circa il 600% di tempo in più. Quindi il salto di qualità è reale, e così anche il prezzo in termini di tempo di esecuzione.

Altre quattro cose da usare contro di esso:

Ancora nessun benchmark di terze parti. Ogni cifra principale in questo articolo è riportata da Ali​baba al 15 agosto. La scheda del fornitore è dettagliata, ma la riproduzione da parte di un laboratorio indipendente non è avvenuta. Se la tua decisione dipende da numeri verificati, attendili: i pesi saranno ancora lì.

Il requisito minimo di VRAM è reale. BF16 richiede una GPU di classe 80 GB. Per farlo stare in una scheda da 24 GB devi usare la quantizzazione a 4 bit, e i report della community (thread di commenti su dev.to, giorni dopo il rilascio) dicono che le build quantizzate "perdono concentrazione dopo un contesto lungo." Pesi ufficiali se hai la VRAM; quantizzati se non l'hai.

Il contesto di 1M è disponibile solo nella versione ospitata. I pesi aperti si limitano a 262K. La cifra estendibile a 1M è una funzionalità di Qwen Cloud ospitata, non qualcosa che una copia locale fa automaticamente.

"Beats Opus" richiede precisazioni. I benchmark agentici premiano comportamenti specifici dell'harness, e un commento in cima al post di lancio su dev.to lo ha detto senza mezzi termini: "non battono opus nell'uso reale." Tratta la classifica come un limite superiore in una buona giornata, non come una promessa.

Come si colloca nella famiglia Qwe​n 3.8

vs Qwen3.6-27B — la stessa classe di hardware e un contesto di 262K, ma un notevole salto di capacità a scapito di velocità ed efficienza dei token. Se esegui già la 3.6 e sei vincolato dal throughput, restare è una scelta difendibile.

contro Qwen3-Coder-30B-A3B — il Coder è un MoE con circa 3,3 miliardi di parametri attivi che gira molto più velocemente (~90–110 token/s). Il 27B denso è più lento per token ma eredita i guadagni agentici della generazione; se i punteggi di ingegneria del software del 27B reggono a test indipendenti, il ruolo del Coder-30B si riduce.

vs Qwen3.8-Max — il modello di punta MoE da 2.4T è un modello da data center (solo API, circa $2/$6 per milione di token secondo i resoconti pubblicati) con contesto da 1M e supporto video. Il 27B è quello distribuibile. Rispondono a domande diverse.

Costo: la questione tra locale e API, risolta.

Per un modello chiuso confronti i prezzi per token. Per Qwen3.8 27B il costo marginale dei token non costa nulla sul tuo hardware — il prezzo reale è la GPU iniziale e il tuo tempo. A 4 bit è una scheda da 24 GB; in BF16 è una macchina di classe 80 GB. Se devi solo valutare il modello, o non hai l'hardware, esiste la soluzione di hosting: OrcaRouter ora elenca Qwen3.8 27B con una fascia gratuita con limiti di frequenza che addebita $0 e risponde HTTP 429 oltre il suo tetto, più una fascia a pagamento a $0,33 per milione di token in input e $2,40 per milione di token in output (verificato il 15 agosto). La versione hostata di Qwe​n Cloud, con contesto da 1M, è contrassegnata come "in arrivo."

Cost comparison card for Qwen3.8-27B titled 'Self-host vs hosted — the real price': Apache 2.0 weights at $0 license plus your own GPU and electricity; a 4-bit GGUF of roughly 17 GB that fits a 24 GB card; BF16 at 55.6 GB needing an 80 GB-class GPU; a free rate-limited hosted tier at $0 with HTTP 429 past the cap; and a paid hosted tier at $0.33 input / $2.40 output per million tokens with a 262K context window. Footer: prices from the OrcaRouter model page, read August 15, 2026.

La lettura onesta: per un modello a pesi aperti, un provider è una comodità, non una dipendenza. Il livello gratuito è il modo più economico in assoluto per decidere se un download da 55,6 GB ne vale la pena. Ma una volta che hai deciso, i pesi sono ciò che conta — e sono gratuiti.

Come provarlo davvero

Valutazione più rapida — prova il piano gratuito ospitato con limiti di frequenza; se risponde a ciò che ti serve, hai finito e non ti è costato nulla.

Test reale sul tuo hardware — scarica un GGUF della community (la build Q4_K_M è di circa 17 GB e sta in una scheda da 24 GB) ed eseguilo in llama.cpp o Ollama. Passa il template chat Jinja oppure il modello ti risponde con i tag thought. Per la visione da un GGUF ti serve anche il file mmproj separato. Il nostro runbook per eseguire Qwen3.8 27B in locale ti guida passo dopo passo.

Piena precisione — huggingface-cli download Qwen/Qwen3.8-27B su una GPU di classe 80 GB.

Verifica cosa hai scaricato — controlla che l'editore sia l'organizzazione Qwe​n e valida gli shard rispetto a crc32.txt; repository simili sono comparsi prima del rilascio.

Quando questa recensione è sbagliata (e chi dovrebbe saltare Qwen3.8 27B)

Non hai una GPU e non ne affitterai una. Il livello gratuito è soggetto a limiti di frequenza e quello a pagamento costa $0.33/$2.40 per milione — un piccolo modello API potrebbe servirti a un costo minore e in modo più affidabile. Questo modello è per chi vuole possedere l'inferenza.

Ti serve un contratto di livello di servizio (SLA). Il piano ospitato ha solo pochi giorni; la pagina del modello OrcaRouter, letta oggi, mostra un tasso di errore del 33,3% negli ultimi sette giorni e una latenza p50 del primo token di 225 ms. È un modello nuovissimo sotto carico iniziale, non un contratto di produzione. Chi si auto-ospita dovrebbe fissare il commit del download e tenere un fallback.

Ti servono benchmark verificati per una decisione di acquisto. I numeri forniti dai vendor sono utili a livello indicativo, ma non sono idonei per il procurement. Attendi una riproduzione indipendente.

262K di contesto open-weights non è sufficiente. L'estensione 1M oggi è disponibile solo in versione hosted.

Il throughput è il tuo collo di bottiglia. Il riepilogo in blocco o i batch di grandi dimensioni faranno male: questo è un 27B denso che brucia circa 3 volte i token del suo predecessore. Per lavori in blocco a basso costo, vince un modello più piccolo o più veloce.

Hai una scheda da 12 GB. I GGUF a 2 bit ci stanno con una perdita di qualità visibile; questo non è il modello per te.

Verdict infographic titled 'Use it if / Skip it if' for Qwen3.8-27B: left lane in soft blue labeled 'Use it if' with three items — '24 GB GPU', 'Free Apache 2.0 weights', '262K context + image/video'; right lane in soft gray labeled 'Skip it if' with three items — 'No GPU', 'Need an SLA', 'Need verified benchmarks'.

La conclusione

Qwen3.8 27B è il modello open-weights 27B più potente disponibile oggi, ed è gratuito per sempre con licenza Apache 2.0. Se hai una GPU da 24 GB+ e vuoi coding agentico, contesto da 262K e input nativo di immagini/video senza bollette a consumo, questo è l'acquisto giusto. Le ragioni per aspettare sono altrettanto concrete: ti serve una conferma indipendente dai benchmark, un SLA, più di 262K di contesto open-weights, o una velocità di elaborazione superiore a quella che un 27B denso può offrirti. Il modello è uscito, i pesi sono reali e i numeri sono buoni — ricorda solo di chi sono quei numeri.

© 2026 OrcaRouter

Per i provider

Gestisci una piattaforma di inferenza? Porta i tuoi modelli su OrcaRouter.

Contattaci

Unisciti alla community

DiscordEmailXGitHubYouTube