
Recensione di Qwen3.8-27B: il 27B open-weight che è "Opus at home" — messo alla prova contro l'hype
- obsidianNUOVOQwen3.8 27B Uncensored (Aggressive)2026-08-15$0.40 / $4.21 per 1M di token · 22 tok/s
- qwenNUOVOQwen: Qwen3.8 27B (free)2026-08-1343 tok/s
- deepseekNUOVODeepSeek: DeepSeek V4 Pro 08132026-08-1253Intelligenza69Codice
- grokNUOVOSpaceXAI: Grok 4.62026-08-1261Intelligenza77Codice
- metaNUOVOMeta: Muse Spark 1.22026-08-0557Intelligenza72Codice
- qwenQwen: Qwen3.8 Max2026-08-0358Intelligenza72Codice
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3152Intelligenza69Codice
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 per 1M di token · 273 tok/s
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2463Intelligenza78Codice
- googleGoogle: Gemini 3.6 Flash2026-07-2152Intelligenza69Codice
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2137Intelligenza49Codice
- metaMeta: Muse Spark 1.12026-07-1653Intelligenza71Codice
- kimiMoonshotAI: Kimi K32026-07-1560Intelligenza76Codice
- openaiOpenAI: GPT-5.6 Luna2026-07-0952Intelligenza71Codice
- openaiOpenAI: GPT-5.6 Terra2026-07-0957Intelligenza77Codice
- openaiOpenAI: GPT-5.6 Sol2026-07-0961Intelligenza77Codice
- grokxAI: Grok 4.52026-07-0856Intelligenza72Codice
- tencentTencent: Hy32026-07-0642Intelligenza59Codice
Qwen3.8 27B è il miglior 27B open-weights che puoi auto-ospitare in questo momento, e non è nemmeno lontanamente vicino. I pesi sono stati rilasciati il 14 agosto 2026 con licenza Apache 2.0: un modello denso da 27B (28B contando l'encoder visivo) con contesto nativo di 262K, input nativo per immagini e video, e punteggi di coding agentico riportati dal fornitore che si collocano a o sopra Claude Opus 4.6 Max — SWE-bench Pro 61.7, DeepSWE 1.1 42.2, LiveCodeBench v6 90.3. Il prezzo annunciato è zero: scarica 55.6 GB ed eseguilo. Anche le avvertenze sono reali: i test indipendenti lo trovano circa tre volte più lento e più avido di token rispetto al suo predecessore, ogni benchmark sulla scheda è ancora riportato da Alibaba, e il contesto da 1M è una funzionalità disponibile solo nella versione ospitata. Verdetto: se hai una GPU da 24 GB+ e vuoi una capacità vicina alla frontiera senza una bolletta a consumo, auto-ospitalo — ma sapendo esattamente dove i numeri sono deboli.
Prima il verdetto: dovresti usare Qwen3.8 27B?
Risposta breve — sì per i carichi di lavoro locali e privati; attendere i dati di terze parti prima di una decisione di acquisto. Qwen3.8 27B è il raro modello in cui i pesi aperti sono il prodotto e l'API è la comodità. Poiché la licenza è Apache 2.0, il prezzo per token è permanentemente zero una volta che hai l'hardware, e nulla di ciò che costruisci su di esso può essere rilicenziato o fatturato retroattivamente. Ciò a cui rinunci sono velocità, verifica e comodità.
Se utilizzi già Qwen3.6-27B e ne sei soddisfatto, l'upgrade è reale ma non è gratuito in termini di tempo effettivo. Se sei arrivato qui dal lancio di Qwen3.8-Max, questo è il membro più piccolo e auto-ospitabile della stessa generazione — uno strumento diverso per un lavoro diverso.
I fatti in breve, verificati il 15 agosto 2026
• Rilasciato — i pesi sono stati pubblicati il 14 agosto 2026 su Qwen/Qwen3.8-27B su Hugging Face, con mirror su ModelScope; la copertura che tiene conto dei fusi orari cita anche il 13 agosto, e il rilascio è avvenuto circa una settimana dopo l'annuncio della generazione Qwen3.8.
• Licenza — Apache 2.0: scaricare, modificare, ridistribuire, uso commerciale, con una concessione esplicita di brevetto. Permanente.
• Parametri — 27B denso (28B contando l'encoder visivo), 64 strati, dimensione nascosta 5.120, vocabolario 248.320.
• Architettura — attenzione ibrida: 48 layer di attenzione lineare Gated DeltaNet contro 16 layer completi di Gated Attention (un rapporto 3:1). È per questo che un modello denso da 27B può gestire 262K token di contesto nativo.
• Contesto — 262.144 token nativamente; estendibile a 1.000.000 tramite YaRN sulla versione ospitata.
• Input — immagine e video nativi accanto al testo; restituisce testo. L'encoder visivo è il motivo per cui il conteggio dei parametri indica 28B.
• Pensiero — modalità di ragionamento attiva per impostazione predefinita e disattivabile su richiesta; reasoning_effort (basso/medio/alto) e preserve_thinking per lunghe esecuzioni di agenti.
• Pesi — 55,6 GB di safetensors BF16 in 18 shard; sono inclusi anche FP8 e GGUFs della community.
Le specifiche sopra riportate provengono dalla scheda del modello e dalla configurazione di Hugging Face per Qwen3.8 27B, lette oggi. Le affermazioni sui benchmark sono riportate da Alibaba; ad oggi nessun laboratorio indipendente le ha riprodotte.
Ciò in cui Qwen3.8 27B è davvero bravo
Il caso più convincente è l'ingegneria del software agentica. Alibaba riporta un incremento di 3x su DeepSWE 1.1 rispetto al precedente 27B (42.2 vs 13.3) e un punteggio superiore a Claude Opus 4.6 Max su SWE-bench Pro (61.7 vs 53.4). Quelli sono i numeri che gli hanno valso il soprannome "Opus at home" — un denso 27B che svolge lavoro di codifica vicino alla frontiera su hardware che una persona può davvero possedere.

Tre cose oltre ai numeri grezzi lo rendono un acquisto difendibile:
• Multimodale nativo. Immagini e video in ingresso, testo in uscita — un documento con diagrammi o una video guida non è un modello separato. I punteggi di ragionamento visivo (85.6 con la funzionalità chain-of-thought attivata, 94.6 matematica visiva, entrambi riportati dal fornitore) sono il punto in cui l'encoder visivo dà il suo contributo.
• 262K di contesto nativo. Compiti dell'agente a lungo orizzonte, grandi codebase e trascrizioni di più ore rientrano in un'unica finestra. Il design ibrido ad attenzione lineare mantiene il costo KV di quel contesto più basso rispetto a un modello puro a piena attenzione della stessa dimensione.
• Pesi gratuiti e permanenti. Questo è il senso stesso della categoria: un modello API chiuso è a noleggio; Qwen3.8 27B è di proprietà. A 4 bit gira su una scheda da 24 GB (classe RTX 3090/4090), e AMD ha fornito supporto Day-0 (fino a 24,5 token/s su un Ryzen AI Max+ 395 e 51,8 token/s su una Radeon AI PRO R9700, secondo il blog di AMD).
Dove la recensione si fa brutta: velocità, token e verifica
I test indipendenti finora sono l'ambiente di test di un singolo tester, non un laboratorio — ma è il miglior segnale che abbiamo. Eseguendo Qwen3.8 27B contro Qwen3.6-27B su dieci compiti del mondo reale (giudicati da GPT-5.5 tramite l'harness llmcompare), il 3.8 ha vinto nove su dieci e ha ottenuto in media 8.838 contro 6.862 — "uno degli incrementi di intelligenza più impressionanti" che il tester aveva visto. Ha anche usato quasi tre volte i token ed è stato considerevolmente più lento; un compito ha richiesto circa il 600% di tempo in più. Quindi il salto di qualità è reale, e così anche il prezzo in termini di tempo di esecuzione.
Altre quattro cose da usare contro di esso:
• Ancora nessun benchmark di terze parti. Ogni cifra principale in questo articolo è riportata da Alibaba al 15 agosto. La scheda del fornitore è dettagliata, ma la riproduzione da parte di un laboratorio indipendente non è avvenuta. Se la tua decisione dipende da numeri verificati, attendili: i pesi saranno ancora lì.
• Il requisito minimo di VRAM è reale. BF16 richiede una GPU di classe 80 GB. Per farlo stare in una scheda da 24 GB devi usare la quantizzazione a 4 bit, e i report della community (thread di commenti su dev.to, giorni dopo il rilascio) dicono che le build quantizzate "perdono concentrazione dopo un contesto lungo." Pesi ufficiali se hai la VRAM; quantizzati se non l'hai.
• Il contesto di 1M è disponibile solo nella versione ospitata. I pesi aperti si limitano a 262K. La cifra estendibile a 1M è una funzionalità di Qwen Cloud ospitata, non qualcosa che una copia locale fa automaticamente.
• "Beats Opus" richiede precisazioni. I benchmark agentici premiano comportamenti specifici dell'harness, e un commento in cima al post di lancio su dev.to lo ha detto senza mezzi termini: "non battono opus nell'uso reale." Tratta la classifica come un limite superiore in una buona giornata, non come una promessa.
Come si colloca nella famiglia Qwen 3.8
• vs Qwen3.6-27B — la stessa classe di hardware e un contesto di 262K, ma un notevole salto di capacità a scapito di velocità ed efficienza dei token. Se esegui già la 3.6 e sei vincolato dal throughput, restare è una scelta difendibile.
• contro Qwen3-Coder-30B-A3B — il Coder è un MoE con circa 3,3 miliardi di parametri attivi che gira molto più velocemente (~90–110 token/s). Il 27B denso è più lento per token ma eredita i guadagni agentici della generazione; se i punteggi di ingegneria del software del 27B reggono a test indipendenti, il ruolo del Coder-30B si riduce.
• vs Qwen3.8-Max — il modello di punta MoE da 2.4T è un modello da data center (solo API, circa $2/$6 per milione di token secondo i resoconti pubblicati) con contesto da 1M e supporto video. Il 27B è quello distribuibile. Rispondono a domande diverse.
Costo: la questione tra locale e API, risolta.
Per un modello chiuso confronti i prezzi per token. Per Qwen3.8 27B il costo marginale dei token non costa nulla sul tuo hardware — il prezzo reale è la GPU iniziale e il tuo tempo. A 4 bit è una scheda da 24 GB; in BF16 è una macchina di classe 80 GB. Se devi solo valutare il modello, o non hai l'hardware, esiste la soluzione di hosting: OrcaRouter ora elenca Qwen3.8 27B con una fascia gratuita con limiti di frequenza che addebita $0 e risponde HTTP 429 oltre il suo tetto, più una fascia a pagamento a $0,33 per milione di token in input e $2,40 per milione di token in output (verificato il 15 agosto). La versione hostata di Qwen Cloud, con contesto da 1M, è contrassegnata come "in arrivo."

La lettura onesta: per un modello a pesi aperti, un provider è una comodità, non una dipendenza. Il livello gratuito è il modo più economico in assoluto per decidere se un download da 55,6 GB ne vale la pena. Ma una volta che hai deciso, i pesi sono ciò che conta — e sono gratuiti.
Come provarlo davvero
• Valutazione più rapida — prova il piano gratuito ospitato con limiti di frequenza; se risponde a ciò che ti serve, hai finito e non ti è costato nulla.
• Test reale sul tuo hardware — scarica un GGUF della community (la build Q4_K_M è di circa 17 GB e sta in una scheda da 24 GB) ed eseguilo in llama.cpp o Ollama. Passa il template chat Jinja oppure il modello ti risponde con i tag thought. Per la visione da un GGUF ti serve anche il file mmproj separato. Il nostro runbook per eseguire Qwen3.8 27B in locale ti guida passo dopo passo.
• Piena precisione — huggingface-cli download Qwen/Qwen3.8-27B su una GPU di classe 80 GB.
• Verifica cosa hai scaricato — controlla che l'editore sia l'organizzazione Qwen e valida gli shard rispetto a crc32.txt; repository simili sono comparsi prima del rilascio.
Quando questa recensione è sbagliata (e chi dovrebbe saltare Qwen3.8 27B)
• Non hai una GPU e non ne affitterai una. Il livello gratuito è soggetto a limiti di frequenza e quello a pagamento costa $0.33/$2.40 per milione — un piccolo modello API potrebbe servirti a un costo minore e in modo più affidabile. Questo modello è per chi vuole possedere l'inferenza.
• Ti serve un contratto di livello di servizio (SLA). Il piano ospitato ha solo pochi giorni; la pagina del modello OrcaRouter, letta oggi, mostra un tasso di errore del 33,3% negli ultimi sette giorni e una latenza p50 del primo token di 225 ms. È un modello nuovissimo sotto carico iniziale, non un contratto di produzione. Chi si auto-ospita dovrebbe fissare il commit del download e tenere un fallback.
• Ti servono benchmark verificati per una decisione di acquisto. I numeri forniti dai vendor sono utili a livello indicativo, ma non sono idonei per il procurement. Attendi una riproduzione indipendente.
• 262K di contesto open-weights non è sufficiente. L'estensione 1M oggi è disponibile solo in versione hosted.
• Il throughput è il tuo collo di bottiglia. Il riepilogo in blocco o i batch di grandi dimensioni faranno male: questo è un 27B denso che brucia circa 3 volte i token del suo predecessore. Per lavori in blocco a basso costo, vince un modello più piccolo o più veloce.
• Hai una scheda da 12 GB. I GGUF a 2 bit ci stanno con una perdita di qualità visibile; questo non è il modello per te.

La conclusione
Qwen3.8 27B è il modello open-weights 27B più potente disponibile oggi, ed è gratuito per sempre con licenza Apache 2.0. Se hai una GPU da 24 GB+ e vuoi coding agentico, contesto da 262K e input nativo di immagini/video senza bollette a consumo, questo è l'acquisto giusto. Le ragioni per aspettare sono altrettanto concrete: ti serve una conferma indipendente dai benchmark, un SLA, più di 262K di contesto open-weights, o una velocità di elaborazione superiore a quella che un 27B denso può offrirti. Il modello è uscito, i pesi sono reali e i numeri sono buoni — ricorda solo di chi sono quei numeri.
