
Qwen3.8-27B su Ollama: un comando, quattro quantizzazioni e quanto costa davvero il "gratis"
- obsidianNUOVOQwen3.8 27B Uncensored (Aggressive)2026-08-15$0.40 / $4.21 per 1M di token · 18 tok/s
- qwenNUOVOQwen: Qwen3.8 27B (free)2026-08-1335 tok/s
- deepseekNUOVODeepSeek: DeepSeek V4 Pro 08132026-08-1253Intelligenza69Codice
- grokNUOVOSpaceXAI: Grok 4.62026-08-1261Intelligenza77Codice
- metaNUOVOMeta: Muse Spark 1.22026-08-0557Intelligenza72Codice
- qwenNUOVOQwen: Qwen3.8 Max2026-08-0358Intelligenza72Codice
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3152Intelligenza69Codice
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 per 1M di token · 2341 tok/s
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2463Intelligenza78Codice
- googleGoogle: Gemini 3.6 Flash2026-07-2152Intelligenza69Codice
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2137Intelligenza49Codice
- metaMeta: Muse Spark 1.12026-07-1653Intelligenza71Codice
- kimiMoonshotAI: Kimi K32026-07-1560Intelligenza76Codice
- openaiOpenAI: GPT-5.6 Luna2026-07-0952Intelligenza71Codice
- openaiOpenAI: GPT-5.6 Terra2026-07-0957Intelligenza77Codice
- openaiOpenAI: GPT-5.6 Sol2026-07-0961Intelligenza77Codice
- grokxAI: Grok 4.52026-07-0856Intelligenza72Codice
- tencentTencent: Hy32026-07-0642Intelligenza59Codice
Eseguilo con un solo comando: ollama run qwen3.8:27b. Questa è l'intera risposta alla domanda a cui è dedicata questa pagina. Qwen3.8 27B — il modello denso da 27 miliardi di parametri di Alibaba, con pesi rilasciati il 14 agosto 2026 sotto licenza Apache 2.0 — è arrivato questa settimana nella libreria di Ollama, e la build predefinita è già una ragionevole quantizzazione Q4_K_M da 18 GB (17 GB di pesi più un encoder visivo da 931 MB). Gira completamente su una GPU da 24 GB con lunghezze di contesto normali, passa alla CPU quando la tua scheda è più piccola e non costa nulla per token.
Tutto qui è datato 15 agosto 2026. Le specifiche provengono dalla scheda del modello Qwen3.8 27B; le dimensioni dei download, i tag e i conteggi dei download provengono dalla pagina live della libreria Ollama; i numeri dei benchmark sono riportati da Alibaba e non hanno ancora una replica indipendente. Il modello è stato rilasciato giorni fa, quindi considera provvisorio tutto ciò che può cambiare.
La frase che funziona davvero
Se hai già Ollama installato, ti bastano due parole:
ollama run qwen3.8:27b
Il supporto per Ollama è arrivato nella v0.32.12 — la nota di rilascio recita, semplicemente: "Questa versione aggiunge il supporto di Qwen 3.8 27B." La prima esecuzione scarica la build predefinita (circa 18 GB, Q4_K_M), poi ti porta in una REPL di chat con la modalità di pensiero attivata per impostazione predefinita. La pagina della libreria elenca la build con i tag di capacità "vision tools thinking 27b", ed è così che capisci che i percorsi di visione e chiamata degli strumenti sono collegati allo stesso download. Al momento in cui scriviamo, la pagina mostra più di 40.000 download e un elenco di tag che include già undici varianti.

Due varianti a cui ricorrerai davvero:
• ollama run qwen3.8:27b-mlx — la versione per Apple Silicon, stesso ingombro di 18 GB ma compilata per Metal; è quella che la nota di rilascio di Ollama ottimizza specificamente "per ottenere prestazioni massime e una qualità di output adatta a attività ripetitive e agenti di codifica."
• ollama run qwen3.8:27b-q8_0 — una quantizzazione a 8 bit da 30 GB, per quando hai la VRAM e vuoi i pesi più vicini alla piena precisione.
Ciò che stai effettivamente scaricando
Il nome dice 27B, ma il conteggio totale dei parametri è 28B: un modello linguistico denso da 27.3B più un encoder visivo da 461M che gli conferisce input nativi per immagini e video. Il resto delle specifiche principali, direttamente dalla scheda del modello:
• 64 strati, dimensione nascosta 5.120, vocabolario 248.320.
{{1}}Attenzione ibrida: {{2}}16 layer completi di Gated Attention e 48 layer lineari di Gated DeltaNet{{/2}} — {{3}}un mix lineare-lean di 3:1{{/3}}, {{4}}il motivo per cui un modello da 27B può mantenere un contesto nativo di 262.144 token (estensibile a 1M) senza che la cache KV consumi un intero datacenter{{/4}}.{{/1}}
Comprensione nativa di immagini e video — "dai diagrammi STEM e documenti ai video di durata oraria" è la formulazione di Alibaba.
• Apache 2.0. Scaricalo, modificalo, vendi un prodotto basato su di esso. Quella licenza è il fatto legale su cui poggia l'economia del resto di questo articolo.
Il riferimento a piena precisione è BF16, motivo per cui esistono i tag da 56 GB; ogni tag più piccolo è un compromesso tra precisione e ingombro, e i benchmark della scheda del modello sono ciò a cui stai rinunciando.
Scegli un quant, poi controlla la tua VRAM, non viceversa
Ollama ti dà undici tag, ma la decisione si riduce a tre dimensioni.
• 18 GB — Q4_K_M (predefinito). Entra completamente su una scheda da 24 GB (classe RTX 4090 / 5090) con un contesto normale, e su schede da 16 GB con offload parziale della CPU — più lento, ma funziona. Questa è la build per "farlo girare e basta".
• 30 GB — Q8_0. Pesi quasi a piena precisione, richiede circa 40 GB di VRAM per rimanere completamente su GPU. Su un 27B, dovresti già sapere perché vuoi la fedeltà extra prima di pagarla.
• 56 GB — BF16. La build di riferimento. Richiede hardware di classe H100 o da 96 GB. Nessuno la esegue su una GPU consumer, e va bene così.

Il numero che inganna molti è la cache KV. Il download da 18 GB non significa che 18 GB di VRAM bastino per una sessione con contesto 262K — con contesti lunghi la cache aggiunge diversi gigabyte in più rispetto ai pesi, ed è per questo che una scheda da 24 GB regge comodamente questo modello con contesto 8K–32K ma non a 262K. Su una scheda al limite, taglia il contesto, non la quantizzazione.
Apple Silicon è un target di prim'ordine qui
Le note di rilascio di Ollama v0.32.12 menzionano specificamente macOS. In concreto, `ollama run qwen3.8:27b-mlx` richiede circa 18 GB di memoria unificata, quindi un Mac con 24 GB o più lo esegue completamente sulla GPU con margine per il contesto. Ci sono anche un tag MXFP8 MLX da 32 GB e un tag mlx-bf16 da 56 GB per le macchine da 64–128 GB. Se il tuo Mac con chip serie M ha seguito le novità sui modelli desktop, questa è la build che stavi aspettando.
262K sulla scheda tecnica, meno in sella
La scheda del modello elenca 262.144 token nativi, estendibili a 1M; la pagina della libreria di Ollama riporta la stessa finestra come 256K. Entrambe le affermazioni sono vere — 262.144 è 256K per 1024 — e nessuna delle due significa che dovresti digitare quel numero in --num-ctx su una scheda da 24 GB. La cache KV cresce all'incirca in modo lineare con il contesto, quindi su hardware consumer vivrai con 16K–64K, non con 262K. Inizia con il valore predefinito di Ollama, alza --num-ctx solo quando un'attività lo richiede davvero, e ricorda che la cifra di 1M richiede il meccanismo di estensione oltre alla VRAM per alimentarla.
Ciò che è ancora traballante — leggi questo prima di scommetterci
• Non ci sono ancora benchmark indipendenti.Ogni dato riportato nella scheda del modello è la parola di Alibaba al 15 agosto. I miglioramenti dichiarati rispetto a Qwen3.6-27B sono notevoli — SWE-bench Pro 61.7 vs 53.5, Terminal Bench 2.1 73.0 vs 63.4, LiveCodeBench v6 90.3 vs 83.9, GPQA Diamond 89.2 vs 87.8 — e tutti appaiono plausibili, ma nessuno di essi è stato riprodotto da un sistema di valutazione esterno. Non basare una decisione di produzione esclusivamente su questi dati.
• Lo stack di visione è di pochi giorni. Un primo rapporto di bug (ollama issue #17753) ha mostrato che la build Q4 instradava l'input visivo attraverso il parser Qwen3.5 e falliva sulle immagini; è stato corretto entro pochi giorni nella PR #17755, ma il percorso multimodale su un modello di una settimana è esattamente il punto in cui dovresti testare prima di fare affidamento su di esso.
• La build predefinita include MTP. Il tag q4_K_M è anche la build multi-token-prediction — decodifica più veloce, ed è il motivo per cui "18 GB" e "27B" possono coesistere senza contraddizione.
• Le etichette di quantizzazione possono trarre in inganno su Apple. Le etichette da 18 GB "mlx" e "nvfp4" differiscono nella quantizzazione — NVFP4 è un formato FP4 di NVIDIA — quindi su un Mac preferisci la build -mlx semplice, a meno che tu non abbia specificamente bisogno di una variante FP8/FP4 per una GPU Blackwell.
«"Free" sta facendo un gran lavoro in quel titolo.»
Self-hosting di un 27B è gratuito per token, ma non è gratuito. L'inquadramento onesto è che ci sono tre opzioni che costano valute diverse:
• Eseguilo tu stesso (Ollama). $0 per token, offline, senza limiti, privato: e l'hardware è tuo. Una GPU da 24 GB o un Mac da 18 GB+ sono un acquisto vero, e lo sono anche l'elettricità e il tempo di configurazione. È la scelta giusta quando Qwen3.8 27B diventa uno strumento di uso quotidiano.
• Chiama un'API a $0 con limite di frequenza. OrcaRouter mette a disposizione Qwen3.8 27B sulla propria infrastruttura a costo zero (ID modello qwen/qwen3.8-27b-free, $0 per richiesta, con limite di frequenza) — poiché i pesi sono aperti, non c'è alcun costo per token del fornitore da ribaltare. È la scelta giusta quando vuoi provare il modello senza acquistare hardware per testare una release di una settimana fa.
• Chiama un’API senza limiti.Lo stesso modello senza limite di frequenza costa $0,33 per milione di token di input e $2,40 per milione di token di output su OrcaRouter (qwen/qwen3.8-27b, 262K di contesto, input di testo, immagini e video). È la scelta giusta quando ti serve una scala di produzione e non vuoi stare dietro a una GPU.

I conti che decidono tra loro: l'uso occasionale si ripaga meglio a $0 o a $0.33/$2.40 che al prezzo di una GPU; l'uso interattivo quotidiano è più conveniente in locale; il throughput di produzione sostenuto è più economico come un'API che non devi tenere attiva. I requisiti di privacy e offline ti spostano nella prima colonna, qualunque cosa dicano i conti.
Quando questa raccomandazione è sbagliata
• Ti serve davvero un contesto di 100K+. Il modello può farlo; la tua scheda da 24 GB non può. Con un contesto davvero lungo, una GPU da 40 GB+ o un'API con contesto più lungo non sono un lusso.
• Hai bisogno di video in produzione oggi. Il bug del parser nel percorso di visione è stato appena corretto; il video in produzione su un modello multimodale uscito una settimana fa è una scommessa che non dovresti fare senza una soluzione alternativa.
• You want concurrency. One consumer GPU streams one or two generations at a time. A 27B is not a serving box.
• You are on CPU-only hardware. A 27B at 4-bit on CPU is a slow demonstration, not a tool. An API is the honest choice until you have a GPU.
La conclusione
Qwen3.8 27B on Ollama is the easiest way to run a current-generation 27B that anyone has shipped yet: one command, an 18 GB default that fits a 24 GB card, a first-class Apple Silicon build, and Apache 2.0 freedom. The quant you should pick is almost always the default Q4_K_M — move to q8_0 only when you can measure the difference. And the "free" is conditional: if you will touch the model occasionally, the $0 rate-limited API is freer than buying hardware; if it becomes your daily driver, the local copy is the cheapest thing you own. Verify the numbers before you build on them — everything in this article was true on August 15, 2026, and this model is changing by the day.
