
Qwen3.8-27B con MLX su Apple Silicon: Sì, funziona — Ecco cosa ti serve davvero
- obsidianNUOVOQwen3.8 27B Uncensored (Aggressive)2026-08-15$0.40 / $4.21 per 1M di token · 22 tok/s
- qwenNUOVOQwen: Qwen3.8 27B (free)2026-08-1343 tok/s
- deepseekNUOVODeepSeek: DeepSeek V4 Pro 08132026-08-1253Intelligenza69Codice
- grokNUOVOSpaceXAI: Grok 4.62026-08-1261Intelligenza77Codice
- metaNUOVOMeta: Muse Spark 1.22026-08-0557Intelligenza72Codice
- qwenQwen: Qwen3.8 Max2026-08-0358Intelligenza72Codice
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3152Intelligenza69Codice
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 per 1M di token · 273 tok/s
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2463Intelligenza78Codice
- googleGoogle: Gemini 3.6 Flash2026-07-2152Intelligenza69Codice
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2137Intelligenza49Codice
- metaMeta: Muse Spark 1.12026-07-1653Intelligenza71Codice
- kimiMoonshotAI: Kimi K32026-07-1560Intelligenza76Codice
- openaiOpenAI: GPT-5.6 Luna2026-07-0952Intelligenza71Codice
- openaiOpenAI: GPT-5.6 Terra2026-07-0957Intelligenza77Codice
- openaiOpenAI: GPT-5.6 Sol2026-07-0961Intelligenza77Codice
- grokxAI: Grok 4.52026-07-0856Intelligenza72Codice
- tencentTencent: Hy32026-07-0642Intelligenza59Codice
Qwen3.8 27B gira oggi su Apple Silicon tramite MLX. Il tag è qwen3.8:27b-mlx in Ollama, aggiunto in Ollama v0.32.12, e la build a 4 bit pesa circa 18 GB al download e richiede all'incirca 16–19 GB di memoria unificata — il che rende un Mac con 24 GB+ il minimo realistico e un Mac da 16 GB da escludere. I pesi sono Apache 2.0, gratuiti al momento dell'uso su hardware che possiedi, che è esattamente lo scopo del modello. Il rilascio di Alibaba risale a due giorni fa (13–14 agosto 2026), quindi ogni numero qui sotto è etichettato: ciò che proviene dalla scheda del modello di Alibaba, ciò che abbiamo verificato oggi sulla pagina di Ollama, e ciò che è proiezione o misurazione di terze parti.
La scheda informativa di 30 secondi
Qwen3.8 27B è il modello denso da 27 miliardi di parametri di Alibaba, rilasciato il 13–14 agosto 2026 con licenza Apache 2.0 — i pesi sono apparsi su Hugging Face e ModelScope il 13, mentre il file LICENSE è comparso la mattina successiva. È il fratello denso e distribuibile del Qwen3.8-Max da 2,4T di parametri. Dalla scheda del modello, tutti i dati sono riportati da Alibaba e non ancora riprodotti in modo indipendente.
• Dimensioni — 27B dense, 27,78B parametri totali contando l'encoder visivo.
• Architettura — 64 strati, dimensione nascosta 5.120, vocabolario 248.320.
• Attenzione ibrida — 16 strati di attenzione completa più 48 strati lineari Gated DeltaNet, con un rapporto di 3:1.
• Contesto — 262.144 token nativi, estendibili a 1M tramite YaRN (Ollama elenca il tag a 256K).
• Inputcomprensione nativa di immagini e video oltre al testo, dai documenti ai video della durata di ore.
• Pesi — 55.6 GB in BF16, testa di decodifica speculativa MTP inclusa.

Sul lato MLX, verificato oggi: Ollama include qwen3.8:27b-mlx — una build nativa MLX per Apple Silicon con un download a 4 bit di circa 18 GB — e le note di rilascio della v0.32.12 evidenziano l'ottimizzazione per Apple Silicon. mlx-lm, la toolchain Python di Apple, supporta l'architettura per generazione e conversione, e le quantizzazioni MLX (3/5/6-bit, oltre a MXFP4 e NVFP4) sono apparse entro poche ore dal rilascio dei pesi. Il resto di questo articolo presuppone un Mac con chip serie M e 24 GB o più di memoria unificata.
Cosa cambia MLX riguardo alla memoria
Su Apple Silicon non esiste una VRAM separata. MLX utilizza il pool di memoria unificata della serie M, quindi il numero che conta è la RAM totale del tuo Mac meno quella che macOS e tutto il resto occupano. Un modello che "entra in 17 GB" richiede una macchina che ne abbia comodamente di più.
La buona notizia è che Qwen3.8 27B è più economico da mantenere di quanto suggerisca il numero dei suoi parametri. Poiché solo i 16 layer di attenzione completa mantengono una cache KV — mentre i 48 layer lineari no — la cache costa circa 64 KB per token, all'incirca un quarto di quanto paga un modello denso convenzionale a 64 layer. All'estremo opposto, la finestra completa di 262K richiede ~16,4 GB di cache in aggiunta ai pesi, che è un budget da server, non da laptop.
La scala realistica per un Mac: dimensione del file più spazio di riserva per la cache.
• 4-bit MLX — ~16–19 GB in totale. Entra in un Mac da 24 GB con una finestra di circa 64K–96K; la scelta predefinita più sensata.
• 6-bit MLX — ~21–22 GB. Macchine da 32 GB; il salto di qualità rispetto a 4-bit è modesto.
• 8-bit MLX — ~27–30 GB. Macchine con 48 GB+; quasi senza perdite.
• BF16 — ~55.6 GB. Solo le macchine studio M-series Max e Ultra di fascia alta.

Fonti: la cifra a 4 bit segue il GGUF Q4_K_M misurato (17,1 GB, unsloth, 14 agosto) e il download Ollama da 18 GB; le cifre a 8 bit e BF16 seguono la scheda BF16 di Alibaba e la serie Qwen3.6-27B. Il valore di cache di 64 KB per token deriva dall'architettura, non è riportato in una scheda tecnica, e vale solo per i runtime che saltano la cache KV sugli strati lineari come fa MLX.
Tre modi per eseguirlo, dal più semplice al massimo controllo
Percorso A — Ollama, il più semplice
Aggiorna a Ollama 0.32.12 o versione successiva, poi:
• ollama pull qwen3.8:27b-mlx — scarica la build MLX di ~18 GB.
• ollama run qwen3.8:27b-mlx — chat interattiva con il template di pensiero collegato.
• ollama serve — espone l'API compatibile con OpenAI su localhost:11434 per le tue app.

Un problema noto, da una segnalazione GitHub aperta al momento della scrittura: qwen3.8:27b-mlx rifiuta il ruolo "developer" sull'endpoint /v1/responses, il che fa fallire ollama launch codex per questo modello — mentre il comando diretto ollama run funziona. Se stai costruendo un loop agente in stile Codex sulla build MLX, testa l'endpoint esatto che intendi usare prima di scommetterci il loop.
Percorso B — mlx-lm, il massimo controllo.
Il toolkit di Apple. Installalo con pip install mlx-lm, poi puoi scaricare un checkpoint MLX pre-quantizzato oppure convertire tu stesso i pesi BF16 ufficiali:
• mlx_lm.generate --model <checkpoint> — esegui un checkpoint direttamente; i quant a 4 e 8 bit della community per il 27B continuavano ad arrivare su mlx-community entro pochi giorni dal rilascio.
• mlx_lm.convert --hf-path Qwen/Qwen3.8-27B --q-bits 4 — converti una volta; costa circa un download.
• mlx_lm.server --model <checkpoint> — Server compatibile con OpenAI che applica per te il template di chat con blocchi di pensiero.
Se la quantizzazione esatta che desideri non è ancora disponibile, convertire dai pesi ufficiali è un'operazione rapida su qualsiasi Mac della serie M ed elimina ogni dubbio su ciò che una terza parte ha distribuito.
Percorso C — LM Studio, l'opzione con un clic
LM Studio utilizza il backend MLX su Apple Silicon e ha supportato Qwen3.8 27B fin dall'uscita: cerca il modello, scegli una versione quantizzata adatta alla tua RAM, e lo scarica ed esegue. Se preferisci una GUI, questa è la via più semplice, e la nostra guida di accompagnamento la copre dall'inizio alla fine — vedi "Come eseguire Qwen3.8 27B in locale" negli articoli correlati qui sotto.
La trappola dei modelli
Qwen3.8 27B pensa per impostazione predefinita, e i blocchi di pensiero (think) sono resi dal template della chat, non dal core del modello. I test di terze parti delle prime 48 ore notano che il template ufficiale avvolge ogni turno dell'assistente in un blocco di pensiero — anche quelli vuoti — e che nei loop di agenti multi-turno i blocchi si annidano e la cronologia si tronca, il che appare come amnesia. Non è la quantizzazione. Se un runtime fornisce un template corretto, usalo; quando costruisci un loop di agenti e non hai bisogno del ragionamento, disabilita il pensiero per richiesta — il template della chat espone un flag enable_thinking, e il modello accetta un reasoning_effort di xhigh, medium o low.
Come ci si sente davvero
Un test indipendente su un Mac mini M4 con 32 GB di memoria unificata, utilizzando la build MLX a 4 bit, ha misurato circa 5–6 token/s di generazione. È questo il numero che dovrebbe fissare le aspettative: adatto per la stesura interattiva, il ragionamento di lunga durata e chiamate occasionali di agenti; scomodo per lunghi cicli agentici e lavori batch. L'aneddoto dello stesso tester — una riflessione durata diversi minuti seguita da una piccola applicazione che sembrava giusta ma che in realtà non tornava — è un buon promemoria del fatto che un 27B su un laptop è un assistente capace ma non infallibile.
La velocità scala con il livello del chip: un M-series Max con più banda di memoria e più core gira sensibilmente più veloce rispetto all'M4 base nel mini. Ma 5–6 tok/s sul modello d'ingresso è la baseline onesta, ed è rispetto a questa che dovresti giudicare qualsiasi titolo "gira su Apple Silicon".
Il contesto 262K è una funzionalità del server.
La finestra nativa di 262K di Qwen3.8 27B è davvero utile — ma su un Mac è limitata dalla memoria, non dal modello. Con 64 KB di cache KV per token, una finestra da 8K costa circa 0,5 GB, 32K circa 2 GB, 128K circa 8 GB, e i pieni 262K circa 16,4 GB in aggiunta ai pesi. Su una macchina da 24 GB in esecuzione a 4 bit, il tetto realistico è di circa 64K–96K token; avvicinarsi a 128K+ richiede una macchina da 32 GB+, e la finestra completa richiede una macchina la cui memoria unificata è per lo più cache. Pianifica il contesto di cui hai realmente bisogno e imposta un limite nella configurazione runtime — il modello è contento e il tuo file di swap resta tranquillo.
Quando Apple Silicon è la risposta sbagliata.
Prendi un percorso diverso se uno di questi è il tuo carico di lavoro:
• Hai un Mac da 8 GB o 16 GB. La versione a 4 bit richiede già circa 17 GB di memoria unificata; con meno si va in swap e il modello diventa inutilizzabile. Questo è l'errore più comune in assoluto, e nessun trucco di quantizzazione può risolverlo.
• Hai bisogno della finestra completa da 262K o dell'estensione YaRN da 1M. Quel budget KV è un budget da server, non da laptop.
• Stai servendo altre persone. Un laptop è un solo posto; il throughput multi-utente richiede un box GPU o un'API ospitata.
• Devi muoverti velocemente nei lunghi loop agentici. 5–6 tok/s va bene per un umano che legge man mano, lento per un sub-agente.
L'inquadramento onesto: la proposta di Qwen3.8 27B è di essere gratuito al momento dell'uso su hardware di tua proprietà — l'opposto di un modello API che addebita un costo per token. È esattamente per questo che non è nel catalogo di OrcaRouter (il catalogo instrada la generazione precedente Qwen3.6/3.5-27B e la linea API Qwen ospitata). Siamo lo strumento sbagliato per la storia del free-local, ed è proprio questo il punto: quando un carico di lavoro supera le capacità di un Mac, le alternative sono un box GPU, una GPU a noleggio o un'API Qwen ospitata — non un router che si trova a includere questo specifico 27B.
Il risultato finale
Qwen3.8 27B su Apple Silicon è reale, è buono, ed è di portata ristretta. La build MLX a 4 bit sta in un Mac da 24 GB+, si scarica come qwen3.8:27b-mlx in Ollama, non costa nulla per token, ed è il primo modello open di livello agente davvero utilizzabile che sta in un laptop. I compromessi sono la velocità (5–6 tok/s su un mini M4) e il contesto (limitarlo ben sotto i 262K a meno che tu non abbia la RAM). Se hai un Mac da 24 GB+ e un carico di lavoro che un 27B può gestire, questo è il miglior modello locale gratuito disponibile questa settimana. Se hai un Mac da 16 GB o hai bisogno di throughput di produzione, non lo è — e l'alternativa è un percorso a pagamento, che è una decisione completamente diversa.
