
Qwen3.8-27B-Uncensored-MLX su Apple Silicon: come scegliere la tua build, caricarla in LM Studio o mlx-vlm, e domare il contesto da 262K
- AlibabaNUOVOQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1M di token
- z-aiNUOVOZ.ai: GLM 5.3 Flash2026-08-2658Intelligenza72Codice
- DeepSeekNUOVODeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.15 / $0.29 per 1M di token
- z-aiNUOVOZ.ai: GLM 5.32026-08-1860Intelligenza75Codice
- obsidianQwen3.8 27B2026-08-1552Intelligenza68Codice
- qwenQwen: Qwen3.8 27B (free)2026-08-13qwen/qwen3.8-27b-free
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1253Intelligenza69Codice
- grokSpaceXAI: Grok 4.62026-08-1261Intelligenza77Codice
- metaMeta: Muse Spark 1.22026-08-0557Intelligenza72Codice
- qwenQwen: Qwen3.8 Max2026-08-0358Intelligenza72Codice
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3152Intelligenza69Codice
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 per 1M di token
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2463Intelligenza78Codice
- googleGoogle: Gemini 3.6 Flash2026-07-2152Intelligenza69Codice
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2137Intelligenza49Codice
- metaMeta: Muse Spark 1.12026-07-1653Intelligenza71Codice
- kimiMoonshotAI: Kimi K32026-07-1560Intelligenza76Codice
- openaiOpenAI: GPT-5.6 Luna2026-07-0952Intelligenza71Codice
La cosa più utile da sapere su orcarouter/Qwen3.8-27B-Uncensored-MLX è che non devi scegliere una sottocartella per eseguirlo. La build abliterata di OrcaRouter per Apple Silicon di Qwen/Qwen3.8-27B — pubblicata su Hugging Face il 17 agosto 2026, quindi non è nuova, solo poco documentata — mantiene una copia della build a 4 bit nella radice del repository, proprio perché gli strumenti che trattano un repository come un unico modello, in particolare LM Studio, lo carichino senza alcuna configurazione. Questa singola scelta è il motivo per cui questa scheda ha registrato circa 83.000 download nell'ultimo mese, mentre conversioni MLX comparabili ottengono una piccola frazione di quel numero. Tutto il resto è una vera scelta: quale delle quattro precisioni si adatta alla memoria unificata del tuo Mac, quale runner usi, se la visione e il tool calling sopravvivono alla tua larghezza di bit, e se la finestra di contesto di 262.144 token vale ciò che costa sul tuo hardware. Questo runbook esamina queste decisioni in ordine. È documentazione di prima parte: le dimensioni, le precisioni e i valori di fedeltà qui sotto sono di OrcaRouter stessa, misurati su questa esatta build, e ogni numero della community è etichettato come tale.

Cosa c'è esattamente in questo repository
Questa è una build abliterata di Qwen/Qwen3.8-27B — un modello denso da 27B con attenzione ibrida (attenzione lineare Gated DeltaNet più attenzione completa), nativamente visione-linguaggio, con controllo del pensiero, chiamata di strumenti, una testa di predizione multi-token (MTP) e una finestra di contesto di 262.144 token. L'abliteration rimuove il comportamento di rifiuto del modello ortogonalizzando la direzione del rifiuto dal flusso residuo; se questo concetto ti è nuovo, la nostra guida introduttiva alla tecnica è il punto migliore da cui iniziare rispetto a questa pagina, che riguarda l'esecuzione della build, non il metodo. I pesi sono sotto licenza Apache-2.0, ereditati dal modello base.
Non confondere questa repository con qwen-3-8-27b-mlx, che è lo stesso modello base in formato MLX senza l'abliteration. I lettori scaricano regolarmente l'una quando volevano l'altra: questa è la build di ricerca con il rifiuto rimosso; quella è la Qwen/Qwen3.8-27B standard su Apple Silicon. Controlla il nome della repository prima di perdere tempo a scaricare.
Un dettaglio strutturale conta più di quanto sembri: la vision tower, tutte le norme e la conv1d dell'attenzione lineare rimangono in BF16, e solo i layer lineari del modello linguistico — inclusi embed_tokens e lm_head — vengono quantizzati. È per questo che la comprensione delle immagini sopravvive alla quantizzazione, ed è anche per questo che le dimensioni su disco riportate sotto sono un po' più grandi di una stima ingenua "27B a N bit": una parte del modello non viene mai compressa.
La decisione: quale build si adatta a quale Mac

Quattro precisioni sono disponibili come sottocartelle — 8-bit/, 6-bit/, 4-bit/, 2-bit/ — tutte in quantizzazione affine MLX con group size 64. La build a 4 bit è anche duplicata nella root del repository. Scegli prima in base alla memoria unificata del tuo Mac, poi in base alla qualità:
• 8-bit — ~27.5 GB su disco, richiede un Mac da 64 GB (una macchina da 32 GB può caricarlo ma lascia poco spazio per altro). Fedeltà coseno misurata rispetto alla sorgente BF16: 0.9997, di fatto quasi senza perdite. Sceglilo quando la qualità è il punto principale e la memoria è abbondante.
• 6-bit — ~22 GB, adatto a Mac con 24–32 GB di RAM. Fedeltà 0.9996, eccellente. Il miglior rapporto qualità-per-gigabyte per la maggior parte dei possessori di una macchina da 48 GB.
• 4-bit — circa 15 GB, comodo su un Mac da 24 GB. Fedeltà 0.996, molto buona. Questa è la nostra impostazione predefinita consigliata, ed è la copia nella radice del repository per questo motivo.
• 2-bit — ~8.7 GB, entra in un Mac da 16 GB. Fedeltà 0.92 e, a 27B, gravemente degradato: loop di ripetizione, testo distorto, codice e cinese, visione parziale. La scheda lo dice chiaramente — solo per archiviazione, non per lavoro reale. Un Mac da 16 GB può tecnicamente caricarlo; ciò non lo rende utilizzabile.
La dimensione su disco non è la cifra di memoria. I pesi devono stare nella memoria unificata insieme a macOS, alla cache KV e ai buffer scratch di Metal, quindi lascia un margine di sicurezza. Un test della community con la build a 4 bit su un Mac M1 Pro da 32 GB ha misurato ~16 GB di pesi su disco ma un picco di inferenza di 18,5–21,7 GB; i test della community con build MLX a 8 bit riportano picchi intorno a 34–36 GB anche quando i pesi sono ~29,5 GB. L'indicazione pratica emersa da quello stesso test della community è: 16 GB non sono una vera opzione per un modello da 27B, 24 GB possono provare il 4-bit con un contesto breve, e 32 GB sono il punto di partenza comodo. Il nostro articolo sulla pianificazione della VRAM applica lo stesso calcolo all'intera famiglia.
Poiché l'elenco dell'intero repository ammonta a circa 94 GB in tutte le precisioni, scarica solo la sottocartella di cui hai bisogno conhf download orcarouter/Qwen3.8-27B-Uncensored-MLX --include "4-bit/*" --local-dir ./Qwen3.8-27B-Uncensored-MLX — sostituendo con la precisione scelta. La copia 4-bit nella root è un duplicato della sottocartella 4-bit, quindi non devi mai scaricare entrambe.
Percorso uno — LM Studio, configurazione zero
La copia root a 4 bit esiste appositamente affinché LM Studio possa trattare l'intero repo come un unico modello. Cerca l'ID del modello, seleziona la precisione che desideri (la copia root è a 4 bit) e l'app gestisce il resto. Tre insidie, tutte dalla nostra scheda, e sono l'intera differenza tra il funzionamento e il fallimento:

• Il repository è ad accesso limitato.I download anonimi ricevono HTTP 401. Accetta i termini nella pagina del modello, quindi incolla un token di lettura Hugging Face in LM Studio: Settings → Integrations → Hugging Face. Se salti questo passaggio, il caricamento semplicemente fallisce.
• Disattiva la quantizzazione della cache KV. I modelli di visione MLX non la supportano su questa architettura e il caricamento fallisce durante l'inizializzazione se è abilitata (tracciato come mlx-engine#286). Questo è l'opposto del consiglio per le build GGUF, dove quantizzare la cache K/V è un legittimo risparmio di VRAM — i due formati non sono intercambiabili qui.
• Aggiorna il runtime. qwen3_5, il supporto per questa architettura è arrivato in mlx-vlm 0.6.x; un runtime incluso più vecchio non può caricare affatto questi pesi. Il badge "Likely too large" di LM Studio, al contrario, è solo un avviso sulla RAM, non un errore — ignoralo se la tua memoria unificata soddisfa le indicazioni sopra.
Quale precisione in LM Studio: 8-bit occupa circa 29,5 GB su disco e richiede un Mac da 64 GB; 6-bit ~22 GB è adatta a una macchina da 48 GB; 4-bit a ~16 GB è la scelta giusta su un Mac da 32 GB. Se invece preferisci la via llama.cpp / Ollama su altro hardware, la nostra guida per l'esecuzione locale del modello non censurato copre quel percorso separatamente.
Percorso due — mlx-vlm e mlx-lm da una sottocartella
L'approccio da riga di comando offre la precisione direttamente e un server compatibile con OpenAI per gli strumenti degli agenti. Requisiti: pip install -U mlx-vlm (mlx-vlm ≥ 0.6.13 e mlx ≥ 0.32; il backend Metal viene selezionato automaticamente su Apple Silicon). Dopo il download della sottocartella di cui sopra:
python -m mlx_vlm generate --model ./Qwen3.8-27B-Uncensored-MLX/4-bit --prompt "Spiega l'entanglement quantistico in una frase." --max-tokens 256
Aggiungi --image path/to/image.png per l'input visivo, oppure servilo:
python -m mlx_vlm server --model ./Qwen3.8-27B-Uncensored-MLX/4-bit --port 8080
For agent frameworks that speak OpenAI-compatible APIs, mlx_lm.server is the lighter path — uv tool install mlx-lm then mlx_lm.server --model "orcarouter/Qwen3.8-27B-Uncensored-MLX", which serves at http://localhost:8080/v1 with api type openai-completions. Our card carries self-reported community configs pointing Pi, Hermes and OpenClaw at that endpoint. Those are user-supplied setups we have not reproduced, so treat them as starting points, not guarantees.
La visione sopravvive alla quantizzazione
Poiché la torre di visione e la conv1d restano in BF16, la comprensione delle immagini è preservata a 4/6/8 bit. Sulla nostra immagine di prova — forme, colori, posizione, sfondo e testo nell'immagine — le build a 4/6/8 bit hanno descritto tutto correttamente; quella a 2 bit solo parzialmente. Se stai scegliendo una build e l'aspetto visivo conta, 4 bit è il minimo a cui dovresti scendere. Non abbiamo pubblicato throughput di visione specifico per Apple Silicon per questa build, quindi non fidarti di un valore tok/s per essa a meno che non provenga da un run nominato sulla tua stessa classe di chip.
La torre di visione preservata fa anch'essa parte della superficie di rischio, ed è giusto dirlo chiaramente: un modello abliterato che può anche leggere immagini non è un problema di sicurezza limitato al solo testo.
Chiamata degli strumenti e uso degli agenti
Il tool calling è una capacità del modello base e sopravvive all'abliterazione, il che rende questa build genuinamente utile per il red-teaming di sistemi agentici — e genuinamente pericolosa se indirizzata verso servizi reali. La configurazione standard è quella dell'endpoint mlx_lm.server sopra menzionato, che qualsiasi agente compatibile con OpenAI può utilizzare. Se lo esegui come agente, comprendi cosa hai abilitato: un modello che non rifiuta con function calling e contesto da 262K è una postura di sicurezza diversa da un modello chat, e l'inquadramento della scheda come 'solo ricerca' esiste proprio per questo motivo.
Il contesto da 262K e quanto costa davvero
{{1}}L'architettura conferisce a questo modello un contesto lungo insolitamente economico.{{/1}} {{2}}Qui l'attenzione ibrida significa 48 layer di attenzione lineare (Gated DeltaNet) alternati a 16 layer a piena attenzione, e solo i 16 layer a piena attenzione dispongono di una classica cache KV — i layer lineari mantengono invece uno stato ricorrente compatto.{{/2}} {{3}}Quindi 262.144 token costano materialmente meno di quanto costerebbero su un modello 27B a piena attenzione.{{/3}} {{4}}Questo è un dato strutturale del modello base, non una promessa sul tuo Mac.{{/4}}
In pratica la finestra è una capacità, non un livello gratuito. Un test comunitario di contesto lungo su un M4 Max ha misurato circa 63 tok/s a contesto breve, scendendo a circa 11 tok/s a 31K token — la decodifica degrada bruscamente man mano che la cache si riempie, e la latenza del primo token su prompt molto lunghi è solitamente l'ostacolo maggiore rispetto alla velocità di elaborazione grezza. Il prefill speculativo e basato su ANE migliora l'ingestione, non la decodifica. I nostri dati sui costi della KV-cache Apple-Silicon per questa build non sono pubblicati; se ti servono numeri concreti per il tuo hardware, le esecuzioni comunitarie sono la fonte onesta, e il consenso della comunità è di trattare l'intero 262K come qualcosa a cui ricorrere deliberatamente, non come un'impostazione predefinita da lasciare attiva.
Velocità — ciò che viene effettivamente misurato
Pubbliciamo esattamente un dato di velocità per questa build e non è Apple Silicon: ~32–37 tok/s in stato stazionario su una singola H200 tramite il backend MLX CUDA, il che conferma che i pesi funzionano anche al di fuori di macOS. Su Mac la nostra scheda pubblica deliberatamente nessun tok/s, perché dipende dal chip, dalla precisione e dal runner. Numeri pratici che vale la pena conoscere, tutti etichettati come tali:
Questa build esatta, 4-bit, M1 Pro 32 GB: ~8,7 tok/s di generazione e ~41,7 tok/s di prefill in una breve esecuzione (test della community, agosto 2026). Un chip più vecchio, ma un minimo realistico.
oMLX con MTP nativo su un M4 Max, checkpoint stock non-abliterato: 53.3 tok/s in prosa e 72.1 tok/s in codice, con ~273.7 tok/s di prefill a 4K; decodifica raw senza MTP ~24.6 tok/s. Misurato da un practitioner su un checkpoint e un runtime diversi, quindi trattalo come un limite superiore che i pesi abliterati potrebbero avvicinare piuttosto che una promessa.
• prefill oMLX dual-ANE su un M3 Ultra, oQ4e-MTP abliterato: prefill fino a ~17.7% a 16K e ~18.9% a 32K, e decode tramite Lightning MTP fino a ~75 tok/s a 16K. I caveat sono reali: usa interfacce runtime private di Apple e pesi INT8 approssimati, aggiunge circa 4 GB di memoria di picco e porta il tempo di caricamento del modello da ~3.4 s a ~28 s. Questa è un'ottimizzazione dell'ingestione del prompt, non un acceleratore di generazione.
La testa MTP — una velocizzazione gratuita se il tuo runner la supporta
Questa build include il drafter di predizione multi-token del modello base nella sottocartella mtp/ (architettura qwen3_5_mtp), e funziona con qualsiasi precisione principale. L'accettazione è senza perdite — con decodifica greedy l'output è identico all'esecuzione senza drafter — quindi è un vero incremento di velocità senza costi di qualità quando si attiva. Due note di configurazione dalla nostra scheda: richiede una build mlx-vlm che includa il drafter qwen3_5_mtp (il branch main), e devi passare sia --draft-model ./Qwen3.8-27B-Uncensored-MLX/mtp che --draft-kind mtp. Impostare mtp_enabled da solo non fa nulla. Se il tuo runner non supporta il drafter, questo viene ignorato e il modello funziona normalmente — non si rompe nulla.
Sicurezza — leggilo prima di eseguirlo, non dopo
La dichiarazione di non responsabilità della scheda del modello è insolitamente diretta, e questa pagina non intende attenuarla. L'allineamento di sicurezza di questa build è stato sostanzialmente rimosso. Sarà in grado di soddisfare richieste dannose, non etiche, offensive o illegali che il Qwen/Qwen3.8-27B di base rifiuterebbe, e non dispone di salvaguardie integrate significative. È rilasciato esclusivamente per la ricerca legittima — interpretabilità, studio della sicurezza dell'IA e dei meccanismi di rifiuto, red-teaming, valutazione della robustezza ed esperimenti controllati. Se non è questo ciò che stai facendo, questo è il modello sbagliato.
{{1}}Due avvertimenti della scheda meritano enfasi.{{/1}} {{2}}In primo luogo, i test di jailbreak e di sicurezza "riescono" banalmente su un modello abliterato, e questo non equivale a superare una valutazione di sicurezza — è il comportamento atteso di un modello a cui è stata rimossa la direzione del rifiuto.{{/2}} {{3}}L'assenza di rifiuti non è prova di sicurezza.{{/3}} {{4}}In secondo luogo, la visione preservata, il tool-calling e il contesto di 262K estendono la superficie d'attacco alla comprensione delle immagini e all'uso agentico: un modello non censurato che può leggere screenshot e chiamare strumenti rappresenta un rischio più ampio rispetto a una build solo-chat privata dei rifiuti.{{/4}} {{5}}La quantizzazione a bassa bit aggiunge un terzo strato di instabilità — a 2 bit, l'output distorto può persino essere scambiato per un rifiuto, che è un tipo di errore fuorviante a sé stante.{{/5}}
Ti assumi la piena responsabilità e ogni obbligo di risarcimento per l'uso e gli output. La licenza Apache-2.0 è ereditata dal modello di base e non cambia questo: ne consente l'uso; non rende sicura la tua implementazione. Chiunque distribuisca questo prodotto a utenti finali, minori o in qualsiasi ambiente di produzione deve prima aggiungere i propri livelli di moderazione, sicurezza e prevenzione degli abusi e rispettare la legge applicabile. Per i ricercatori che lo eseguono davvero, le misure di salvaguardia pratiche sono: un ambiente isolato, idealmente offline; strumenti degli agenti non puntati verso servizi reali; nessuna esposizione a utenti finali; e la revisione degli output prima che vengano diffusi.
Quando il locale non è la risposta
Il punto di questa build è la natura locale: i pesi risiedono sul tuo disco, non c'è alcun costo per token e nulla lascia la macchina. Ma l'approccio locale è anche un tetto: è limitato ad Apple Silicon, devi convivere con la qualità della quantizzazione e non c'è ridondanza se la macchina è occupata. Se ti serve un modello di classe 27B non abliterato via API per un carico di lavoro reale, o se vuoi fare un A/B test di questa build locale contro un modello hosted con gli stessi prompt, è questo il vuoto che un livello di routing esiste per colmare. OrcaRouter mette oltre 200 modelli dietro un'unica chiave API al prezzo di listino del provider, con failover automatico e un DSL di routing — un taglio di prezzo del fornitore diventa attivo dal nostro lato lo stesso giorno in cui viene annunciato, perché trasmettiamo il prezzo di listino. Una sola API, una sola integrazione, e puoi confrontare un setup locale non testato con un modello hosted senza dover creare un secondo account. Noi non ospitiamo questa build MLX — è a pesi locali per progettazione — quindi l'API è il percorso complementare, non un sostituto.
La guida rapida alle decisioni
• Mac da 16 GB — onestamente, non questo modello. La versione 2-bit ci sta ed è solo per archiviazione; avrai problemi di memoria in ogni caso. Considera un modello non censurato più piccolo, oppure la conversione mista 3/6-bit della community creata per macchine da 18–24 GB.
• Mac da 24 GB — 4-bit, e mantieni il contesto breve; non eseguire visione e contesto lungo contemporaneamente.
• Mac da 32 GB — 4-bit è il punto ottimale; 6-bit se mantieni il contesto ristretto.
• Mac da 48 GB — 6-bit con margine; 8-bit se non spingi la finestra.
• 64 GB e oltre — 8-bit, quasi senza perdite, e contesto 262K a portata di mano con le avvertenze sopra.
Questo è l'intero runbook. Il modello è del 17 agosto 2026, non è una notizia di lancio e non deve esserlo: 83.000 download sono avvenuti perché le persone volevano una guida pratica, e questa pagina è quella guida. Inizia dalla root del repository, carica il 4-bit in LM Studio, e non abbandonare la build predefinita finché non sai cosa stai sacrificando per la qualità. Se provieni dal lato della famiglia GGUF o FP8, le guide correlate coprono quei percorsi — il quadro decisionale qui è lo stesso, la matematica della quantizzazione no.
Non un'altra build di questo modello — Qwen3.8-Flash-Next-Uncensored è un rilascio separato: abliterato da Qwen3.8-Flash-Next, un'anteprima mixture-of-experts da 176B memorizzati / 6B attivi dell'architettura Qwen4. Stessa tecnica di abliterazione, pesi diversi, una propria collezione.
Tutte e sei le build 27B — BF16, GGUF, MLX, FP8, INT8 e NVFP4 — sono raccolte nella collezione Qwen3.8-27B-Uncensored su Hugging Face.
Questi pesi sono progettati per essere solo locali. Per una baseline ospitata con cui confrontare la build abliterata, Qwen3.8-27B è servito su OrcaRouter al prezzo di listino del provider con markup 0% — il modello standard, con l'allineamento della sicurezza intatto.
