Card del titolo hero per l'articolo 'Qwen3.8-27B-Uncensored-MLX on Apple Silicon' che mostra il titolo 'Qwen3.8-27B-Uncensored-MLX', il sottotitolo 'The Apple Silicon Runbook', una riga di chip quant etichettati 2-bit, 4-bit, 6-bit e 8-bit con il 4-bit evidenziato, una finestra stilizzata di LM Studio che mostra '4-bit build at repo root' e un motivo di contesto 262K, con il logo OrcaRouter composto nell'angolo.
Guides & Insights

Qwen3.8-27B-Uncensored-MLX su Apple Silicon: come scegliere la tua build, caricarla in LM Studio o mlx-vlm, e domare il contesto da 262K

Autore

Magnus Corvin

Data di pubblicazione

Ultimi modelli · 20Vedi tutti i modelli
Benchmark: Artificial Analysis · aggiornato ogni giorno
Torna a tutti gli articoli

La cosa più utile da sapere su orcarouter/Qwen3.8-27B-Uncensored-MLX è che non devi scegliere una sottocartella per eseguirlo. La build abliterata di OrcaRouter per Apple Silicon di Qw​en/Qwen3.8-27B — pubblicata su Hugging Face il 17 agosto 2026, quindi non è nuova, solo poco documentata — mantiene una copia della build a 4 bit nella radice del repository, proprio perché gli strumenti che trattano un repository come un unico modello, in particolare LM Studio, lo carichino senza alcuna configurazione. Questa singola scelta è il motivo per cui questa scheda ha registrato circa 83.000 download nell'ultimo mese, mentre conversioni MLX comparabili ottengono una piccola frazione di quel numero. Tutto il resto è una vera scelta: quale delle quattro precisioni si adatta alla memoria unificata del tuo Mac, quale runner usi, se la visione e il tool calling sopravvivono alla tua larghezza di bit, e se la finestra di contesto di 262.144 token vale ciò che costa sul tuo hardware. Questo runbook esamina queste decisioni in ordine. È documentazione di prima parte: le dimensioni, le precisioni e i valori di fedeltà qui sotto sono di OrcaRouter stessa, misurati su questa esatta build, e ogni numero della community è etichettato come tale.

Screenshot of the Hugging Face model card for orcarouter/Qwen3.8-27B-Uncensored-MLX showing the model title, the description 'An abliterated (refusal-removed) MLX build of Qwen's Qwen3.8-27B — 2/4/6/8-bit for Apple Silicon', the apache-2.0 license, tag chips, and the 'Downloads last month' statistic of 83,352.

Cosa c'è esattamente in questo repository

Questa è una build abliterata di Qw​en/Qwen3.8-27B — un modello denso da 27B con attenzione ibrida (attenzione lineare Gated DeltaNet più attenzione completa), nativamente visione-linguaggio, con controllo del pensiero, chiamata di strumenti, una testa di predizione multi-token (MTP) e una finestra di contesto di 262.144 token. L'abliteration rimuove il comportamento di rifiuto del modello ortogonalizzando la direzione del rifiuto dal flusso residuo; se questo concetto ti è nuovo, la nostra guida introduttiva alla tecnica è il punto migliore da cui iniziare rispetto a questa pagina, che riguarda l'esecuzione della build, non il metodo. I pesi sono sotto licenza Apache-2.0, ereditati dal modello base.

Non confondere questa repository con qwen-3-8-27b-mlx, che è lo stesso modello base in formato MLX senza l'abliteration. I lettori scaricano regolarmente l'una quando volevano l'altra: questa è la build di ricerca con il rifiuto rimosso; quella è la Qw​en/Qwen3.8-27B standard su Apple Silicon. Controlla il nome della repository prima di perdere tempo a scaricare.

Un dettaglio strutturale conta più di quanto sembri: la vision tower, tutte le norme e la conv1d dell'attenzione lineare rimangono in BF16, e solo i layer lineari del modello linguistico — inclusi embed_tokens e lm_head — vengono quantizzati. È per questo che la comprensione delle immagini sopravvive alla quantizzazione, ed è anche per questo che le dimensioni su disco riportate sotto sono un po' più grandi di una stima ingenua "27B a N bit": una parte del modello non viene mai compressa.

La decisione: quale build si adatta a quale Mac

A generated scoreboard titled 'Qwen3.8-27B-Uncensored-MLX — pick your build' comparing the four MLX builds: 8-bit at 27.5 GB near-lossless cos 0.9997, 6-bit at 22 GB excellent cos 0.9996, 4-bit at 15 GB recommended default cos 0.996, 2-bit at 8.7 GB archival only cos 0.92, plus 'Repo root: 4-bit copy, zero-config in LM Studio' and 'BF16 kept: vision tower, norms, conv1d', with a footer noting sizes and fidelity per the OrcaRouter model card and Mac RAM guidance per card and community tests, and the OrcaRouter logo composited in the corner.

Quattro precisioni sono disponibili come sottocartelle — 8-bit/, 6-bit/, 4-bit/, 2-bit/ — tutte in quantizzazione affine MLX con group size 64. La build a 4 bit è anche duplicata nella root del repository. Scegli prima in base alla memoria unificata del tuo Mac, poi in base alla qualità:

8-bit — ~27.5 GB su disco, richiede un Mac da 64 GB (una macchina da 32 GB può caricarlo ma lascia poco spazio per altro). Fedeltà coseno misurata rispetto alla sorgente BF16: 0.9997, di fatto quasi senza perdite. Sceglilo quando la qualità è il punto principale e la memoria è abbondante.

6-bit — ~22 GB, adatto a Mac con 24–32 GB di RAM. Fedeltà 0.9996, eccellente. Il miglior rapporto qualità-per-gigabyte per la maggior parte dei possessori di una macchina da 48 GB.

4-bit — circa 15 GB, comodo su un Mac da 24 GB. Fedeltà 0.996, molto buona. Questa è la nostra impostazione predefinita consigliata, ed è la copia nella radice del repository per questo motivo.

2-bit — ~8.7 GB, entra in un Mac da 16 GB. Fedeltà 0.92 e, a 27B, gravemente degradato: loop di ripetizione, testo distorto, codice e cinese, visione parziale. La scheda lo dice chiaramente — solo per archiviazione, non per lavoro reale. Un Mac da 16 GB può tecnicamente caricarlo; ciò non lo rende utilizzabile.

La dimensione su disco non è la cifra di memoria. I pesi devono stare nella memoria unificata insieme a macOS, alla cache KV e ai buffer scratch di Metal, quindi lascia un margine di sicurezza. Un test della community con la build a 4 bit su un Mac M1 Pro da 32 GB ha misurato ~16 GB di pesi su disco ma un picco di inferenza di 18,5–21,7 GB; i test della community con build MLX a 8 bit riportano picchi intorno a 34–36 GB anche quando i pesi sono ~29,5 GB. L'indicazione pratica emersa da quello stesso test della community è: 16 GB non sono una vera opzione per un modello da 27B, 24 GB possono provare il 4-bit con un contesto breve, e 32 GB sono il punto di partenza comodo. Il nostro articolo sulla pianificazione della VRAM applica lo stesso calcolo all'intera famiglia.

Poiché l'elenco dell'intero repository ammonta a circa 94 GB in tutte le precisioni, scarica solo la sottocartella di cui hai bisogno conhf download orcarouter/Qwen3.8-27B-Uncensored-MLX --include "4-bit/*" --local-dir ./Qwen3.8-27B-Uncensored-MLX — sostituendo con la precisione scelta. La copia 4-bit nella root è un duplicato della sottocartella 4-bit, quindi non devi mai scaricare entrambe.

Percorso uno — LM Studio, configurazione zero

La copia root a 4 bit esiste appositamente affinché LM Studio possa trattare l'intero repo come un unico modello. Cerca l'ID del modello, seleziona la precisione che desideri (la copia root è a 4 bit) e l'app gestisce il resto. Tre insidie, tutte dalla nostra scheda, e sono l'intera differenza tra il funzionamento e il fallimento:

Screenshot of the Hugging Face files-and-versions page for orcarouter/Qwen3.8-27B-Uncensored-MLX showing the repo tree with the 4-bit build's files at the repo root (config.json and model-00001 through model-00003-of-00003 safetensors shards) alongside the 2-bit, 4-bit, 6-bit, 8-bit and mtp subfolders.

Il repository è ad accesso limitato.I download anonimi ricevono HTTP 401. Accetta i termini nella pagina del modello, quindi incolla un token di lettura Hugging Face in LM Studio: Settings → Integrations → Hugging Face. Se salti questo passaggio, il caricamento semplicemente fallisce.

Disattiva la quantizzazione della cache KV. I modelli di visione MLX non la supportano su questa architettura e il caricamento fallisce durante l'inizializzazione se è abilitata (tracciato come mlx-engine#286). Questo è l'opposto del consiglio per le build GGUF, dove quantizzare la cache K/V è un legittimo risparmio di VRAM — i due formati non sono intercambiabili qui.

Aggiorna il runtime. qwen3_5, il supporto per questa architettura è arrivato in mlx-vlm 0.6.x; un runtime incluso più vecchio non può caricare affatto questi pesi. Il badge "Likely too large" di LM Studio, al contrario, è solo un avviso sulla RAM, non un errore — ignoralo se la tua memoria unificata soddisfa le indicazioni sopra.

Quale precisione in LM Studio: 8-bit occupa circa 29,5 GB su disco e richiede un Mac da 64 GB; 6-bit ~22 GB è adatta a una macchina da 48 GB; 4-bit a ~16 GB è la scelta giusta su un Mac da 32 GB. Se invece preferisci la via llama.cpp / Ollama su altro hardware, la nostra guida per l'esecuzione locale del modello non censurato copre quel percorso separatamente.

Percorso due — mlx-vlm e mlx-lm da una sottocartella

L'approccio da riga di comando offre la precisione direttamente e un server compatibile con Open​AI per gli strumenti degli agenti. Requisiti: pip install -U mlx-vlm (mlx-vlm ≥ 0.6.13 e mlx ≥ 0.32; il backend Metal viene selezionato automaticamente su Apple Silicon). Dopo il download della sottocartella di cui sopra:

python -m mlx_vlm generate --model ./Qwen3.8-27B-Uncensored-MLX/4-bit --prompt "Spiega l'entanglement quantistico in una frase." --max-tokens 256

Aggiungi --image path/to/image.png per l'input visivo, oppure servilo:

python -m mlx_vlm server --model ./Qwen3.8-27B-Uncensored-MLX/4-bit --port 8080

For agent frameworks that speak Open​AI-compatible APIs, mlx_lm.server is the lighter path — uv tool install mlx-lm then mlx_lm.server --model "orcarouter/Qwen3.8-27B-Uncensored-MLX", which serves at http://localhost:8080/v1 with api type openai-completions. Our card carries self-reported community configs pointing Pi, Hermes and OpenClaw at that endpoint. Those are user-supplied setups we have not reproduced, so treat them as starting points, not guarantees.

La visione sopravvive alla quantizzazione

Poiché la torre di visione e la conv1d restano in BF16, la comprensione delle immagini è preservata a 4/6/8 bit. Sulla nostra immagine di prova — forme, colori, posizione, sfondo e testo nell'immagine — le build a 4/6/8 bit hanno descritto tutto correttamente; quella a 2 bit solo parzialmente. Se stai scegliendo una build e l'aspetto visivo conta, 4 bit è il minimo a cui dovresti scendere. Non abbiamo pubblicato throughput di visione specifico per Apple Silicon per questa build, quindi non fidarti di un valore tok/s per essa a meno che non provenga da un run nominato sulla tua stessa classe di chip.

La torre di visione preservata fa anch'essa parte della superficie di rischio, ed è giusto dirlo chiaramente: un modello abliterato che può anche leggere immagini non è un problema di sicurezza limitato al solo testo.

Chiamata degli strumenti e uso degli agenti

Il tool calling è una capacità del modello base e sopravvive all'abliterazione, il che rende questa build genuinamente utile per il red-teaming di sistemi agentici — e genuinamente pericolosa se indirizzata verso servizi reali. La configurazione standard è quella dell'endpoint mlx_lm.server sopra menzionato, che qualsiasi agente compatibile con Open​AI può utilizzare. Se lo esegui come agente, comprendi cosa hai abilitato: un modello che non rifiuta con function calling e contesto da 262K è una postura di sicurezza diversa da un modello chat, e l'inquadramento della scheda come 'solo ricerca' esiste proprio per questo motivo.

Il contesto da 262K e quanto costa davvero

{{1}}L'architettura conferisce a questo modello un contesto lungo insolitamente economico.{{/1}} {{2}}Qui l'attenzione ibrida significa 48 layer di attenzione lineare (Gated DeltaNet) alternati a 16 layer a piena attenzione, e solo i 16 layer a piena attenzione dispongono di una classica cache KV — i layer lineari mantengono invece uno stato ricorrente compatto.{{/2}} {{3}}Quindi 262.144 token costano materialmente meno di quanto costerebbero su un modello 27B a piena attenzione.{{/3}} {{4}}Questo è un dato strutturale del modello base, non una promessa sul tuo Mac.{{/4}}

In pratica la finestra è una capacità, non un livello gratuito. Un test comunitario di contesto lungo su un M4 Max ha misurato circa 63 tok/s a contesto breve, scendendo a circa 11 tok/s a 31K token — la decodifica degrada bruscamente man mano che la cache si riempie, e la latenza del primo token su prompt molto lunghi è solitamente l'ostacolo maggiore rispetto alla velocità di elaborazione grezza. Il prefill speculativo e basato su ANE migliora l'ingestione, non la decodifica. I nostri dati sui costi della KV-cache Apple-Silicon per questa build non sono pubblicati; se ti servono numeri concreti per il tuo hardware, le esecuzioni comunitarie sono la fonte onesta, e il consenso della comunità è di trattare l'intero 262K come qualcosa a cui ricorrere deliberatamente, non come un'impostazione predefinita da lasciare attiva.

Velocità — ciò che viene effettivamente misurato

Pubbliciamo esattamente un dato di velocità per questa build e non è Apple Silicon: ~32–37 tok/s in stato stazionario su una singola H200 tramite il backend MLX CUDA, il che conferma che i pesi funzionano anche al di fuori di macOS. Su Mac la nostra scheda pubblica deliberatamente nessun tok/s, perché dipende dal chip, dalla precisione e dal runner. Numeri pratici che vale la pena conoscere, tutti etichettati come tali:

Questa build esatta, 4-bit, M1 Pro 32 GB: ~8,7 tok/s di generazione e ~41,7 tok/s di prefill in una breve esecuzione (test della community, agosto 2026). Un chip più vecchio, ma un minimo realistico.

oMLX con MTP nativo su un M4 Max, checkpoint stock non-abliterato: 53.3 tok/s in prosa e 72.1 tok/s in codice, con ~273.7 tok/s di prefill a 4K; decodifica raw senza MTP ~24.6 tok/s. Misurato da un practitioner su un checkpoint e un runtime diversi, quindi trattalo come un limite superiore che i pesi abliterati potrebbero avvicinare piuttosto che una promessa.

• prefill oMLX dual-ANE su un M3 Ultra, oQ4e-MTP abliterato: prefill fino a ~17.7% a 16K e ~18.9% a 32K, e decode tramite Lightning MTP fino a ~75 tok/s a 16K. I caveat sono reali: usa interfacce runtime private di Apple e pesi INT8 approssimati, aggiunge circa 4 GB di memoria di picco e porta il tempo di caricamento del modello da ~3.4 s a ~28 s. Questa è un'ottimizzazione dell'ingestione del prompt, non un acceleratore di generazione.

La testa MTP — una velocizzazione gratuita se il tuo runner la supporta

Questa build include il drafter di predizione multi-token del modello base nella sottocartella mtp/ (architettura qwen3_5_mtp), e funziona con qualsiasi precisione principale. L'accettazione è senza perdite — con decodifica greedy l'output è identico all'esecuzione senza drafter — quindi è un vero incremento di velocità senza costi di qualità quando si attiva. Due note di configurazione dalla nostra scheda: richiede una build mlx-vlm che includa il drafter qwen3_5_mtp (il branch main), e devi passare sia --draft-model ./Qwen3.8-27B-Uncensored-MLX/mtp che --draft-kind mtp. Impostare mtp_enabled da solo non fa nulla. Se il tuo runner non supporta il drafter, questo viene ignorato e il modello funziona normalmente — non si rompe nulla.

Sicurezza — leggilo prima di eseguirlo, non dopo

La dichiarazione di non responsabilità della scheda del modello è insolitamente diretta, e questa pagina non intende attenuarla. L'allineamento di sicurezza di questa build è stato sostanzialmente rimosso. Sarà in grado di soddisfare richieste dannose, non etiche, offensive o illegali che il Qw​en/Qwen3.8-27B di base rifiuterebbe, e non dispone di salvaguardie integrate significative. È rilasciato esclusivamente per la ricerca legittima — interpretabilità, studio della sicurezza dell'IA e dei meccanismi di rifiuto, red-teaming, valutazione della robustezza ed esperimenti controllati. Se non è questo ciò che stai facendo, questo è il modello sbagliato.

{{1}}Due avvertimenti della scheda meritano enfasi.{{/1}} {{2}}In primo luogo, i test di jailbreak e di sicurezza "riescono" banalmente su un modello abliterato, e questo non equivale a superare una valutazione di sicurezza — è il comportamento atteso di un modello a cui è stata rimossa la direzione del rifiuto.{{/2}} {{3}}L'assenza di rifiuti non è prova di sicurezza.{{/3}} {{4}}In secondo luogo, la visione preservata, il tool-calling e il contesto di 262K estendono la superficie d'attacco alla comprensione delle immagini e all'uso agentico: un modello non censurato che può leggere screenshot e chiamare strumenti rappresenta un rischio più ampio rispetto a una build solo-chat privata dei rifiuti.{{/4}} {{5}}La quantizzazione a bassa bit aggiunge un terzo strato di instabilità — a 2 bit, l'output distorto può persino essere scambiato per un rifiuto, che è un tipo di errore fuorviante a sé stante.{{/5}}

Ti assumi la piena responsabilità e ogni obbligo di risarcimento per l'uso e gli output. La licenza Apache-2.0 è ereditata dal modello di base e non cambia questo: ne consente l'uso; non rende sicura la tua implementazione. Chiunque distribuisca questo prodotto a utenti finali, minori o in qualsiasi ambiente di produzione deve prima aggiungere i propri livelli di moderazione, sicurezza e prevenzione degli abusi e rispettare la legge applicabile. Per i ricercatori che lo eseguono davvero, le misure di salvaguardia pratiche sono: un ambiente isolato, idealmente offline; strumenti degli agenti non puntati verso servizi reali; nessuna esposizione a utenti finali; e la revisione degli output prima che vengano diffusi.

Quando il locale non è la risposta

Il punto di questa build è la natura locale: i pesi risiedono sul tuo disco, non c'è alcun costo per token e nulla lascia la macchina. Ma l'approccio locale è anche un tetto: è limitato ad Apple Silicon, devi convivere con la qualità della quantizzazione e non c'è ridondanza se la macchina è occupata. Se ti serve un modello di classe 27B non abliterato via API per un carico di lavoro reale, o se vuoi fare un A/B test di questa build locale contro un modello hosted con gli stessi prompt, è questo il vuoto che un livello di routing esiste per colmare. OrcaRouter mette oltre 200 modelli dietro un'unica chiave API al prezzo di listino del provider, con failover automatico e un DSL di routing — un taglio di prezzo del fornitore diventa attivo dal nostro lato lo stesso giorno in cui viene annunciato, perché trasmettiamo il prezzo di listino. Una sola API, una sola integrazione, e puoi confrontare un setup locale non testato con un modello hosted senza dover creare un secondo account. Noi non ospitiamo questa build MLX — è a pesi locali per progettazione — quindi l'API è il percorso complementare, non un sostituto.

La guida rapida alle decisioni

• Mac da 16 GB — onestamente, non questo modello. La versione 2-bit ci sta ed è solo per archiviazione; avrai problemi di memoria in ogni caso. Considera un modello non censurato più piccolo, oppure la conversione mista 3/6-bit della community creata per macchine da 18–24 GB.

• Mac da 24 GB — 4-bit, e mantieni il contesto breve; non eseguire visione e contesto lungo contemporaneamente.

• Mac da 32 GB — 4-bit è il punto ottimale; 6-bit se mantieni il contesto ristretto.

• Mac da 48 GB — 6-bit con margine; 8-bit se non spingi la finestra.

• 64 GB e oltre — 8-bit, quasi senza perdite, e contesto 262K a portata di mano con le avvertenze sopra.

Questo è l'intero runbook. Il modello è del 17 agosto 2026, non è una notizia di lancio e non deve esserlo: 83.000 download sono avvenuti perché le persone volevano una guida pratica, e questa pagina è quella guida. Inizia dalla root del repository, carica il 4-bit in LM Studio, e non abbandonare la build predefinita finché non sai cosa stai sacrificando per la qualità. Se provieni dal lato della famiglia GGUF o FP8, le guide correlate coprono quei percorsi — il quadro decisionale qui è lo stesso, la matematica della quantizzazione no.

Non un'altra build di questo modello — Qwen3.8-Flash-Next-Uncensored è un rilascio separato: abliterato da Qwen3.8-Flash-Next, un'anteprima mixture-of-experts da 176B memorizzati / 6B attivi dell'architettura Qwen4. Stessa tecnica di abliterazione, pesi diversi, una propria collezione.

Tutte e sei le build 27B — BF16, GGUF, MLX, FP8, INT8 e NVFP4 — sono raccolte nella collezione Qwen3.8-27B-Uncensored su Hugging Face.

Questi pesi sono progettati per essere solo locali. Per una baseline ospitata con cui confrontare la build abliterata, Qwen3.8-27B è servito su OrcaRouter al prezzo di listino del provider con markup 0% — il modello standard, con l'allineamento della sicurezza intatto.

© 2026 OrcaRouter

Per i provider

Gestisci una piattaforma di inferenza? Porta i tuoi modelli su OrcaRouter.

providers@orcarouter.ai

Unisciti alla community

Discordsupport@orcarouter.aiXGitHubYouTube