Illustrazione editoriale flat-vector per la hero di un blog tecnologico sull'esecuzione di un modello linguistico di grandi dimensioni non censurato e abliterato, localmente sul proprio hardware: un grande chip arrotondato del modello in blu profondo con un tenue bagliore ciano fluttua al centro-sinistra, il suo circuito interno si dissolve da una forma di lucchetto chiuso a una aperta. Alla sua destra, una scheda GPU compatta su un banco di lavoro e una finestra di terminale sottile con barre di comando orizzontali astratte, con accanto una piccola sagoma di llama. Nell'angolo superiore, una piccola icona di microscopio e uno scudo arrotondato con un triangolo di avvertimento, a suggerire l'uso di ricerca e i confini di sicurezza. Sfondo azzurro tenue e bianco, ampio spazio vuoto nel terzo inferiore. Nessun testo leggibile.
Guides & Insights

Come eseguire Qwen3.8-27B-Uncensored localmente: GGUF Quants, llama.cpp e Ollama

Autore

Rowan Sterling

Data di pubblicazione

Ultimi modelli · 20Vedi tutti i modelli
Benchmark: Artificial Analysis · aggiornato ogni giorno
Torna a tutti gli articoli

Per eseguire Qwen3.8-27B-Uncensored localmente, scarica la repo GGUF ad accesso limitato orcarouter/Qwen3.8-27B-Uncensored-GGUF da Hugging Face, scegli una quantizzazione in base alla tua VRAM — Q4_K_M (16,8 GB) per una GPU da 24 GB, IQ4_XS (15,3 GB) per una GPU da 16 GB, Q3_K_M (13,5 GB) se vuoi più spazio per il contesto — e servilo con una build recente di llama.cpp usando il flag --jinja, aggiungendo --mmproj se ti serve la visione. Lo stesso file si importa in Ollama con tre comandi. Questa è la versione GGUF della build abliterata di Qwen3.8 27B, rilasciata il 16 agosto 2026, con il contesto nativo di 262K, il proiettore per la visione e la testa di decodifica speculativa MTP preservati in ogni quantizzazione. È uno strumento di ricerca, non un assistente: il suo comportamento di rifiuto è stato rimosso, non include salvaguardie integrate e la licenza è Apache 2.0. Leggi il limite di sicurezza in fondo a questa pagina prima di scaricare — è il motivo per cui la repo è ad accesso limitato.

Quale GGUF scaricare, in base alla VRAM

Il repository include una coppia a piena precisione e dodici file quantizzati, quindi la decisione sul download è in realtà una decisione sulla VRAM. I numeri qui sotto sono le dimensioni dei file lette dal repository Hugging Face il 16 agosto 2026.

A quant-picker card titled 'Qwen3.8-27B-Uncensored GGUF — pick by VRAM', sourced to the Hugging Face repo orcarouter/Qwen3.8-27B-Uncensored-GGUF checked 2026-08-16. It lists: 24 GB GPU — Q4_K_M at 16.8 GB, the recommended default; 16 GB GPU — IQ4_XS at 15.3 GB (tight) or Q3_K_M at 13.5 GB (context headroom); 12 GB GPU — Q2_K at 10.9 GB only, quality drops; 48 GB+ — Q8_0 at 29.0 GB or F16 at 54.7 GB; plus a vision line reading add mmproj 0.9 GB for image input. Footer: only 16 of 64 layers use full attention, so the KV cache stays ~2 GB at 32K context and Q4_K_M fits a 24 GB card with long context.

Cosa c'è effettivamente nel repo

Il repository orcarouter/Qwen3.8-27B-Uncensored-GGUF contiene quindici file di modello: i pesi F16 divisi in due parti, dodici GGUF quantizzati — Q2_K, Q3_K_S, Q3_K_M, Q3_K_L, Q4_K_S, Q4_K_M, Q5_K_S, Q5_K_M, Q6_K, Q8_0, IQ3_M e IQ4_XS — e il proiettore visivo mmproj. Si tratta dell'esportazione GGUF della stessa build abliterata di Qwen3.8-27B-Uncensored-FP8, reimpacchettata per i runtime locali di classe llama.cpp, ed eredita la licenza Apache 2.0 del modello base e il suo contesto nativo di 262.144 token.

Tre proprietà valgono per ogni quant. L'architettura è qwen35 — attenzione ibrida con 48 layer lineari Gated DeltaNet e 16 layer di attenzione completa — ed è per questo che il repository rifiuta di caricarsi nelle build più vecchie di llama.cpp e che la cache KV rimane piccola. La testa di decodifica speculativa MTP (nextn) è preservata in tutti i quant, sia K-quant che IQ. E il template di chat è quello Qwen Jinja, che devi abilitare esplicitamente (vedi sotto) o le conversazioni multi-turno si rompono.

Perché la cache KV rimane abbastanza piccola da essere rilevante

Questo è il dettaglio che fa funzionare la storia locale. Dei 64 layer, solo 16 usano l'attenzione completa; gli altri 48 usano l'attenzione lineare Gated DeltaNet, che non mantiene alcuna cache KV convenzionale. L'effetto pratico, misurato sul runbook originale per questa architettura, è una cache KV di circa 2 GB a contesto 32K — circa un quarto di ciò che servirebbe a un 27B convenzionale. Ecco perché un file Q4_K_M da 16,8 GB trova ancora spazio su una scheda da 24 GB con una finestra di contesto lunga, e perché la linea GGUF non censurata è utilizzabile su hardware che non potrebbe ospitare affatto il checkpoint BF16 da 55,6 GB.

Eseguilo con llama.cpp

llama.cpp è il percorso previsto. Serve una build attuale: il trunk registra l'architettura qwen35, e le build più vecchie rifiutano il file completamente. La forma del comando, dalle note di utilizzo della scheda del modello e dal runbook di questa architettura, è:

A command card titled 'llama.cpp — serve the uncensored GGUF' showing the run command llama-server -m Qwen3.8-27B-Uncensored-Q4_K_M.gguf --ctx-size 32768 --n-gpu-layers 99 --jinja, an optional vision line adding --mmproj mmproj-Qwen3.8-27B-Uncensored-f16.gguf, and notes: a current build is required because the qwen35 architecture is refused by older llama.cpp versions; the MTP nextn head is preserved in every quant but needs a build with MTP support, stock builds ignore it. Footer: the Ollama path is a Modelfile with FROM ./Qwen3.8-27B-Uncensored-Q4_K_M.gguf, then ollama create qwen3.8-27b-uncensored -f Modelfile, then ollama run qwen3.8-27b-uncensored.

llama-server -m Qwen3.8-27B-Uncensored-Q4_K_M.gguf --ctx-size 32768 --n-gpu-layers 99 --jinja

Questo ti offre un endpoint compatibile con OpenAI su localhost:8080. Per l'input di immagini aggiungi --mmproj mmproj-Qwen3.8-27B-Uncensored-f16.gguf. Sostituisci Q4_K_M con la quantizzazione che corrisponde alla tua VRAM; i flag sono identici.

Eseguilo con Ollama

Ollama esegue lo stesso file importandolo da un Modelfile, che è il modo supportato per aggiungere un GGUF che non è nella libreria. Nella directory che contiene il quant che hai scaricato:

DA ./Qwen3.8-27B-Uncensored-Q4_K_M.gguf

Salva quella riga come Modelfile, poi ollama create qwen3.8-27b-uncensored -f Modelfile e ollama run qwen3.8-27b-uncensored. Per la visione, aggiungi la riga mmproj al Modelfile (FROM ... Q4_K_M.gguf più il percorso di mmproj) e Ollama collega automaticamente il projector. Valgono le stesse avvertenze su --ctx e template: imposta la dimensione del contesto che puoi effettivamente gestire e ricorda che un modello privato del meccanismo di rifiuto risponde senza alcuna barriera tra te e l'output.

Cosa ha effettivamente cambiato la rimozione del rifiuto

La scheda del modello pubblica una suite di valutazione della sicurezza per questa build. Con il pensiero disattivato, il tasso di rifiuto nei benchmark standard di prompt dannosi scende da 64–99% sul modello base a 0–6% sui pesi abliterati; con il pensiero attivato non rifiuta praticamente mai — 1,7% o meno. I benchmark delle capacità restano entro ±1,3 punti rispetto al modello base. Questa è la forma di ogni release abliterata in questa linea: rifiuti rimossi, capacità intatte, e l'avvertenza che un'onesta frazione delle risposte antepone ancora una breve dichiarazione di non responsabilità prima di rispondere — un artefatto di addestramento, non un rifiuto.

Il rovescio della medaglia è proprio il senso del confine di sicurezza sotto: un modello che non rifiuta mai non è un assistente migliore, è un tipo diverso di oggetto. È uno strumento di test per misurare i meccanismi di rifiuto e per scoprire se la propria protezione funziona.

Cosa farne realmente nella ricerca

Tre progetti legittimi che rappresentano l'uso autorizzato di un modello senza rifiuti:

Quando questa build è la risposta sbagliata

Se vuoi un assistente normale, o qualsiasi cosa che metteresti davanti agli utenti finali, questo è il modello sbagliato — non ha salvaguardie integrate significative, eseguirà richieste che il modello base rifiuta, e Apache 2.0 non ti libera dalla responsabilità. Per quello, usa il Qwen3.8-27B allineato originale. Se vuoi aggirare i rifiuti in un chatbot, un pacchetto di prompt di sistema ottiene di più con meno rischio di una modifica dei pesi. E se non hai affatto una GPU ma vuoi comunque studiare il modello, la scheda ospitata obsidian/Qwen3.8-27B su OrcaRouter offre la stessa variante non censurata a $0.40 per milione di token di input e $4.21 per milione di token di output con lo stesso contesto di 262K; è ad accesso controllato per ricercatori di sicurezza e AI-safety, allo stesso modo del repository, e la decisione di moderazione spetta comunque a te. La scheda del modello contiene i dettagli sui prezzi e sui benchmark.

Il confine di sicurezza — leggi questo prima di scaricare.

A safety-boundary card for Qwen3.8-27B-Uncensored with two columns: under Research use it lists refusal-mechanism study, interpretability, red-teaming, robustness evaluation and guardrail testing; under Never deploy it lists end-user chatbots, production applications and consumer services, with a warning that this model has had its safety alignment removed and will comply with harmful, unethical or illegal requests the base model refuses, and a footer reading Apache 2.0, research-only, you assume full responsibility.

L'allineamento di sicurezza di questo modello è stato {{1}}sostanzialmente{{/1}} rimosso. Soddisferà richieste dannose, non etiche, offensive o illegali che il Qwen3.8-27B originale rifiuterebbe, e non dispone di {{2}}significative{{/2}} barriere di sicurezza integrate. È rilasciato {{3}}esclusivamente per ricerca legittima{{/3}} — interpretabilità, studio dell'AI-safety e dei meccanismi di rifiuto, red-teaming, valutazione della robustezza ed esperimenti controllati. L'utente si assume {{4}}piena responsabilità e ogni obbligo di risarcimento{{/4}} per l'uso che ne fa e per tutto ciò che genera, e non deve distribuirlo agli utenti finali né metterlo in produzione {{5}}senza aggiungere propri livelli di sicurezza, moderazione e prevenzione degli abusi{{/5}}. Gli autori non accettano alcuna responsabilità per un uso improprio. {{6}}Il download del repository implica l'accettazione di queste condizioni; la licenza è Apache 2.0.{{/6}}

Questo articolo non contiene deliberatamente prompt dannosi. I numeri di rifiuto sopra riportati provengono dalla suite di valutazione della sicurezza della scheda del modello stessa, che è il modo corretto per misurare un modello di questa classe: eseguire i benchmark standard di rifiuto, leggere i numeri e progettare la ricerca in base a ciò che mostrano.

Fonti e data

Tutti i fatti di cui sopra sono stati verificati il 16 agosto 2026. L'elenco dei file e le dimensioni sono letti dal repository Hugging Face orcarouter/Qwen3.8-27B-Uncensored-GGUF (creato il 16 agosto 2026; architettura qwen35; Apache 2.0; ad accesso limitato). I punteggi di rifiuto e di capacità provengono dalla suite di valutazione della sicurezza della model card. La misurazione della KV-cache (circa 2 GB con contesto 32K) proviene dal runbook OrcaRouter per questa architettura, How to Run Qwen 3.8 27B Locally. I prezzi e i controlli di accesso della versione ospitata provengono dalla pagina del modello obsidian/Qwen3.8-27B, verificata lo stesso giorno. Le dimensioni dei file quantizzati sono espresse in GB decimali, come memorizzati su Hugging Face.

Per scopi di ricerca legittimi, i pesi sono su Hugging Face: Scarica da Hugging Face — nessuna carta di credito, attivo in 60 secondi.

© 2026 OrcaRouter

Per i provider

Gestisci una piattaforma di inferenza? Porta i tuoi modelli su OrcaRouter.

providers@orcarouter.ai

Unisciti alla community

Discordsupport@orcarouter.aiXGitHubYouTube