
Qwen 3.8 27B Uncensored GGUF: la build locale abliterata, 12 quantizzazioni e il confine di sola ricerca
- obsidianNUOVOQwen3.8 27B Uncensored (Aggressive)2026-08-1552Intelligenza68Codice
- qwenNUOVOQwen: Qwen3.8 27B (free)2026-08-1358 tok/s
- deepseekNUOVODeepSeek: DeepSeek V4 Pro 08132026-08-1253Intelligenza69Codice
- grokNUOVOSpaceXAI: Grok 4.62026-08-1261Intelligenza77Codice
- metaNUOVOMeta: Muse Spark 1.22026-08-0557Intelligenza72Codice
- qwenQwen: Qwen3.8 Max2026-08-0358Intelligenza72Codice
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3152Intelligenza69Codice
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 per 1M di token · 231 tok/s
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2463Intelligenza78Codice
- googleGoogle: Gemini 3.6 Flash2026-07-2152Intelligenza69Codice
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2137Intelligenza49Codice
- metaMeta: Muse Spark 1.12026-07-1653Intelligenza71Codice
- kimiMoonshotAI: Kimi K32026-07-1560Intelligenza76Codice
- openaiOpenAI: GPT-5.6 Luna2026-07-0952Intelligenza71Codice
- openaiOpenAI: GPT-5.6 Terra2026-07-0957Intelligenza77Codice
- openaiOpenAI: GPT-5.6 Sol2026-07-0961Intelligenza77Codice
- grokxAI: Grok 4.52026-07-0856Intelligenza72Codice
- tencentTencent: Hy32026-07-0642Intelligenza59Codice
Qwen 3.8 27B uncensored GGUF è un download reale, e la build da cui iniziare è Qwen3.8-27B-Uncensored-GGUF — pubblicato su Hugging Face il 16 agosto 2026 come gemello nativo di llama.cpp della nostra release FP8 abliterata. Sono gli stessi pesi da 27 miliardi di parametri privati del rifiuto di Qwen3.8-27B-Uncensored-FP8, convertiti in GGUF per l'inferenza locale: F16 più 12 livelli di quantizzazione da Q2_K a Q8_0 (inclusi i quant imatrix IQ3_M e IQ4_XS), la finestra di contesto da 262K, un proiettore visivo separato e la testa di decodifica speculativa MTP intatta. "Uncensored" significa abliterato — la direzione del rifiuto è stata ortogonalizzata via dai pesi — quindi risponderà dove la base allineata rifiuta, ed è esattamente per questo che è solo per ricerca. Ecco cosa contiene realmente il repository, quale quant si adatta alla tua GPU, come eseguirlo in llama.cpp e il limite di sicurezza che accetti scaricandolo.
La versione da 30 secondi: F16 più 12 quants, Q4_K_M a 16,8 GB è la scelta predefinita, serve una build di llama.cpp di maggio 2026 o successiva, e questo è uno strumento di ricerca senza protezioni — non qualcosa da distribuire agli utenti finali.
Cosa significa realmente "uncensored GGUF" — e in cosa questa build differisce dalla versione FP8
GGUF è il formato di modello a file singolo usato da llama.cpp; FP8 è uno schema di quantizzazione che gira su server GPU vLLM. Le nostre due versioni non censurate sono gli stessi pesi abliterati in due runtime. Qwen3.8-27B-Uncensored-FP8 (15 agosto 2026) è pensata per vLLM su un server, ri-quantizzata secondo lo schema ufficiale Qwen3.8-27B-FP8 per servire sullo stesso percorso kernel. Qwen3.8-27B-Uncensored-GGUF (16 agosto 2026) è pensata per llama.cpp su una macchina locale — la GPU desktop o workstation che controlli. Stessi pesi, diverso modello di distribuzione: API cloud vs processo locale.
Abliteration è un intervento a livello di pesi, non un fine-tuning. La direzione del rifiuto è un vettore nel flusso residuo del modello che, quando attivato, produce "Non posso aiutarti con questo"; la build trova quella direzione e la ortogonalizza dai pesi, seguendo l'approccio di Arditi et al. 2024 ("Refusal in Language Models Is Mediated by a Single Direction"). Non vengono addestrati nuovi pesi. La base è Qwen/Qwen3.8-27B — un modello denso da 27B con architettura ibrida (48 layer di attenzione lineare Gated DeltaNet e 16 layer di attenzione completa), visione nativa e un contesto di 262.144 token. La licenza è Apache 2.0, ereditata dalla base. Nota che il repository ufficiale di Qwen distribuisce solo safetensors BF16 — non esiste un GGUF ufficiale di Qwen — quindi qualsiasi GGUF non censurato di questo modello, incluso questo, è una conversione dei pesi aperti.
La scala quant — F16 più 12 livelli
Il repository include F16 (54,6 GB in due file) e 12 livelli di quantizzazione. Le dimensioni sotto indicate sono le dimensioni dei file del repository stesso, lette il 16 agosto 2026; le dimensioni dei file GGUF variano leggermente da build a build.

• F16 — 54.6 GB (2 file) — precisione di riferimento
• Q8_0 — 29.0 GB — quasi senza perdite, per GPU di fascia alta
• Q6_K — 22.4 GB — il punto ottimale qualità-per-gigabyte
• Q5_K_M — 19.5 GB / Q5_K_S — 19.0 GB — alta qualità su schede più grandi
• Q4_K_M — 16.8 GB — il default consigliato
• Q4_K_S — 15.8 GB
• IQ4_XS — 15.3 GB — la migliore scelta a basso bit (calibrato con imatrix)
• Q3_K_L — 14.6 GB / Q3_K_M — 13.5 GB — per schede da 16 GB
• IQ3_M — 12.8 GB — ingombro ridotto (calibrato con imatrix)
• Q3_K_S — 12.3 GB
• Q2_K — 10.9 GB — il più piccolo K-quant, un compromesso di qualità visibile
Guida hardware: Q4_K_M su una scheda da 24 GB (RTX 4090 o RTX 3090); IQ4_XS o Q3_K_M se hai 16 GB; Q2_K solo se sei limitato a 12 GB. Poiché la base usa l'attenzione ibrida Gated DeltaNet, la cache KV è piccola — circa 0,5 GB con contesto 8K — quindi puoi spingere la finestra molto più in alto rispetto a un modello denso convenzionale da 27B. La visione aggiunge un file separato: il proiettore F16 è di 931 MB. Esiste anche una serie abliterata della community a 9 quant per la stessa base; la nostra è la conversione dell'abliterazione FP8 documentata, con i quant imatrix e i numeri di refusal-delta della scheda del modello riportati.
Come eseguirlo in llama.cpp
Tre passaggi. Un requisito non ovvio: l'architettura qwen35 e il supporto MTP sono stati introdotti in llama.cpp a maggio 2026, quindi aggiorna a una build del 2026-05 o successiva — le build più vecchie non caricheranno questi file (secondo il README del repository).
1. Scarica il quant che hai scelto e il proiettore visivo. L'accesso al repository è limitato, quindi devi accedere a Hugging Face e accettare le condizioni prima — leggere il README fa parte dell'accettazione di ciò che questo modello è.
huggingface-cli download orcarouter/Qwen3.8-27B-Uncensored-GGUF --include "Qwen3.8-27B-Uncensored-Q4_K_M.gguf" "mmproj-Qwen3.8-27B-Uncensored-f16.gguf" --local-dir ./qwen-unc
2. Avvia llama-server. Questo serve un endpoint compatibile con OpenAI; -ngl 99/ scarica ogni layer sulla GPU.
llama-server -m ./qwen-unc/Qwen3.8-27B-Uncensored-Q4_K_M.gguf --mmproj ./qwen-unc/mmproj-Qwen3.8-27B-Uncensored-f16.gguf -ngl 99 -c 16384 --jinja --host 0.0.0.0 --port 8080
3. (Opzionale) abilita la testa di decodifica speculativa MTP. Aggiungi --spec-type draft-mtp/ — la testa nextn è incorporata in ogni quant, quindi non è necessario un modello draft separato.

Le esecuzioni di ricerca con solo testo possono omettere --mmproj/; l'input di immagini lo richiede, perché questo è un modello nativo visione-linguaggio. L'endpoint è http://localhost:8080/v1/chat/completions, quindi il codice esistente dell'SDK OpenAI funziona con un semplice scambio dell'URL di base.
Niente GPU? La stessa linea non censurata è ospitata
Il GGUF locale non costa nulla per token, ma richiede circa 17 GB di VRAM per il livello Q4_K_M. Se non possiedi l'hardware, la scheda ospitata obsidian/Qwen3.8-27B su OrcaRouter offre la stessa linea 27B senza censura — visione, ragionamento, contesto da 262K — a $0,40 per milione di token in input e $4,21 per milione in output, con accesso riservato a ricercatori di sicurezza, red team e ricercatori di sicurezza dell'IA. Stessa famiglia di pesi, due runtime: GGUF in locale, FP8 nel cloud. La decisione di moderazione resta comunque dalla tua parte.
Il confine di sicurezza — leggi questo prima di scaricare.
L'allineamento alla sicurezza di questo modello è stato sostanzialmente rimosso. Esaudirà richieste dannose, non etiche, offensive o illegali che il Qwen3.8-27B di base rifiuterebbe, e non dispone di barriere di sicurezza integrate significative. È rilasciato esclusivamente per ricerca legittima — interpretabilità, studio dei meccanismi di rifiuto, red-teaming, valutazione della robustezza e test delle barriere di sicurezza. Ti assumi piena responsabilità e ogni obbligo di risarcimento per come lo utilizzi e per tutto ciò che genera, e non devi distribuirlo agli utenti finali o metterlo in produzione senza aggiungere i tuoi livelli di sicurezza, moderazione e prevenzione degli abusi. Gli autori non accettano alcuna responsabilità. La licenza è Apache 2.0.

Il comportamento misurato dice cosa costa essere "non censurati". Dalla suite di valutazione della sicurezza della scheda del modello — eseguita sulla build FP8 e datata 15 agosto 2026, cioè i pesi che questa GGUF converte: il rifiuto di prompt dannosi scende dal 64–99% della base allo 0–6% sui pesi abliterati, il rifiuto eccessivo di prompt benigni scende dal 5,6% allo 0,4%, e i punteggi di capacità restano entro ±1,3 punti dalla base. Quei numeri sono il motivo per cui questa classe di modelli è un legittimo oggetto di ricerca — e sono anche l'avvertimento.
Questo articolo non contiene volutamente prompt dannosi. Se stai valutando il modello, esegui i benchmark di rifiuto standard — AdvBench, HarmBench, StrongREJECT, XSTest-safe — e leggi tu stesso i numeri. Questa è la modalità autorizzata per studiare un modello senza rifiuti.
Quando questa build è la risposta sbagliata
1. Vuoi un assistente normale.Modello sbagliato. Non ha protezioni e soddisfarà richieste dannose. Usa invece il Qwen3.8-27B allineato.
2. Qualsiasi cosa metteresti davanti agli utenti finali. Modello sbagliato a prescindere dall'intenzione. Apache 2.0 non trasferisce la tua responsabilità, e distribuire un modello senza guardrail agli utenti non è una strategia di deployment.
3. Sei su Apple Silicon. Il GGUF funzionerà, ma la conversione MLX del modello base è la soluzione più naturale — consulta la nostra guida MLX separata.
4. Non vuoi affatto eseguirlo. Usa la versione ospitata — stessi pesi, niente 17 GB di VRAM e lo stesso accesso riservato alla sola ricerca.
Il risultato finale
"Qwen 3.8 27B uncensored GGUF" ha una risposta, ed è un download concreto: Qwen3.8-27B-Uncensored-GGUF — F16 più 12 livelli di quantizzazione per llama.cpp, i pesi abliterati dalla nostra build FP8, contesto 262K, visione e MTP, sotto Apache 2.0 e solo per ricerca. Scegli Q4_K_M su una scheda da 24 GB, aggiorna llama.cpp a una versione successiva a maggio 2026, ed eseguilo come server locale compatibile con OpenAI. È uno strumento di ricerca per studiare i rifiuti e testare i guardrail — non un chatbot, e non qualcosa da distribuire. I pesi sono gratuiti; la responsabilità di ciò che ne fai è interamente tua.
Per ricerca legittima, l'F16 e tutti i 12 livelli di quantizzazione sono su Hugging Face: Scarica il GGUF da Hugging Face
