Card hero per l'articolo 'Qwen 3.8 27B Uncensored GGUF': una scheda di ricerca arrotondata con il titolo 'Qwen3.8-27B Uncensored GGUF', sottotitolo 'Abliterated local build for llama.cpp', chip che riportano '12 QUANT TIERS', '262K CONTEXT', 'VISION + MTP', e un'icona a scudo con etichetta RESEARCH-ONLY. Logo OrcaRouter composito in basso a destra.
Guides & Insights

Qwen 3.8 27B Uncensored GGUF: la build locale abliterata, 12 quantizzazioni e il confine di sola ricerca

Autore

Alistair Wren

Data di pubblicazione

Ultimi modelli · 20Vedi tutti i modelli
Benchmark: Artificial Analysis · aggiornato ogni giorno
Torna a tutti gli articoli

Qwen 3.8 27B uncensored GGUF è un download reale, e la build da cui iniziare è Qwen3.8-27B-Uncensored-GGUF — pubblicato su Hugging Face il 16 agosto 2026 come gemello nativo di llama.cpp della nostra release FP8 abliterata. Sono gli stessi pesi da 27 miliardi di parametri privati del rifiuto di Qwen3.8-27B-Uncensored-FP8, convertiti in GGUF per l'inferenza locale: F16 più 12 livelli di quantizzazione da Q2_K a Q8_0 (inclusi i quant imatrix IQ3_M e IQ4_XS), la finestra di contesto da 262K, un proiettore visivo separato e la testa di decodifica speculativa MTP intatta. "Uncensored" significa abliterato — la direzione del rifiuto è stata ortogonalizzata via dai pesi — quindi risponderà dove la base allineata rifiuta, ed è esattamente per questo che è solo per ricerca. Ecco cosa contiene realmente il repository, quale quant si adatta alla tua GPU, come eseguirlo in llama.cpp e il limite di sicurezza che accetti scaricandolo.

La versione da 30 secondi: F16 più 12 quants, Q4_K_M a 16,8 GB è la scelta predefinita, serve una build di llama.cpp di maggio 2026 o successiva, e questo è uno strumento di ricerca senza protezioni — non qualcosa da distribuire agli utenti finali.

Cosa significa realmente "uncensored GGUF" — e in cosa questa build differisce dalla versione FP8

GGUF è il formato di modello a file singolo usato da llama.cpp; FP8 è uno schema di quantizzazione che gira su server GPU vLLM. Le nostre due versioni non censurate sono gli stessi pesi abliterati in due runtime. Qwen3.8-27B-Uncensored-FP8 (15 agosto 2026) è pensata per vLLM su un server, ri-quantizzata secondo lo schema ufficiale Qwen3.8-27B-FP8 per servire sullo stesso percorso kernel. Qwen3.8-27B-Uncensored-GGUF (16 agosto 2026) è pensata per llama.cpp su una macchina locale — la GPU desktop o workstation che controlli. Stessi pesi, diverso modello di distribuzione: API cloud vs processo locale.

Abliteration è un intervento a livello di pesi, non un fine-tuning. La direzione del rifiuto è un vettore nel flusso residuo del modello che, quando attivato, produce "Non posso aiutarti con questo"; la build trova quella direzione e la ortogonalizza dai pesi, seguendo l'approccio di Arditi et al. 2024 ("Refusal in Language Models Is Mediated by a Single Direction"). Non vengono addestrati nuovi pesi. La base è Qwen/Qwen3.8-27B — un modello denso da 27B con architettura ibrida (48 layer di attenzione lineare Gated DeltaNet e 16 layer di attenzione completa), visione nativa e un contesto di 262.144 token. La licenza è Apache 2.0, ereditata dalla base. Nota che il repository ufficiale di Qwen distribuisce solo safetensors BF16 — non esiste un GGUF ufficiale di Qwen — quindi qualsiasi GGUF non censurato di questo modello, incluso questo, è una conversione dei pesi aperti.

La scala quant — F16 più 12 livelli

Il repository include F16 (54,6 GB in due file) e 12 livelli di quantizzazione. Le dimensioni sotto indicate sono le dimensioni dei file del repository stesso, lette il 16 agosto 2026; le dimensioni dei file GGUF variano leggermente da build a build.

Card titled 'Qwen3.8-27B Uncensored GGUF — the quant ladder' listing F16 54.6 GB and 12 quantization tiers with file sizes: Q8_0 29.0 GB near-lossless, Q6_K 22.4 GB, Q5_K_M 19.5 GB, Q5_K_S 19.0 GB, Q4_K_M 16.8 GB marked recommended default, Q4_K_S 15.8 GB, IQ4_XS 15.3 GB marked best low-bit pick, Q3_K_L 14.6 GB, Q3_K_M 13.5 GB, IQ3_M 12.8 GB, Q3_K_S 12.3 GB, Q2_K 10.9 GB, with a footer reading 'File sizes per the Hugging Face repo, read August 16 2026'.

F16 — 54.6 GB (2 file) — precisione di riferimento

Q8_0 — 29.0 GB — quasi senza perdite, per GPU di fascia alta

Q6_K — 22.4 GB — il punto ottimale qualità-per-gigabyte

Q5_K_M — 19.5 GB / Q5_K_S — 19.0 GB — alta qualità su schede più grandi

Q4_K_M — 16.8 GB — il default consigliato

Q4_K_S — 15.8 GB

IQ4_XS — 15.3 GB — la migliore scelta a basso bit (calibrato con imatrix)

Q3_K_L — 14.6 GB / Q3_K_M — 13.5 GB — per schede da 16 GB

IQ3_M — 12.8 GB — ingombro ridotto (calibrato con imatrix)

Q3_K_S — 12.3 GB

Q2_K — 10.9 GB — il più piccolo K-quant, un compromesso di qualità visibile

Guida hardware: Q4_K_M su una scheda da 24 GB (RTX 4090 o RTX 3090); IQ4_XS o Q3_K_M se hai 16 GB; Q2_K solo se sei limitato a 12 GB. Poiché la base usa l'attenzione ibrida Gated DeltaNet, la cache KV è piccola — circa 0,5 GB con contesto 8K — quindi puoi spingere la finestra molto più in alto rispetto a un modello denso convenzionale da 27B. La visione aggiunge un file separato: il proiettore F16 è di 931 MB. Esiste anche una serie abliterata della community a 9 quant per la stessa base; la nostra è la conversione dell'abliterazione FP8 documentata, con i quant imatrix e i numeri di refusal-delta della scheda del modello riportati.

Come eseguirlo in llama.cpp

Tre passaggi. Un requisito non ovvio: l'architettura qwen35 e il supporto MTP sono stati introdotti in llama.cpp a maggio 2026, quindi aggiorna a una build del 2026-05 o successiva — le build più vecchie non caricheranno questi file (secondo il README del repository).

1. Scarica il quant che hai scelto e il proiettore visivo. L'accesso al repository è limitato, quindi devi accedere a Hugging Face e accettare le condizioni prima — leggere il README fa parte dell'accettazione di ciò che questo modello è.

huggingface-cli download orcarouter/Qwen3.8-27B-Uncensored-GGUF --include "Qwen3.8-27B-Uncensored-Q4_K_M.gguf" "mmproj-Qwen3.8-27B-Uncensored-f16.gguf" --local-dir ./qwen-unc

2. Avvia llama-server. Questo serve un endpoint compatibile con OpenAI; -ngl 99/ scarica ogni layer sulla GPU.

llama-server -m ./qwen-unc/Qwen3.8-27B-Uncensored-Q4_K_M.gguf --mmproj ./qwen-unc/mmproj-Qwen3.8-27B-Uncensored-f16.gguf -ngl 99 -c 16384 --jinja --host 0.0.0.0 --port 8080

3. (Opzionale) abilita la testa di decodifica speculativa MTP. Aggiungi --spec-type draft-mtp/ — la testa nextn è incorporata in ogni quant, quindi non è necessario un modello draft separato.

Card titled 'Run it locally in llama.cpp' with steps: update to a llama.cpp build from May 2026 or newer for the qwen35 architecture and MTP; download via huggingface-cli including the Q4_K_M quant and mmproj-Qwen3.8-27B-Uncensored-f16.gguf; run llama-server with --mmproj, -ngl 99, -c 16384, --jinja; optional --spec-type draft-mtp for the embedded speculative-decoding head, with a footer reading 'OpenAI-compatible endpoint at http://localhost:8080/v1/chat/completions'.

Le esecuzioni di ricerca con solo testo possono omettere --mmproj/; l'input di immagini lo richiede, perché questo è un modello nativo visione-linguaggio. L'endpoint è http://localhost:8080/v1/chat/completions, quindi il codice esistente dell'SDK OpenAI funziona con un semplice scambio dell'URL di base.

Niente GPU? La stessa linea non censurata è ospitata

Il GGUF locale non costa nulla per token, ma richiede circa 17 GB di VRAM per il livello Q4_K_M. Se non possiedi l'hardware, la scheda ospitata obsidian/Qwen3.8-27B su OrcaRouter offre la stessa linea 27B senza censura — visione, ragionamento, contesto da 262K — a $0,40 per milione di token in input e $4,21 per milione in output, con accesso riservato a ricercatori di sicurezza, red team e ricercatori di sicurezza dell'IA. Stessa famiglia di pesi, due runtime: GGUF in locale, FP8 nel cloud. La decisione di moderazione resta comunque dalla tua parte.

Il confine di sicurezza — leggi questo prima di scaricare.

L'allineamento alla sicurezza di questo modello è stato sostanzialmente rimosso. Esaudirà richieste dannose, non etiche, offensive o illegali che il Qwen3.8-27B di base rifiuterebbe, e non dispone di barriere di sicurezza integrate significative. È rilasciato esclusivamente per ricerca legittima — interpretabilità, studio dei meccanismi di rifiuto, red-teaming, valutazione della robustezza e test delle barriere di sicurezza. Ti assumi piena responsabilità e ogni obbligo di risarcimento per come lo utilizzi e per tutto ciò che genera, e non devi distribuirlo agli utenti finali o metterlo in produzione senza aggiungere i tuoi livelli di sicurezza, moderazione e prevenzione degli abusi. Gli autori non accettano alcuna responsabilità. La licenza è Apache 2.0.

A safety-boundary card with two columns: under Research use it lists refusal-mechanism study, interpretability, red-teaming, robustness evaluation and guardrail testing; under Never deploy it lists end-user chatbots, production apps and consumer services, with a warning strip reading 'No built-in guardrails — the model will comply with requests the base model refuses' and a footer reading 'Apache 2.0 · research-only · you assume full responsibility and liability'.

Il comportamento misurato dice cosa costa essere "non censurati". Dalla suite di valutazione della sicurezza della scheda del modello — eseguita sulla build FP8 e datata 15 agosto 2026, cioè i pesi che questa GGUF converte: il rifiuto di prompt dannosi scende dal 64–99% della base allo 0–6% sui pesi abliterati, il rifiuto eccessivo di prompt benigni scende dal 5,6% allo 0,4%, e i punteggi di capacità restano entro ±1,3 punti dalla base. Quei numeri sono il motivo per cui questa classe di modelli è un legittimo oggetto di ricerca — e sono anche l'avvertimento.

Questo articolo non contiene volutamente prompt dannosi. Se stai valutando il modello, esegui i benchmark di rifiuto standard — AdvBench, HarmBench, StrongREJECT, XSTest-safe — e leggi tu stesso i numeri. Questa è la modalità autorizzata per studiare un modello senza rifiuti.

Quando questa build è la risposta sbagliata

1. Vuoi un assistente normale.Modello sbagliato. Non ha protezioni e soddisfarà richieste dannose. Usa invece il Qwen3.8-27B allineato.

2. Qualsiasi cosa metteresti davanti agli utenti finali. Modello sbagliato a prescindere dall'intenzione. Apache 2.0 non trasferisce la tua responsabilità, e distribuire un modello senza guardrail agli utenti non è una strategia di deployment.

3. Sei su Apple Silicon. Il GGUF funzionerà, ma la conversione MLX del modello base è la soluzione più naturale — consulta la nostra guida MLX separata.

4. Non vuoi affatto eseguirlo. Usa la versione ospitata — stessi pesi, niente 17 GB di VRAM e lo stesso accesso riservato alla sola ricerca.

Il risultato finale

"Qwen 3.8 27B uncensored GGUF" ha una risposta, ed è un download concreto: Qwen3.8-27B-Uncensored-GGUF — F16 più 12 livelli di quantizzazione per llama.cpp, i pesi abliterati dalla nostra build FP8, contesto 262K, visione e MTP, sotto Apache 2.0 e solo per ricerca. Scegli Q4_K_M su una scheda da 24 GB, aggiorna llama.cpp a una versione successiva a maggio 2026, ed eseguilo come server locale compatibile con OpenAI. È uno strumento di ricerca per studiare i rifiuti e testare i guardrail — non un chatbot, e non qualcosa da distribuire. I pesi sono gratuiti; la responsabilità di ciò che ne fai è interamente tua.

Per ricerca legittima, l'F16 e tutti i 12 livelli di quantizzazione sono su Hugging Face: Scarica il GGUF da Hugging Face

© 2026 OrcaRouter

Per i provider

Gestisci una piattaforma di inferenza? Porta i tuoi modelli su OrcaRouter.

Contattaci

Unisciti alla community

DiscordEmailXGitHubYouTube