
LLM non censurato, spiegato: la tecnica dell'abliteration, l'uso nella ricerca e il limite che non si oltrepassa
- obsidianNUOVOQwen3.8 27B Uncensored (Aggressive)2026-08-1552Intelligenza68Codice
- qwenNUOVOQwen: Qwen3.8 27B (free)2026-08-1354 tok/s
- deepseekNUOVODeepSeek: DeepSeek V4 Pro 08132026-08-1253Intelligenza69Codice
- grokNUOVOSpaceXAI: Grok 4.62026-08-1261Intelligenza77Codice
- metaNUOVOMeta: Muse Spark 1.22026-08-0557Intelligenza72Codice
- qwenQwen: Qwen3.8 Max2026-08-0358Intelligenza72Codice
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3152Intelligenza69Codice
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 per 1M di token · 252 tok/s
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2463Intelligenza78Codice
- googleGoogle: Gemini 3.6 Flash2026-07-2152Intelligenza69Codice
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2137Intelligenza49Codice
- metaMeta: Muse Spark 1.12026-07-1653Intelligenza71Codice
- kimiMoonshotAI: Kimi K32026-07-1560Intelligenza76Codice
- openaiOpenAI: GPT-5.6 Luna2026-07-0952Intelligenza71Codice
- openaiOpenAI: GPT-5.6 Terra2026-07-0957Intelligenza77Codice
- openaiOpenAI: GPT-5.6 Sol2026-07-0961Intelligenza77Codice
- grokxAI: Grok 4.52026-07-0856Intelligenza72Codice
- tencentTencent: Hy32026-07-0642Intelligenza59Codice
Un LLM non censurato è un modello linguistico il cui comportamento di rifiuto — la parte del modello che declina una richiesta invece di rispondere — è stato deliberatamente rimosso. La maggior parte di essi sono costruiti tramite abliterazione: un ricercatore individua la singola direzione interna che media il rifiuto e la cancella dai pesi, lasciando il resto del modello in gran parte intatto. Il risultato è un modello che risponde dove un modello normale direbbe di no, ed è esattamente per questo che viene studiato ed esattamente per questo che non è destinato alla produzione. Abbiamo rilasciato una build di questo tipo, Qwen3.8-27B-Uncensored-FP8, una versione abliterata e quantizzata FP8 di Qwen3.8 27B, su Hugging Face con licenza Apache 2.0 come artefatto di sola ricerca. Questa pagina è la spiegazione della categoria: cosa sono questi modelli, la ricerca che li giustifica, come lavorarci in sicurezza e dove si trova il confine.
Una certa inquadratura mantiene onesta l'intera categoria, quindi la metto subito in chiaro: un modello non censurato non è più intelligente, più veritiero o più capace del modello da cui deriva. Sono gli stessi pesi con un solo comportamento sottratto. Tutto ciò che sa ancora, lo ha sempre saputo — ciò che è cambiato è che non rifiuta più. Questo lo rende un oggetto genuinamente utile per la ricerca sulla sicurezza, e una cosa genuinamente pericolosa da implementare. Entrambe le metà di quella frase sono portanti, e il resto di questa pagina spiega entrambe.
Cosa significa davvero "non censurato"
• Oppure accedici tramite la nostra scheda del modello, che contiene i dettagli sui prezzi e i benchmark.
La tecnica deriva da una scoperta di interpretabilità del 2024. In "Refusal in Language Models Is Mediated by a Single Direction" (Arditi et al., arXiv:2406.11717, NeurIPS 2024), gli autori hanno mostrato che in 13 modelli chat open source con dimensioni da 1,8B a 72B parametri, il rifiuto è governato approssimativamente da un sottospazio unidimensionale del flusso residuo — lo stato interno che trasporta informazioni tra i livelli. Rimuovi quella direzione e il modello smette di rifiutare; aggiungila di nuovo e il modello rifiuta anche richieste innocue.
Abliteration operazionalizza questa scoperta: stima la direzione, poi la rimuove tramite ortogonalizzazione dalle matrici di peso che scrivono nel flusso residuo. Nella nostra build, Qwen3.8-27B-Uncensored-FP8, la direzione di rifiuto è stata stimata in un singolo strato e rimossa da 131 matrici che scrivono nel flusso residuo, lasciando intatta la torre visiva. Ciò che sopravvive è la stessa conoscenza, lo stesso ragionamento e lo stesso contesto di 262.144 token — con il rifiuto rimosso. E per essere precisi sull'etichetta: "uncensored" non significa allineato o sicuro. Significa che la guardia è disattivata. Torneremo su ciò che questo richiede da te.
La ricerca che li ha creati
Il risultato sulla direzione di rifiuto ha fatto due cose contemporaneamente. Scientificamente, ha spiegato un comportamento di sicurezza a livello meccanicistico: esiste un circuito reale e individuabile che fa dire di no a un modello. In pratica, ha mostrato quanto fragile possa essere l'allineamento — una singola modifica di rango uno ai pesi può disattivare il comportamento, senza bisogno di fine-tuning. Non è un difetto del modello di un singolo laboratorio; gli autori lo hanno riprodotto in più di una dozzina di modelli chat.
Entro il 2026 la tecnica è diventata una pipeline a comando singolo, un fatto a doppio taglio. Heretic, una libreria open-source, stima le direzioni di rifiuto per livello e le ortogonalizza rispetto alle proiezioni di attenzione e MLP; un rapporto di maggio 2026 stimava la rimozione delle barriere di sicurezza per Llama 3.3 di Meta in circa 10 minuti e per Gemma 4 di Google in circa 90 minuti, con più di 3.500 modelli derivati e oltre 13 milioni di download cumulativi. Abliterix (Wu Wangzhang) segue una strada più prudente: estrae una direzione di rifiuto da 800 prompt dannosi e 800 benigni, applica una proiezione ortogonale, consegna la modifica come adattatori LoRA di rango 1, così i pesi di base rimangono intatti, e riporta il tasso di rifiuto e la divergenza KL, così il costo in termini di capacità rimane visibile. Su un modello Qwen3.5 da 0.8B ha riportato 0 rifiuti su 200 prompt dannosi.
Leggete quel paragrafo come farebbe un ricercatore della sicurezza. Lo scopo di costruire questi strumenti non è che qualcuno debba rimuovere le salvaguardie di un modello per divertimento. Il punto è che la rimozione è banale e pubblica — quindi misurarla, studiarne il funzionamento e costruire salvaguardie che le sopravvivano è di per sé un programma di ricerca. Questo è red-teaming in senso white-box: non si può difendere un sistema finché non si sa quanto sia facile romperlo.
Perché i modelli non censurati sono diventati popolari nel 2026
Tre forze sono confluite. In primo luogo, l'ondata dei pesi aperti: Qwen3.8 27B e i suoi omologhi sono distribuiti con licenze permissive, e l'abliteration non richiede una sessione di addestramento — modifichi i pesi e li ri-quantizzi. In secondo luogo, gli strumenti sono maturati da codice di ricerca a librerie con un solo comando, così un ingegnere competente può produrre una build in un pomeriggio. In terzo luogo, Hugging Face è diventato il canale di distribuzione, il che significa che l'adozione è misurabile.
Il nostro dato: Qwen3.8-27B-Uncensored-FP8, rilasciato il 15 agosto 2026, aveva 257 like e 4.285 download in circa un giorno (verificato il 16 agosto). Non è che decine di migliaia di persone vogliano implementare un modello senza filtri. È che molti ricercatori e ingegneri vogliono studiarne uno — e i numeri dei download sono la curva di domanda di quella curiosità.
A cosa serve: gli usi legittimi a scopo di ricerca
Ecco l'elenco difendibile, ed è l'intero elenco. Se un uso non è presente, presumi che non sia legittimo:
• Interpretabilità — studiare cosa sia effettivamente il circuito di rifiuto, dove risiede e perché rimuovere una direzione cambia il comportamento.
• Red-teaming e valutazione delle guardrail — costruire un livello di moderazione e testare se cattura ciò che produce un modello a cui è stato rimosso il rifiuto.
• Misurazione dell'oversafety — quantificare la frequenza con cui i modelli di base rifiutano richieste benigne, separando questo aspetto dalla sicurezza reale.
• Ricerca sulla robustezza — misurare quanto facilmente l'allineamento può essere rimosso, un'informazione essenziale per chiunque progetti il fine-tuning della sicurezza.
• Esperimenti di sicurezza controllati — suite di benchmark come AdvBench e JailbreakBench esistono proprio affinché il comportamento di rifiuto possa essere misurato in modo standardizzato e riproducibile.

Tutte queste condividono una proprietà: il modello è l'oggetto di studio, non il prodotto finale. Il risultato di questa ricerca è un paper, un risultato di benchmark o un guardrail migliore — mai un servizio.
Come gestirne uno in modo responsabile (se fai davvero ricerca)
Se hai un motivo legittimo per lavorare con un modello abliterato, le regole operative sono semplici:
Eseguilo localmente, in sandbox e idealmente air-gapped. Nessun endpoint pubblico, nessun servizio di chat, nessun server condiviso.
• Servitelo con strumenti standard — vLLM o llama.cpp — come fareste con qualsiasi modello a pesi aperti. La nostra build è una quantizzazione block-FP8 che gira sul percorso kernel FP8 standard di vLLM, mantenendo intatti i suoi 262K di contesto, la modalità di pensiero e il tool calling.
• Misura, non limitarti a chiacchierare. Quantifica il rifiuto su una suite di benchmark con prompt dannosi e confrontalo con il modello base; quantifica il rifiuto eccessivo su prompt benigni; riporta la divergenza KL così la deriva delle capacità è visibile. Questa è la differenza tra un esperimento e un aneddoto.

• Mantenere gli output in un ambiente controllato. Registrare, rivedere e distruggere piuttosto che propagare.
• Se stai valutando i tuoi guardrail, metti il tuo strato di moderazione davanti al modello e testalo — questo è l'intero scopo dell'esercizio.
Per la scheda tecnica completa, la tabella dei benchmark e i dettagli di hosting, apri la nostra model card — è il riferimento canonico per questa build.
Il confine della sicurezza: cosa significa "solo ricerca"
Ecco la parte che non può essere ribadita abbastanza spesso. Un modello abliterato non ha protezioni integrate significative. Esaudirà richieste che un modello normale rifiuterebbe. Questa è la caratteristica, ed è anche il rischio — ed è per questo che ogni rilascio serio di uno di essi, incluso il nostro, porta con sé gli stessi avvertimenti.
• Nessun guardrail integrato. Il comportamento di rifiuto è sparito; non comportarti come se non fosse così.
• Non per gli utenti finali, non per la produzione. Un prodotto, un chatbot, un'API che serve il pubblico, uno strumento interno su cui contano i tuoi colleghi — nessuno di questi è il posto giusto per un modello senza censura.
• La responsabilità è tua. Rilasciamo Qwen3.8-27B-Uncensored-FP8 sotto licenza Apache 2.0, che è permissiva riguardo alla redistribuzione. Una licenza non è un certificato di sicurezza: il codice permissivo non cambia ciò che il modello farà e non trasferisce il dovere di diligenza.
• Se lo usi, possiedi i risultati. L'ambiente controllato è compito tuo; così come lo è decidere cosa dargli in pasto e cosa no, e cosa fare con ciò che ne viene fuori.

Quando un modello non censurato è la risposta sbagliata
Per dirla chiaramente: se dall'altra parte del modello c'è una persona, un modello non censurato è la risposta sbagliata. Qualsiasi prodotto che debba essere affidabile, qualsiasi assistente il cui giudizio conti, qualsiasi cosa in cui un rifiuto sia il comportamento corretto — usa invece il modello base. Il motivo per cui Qwen3.8 27B esiste nella sua forma normale è proprio che il rifiuto è una funzionalità, non un bug, per quasi ogni uso reale. La build abliterata esiste per i limitati casi di ricerca di cui sopra e per nient'altro.
In conclusione. Un LLM senza censure non è una categoria di prodotto e non è un espediente. È un artefatto di ricerca con un vero lignaggio scientifico — dalla scoperta della direzione del rifiuto agli strumenti automatizzati del 2026 — e un confine di distribuzione netto. I modelli sono reali, la domanda è misurabile, e gli usi legittimi sono altrettanto reali: interpretabilità, red-teaming, valutazione dei guardrail ed esperimenti di sicurezza controllati. La linea tra studiare il guardrail e disattivarlo per qualcun altro è il punto centrale di questa pagina, e non si sposta.
Questa build esatta è pubblica sotto Apache 2.0 — solo a scopo di ricerca. Puoi scaricare i pesi su Hugging Face
Confrontati in questo articolo1
Rilevato da questo articolo · Benchmark: Artificial Analysis · aggiornato ogni giorno
