
LLM não censurado, explicado: a técnica de abliteração, o uso em pesquisa e a linha que você não cruza
- obsidianNOVOQwen3.8 27B Uncensored (Aggressive)2026-08-1552Inteligência68Código
- qwenNOVOQwen: Qwen3.8 27B (free)2026-08-1354 tok/s
- deepseekNOVODeepSeek: DeepSeek V4 Pro 08132026-08-1253Inteligência69Código
- grokNOVOSpaceXAI: Grok 4.62026-08-1261Inteligência77Código
- metaNOVOMeta: Muse Spark 1.22026-08-0557Inteligência72Código
- qwenQwen: Qwen3.8 Max2026-08-0358Inteligência72Código
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3152Inteligência69Código
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 por 1M de tokens · 252 tok/s
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2463Inteligência78Código
- googleGoogle: Gemini 3.6 Flash2026-07-2152Inteligência69Código
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2137Inteligência49Código
- metaMeta: Muse Spark 1.12026-07-1653Inteligência71Código
- kimiMoonshotAI: Kimi K32026-07-1560Inteligência76Código
- openaiOpenAI: GPT-5.6 Luna2026-07-0952Inteligência71Código
- openaiOpenAI: GPT-5.6 Terra2026-07-0957Inteligência77Código
- openaiOpenAI: GPT-5.6 Sol2026-07-0961Inteligência77Código
- grokxAI: Grok 4.52026-07-0856Inteligência72Código
- tencentTencent: Hy32026-07-0642Inteligência59Código
Um LLM sem censura é um modelo de linguagem cujo comportamento de recusa — a parte do modelo que recusa um pedido em vez de respondê-lo — foi deliberadamente removido. A maioria é construída por abliteração: um pesquisador encontra a única direção interna que media a recusa e a apaga dos pesos, deixando o restante do modelo em grande parte intacto. O resultado é um modelo que responde onde um modelo normal diria não, o que é exatamente por que ele é estudado e exatamente por que não é para produção. Disponibilizamos uma dessas construções, Qwen3.8-27B-Uncensored-FP8, uma versão abliterada e quantizada em FP8 do Qwen3.8 27B, no Hugging Face sob Apache 2.0 como um artefato apenas para pesquisa. Esta página é o explicador da categoria: o que são esses modelos, a pesquisa que os justifica, como trabalhar com eles com segurança e onde fica o limite.
Uma formulação mantém toda a categoria honesta, então deixe-me apresentá-la logo no início: um modelo sem censura não é mais inteligente, mais verdadeiro ou mais capaz do que o modelo do qual veio. São os mesmos pesos com um comportamento subtraído. Tudo o que ele ainda sabe, sempre soube — o que mudou é que ele não recusa mais. Isso o torna um objeto genuinamente útil para pesquisa de segurança e algo genuinamente inseguro de se implantar. Ambas as metades dessa frase são fundamentais, e o restante desta página explica ambas.
O que "sem censura" realmente significa
• Ou acesse-o através da nossa ficha do modelo, que contém os detalhes de preços e benchmarks.
A técnica vem de uma descoberta de interpretabilidade de 2024. Em "Refusal in Language Models Is Mediated by a Single Direction" (Arditi et al., arXiv:2406.11717, NeurIPS 2024), os autores mostraram que, em 13 modelos de chat abertos variando de 1,8B a 72B de parâmetros, a recusa é governada por aproximadamente um subespaço unidimensional do fluxo residual — o estado interno que carrega informações entre as camadas. Remova essa direção e o modelo para de recusar; adicione-a de volta e o modelo recusa também solicitações inofensivas.
A abliteration operacionaliza essa descoberta: estimar a direção e então ortogonalizá-la, removendo-a das matrizes de pesos que escrevem no fluxo residual. Em nossa própria build, Qwen3.8-27B-Uncensored-FP8, a direção de recusa foi estimada em uma única camada e removida de 131 matrizes de escrita residual, deixando a torre de visão intocada. O que sobrevive é o mesmo conhecimento, o mesmo raciocínio e o mesmo contexto de 262.144 tokens — com a recusa removida. E, para ser preciso quanto ao rótulo: "uncensored" não significa alinhado ou seguro. Significa que a proteção está desligada. Voltaremos ao que isso exige de você.
A pesquisa que os criou
O resultado da direção de recusa fez duas coisas ao mesmo tempo. Cientificamente, explicou, em termos mecanicistas, um comportamento de segurança: existe um circuito real e localizável que faz o modelo dizer não. Na prática, mostrou como o alinhamento pode ser frágil — uma única edição de posto um nos pesos pode desativar o comportamento, sem necessidade de ajuste fino. Isso não é uma falha do modelo de um único laboratório; os autores o reproduziram em mais de uma dúzia de modelos de chat.
Até 2026, a técnica se tornou um pipeline de um único comando, o que é uma faca de dois gumes. Heretic, uma biblioteca de código aberto, estima direções de recusa por camada e as ortogonaliza para removê-las das projeções de atenção e MLP; um relatório de maio de 2026 estimou a remoção das salvaguardas do Llama 3.3 da Meta em cerca de 10 minutos e a do Gemma 4 do Google em cerca de 90 minutos, com mais de 3.500 modelos derivados e mais de 13 milhões de downloads acumulados. Abliterix (Wu Wangzhang) adota um caminho mais cauteloso: extrai uma direção de recusa de 800 prompts prejudiciais e 800 benignos, aplica uma projeção ortogonal, disponibiliza a edição como adaptadores LoRA de rank 1 para que os pesos base permaneçam intactos e relata a taxa de recusa e a divergência KL para que o custo de capacidade continue visível. Em um modelo Qwen3.5 de 0,8B, ele relatou 0 recusas em 200 prompts prejudiciais.
Leia esse parágrafo como um pesquisador de segurança leria. O objetivo de construir essas ferramentas não é que alguém deva remover as salvaguardas de um modelo por diversão. A questão é que a remoção é trivial e pública — então medi-la, estudar como funciona e construir salvaguardas que sobrevivam a ela é, por si só, um programa de pesquisa. Isso é red-teaming no sentido white-box: você não pode defender um sistema até saber o quão fácil é quebrá-lo.
Por que os modelos sem censura ficaram em alta em 2026
Três forças convergiram. Primeiro, a onda de pesos abertos: o Qwen3.8 27B e seus pares são lançados sob licenças permissivas, e a abliteração não exige execução de treinamento — você edita os pesos e re-quantiza. Segundo, as ferramentas amadureceram de código de pesquisa para bibliotecas de comando único, então um engenheiro competente consegue produzir um build em uma tarde. Terceiro, o Hugging Face se tornou o canal de distribuição, o que significa que a tração é mensurável.
Nosso próprio ponto de dados: Qwen3.8-27B-Uncensored-FP8, lançado em 15 de agosto de 2026, estava com 257 curtidas e 4.285 downloads em cerca de um dia (verificado em 16 de agosto). Não é que dezenas de milhares de pessoas queiram implantar um modelo sem salvaguardas. É que muitos pesquisadores e engenheiros querem estudar um — e os números de downloads são a curva de demanda por essa curiosidade.
Para que serve: os usos legítimos de pesquisa
Aqui está a lista defensável, e é a lista completa. Se um uso não estiver nela, considere que não é legítimo:
• Interpretabilidade — estudar o que o circuito de recusa realmente é, onde ele vive e por que remover uma direção muda o comportamento.
• Red-teaming e avaliação de guardrails — construção de uma camada de moderação e teste se ela captura o que um modelo sem recusas produz.
— Medição de excesso de segurança — quantificar com que frequência os modelos de base recusam solicitações benignas, e separar isso da segurança real.
• Pesquisa de robustez — medir a facilidade com que o alinhamento pode ser removido, informação essencial para quem projeta fine-tuning de segurança.
• Experimentos de segurança controlados — suites de benchmark como AdvBench e JailbreakBench existem precisamente para que o comportamento de recusa possa ser medido de forma padronizada e reproduzível.

Todos estes compartilham uma propriedade: o modelo é o objeto de estudo, não o entregável. O resultado desta pesquisa é um artigo, um resultado de benchmark ou uma salvaguarda melhor — nunca um serviço.
Como executar um com responsabilidade (se você realmente faz pesquisa)
Se você tem um motivo legítimo para trabalhar com um modelo abliterado, as regras de operação são simples:
• Execute localmente, em sandbox e, idealmente, isolado da rede. Sem endpoint público, sem serviço de chat, sem servidor compartilhado.
• Sirva-o com ferramentas padrão — vLLM ou llama.cpp — da mesma forma que você serviria qualquer modelo de pesos abertos. Nossa versão é uma quantização block-FP8 que roda no caminho padrão do kernel FP8 do vLLM, com seu contexto de 262K, alternância de raciocínio e chamada de ferramentas intactos.
• Meça, não apenas converse. Quantifique a recusa em um conjunto de benchmarks de prompts prejudiciais e compare com o modelo base; quantifique a recusa excessiva em prompts benignos; relate a divergência KL para que a deriva de capacidade fique visível. Essa é a diferença entre um experimento e uma anedota.

• Mantenha as saídas em um ambiente controlado. Registre, revise e destrua em vez de propagar.
Se você está avaliando suas próprias salvaguardas, coloque sua camada de moderação na frente do modelo e teste-a — esse é exatamente o objetivo do exercício.
Para a ficha técnica completa, a tabela de benchmarks e os detalhes de hospedagem, abra o nosso model card — essa é a referência canônica para esta build.
O limite de segurança: o que significa "somente para pesquisa"
Eis a parte que não se pode repetir com frequência suficiente. Um modelo abliterado não tem salvaguardas integradas significativas. Ele atenderá a solicitações que um modelo normal recusa. Essa é a característica, e também é o risco — razão pela qual todo lançamento sério de um, incluindo o nosso, traz os mesmos avisos.
• Sem proteções integradas. O comportamento de recusa desapareceu; não se comporte como se ainda existisse.
• Não é para usuários finais, nem para produção. Um produto, um chatbot, uma API que atende o público, uma ferramenta interna em que seus colegas confiam — nenhum desses é o lugar certo para um modelo não censurado.
• A responsabilidade é sua. Disponibilizamos o Qwen3.8-27B-Uncensored-FP8 sob a Apache 2.0, que é permissiva quanto à redistribuição. Uma licença não é um certificado de segurança: código permissivo não muda o que o modelo fará, e não transfere o dever de cuidado.
• Se você usar, você é dono dos resultados. O ambiente controlado é sua responsabilidade; assim como decidir o que você vai ou não fornecer a ele, e o que fazer com o que sai.

Quando um modelo não censurado é a resposta errada
A maneira mais clara de dizer: se há uma pessoa do outro lado do modelo, um modelo sem censura é a resposta errada. Qualquer produto que precise ser confiável, qualquer assistente cujo julgamento importe, qualquer coisa em que uma recusa seja o comportamento correto — use o modelo base. A razão pela qual o Qwen3.8 27B existe em sua forma normal é precisamente porque a recusa é um recurso, não um bug, para quase todos os usos reais. A versão abliterada existe para os casos de pesquisa restritos mencionados acima e para nada mais.
Conclusão. Um LLM sem censura não é uma categoria de produto e não é um hack. É um artefato de pesquisa com uma linhagem científica genuína — desde a descoberta da direção de recusa até as ferramentas automatizadas de 2026 — e um limite rígido de implantação. Os modelos são reais, a demanda é mensurável, e os usos legítimos também são reais: interpretabilidade, red-teaming, avaliação de salvaguardas e experimentos controlados de segurança. A linha entre estudar a salvaguarda e desligá-la para outra pessoa é o propósito central desta página, e ela não muda.
Esta compilação exata é pública sob Apache 2.0 — apenas para pesquisa. Você pode baixar os pesos no Hugging Face
Comparados neste artigo1
Detectado a partir deste artigo · Benchmarks: Artificial Analysis · atualizado diariamente
