
Abliteration, Explicada: Como a Remoção de Recusas Funciona Sem Qualquer Treinamento
- typesafeNOVOTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 por 1M de tokens · 1009 tok/s
- OpenAINOVOOpenAI: GPT-6 Luna2026-09-2237Inteligência
- OpenAINOVOOpenAI: GPT-6 Sol2026-09-2248Inteligência
- AnthropicNOVOAnthropic: Claude Opus 5.52026-09-2258Inteligência
- xAINOVOGrok 4.72026-09-2146Inteligência
- OrcaNOVOOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 por 1M de tokens · 195 tok/s
- OrcaNOVOOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 por 1M de tokens · 1189 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Inteligência
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Inteligência77Código
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Inteligência76Código
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Inteligência76Código
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Inteligência82Código
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 por 1M de tokens · 22 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 por 1M de tokens · 108 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Inteligência72Código
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 por 1M de tokens · 220 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Inteligência75Código
- obsidianQwen3.8 27B2026-08-1534Inteligência68Código
- DeepSeekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Inteligência69Código
- xAISpaceXAI: Grok 4.62026-08-1244Inteligência77Código
Abliteration remove o comportamento de recusa de um LLM — o reflexo de "Não posso ajudar com isso" — com uma edição de pesos e sem rodada de treinamento. Funciona porque a recusa é mediada por uma única direção no fluxo residual do modelo: encontre essa direção, subtraia-a das matrizes que escrevem no fluxo, e o modelo para de recusar enquanto mantém suas capacidades. O exemplo público mais claro é Qwen3.8 27B Uncensored (Aggressive), cujo cartão do modelo mostra a recusa a prompts prejudiciais caindo de 99,0% para 0,0% no AdvBench, enquanto o MMLU na verdade sobe um décimo de ponto. É assim que o mecanismo funciona, o que dizem os números medidos e onde está o limite.
Isto não é fine-tuning, não é RLHF e não é um prompt de jailbreak. Abliteração é um resultado de interpretabilidade transformado em álgebra linear: um artigo de 2024 mostrou que uma direção na representação interna controla um comportamento que o treinamento de segurança gastou um esforço enorme para instalar, e que você pode desativá-lo editando os pesos diretamente. Como a edição é uma projeção, ela é barata, reproduzível em uma única GPU e deixa um checkpoint normal e compartilhável — por isso as builds abliteradas de modelos abertos, incluindo a família Qwen3.8-27B, tornaram-se a forma padrão de produzir checkpoints de pesquisa "não censurados".
A direção de recusa: um vetor em um fluxo de muitos milhares de dimensões
Dentro de um transformador, cada token passa por um fluxo residual — a representação corrente da qual as camadas leem e na qual escrevem. Os blocos de atenção e MLP de cada camada recebem o fluxo como entrada e adicionam sua saída de volta a ele. O fluxo é efetivamente a memória de trabalho do modelo: um vetor por posição de token, com dimensão igual à largura do modelo.
O artigo de 2024 que deu início a tudo isso — Andy Arditi e colegas, "A recusa em modelos de linguagem é mediada por uma única direção" (arXiv:2406.11717, NeurIPS 2024) — mediu como são esses vetores de fluxo quando um modelo de chat está prestes a recusar versus quando ele obedece. Em 13 modelos de chat de peso aberto de 1,8B a 72B parâmetros, a resposta foi surpreendentemente consistente: a diferença é essencialmente uma única direção. No token final, o fluxo residual tem um grande componente ao longo de uma única direção de recusa quando o modelo está recusando, e quase nenhum quando está obedecendo. A geometria se alinha entre as categorias de dano, e é por isso que a projeção se concentra no primeiro vetor singular em vez de se espalhar por todo um subespaço.
Para encontrar essa direção, você coleta ativações em dois conjuntos de prompts — prejudiciais e inofensivos — e calcula a média dos resíduos do último token para cada conjunto. A direção de recusa é aproximadamente mean(harmful) − mean(harmless), normalizada para comprimento unitário. O artigo original apresentou isso com sondagem linear; builds de produção como Qwen3.8-27B-Uncensored-FP8 estimam uma única direção (k=1) como uma diferença de médias mascarada por ativações massivas dos resíduos do último token de prompts prejudiciais e inofensivos. Sem rótulos além da divisão prejudiciais/inofensivos, sem gradiente, sem treinamento.
A edição: subtrair a direção de cada matriz que escreve no fluxo.
Depois de ter a direção de recusa r — um vetor unitário no fluxo residual — a intervenção é uma projeção de rank 1. Toda matriz de pesos cuja saída é adicionada ao fluxo residual pode ser "limpa" de r:
W' = W − r(rᵀW)
Em palavras: calcule o componente de saída de cada matriz que aponta na direção de r e remova-o. As matrizes que escrevem no fluxo são as projeções de saída — a projeção de saída da atenção (o_proj), a projeção descendente do MLP (down_proj) e o espaço linha do embedding de tokens. A edição roda em float32, leva minutos em uma GPU e não precisa de otimizador nem de dados de treinamento além dos pares de ativação que você já coletou.
Há duas maneiras de remover uma direção, e vale a pena mantê-las separadas:
• Ablação de ativação — intercepte o forward pass e subtraia o componente r das ativações atuais. Reversível, sem alterar pesos; ideal para experimentos que comparam recusa e conformidade no mesmo checkpoint.
• Ortogonalização de pesos — aplicar a projeção aos próprios pesos, produzindo um checkpoint permanente e compartilhável. É a isso que "abliteration" se refere, e é isso que vem nos repositórios de modelos não censurados.

A ortogonalização é deliberadamente direta. Ela remove o componente de recusa dos pesos e nada mais. Não pode adicionar conhecimento, melhorar o raciocínio ou tornar o modelo mais verdadeiro — por isso um modelo abliterado se comporta como sua base, sem o reflexo de recusa.
Como 131 matrizes se parecem em um build real: Qwen3.8-27B-Uncensored-FP8
Para tornar isso concreto: Qwen3.8-27B-Uncensored-FP8 (Hugging Face, publicado em 2026-08-15, Apache 2.0) é uma versão abliterada do Qwen3.8-27B. O Qwen3.8-27B é um modelo de atenção híbrida — 16 camadas de atenção completa mais 48 camadas lineares Gated DeltaNet, 64 camadas no total, além de uma cabeça de predição de múltiplos tokens (MTP). A versão removeu por ortogonalização a direção de recusa de 131 matrizes de escrita residual:
• self_attn.o_proj — 17 matrizes (16 camadas de atenção completa + MTP)
• linear_attn.out_proj — 48 matrizes (as camadas Gated DeltaNet)
• mlp.down_proj — 65 matrizes (64 camadas + MTP)
• embed_tokens (espaço de linhas) — 1 matriz
A direção de recusa foi estimada na camada 38 — round(0.6 × 64), a camada onde a direção está mais concentrada — e o vazamento residual máximo após a edição foi de 1,8e-2. A torre de visão foi deixada intocada, e a cabeça MTP foi abliterada de forma consistente com o corpo, para que a decodificação especulativa não reintroduza recusas a jusante. A edição foi calculada em float32 e depois requantizada para block-FP8 usando o mesmo esquema do checkpoint oficial Qwen3.8-27B-FP8; a build relata 99,9% de códigos FP8 idênticos aos do checkpoint oficial, e é assim que você sabe que a requantização não embaralhou a edição.
Medido: a recusa colapsa, as capacidades se mantêm.
Todos os números abaixo são da ficha técnica do modelo Qwen3.8-27B-Uncensored-FP8, publicada em 2026-08-15 e avaliada com vLLM. São relatados pelo fornecedor — não reproduzidos de forma independente — e são o antes/depois público mais completo de uma edição por abliteração disponível.
Recusa em benchmarks de prompts prejudiciais, raciocínio desligado (taxa de recusa; menor significa mais sem censura):
• AdvBench (n=100): 99.0% → 0.0%
• StrongREJECT (n=150): 97.3% → 2.0%
• Padrão HarmBench (n=150): 98,7% → 2,7%
• MaliciousInstruct (n=100): 99.0% → 0.0%
• JailbreakBench prejudicial (n=100): 94.0% → 0.0%
• SimpleSafetyTests (n=50): 64.0% → 6.0%
Em toda a suíte, a recusa a prompts prejudiciais cai de 64–99% na base para 0–6% após a edição. Com o pensamento ativado (enable_thinking=true), a recusa restante é ainda menor — ≤1,7% em todos os lugares, com a maioria dos benchmarks em exatamente 0%. A assimetria é informativa: a direção da recusa vive principalmente no caminho rápido, sem pensamento; portanto, uma vez removida da cabeça de saída, resta pouco para o traço de raciocínio esbarrar.
Recusa excessiva — prompts benignos que o modelo base recusa incorretamente — também cai: XSTest-safe (n=250) vai de 5,6% para 0,4%. Remover a direção não apenas interrompe recusas prejudiciais; também impede o modelo de recusar solicitações inofensivas que apenas pareciam arriscadas. Esse número é um argumento sutil de que parte da "segurança" do modelo base é um custo de falso alarme.
Capacidades, todas dentro de ±1,3 pontos da base:
• MMLU (0-shot letra): 84.3% → 84.7% (+0,4)
• GSM8K (CoT): 90.0% → 88.7% (−1.3)
• MMLU-Pro (CoT): 77.6% → 76.8% (−0.8)
• CMMLU (0-shot): 81.4% → 80.8% (−0.6)
A perplexidade do WikiText-2 é 6,96. Em outras palavras, a edição é cirurgicamente direcionada: remove um comportamento que foi instalado sobre o conhecimento e deixa o conhecimento — medido, pelo menos, nessas avaliações — essencialmente intacto.

As advertências honestas
Três coisas que os números do título não lhe contam. Primeiro, abliteration não é um mero interruptor de ligar/desligar. Cerca de 30–50% das respostas a prompts prejudiciais ainda antepõem um breve aviso de segurança — o modelo atende, mas uma frase de ressalva sobrevive como artefato do treinamento. A edição unidirecional não elimina todos os vestígios do comportamento aprendido durante o treinamento.
Em segundo lugar, a recusa é codificada de forma redundante. Uma direção remove a maior parte dela, mas algumas categorias estão mais profundamente enraizadas do que outras, e uma ablação agressiva demais pode fazer o modelo degenerar em palavras sem sentido — a abliteração excessiva é um modo de falha real, não teórico. Você está girando um botão, e o botão tem um piso.
Terceiro, o custo de capacidade é dependente da direção e da camada. Esta versão ficou dentro de ±1,3 pontos porque a direção foi estimada na camada correta e a projeção foi aplicada de forma consistente. Mova a estimativa para a camada errada, ou force mais a projeção, e o mesmo método pode prejudicar o raciocínio de forma mensurável. O resultado não é garantido pelo método — é conquistado pela construção.
Quando a abliteration é a ferramenta errada
Se você quer um assistente que siga as diretrizes, não faça abliteração — você quer o checkpoint base alinhado, não uma versão sem recusas. Se você quer avaliar um Qwen3.8-27B sem recusas sem baixar 30GB de pesos, a família está disponível no OrcaRouter (obsidian/Qwen3.8-27B, $0,40 de entrada / $4,21 de saída por 1M de tokens, contexto de 262K, listado em 2026-08-15), com a variante totalmente desbloqueada com acesso restrito para pesquisadores de segurança e red teams.
Se você quiser recusa seletiva — recusar armas, responder a todo o resto — {{1}}um LoRA ou fine-tune com DPO, ou uma proteção via system prompt, oferece uma superfície de controle{{/1}}. {{2}}Abliteration é uma edição bruta e global; ela não consegue separar uma única categoria{{/2}}.
Se você quiser experimentar de forma reversível, comece com ablação de ativação no momento da inferência em vez de editar os pesos. Você pode comparar recusa e conformidade no mesmo checkpoint e só se comprometer com a edição dos pesos se o comportamento for o que você deseja.
O limite de segurança — leia isto antes de usá-lo
Um modelo abliterado não tem proteções integradas. Para um modelo alinhado, o mecanismo de recusa é a salvaguarda; removê-lo faz com que os pesos brutos respondam a tudo o que o modelo base sabe responder. Nada na projeção adiciona segurança, e nada a jusante captura a saída.
Os usos legítimos são os de pesquisa: interpretabilidade (estudar onde a recusa vive nos pesos e o que mais essa direção controla), red teaming e avaliação de salvaguardas (testar suas próprias camadas de segurança contra um modelo que não se autocensura), e medição de excesso de segurança (a queda de 5,6% → 0,4% no XSTest quantifica com que frequência modelos alinhados recusam entradas benignas). Em todos os casos, o modelo é o objeto de estudo, não o entregável.
A fronteira não é decorativa:
• Somente para pesquisa — não para produção, produtos de uso final ou ferramentas internas.
• Sem salvaguardas — as saídas não são filtradas; você é responsável por elas e pelas consequências.
• Uma licença não é um certificado de segurança — Apache 2.0 permite o uso; não o abençoa.
Ambos os repositórios Hugging Face — Qwen3.8-27B-Uncensored-FP8 e o reempacotamento GGUF Qwen3.8-27B-Uncensored-GGUF (publicado em 2026-08-16) — são restritos: você reconhece o limite de uso exclusivo para pesquisa antes de o download começar.

Conclusão
A abliteration é um dos resultados mais limpos em interpretabilidade de LLMs: uma única direção linear no fluxo residual medeia um comportamento que o treinamento de segurança gastou enorme poder computacional para instalar, e uma projeção de peso de rank-1 pode removê-lo sem uma rodada de treinamento. O caso medido — Qwen3.8-27B-Uncensored-FP8 — mostra que a edição é cirúrgica: a recusa cai de 64–99% para 0–6%, o excesso de recusa cai para uma fração do que era (5,6% → 0,4%), e as capacidades se mantêm dentro de ±1,3 pontos. Isso também mostra exatamente por que esta é uma ferramenta de pesquisa e não um produto: sem guardrails, com avisos residuais e uma fronteira que coloca a responsabilidade em você. Use-a para entender a recusa, testar seus guardrails e medir o excesso de segurança — não para colocá-la diante dos usuários.
Qwen3.8-27B-Uncensored-FP8 é um artefato de pesquisa sob a licença Apache 2.0 — com acesso restrito, não é um serviço hospedado aqui. Baixe os pesos no Hugging Face
