
Benchmarks do Qwen3.8-27B-Uncensored: Recusa Colapsa, Capacidade Permanece
- DeepSeekNOVODeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.15 / $0.29 por 1M de tokens
- z-aiNOVOZ.ai: GLM 5.32026-08-1860Inteligência75Código
- obsidianNOVOQwen3.8 27B2026-08-1552Inteligência68Código
- qwenNOVOQwen: Qwen3.8 27B (free)2026-08-13qwen/qwen3.8-27b-free
- deepseekNOVODeepSeek: DeepSeek V4 Pro 08132026-08-1253Inteligência69Código
- grokNOVOSpaceXAI: Grok 4.62026-08-1261Inteligência77Código
- metaMeta: Muse Spark 1.22026-08-0557Inteligência72Código
- qwenQwen: Qwen3.8 Max2026-08-0358Inteligência72Código
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3152Inteligência69Código
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 por 1M de tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2463Inteligência78Código
- googleGoogle: Gemini 3.6 Flash2026-07-2152Inteligência69Código
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2137Inteligência49Código
- metaMeta: Muse Spark 1.12026-07-1653Inteligência71Código
- kimiMoonshotAI: Kimi K32026-07-1560Inteligência76Código
- openaiOpenAI: GPT-5.6 Luna2026-07-0952Inteligência71Código
- openaiOpenAI: GPT-5.6 Terra2026-07-0957Inteligência77Código
- openaiOpenAI: GPT-5.6 Sol2026-07-0961Inteligência77Código
A história do benchmark do Qwen3.8 27B Uncensored (Aggressive) — a versão abliterada do Qwen3.8 27B lançada como checkpoint FP8 em 15 de agosto de 2026 e como compilação GGUF em 16 de agosto — não é que ele ficou mais forte. É que ele parou de recusar. O card do modelo relata que a recusa a prompts prejudiciais caiu de 64–99% na versão base para 0–6% na versão abliterada com o raciocínio desativado, e para 1,7% ou menos com o raciocínio ativado, enquanto todos os benchmarks de capacidade ficam dentro de ±1,3 pontos da base e a perplexidade do WikiText-2 fica em 6,96. Se você está aqui pelos benchmarks do qwen uncensored, esses são os números de destaque: não é um modelo mais inteligente, é um modelo que não recusa.
Essa distinção importa, porque a maior parte do que aparece nos "benchmarks sem censura" é ou uma listinha rasa de pontuações de capacidade ou um post sensacionalista afirmando que o modelo é "melhor". Nenhum dos dois é o que a abliteração faz. Este artigo percorre os dados reais medidos — colapso de recusa, recusa excessiva, retenção de capacidade e perplexidade — o método que os produziu e o limite de segurança que você deve ler antes de tocar nos pesos.
O que uma análise comparativa de benchmarks sem censura realmente mede
Uma análise de modelo comum relata um eixo: capacidade — MMLU, GSM8K, codificação, raciocínio. Um modelo abliterado é interessante em um eixo diferente, e todo o sentido do rótulo "sem censura" é que o eixo de segurança mudou. Portanto, a pergunta útil para Qwen3.8-27B-Uncensored-FP8 não é "é mais inteligente?" mas "quanto custou remover o mecanismo de recusa e quão completamente ele foi removido?"
Três famílias de números precisam ser lidas em conjunto. Taxa de recusa em benchmarks de prompts nocivos — com que frequência o modelo recusa; quanto maior a base, mais visível a remoção. Recusa excessiva em prompts benignos — com que frequência ele recusa erroneamente um pedido inocente; menor é melhor para todos. E retenção de capacidade — se a edição degradou o modelo. Um resumo de benchmark que apenas imprime pontuações de capacidade está respondendo à pergunta errada.
O método: abliteration é uma edição de pesos, não um fine-tuning.
O que separa a abliteração dos pacotes de "jailbreak" da comunidade é onde a mudança reside. Um jailbreak de nível de prompt envolve a entrada; a abliteração edita os pesos. O método aqui é Arditi et al. (2024), "Refusal in Language Models Is Mediated by a Single Direction". A descoberta central é que o comportamento de recusa em muitos modelos é impulsionado por uma única direção no fluxo residual — estime essa direção, remova-a, e o modelo para de recusar sem ser retreinado.
Concretamente, o card descreve a estimativa de uma direção de recusa a partir da diferença média mascarada por ativação massiva dos residuais do último token de exemplos prejudiciais menos inofensivos, na camada 38 (round(0.6 × 64)), usando AdvBench como conjunto prejudicial e Alpaca como conjunto inofensivo. A edição é uma ortogonalização, W′ = W − r(rᵀW), calculada em float32 e aplicada a 131 matrizes de escrita residual — as projeções de saída da atenção, as projeções de saída da atenção linear, as projeções down do MLP e um espaço de linhas do embedding. Nenhuma etapa de treinamento é executada; a torre de visão permanece intocada; a cabeça de decodificação especulativa MTP é abliterada de forma consistente. É por isso que a capacidade sobrevive: remover uma direção é uma intervenção muito mais suave do que fazer fine-tuning do modelo para obedecer.
Recusa colapsa: os números
Medido no build FP8 servido pela vLLM e publicado no card do modelo no Hugging Face (2026-08-15), a recusa nos benchmarks de prompts prejudiciais cai de 64–99% no modelo base para 0–6% no build sem censura com o pensamento desativado:
• AdvBench — 99.0% → 0.0%
• JailbreakBench (prejudicial) — 94,0% → 0,0%
• StrongREJECT — 97.3% → 2.0%
• HarmBench (padrão) — 98,7% → 2,7%
• MaliciousInstruct — 99.0% → 0.0%
• SimpleSafetyTests — 64,0% → 6,0%
• ForbiddenQuestions — 73.3% → 4.7%
Com o raciocínio habilitado, a recusa é essencialmente inexistente — 1,7% no AdvBench e 0,0% na maior parte do restante. O card acrescenta uma ressalva honesta: 30–50% das respostas ainda colocam um aviso curto no início. Isso é um artefato de treinamento, não uma recusa — o modelo responde, mas faz ressalvas na abertura. Parece atrito, não segurança.

A recusa excessiva também cai
O número menos divulgado fica do outro lado do eixo de segurança. No XSTest-safe — 250 prompts benignos que modelos alinhados às vezes recusam por engano — o modelo base recusa em excesso 5,6% das vezes. A versão sem censura recusa em excesso 0,4%. Remover a direção de recusa não apenas impede o modelo de recusar solicitações prejudiciais; também o impede de recusar as inofensivas que ele sinalizava anteriormente por supergeneralização. Para quem constrói ferramentas de avaliação ou red team em que uma linha de base sem recusa é o ponto central, esta é uma melhoria real na ferramenta, não um efeito colateral pelo qual pedir desculpas.
A capacidade é preservada, não aprimorada.
É aqui que morre a narrativa de que "sem censura = mais forte". O model card relata a build abliterada FP8 contra a FP8 base oficial com os mesmos scripts e configurações:
• MMLU (0-shot) — 84,3% → 84,7%
• GSM8K (CoT) — 90.0% → 88.7%
• MMLU-Pro (CoT) — 77.6% → 76.8%
• CMMLU (0-shot, chinês) — 81.4% → 80.8%
Todas as pontuações ficam dentro de ±1,3 pontos da base, e a perplexidade bruta do WikiText-2 chega a 6,96 — a evidência do cartão de que a modelagem de linguagem em si não degradou. A leitura honesta: a abliteração é quase neutra em capacidade nesta arquitetura. Você não está obtendo um modelo melhor; está obtendo o mesmo modelo sem o comportamento de recusa.

O mesmo aviso se aplica ao ecossistema mais amplo: alegações de "sem perdas e sem censura" em builds da comunidade merecem uma leitura cética. Uma comparação de três vias em um build de pesos abertos de 4B no Hugging Face descobriu que a técnica que alegava ser sem perdas na verdade derrubou o TruthfulQA em cerca de 7 pontos e o Lambada em cerca de 4, enquanto sua taxa de sucesso de ataque no HarmBench chegou a 100%; os outros dois métodos ficaram em 99,2% e 95,5%. E um teste agressivo em um build diferente alcançou zero recusas, mas produziu uma salada de palavras incoerente, então a versão final recuou para parâmetros por camada mais suaves. Os resultados da abliteração são específicos do método — esses números são especificamente os dados da ficha do build FP8.
O que o cartão não afirma
Leia a metodologia antes de citar os números. O card classifica sua medição de recusa como "indicativa, não um número de avaliação por LLM / de nível de publicação": a recusa foi avaliada por um classificador baseado em regras que analisa a frase de abertura, com uma categoria separada de "ressalva" para respostas que cumpriram o pedido, mas acrescentaram um aviso antes. Os benchmarks são somente de texto, executados apenas com o modelo de linguagem, contra a build FP8 servida por vLLM, e a suíte de capacidade usou scripts de avaliação padrão. O enquadramento correto: estes são dados medidos pelo próprio fornecedor, reproduzíveis a partir do card publicado — não uma execução independente de terceiros, e não uma afirmação sobre a build GGUF, que é distribuída quantizada para llama.cpp e deve ser avaliada separadamente.
O limite de segurança
Esta é a parte que não pode ser amenizada. Um modelo abliterado teve seu mecanismo de recusa substancialmente removido. Concretamente: ele atenderá a solicitações prejudiciais, antiéticas ou ilegais que o modelo base Qwen3.8 27B recusaria, e não possui salvaguardas integradas significativas. Os usos legítimos são pesquisa — interpretabilidade (estudar como as direções de recusa são codificadas), estudo de segurança de IA e de mecanismos de recusa, red-teaming (testar modelos com entradas que tentam contornar suas salvaguardas) e avaliação de robustez. Ele é lançado sob a licença Apache 2.0, herdada do modelo base, estritamente como um artefato de pesquisa. Você assume total responsabilidade, inclusive legal, por como o utiliza e por tudo o que ele gera. Não o implante para usuários finais ou em produção sem suas próprias camadas de segurança, moderação e prevenção de abuso — e para qualquer uso em produção ou voltado ao consumidor, o Qwen3.8 27B padrão é o modelo que você realmente deseja.
Quando um benchmark não censurado é a coisa errada para se recorrer
Se a sua pergunta é "qual modelo é mais forte em matemática ou codificação?", você está lendo os números errados — o build não censurado não é uma atualização de capacidade. Se a sua aplicação precisa recusar solicitações prejudiciais, este modelo é o oposto do que você quer. Se você está lançando um produto, não construa sobre um checkpoint abliterado. E se o que você realmente procura é um jailbreak, isso é uma coisa completamente diferente — pacotes de nível de prompt ficam fora da intervenção em nível de pesos discutida aqui e não são o assunto deste artigo. Os dados de benchmark neste texto existem para uma única pergunta estreita e legítima: o que a remoção da recusa faz a um Qwen3.8 27B, medido.
Como acessá-lo
Ambas as versões estão no Hugging Face sob Apache 2.0: orcarouter/Qwen3.8-27B-Uncensored-FP8 (block-FP8 E4M3, cerca de 30,9 GB de pesos, servido no caminho padrão do kernel FP8 do vLLM com contexto de 262K, ferramentas, raciocínio e MTP intactos) e orcarouter/Qwen3.8-27B-Uncensored-GGUF (F16 além de 12 níveis de quantização para llama.cpp, com Q4_K_M em 16,8 GB como o padrão recomendado para uma GPU de 24 GB). O ficha do modelo no OrcaRouter tem os preços e os detalhes de benchmark — a versão sem censura está listada lá como obsidian/Qwen3.8-27B a US$ 0,40 por milhão de tokens de entrada e US$ 4,21 por milhão de tokens de saída, com contexto de 262K, e o acesso é restrito a pesquisadores de segurança, red teams e pesquisadores de segurança de IA.

O resultado final
Os benchmarks não censurados do Qwen respondem a uma pergunta estreita, e a resposta é clara: remover a recusa do Qwen3.8 27B via abliteração mantém a capacidade dentro de ±1,3 pontos, enquanto a recusa a prompts prejudiciais cai de 64–99% para 0–6%, a recusa excessiva cai de 5,6% para 0,4%, e a perplexidade se mantém em 6,96. Leia esses números como "não recusa", nunca como "mais forte". Para pesquisa de interpretabilidade, segurança e red team, essa é exatamente a ferramenta que o model card descreve. Para qualquer coisa que enfrente um usuário, é o modelo errado por construção.
Para uso legítimo de pesquisa, os pesos estão no Hugging Face sob Apache 2.0 — orcarouter/Qwen3.8-27B-Uncensored-FP8 (a versão GGUF para llama.cpp está em orcarouter/Qwen3.8-27B-Uncensored-GGUF).
