Um cartão de título para um relatório de benchmark do Qwen3.8-27B-Uncensored, mostrando um medidor de taxa de recusa caindo de 99 por cento em vermelho, em um painel rotulado como Base, para 0 por cento em verde, em um painel rotulado como Uncensored, com um ícone de escudo riscado no painel direito e uma linha horizontal abaixo indicando capacidade dentro de mais ou menos 1,3 pontos.
Guides & Insights

Benchmarks do Qwen3.8-27B-Uncensored: Recusa Colapsa, Capacidade Permanece

Autor

Rowan Sterling

Data de publicação

Modelos mais recentes · 20Ver todos os modelos
Benchmarks: Artificial Analysis · atualizado diariamente
Voltar para todas as publicações

A história do benchmark do Qwen3.8 27B Uncensored (Aggressive) — a versão abliterada do Qwen3.8 27B lançada como checkpoint FP8 em 15 de agosto de 2026 e como compilação GGUF em 16 de agosto — não é que ele ficou mais forte. É que ele parou de recusar. O card do modelo relata que a recusa a prompts prejudiciais caiu de 64–99% na versão base para 0–6% na versão abliterada com o raciocínio desativado, e para 1,7% ou menos com o raciocínio ativado, enquanto todos os benchmarks de capacidade ficam dentro de ±1,3 pontos da base e a perplexidade do WikiText-2 fica em 6,96. Se você está aqui pelos benchmarks do qwen uncensored, esses são os números de destaque: não é um modelo mais inteligente, é um modelo que não recusa.

Essa distinção importa, porque a maior parte do que aparece nos "benchmarks sem censura" é ou uma listinha rasa de pontuações de capacidade ou um post sensacionalista afirmando que o modelo é "melhor". Nenhum dos dois é o que a abliteração faz. Este artigo percorre os dados reais medidos — colapso de recusa, recusa excessiva, retenção de capacidade e perplexidade — o método que os produziu e o limite de segurança que você deve ler antes de tocar nos pesos.

O que uma análise comparativa de benchmarks sem censura realmente mede

Uma análise de modelo comum relata um eixo: capacidade — MMLU, GSM8K, codificação, raciocínio. Um modelo abliterado é interessante em um eixo diferente, e todo o sentido do rótulo "sem censura" é que o eixo de segurança mudou. Portanto, a pergunta útil para Qwen3.8-27B-Uncensored-FP8 não é "é mais inteligente?" mas "quanto custou remover o mecanismo de recusa e quão completamente ele foi removido?"

Três famílias de números precisam ser lidas em conjunto. Taxa de recusa em benchmarks de prompts nocivos — com que frequência o modelo recusa; quanto maior a base, mais visível a remoção. Recusa excessiva em prompts benignos — com que frequência ele recusa erroneamente um pedido inocente; menor é melhor para todos. E retenção de capacidade — se a edição degradou o modelo. Um resumo de benchmark que apenas imprime pontuações de capacidade está respondendo à pergunta errada.

O método: abliteration é uma edição de pesos, não um fine-tuning.

O que separa a abliteração dos pacotes de "jailbreak" da comunidade é onde a mudança reside. Um jailbreak de nível de prompt envolve a entrada; a abliteração edita os pesos. O método aqui é Arditi et al. (2024), "Refusal in Language Models Is Mediated by a Single Direction". A descoberta central é que o comportamento de recusa em muitos modelos é impulsionado por uma única direção no fluxo residual — estime essa direção, remova-a, e o modelo para de recusar sem ser retreinado.

Concretamente, o card descreve a estimativa de uma direção de recusa a partir da diferença média mascarada por ativação massiva dos residuais do último token de exemplos prejudiciais menos inofensivos, na camada 38 (round(0.6 × 64)), usando AdvBench como conjunto prejudicial e Alpaca como conjunto inofensivo. A edição é uma ortogonalização, W′ = W − r(rᵀW), calculada em float32 e aplicada a 131 matrizes de escrita residual — as projeções de saída da atenção, as projeções de saída da atenção linear, as projeções down do MLP e um espaço de linhas do embedding. Nenhuma etapa de treinamento é executada; a torre de visão permanece intocada; a cabeça de decodificação especulativa MTP é abliterada de forma consistente. É por isso que a capacidade sobrevive: remover uma direção é uma intervenção muito mais suave do que fazer fine-tuning do modelo para obedecer.

Recusa colapsa: os números

Medido no build FP8 servido pela vLLM e publicado no card do modelo no Hugging Face (2026-08-15), a recusa nos benchmarks de prompts prejudiciais cai de 64–99% no modelo base para 0–6% no build sem censura com o pensamento desativado:

• AdvBench — 99.0% → 0.0%

• JailbreakBench (prejudicial) — 94,0% → 0,0%

• StrongREJECT — 97.3% → 2.0%

• HarmBench (padrão) — 98,7% → 2,7%

• MaliciousInstruct — 99.0% → 0.0%

• SimpleSafetyTests — 64,0% → 6,0%

• ForbiddenQuestions — 73.3% → 4.7%

Com o raciocínio habilitado, a recusa é essencialmente inexistente — 1,7% no AdvBench e 0,0% na maior parte do restante. O card acrescenta uma ressalva honesta: 30–50% das respostas ainda colocam um aviso curto no início. Isso é um artefato de treinamento, não uma recusa — o modelo responde, mas faz ressalvas na abertura. Parece atrito, não segurança.

A two-column scoreboard comparing harmful-prompt refusal rates for the base Qwen3.8 27B versus the abliterated Qwen3.8-27B-Uncensored build across seven benchmarks, the base column reading 99.0, 94.0, 97.3, 98.7, 99.0, 64.0 and 73.3 percent and the uncensored column reading 0.0, 0.0, 2.0, 2.7, 0.0, 6.0 and 4.7 percent, with a footer noting the data is from the Hugging Face model card, measured on the vLLM-served FP8 build, 2026-08-15.

A recusa excessiva também cai

O número menos divulgado fica do outro lado do eixo de segurança. No XSTest-safe — 250 prompts benignos que modelos alinhados às vezes recusam por engano — o modelo base recusa em excesso 5,6% das vezes. A versão sem censura recusa em excesso 0,4%. Remover a direção de recusa não apenas impede o modelo de recusar solicitações prejudiciais; também o impede de recusar as inofensivas que ele sinalizava anteriormente por supergeneralização. Para quem constrói ferramentas de avaliação ou red team em que uma linha de base sem recusa é o ponto central, esta é uma melhoria real na ferramenta, não um efeito colateral pelo qual pedir desculpas.

A capacidade é preservada, não aprimorada.

É aqui que morre a narrativa de que "sem censura = mais forte". O model card relata a build abliterada FP8 contra a FP8 base oficial com os mesmos scripts e configurações:

• MMLU (0-shot) — 84,3% → 84,7%

• GSM8K (CoT) — 90.0% → 88.7%

• MMLU-Pro (CoT) — 77.6% → 76.8%

• CMMLU (0-shot, chinês) — 81.4% → 80.8%

Todas as pontuações ficam dentro de ±1,3 pontos da base, e a perplexidade bruta do WikiText-2 chega a 6,96 — a evidência do cartão de que a modelagem de linguagem em si não degradou. A leitura honesta: a abliteração é quase neutra em capacidade nesta arquitetura. Você não está obtendo um modelo melhor; está obtendo o mesmo modelo sem o comportamento de recusa.

A scoreboard for the Qwen3.8-27B-Uncensored capability retention results: MMLU 84.3 to 84.7, GSM8K 90.0 to 88.7, MMLU-Pro 77.6 to 76.8, CMMLU 81.4 to 80.8, every score within plus or minus 1.3 points of the base, with a highlight panel showing WikiText-2 perplexity 6.96 and over-refusal on XSTest-safe falling from 5.6 percent to 0.4 percent, and a footer noting the source is the Hugging Face model card, measured on the vLLM-served FP8 build.

O mesmo aviso se aplica ao ecossistema mais amplo: alegações de "sem perdas e sem censura" em builds da comunidade merecem uma leitura cética. Uma comparação de três vias em um build de pesos abertos de 4B no Hugging Face descobriu que a técnica que alegava ser sem perdas na verdade derrubou o TruthfulQA em cerca de 7 pontos e o Lambada em cerca de 4, enquanto sua taxa de sucesso de ataque no HarmBench chegou a 100%; os outros dois métodos ficaram em 99,2% e 95,5%. E um teste agressivo em um build diferente alcançou zero recusas, mas produziu uma salada de palavras incoerente, então a versão final recuou para parâmetros por camada mais suaves. Os resultados da abliteração são específicos do método — esses números são especificamente os dados da ficha do build FP8.

O que o cartão não afirma

Leia a metodologia antes de citar os números. O card classifica sua medição de recusa como "indicativa, não um número de avaliação por LLM / de nível de publicação": a recusa foi avaliada por um classificador baseado em regras que analisa a frase de abertura, com uma categoria separada de "ressalva" para respostas que cumpriram o pedido, mas acrescentaram um aviso antes. Os benchmarks são somente de texto, executados apenas com o modelo de linguagem, contra a build FP8 servida por vLLM, e a suíte de capacidade usou scripts de avaliação padrão. O enquadramento correto: estes são dados medidos pelo próprio fornecedor, reproduzíveis a partir do card publicado — não uma execução independente de terceiros, e não uma afirmação sobre a build GGUF, que é distribuída quantizada para llama.cpp e deve ser avaliada separadamente.

O limite de segurança

Esta é a parte que não pode ser amenizada. Um modelo abliterado teve seu mecanismo de recusa substancialmente removido. Concretamente: ele atenderá a solicitações prejudiciais, antiéticas ou ilegais que o modelo base Qwen3.8 27B recusaria, e não possui salvaguardas integradas significativas. Os usos legítimos são pesquisa — interpretabilidade (estudar como as direções de recusa são codificadas), estudo de segurança de IA e de mecanismos de recusa, red-teaming (testar modelos com entradas que tentam contornar suas salvaguardas) e avaliação de robustez. Ele é lançado sob a licença Apache 2.0, herdada do modelo base, estritamente como um artefato de pesquisa. Você assume total responsabilidade, inclusive legal, por como o utiliza e por tudo o que ele gera. Não o implante para usuários finais ou em produção sem suas próprias camadas de segurança, moderação e prevenção de abuso — e para qualquer uso em produção ou voltado ao consumidor, o Qwen3.8 27B padrão é o modelo que você realmente deseja.

Quando um benchmark não censurado é a coisa errada para se recorrer

Se a sua pergunta é "qual modelo é mais forte em matemática ou codificação?", você está lendo os números errados — o build não censurado não é uma atualização de capacidade. Se a sua aplicação precisa recusar solicitações prejudiciais, este modelo é o oposto do que você quer. Se você está lançando um produto, não construa sobre um checkpoint abliterado. E se o que você realmente procura é um jailbreak, isso é uma coisa completamente diferente — pacotes de nível de prompt ficam fora da intervenção em nível de pesos discutida aqui e não são o assunto deste artigo. Os dados de benchmark neste texto existem para uma única pergunta estreita e legítima: o que a remoção da recusa faz a um Qwen3.8 27B, medido.

Como acessá-lo

Ambas as versões estão no Hugging Face sob Apache 2.0: orcarouter/Qwen3.8-27B-Uncensored-FP8 (block-FP8 E4M3, cerca de 30,9 GB de pesos, servido no caminho padrão do kernel FP8 do vLLM com contexto de 262K, ferramentas, raciocínio e MTP intactos) e orcarouter/Qwen3.8-27B-Uncensored-GGUF (F16 além de 12 níveis de quantização para llama.cpp, com Q4_K_M em 16,8 GB como o padrão recomendado para uma GPU de 24 GB). O ficha do modelo no OrcaRouter tem os preços e os detalhes de benchmark — a versão sem censura está listada lá como obsidian/Qwen3.8-27B a US$ 0,40 por milhão de tokens de entrada e US$ 4,21 por milhão de tokens de saída, com contexto de 262K, e o acesso é restrito a pesquisadores de segurança, red teams e pesquisadores de segurança de IA.

The OrcaRouter model page for obsidian Qwen3.8-27B, showing the uncensored build's 0.40 USD per million input and 4.21 USD per million output pricing, a 262K token context window, a released August 15 2026 label, and the researcher-access gating note.

O resultado final

Os benchmarks não censurados do Qwen respondem a uma pergunta estreita, e a resposta é clara: remover a recusa do Qwen3.8 27B via abliteração mantém a capacidade dentro de ±1,3 pontos, enquanto a recusa a prompts prejudiciais cai de 64–99% para 0–6%, a recusa excessiva cai de 5,6% para 0,4%, e a perplexidade se mantém em 6,96. Leia esses números como "não recusa", nunca como "mais forte". Para pesquisa de interpretabilidade, segurança e red team, essa é exatamente a ferramenta que o model card descreve. Para qualquer coisa que enfrente um usuário, é o modelo errado por construção.

Para uso legítimo de pesquisa, os pesos estão no Hugging Face sob Apache 2.0 — orcarouter/Qwen3.8-27B-Uncensored-FP8 (a versão GGUF para llama.cpp está em orcarouter/Qwen3.8-27B-Uncensored-GGUF).

© 2026 OrcaRouter

Para provedores

Opera uma plataforma de inferência? Traga seus modelos para o OrcaRouter.

providers@orcarouter.ai

Junte-se à comunidade

Discordsupport@orcarouter.aiXGitHubYouTube