Cartão de título hero para o artigo 'Qwen 3.8 27B Uncensored GGUF': um cartão de pesquisa arredondado com o título 'Qwen3.8-27B Uncensored GGUF', subtítulo 'Compilação local abliterada para llama.cpp', chips com os dizeres '12 NÍVEIS DE QUANTIZAÇÃO', 'CONTEXTO 262K', 'VISÃO + MTP', e um ícone de escudo com um rótulo 'SOMENTE PESQUISA'. Logotipo OrcaRouter composto no canto inferior direito.
Guides & Insights

Qwen 3.8 27B Uncensored GGUF: o Build Local Abliterated, 12 Quants e o Limite de Uso Apenas para Pesquisa

Autor

Alistair Wren

Data de publicação

Modelos mais recentes · 20Ver todos os modelos
Benchmarks: Artificial Analysis · atualizado diariamente
Voltar para todas as publicações

Qwen 3.8 27B uncensored GGUF é um download real, e a build para começar é Qwen3.8-27B-Uncensored-GGUF — publicado no Hugging Face em 16 de agosto de 2026 como o irmão nativo do llama.cpp da nossa versão FP8 abliterada. São os mesmos pesos de 27 bilhões de parâmetros com recusas removidas do Qwen3.8-27B-Uncensored-FP8, convertidos para GGUF para inferência local: F16 mais 12 níveis de quantização de Q2_K a Q8_0 (incluindo as quantizações imatrix IQ3_M e IQ4_XS), a janela de contexto de 262K, um projetor de visão separado e a cabeça de decodificação especulativa MTP intacta. "Uncensored" significa abliterado — a direção de recusa foi ortogonalizada dos pesos — então ele responderá onde a base alinhada recusa, e é exatamente por isso que é apenas para pesquisa. Aqui está o que o repositório realmente contém, qual quantização cabe na sua GPU, como executá-lo no llama.cpp e o limite de segurança que você aceita ao baixá-lo.

A versão de 30 segundos: F16 mais 12 quants, Q4_K_M a 16,8 GB é a escolha padrão, você precisa de um build do llama.cpp de maio de 2026 ou mais novo, e esta é uma ferramenta de pesquisa sem proteções — não é algo para implantar para usuários finais.

O que "GGUF sem censura" realmente significa — e como esta versão difere da versão FP8

GGUF é o formato de modelo de arquivo único que o llama.cpp usa; FP8 é um esquema de quantização que roda em servidores GPU vLLM. Nossos dois lançamentos sem censura são os mesmos pesos abliterados em dois runtimes. Qwen3.8-27B-Uncensored-FP8 (15 de agosto de 2026) tem como alvo o vLLM em um servidor, re-quantizado para o esquema oficial Qwen3.8-27B-FP8, de modo que atende no caminho de kernel idêntico. Qwen3.8-27B-Uncensored-GGUF (16 de agosto de 2026) tem como alvo o llama.cpp em uma máquina local — a GPU de desktop ou estação de trabalho que você controla. Mesmos pesos, modelo de implantação diferente: API na nuvem vs processo local.

Abliteration é uma intervenção no nível dos pesos, não um fine-tune. A direção de recusa é um vetor no fluxo residual do modelo que, quando ativado, produz "Não posso ajudar com isso"; o build encontra essa direção e a ortogonaliza para fora dos pesos, seguindo a abordagem de Arditi et al. 2024 ("Refusal in Language Models Is Mediated by a Single Direction"). Nenhum peso novo é treinado. A base é Qwen/Qwen3.8-27B — um modelo denso de 27B com arquitetura híbrida (48 camadas de atenção linear Gated DeltaNet e 16 camadas de atenção total), visão nativa e contexto de 262.144 tokens. A licença é Apache 2.0, herdada da base. Observe que o repositório oficial da Qwen disponibiliza apenas safetensors em BF16 — não há GGUF oficial da Qwen — portanto, qualquer GGUF não censurado deste modelo, incluindo este, é uma conversão dos pesos abertos.

A escada quant — F16 mais 12 níveis

O repositório inclui F16 (54,6 GB em dois arquivos) e 12 níveis de quantização. Os tamanhos abaixo são os tamanhos de arquivo do próprio repositório, lidos em 16 de agosto de 2026; os tamanhos de arquivo GGUF variam ligeiramente de build para build.

Card titled 'Qwen3.8-27B Uncensored GGUF — the quant ladder' listing F16 54.6 GB and 12 quantization tiers with file sizes: Q8_0 29.0 GB near-lossless, Q6_K 22.4 GB, Q5_K_M 19.5 GB, Q5_K_S 19.0 GB, Q4_K_M 16.8 GB marked recommended default, Q4_K_S 15.8 GB, IQ4_XS 15.3 GB marked best low-bit pick, Q3_K_L 14.6 GB, Q3_K_M 13.5 GB, IQ3_M 12.8 GB, Q3_K_S 12.3 GB, Q2_K 10.9 GB, with a footer reading 'File sizes per the Hugging Face repo, read August 16 2026'.

F16 — 54.6 GB (2 arquivos) — precisão de referência

Q8_0 — 29,0 GB — quase sem perdas, para GPUs de alto desempenho

Q6_K — 22.4 GB — o ponto ideal de qualidade por gigabyte

Q5_K_M — 19.5 GB / Q5_K_S — 19.0 GB — alta qualidade em placas maiores

Q4_K_M — 16.8 GB — o padrão recomendado

Q4_K_S — 15.8 GB

IQ4_XS — 15.3 GB — a melhor escolha de baixo bit (calibrado com imatrix)

Q3_K_L — 14.6 GB / Q3_K_M — 13.5 GB — para placas de 16 GB

IQ3_M — 12.8 GB — tamanho reduzido (calibrado por imatrix)

Q3_K_S — 12.3 GB

Q2_K — 10.9 GB — o menor K-quant, uma perda visível de qualidade

Orientações de hardware: Q4_K_M em uma placa de 24 GB (RTX 4090 ou RTX 3090); IQ4_XS ou Q3_K_M se você estiver com 16 GB; Q2_K apenas se estiver limitado a 12 GB. Como a base usa atenção híbrida Gated DeltaNet, o cache KV é pequeno — cerca de 0,5 GB em contexto de 8K — então você pode estender a janela muito além de um modelo denso convencional de 27B. A visão adiciona um arquivo separado: o projetor F16 tem 931 MB. Também existe uma série abliterada da comunidade com 9 quants para a mesma base; a nossa é a conversão da abliteração FP8 documentada, com os quants imatrix e os números de refusal-delta do model card mantidos.

Como executar no llama.cpp

Três etapas. Um requisito não óbvio: o suporte à arquitetura qwen35 e ao MTP chegou ao llama.cpp em maio de 2026, então atualize para uma compilação de 2026-05 ou mais recente — compilações mais antigas não carregarão esses arquivos (conforme o README do repositório).

1. Baixe o quant que você escolheu mais o projetor de visão. O repositório é restrito, então você faz login no Hugging Face e aceita as condições primeiro — ler o README faz parte de aceitar o que este modelo é.

huggingface-cli download orcarouter/Qwen3.8-27B-Uncensored-GGUF --include "Qwen3.8-27B-Uncensored-Q4_K_M.gguf" "mmproj-Qwen3.8-27B-Uncensored-f16.gguf" --local-dir ./qwen-unc

2. Inicie o llama-server. Isso fornece um endpoint compatível com a OpenAI; -ngl 99/ descarrega todas as camadas para a GPU.

llama-server -m ./qwen-unc/Qwen3.8-27B-Uncensored-Q4_K_M.gguf --mmproj ./qwen-unc/mmproj-Qwen3.8-27B-Uncensored-f16.gguf -ngl 99 -c 16384 --jinja --host 0.0.0.0 --port 8080

3. (Opcional) ative a cabeça MTP de decodificação especulativa. Adicione --spec-type draft-mtp/ — a cabeça nextn está embutida em cada quant; portanto, não é necessário um modelo de rascunho separado.

Card titled 'Run it locally in llama.cpp' with steps: update to a llama.cpp build from May 2026 or newer for the qwen35 architecture and MTP; download via huggingface-cli including the Q4_K_M quant and mmproj-Qwen3.8-27B-Uncensored-f16.gguf; run llama-server with --mmproj, -ngl 99, -c 16384, --jinja; optional --spec-type draft-mtp for the embedded speculative-decoding head, with a footer reading 'OpenAI-compatible endpoint at http://localhost:8080/v1/chat/completions'.

Execuções de pesquisa somente com texto podem dispensar --mmproj/; a entrada de imagem precisa dele, porque este é um modelo nativo de visão-linguagem. O endpoint é http://localhost:8080/v1/chat/completions, então o código existente do SDK da OpenAI funciona com uma troca da URL base.

Sem GPU? A mesma linha sem censura está hospedada

Local GGUF não custa nada por token, mas precisa de aproximadamente 17 GB de VRAM para a camada Q4_K_M. Se você não possui o hardware, o card hospedado obsidian/Qwen3.8-27B no OrcaRouter serve a mesma linha 27B sem censura — visão, raciocínio, contexto de 262K — a US$ 0,40 por milhão de tokens de entrada e US$ 4,21 por milhão de tokens de saída, com acesso restrito a pesquisadores de segurança, red teams e pesquisadores de segurança de IA. Mesma família de pesos, dois runtimes: GGUF localmente, FP8 na nuvem. A decisão de moderação permanece do seu lado em ambos os casos.

O limite de segurança — leia isto antes de baixar

Este modelo teve seu alinhamento de segurança substancialmente removido. Ele atenderá a solicitações prejudiciais, antiéticas, ofensivas ou ilegais que o Qwen3.8-27B base recusaria, e não possui salvaguardas significativas incorporadas. Ele é lançado estritamente para pesquisa legítima — interpretabilidade, estudo de mecanismos de recusa, red-teaming, avaliação de robustez e teste de salvaguardas. Você assume total responsabilidade e responsabilização pelo uso que fizer dele e por tudo o que ele gerar, e não deve implantá-lo para usuários finais ou em produção sem adicionar suas próprias camadas de segurança, moderação e prevenção de abuso. Os autores não aceitam nenhuma responsabilidade. A licença é Apache 2.0.

A safety-boundary card with two columns: under Research use it lists refusal-mechanism study, interpretability, red-teaming, robustness evaluation and guardrail testing; under Never deploy it lists end-user chatbots, production apps and consumer services, with a warning strip reading 'No built-in guardrails — the model will comply with requests the base model refuses' and a footer reading 'Apache 2.0 · research-only · you assume full responsibility and liability'.

O comportamento medido mostra o que "não censurado" custa. Da suíte de avaliação de segurança do model card — executada na build FP8 e datada de 15 de agosto de 2026, que são os pesos que este GGUF converte: a recusa de prompts nocivos cai de 64–99% na base para 0–6% nos pesos abliterados, o excesso de recusa benigna cai de 5,6% para 0,4%, e as pontuações de capacidade permanecem dentro de ±1,3 pontos da base. Esses números são o motivo pelo qual essa classe de modelo é um objeto de pesquisa legítimo — e também são o aviso.

Este artigo deliberadamente não contém prompts prejudiciais. Se você está avaliando o modelo, execute os benchmarks padrão de recusa — AdvBench, HarmBench, StrongREJECT, XSTest-safe — e leia os números você mesmo. Essa é a forma sancionada de estudar um modelo sem recusa.

Quando este build for a resposta errada

1. Você quer um assistente normal. Modelo errado. Ele não tem salvaguardas e atenderá a solicitações prejudiciais. Em vez disso, use o Qwen3.8-27B alinhado.

2. Qualquer coisa que você colocaria na frente dos usuários finais. Modelo errado, independentemente da intenção. O Apache 2.0 não transfere sua responsabilidade, e disponibilizar um modelo sem proteções aos usuários não é uma estratégia de implantação.

3. Você está em Apple Silicon. O GGUF rodará, mas a conversão MLX do modelo base é a opção mais natural — veja nosso guia separado de MLX.

4. Você não quer rodá-lo de jeito nenhum. Use a placa hospedada — os mesmos pesos, sem 17 GB de VRAM e o mesmo acesso restrito à pesquisa.

Conclusão

"Qwen 3.8 27B uncensored GGUF" tem uma resposta, e é um download concreto: Qwen3.8-27B-Uncensored-GGUF — F16 mais 12 níveis de quantização para llama.cpp, os pesos abliterados da nossa build FP8, contexto de 262K, visão e MTP, sob Apache 2.0 e somente para pesquisa. Escolha Q4_K_M em uma placa de 24 GB, atualize o llama.cpp além de maio de 2026 e execute-o como um servidor local compatível com OpenAI. É um instrumento de pesquisa para estudar recusas e testar guardrails — não um chatbot, nem algo para distribuir. Os pesos são gratuitos; a responsabilidade pelo que você faz com eles é inteiramente sua.

Para pesquisa legítima, o F16 e todos os 12 níveis de quantização estão no Hugging Face: Baixe o GGUF do Hugging Face

© 2026 OrcaRouter

Para provedores

Opera uma plataforma de inferência? Traga seus modelos para o OrcaRouter.

Fale conosco

Junte-se à comunidade

DiscordEmailXGitHubYouTube