
Qwen 3.8 27B Uncensored GGUF: o Build Local Abliterated, 12 Quants e o Limite de Uso Apenas para Pesquisa
- obsidianNOVOQwen3.8 27B Uncensored (Aggressive)2026-08-1552Inteligência68Código
- qwenNOVOQwen: Qwen3.8 27B (free)2026-08-1358 tok/s
- deepseekNOVODeepSeek: DeepSeek V4 Pro 08132026-08-1253Inteligência69Código
- grokNOVOSpaceXAI: Grok 4.62026-08-1261Inteligência77Código
- metaNOVOMeta: Muse Spark 1.22026-08-0557Inteligência72Código
- qwenQwen: Qwen3.8 Max2026-08-0358Inteligência72Código
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3152Inteligência69Código
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 por 1M de tokens · 231 tok/s
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2463Inteligência78Código
- googleGoogle: Gemini 3.6 Flash2026-07-2152Inteligência69Código
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2137Inteligência49Código
- metaMeta: Muse Spark 1.12026-07-1653Inteligência71Código
- kimiMoonshotAI: Kimi K32026-07-1560Inteligência76Código
- openaiOpenAI: GPT-5.6 Luna2026-07-0952Inteligência71Código
- openaiOpenAI: GPT-5.6 Terra2026-07-0957Inteligência77Código
- openaiOpenAI: GPT-5.6 Sol2026-07-0961Inteligência77Código
- grokxAI: Grok 4.52026-07-0856Inteligência72Código
- tencentTencent: Hy32026-07-0642Inteligência59Código
Qwen 3.8 27B uncensored GGUF é um download real, e a build para começar é Qwen3.8-27B-Uncensored-GGUF — publicado no Hugging Face em 16 de agosto de 2026 como o irmão nativo do llama.cpp da nossa versão FP8 abliterada. São os mesmos pesos de 27 bilhões de parâmetros com recusas removidas do Qwen3.8-27B-Uncensored-FP8, convertidos para GGUF para inferência local: F16 mais 12 níveis de quantização de Q2_K a Q8_0 (incluindo as quantizações imatrix IQ3_M e IQ4_XS), a janela de contexto de 262K, um projetor de visão separado e a cabeça de decodificação especulativa MTP intacta. "Uncensored" significa abliterado — a direção de recusa foi ortogonalizada dos pesos — então ele responderá onde a base alinhada recusa, e é exatamente por isso que é apenas para pesquisa. Aqui está o que o repositório realmente contém, qual quantização cabe na sua GPU, como executá-lo no llama.cpp e o limite de segurança que você aceita ao baixá-lo.
A versão de 30 segundos: F16 mais 12 quants, Q4_K_M a 16,8 GB é a escolha padrão, você precisa de um build do llama.cpp de maio de 2026 ou mais novo, e esta é uma ferramenta de pesquisa sem proteções — não é algo para implantar para usuários finais.
O que "GGUF sem censura" realmente significa — e como esta versão difere da versão FP8
GGUF é o formato de modelo de arquivo único que o llama.cpp usa; FP8 é um esquema de quantização que roda em servidores GPU vLLM. Nossos dois lançamentos sem censura são os mesmos pesos abliterados em dois runtimes. Qwen3.8-27B-Uncensored-FP8 (15 de agosto de 2026) tem como alvo o vLLM em um servidor, re-quantizado para o esquema oficial Qwen3.8-27B-FP8, de modo que atende no caminho de kernel idêntico. Qwen3.8-27B-Uncensored-GGUF (16 de agosto de 2026) tem como alvo o llama.cpp em uma máquina local — a GPU de desktop ou estação de trabalho que você controla. Mesmos pesos, modelo de implantação diferente: API na nuvem vs processo local.
Abliteration é uma intervenção no nível dos pesos, não um fine-tune. A direção de recusa é um vetor no fluxo residual do modelo que, quando ativado, produz "Não posso ajudar com isso"; o build encontra essa direção e a ortogonaliza para fora dos pesos, seguindo a abordagem de Arditi et al. 2024 ("Refusal in Language Models Is Mediated by a Single Direction"). Nenhum peso novo é treinado. A base é Qwen/Qwen3.8-27B — um modelo denso de 27B com arquitetura híbrida (48 camadas de atenção linear Gated DeltaNet e 16 camadas de atenção total), visão nativa e contexto de 262.144 tokens. A licença é Apache 2.0, herdada da base. Observe que o repositório oficial da Qwen disponibiliza apenas safetensors em BF16 — não há GGUF oficial da Qwen — portanto, qualquer GGUF não censurado deste modelo, incluindo este, é uma conversão dos pesos abertos.
A escada quant — F16 mais 12 níveis
O repositório inclui F16 (54,6 GB em dois arquivos) e 12 níveis de quantização. Os tamanhos abaixo são os tamanhos de arquivo do próprio repositório, lidos em 16 de agosto de 2026; os tamanhos de arquivo GGUF variam ligeiramente de build para build.

• F16 — 54.6 GB (2 arquivos) — precisão de referência
• Q8_0 — 29,0 GB — quase sem perdas, para GPUs de alto desempenho
• Q6_K — 22.4 GB — o ponto ideal de qualidade por gigabyte
• Q5_K_M — 19.5 GB / Q5_K_S — 19.0 GB — alta qualidade em placas maiores
• Q4_K_M — 16.8 GB — o padrão recomendado
• Q4_K_S — 15.8 GB
• IQ4_XS — 15.3 GB — a melhor escolha de baixo bit (calibrado com imatrix)
• Q3_K_L — 14.6 GB / Q3_K_M — 13.5 GB — para placas de 16 GB
• IQ3_M — 12.8 GB — tamanho reduzido (calibrado por imatrix)
• Q3_K_S — 12.3 GB
• Q2_K — 10.9 GB — o menor K-quant, uma perda visível de qualidade
Orientações de hardware: Q4_K_M em uma placa de 24 GB (RTX 4090 ou RTX 3090); IQ4_XS ou Q3_K_M se você estiver com 16 GB; Q2_K apenas se estiver limitado a 12 GB. Como a base usa atenção híbrida Gated DeltaNet, o cache KV é pequeno — cerca de 0,5 GB em contexto de 8K — então você pode estender a janela muito além de um modelo denso convencional de 27B. A visão adiciona um arquivo separado: o projetor F16 tem 931 MB. Também existe uma série abliterada da comunidade com 9 quants para a mesma base; a nossa é a conversão da abliteração FP8 documentada, com os quants imatrix e os números de refusal-delta do model card mantidos.
Como executar no llama.cpp
Três etapas. Um requisito não óbvio: o suporte à arquitetura qwen35 e ao MTP chegou ao llama.cpp em maio de 2026, então atualize para uma compilação de 2026-05 ou mais recente — compilações mais antigas não carregarão esses arquivos (conforme o README do repositório).
1. Baixe o quant que você escolheu mais o projetor de visão. O repositório é restrito, então você faz login no Hugging Face e aceita as condições primeiro — ler o README faz parte de aceitar o que este modelo é.
huggingface-cli download orcarouter/Qwen3.8-27B-Uncensored-GGUF --include "Qwen3.8-27B-Uncensored-Q4_K_M.gguf" "mmproj-Qwen3.8-27B-Uncensored-f16.gguf" --local-dir ./qwen-unc
2. Inicie o llama-server. Isso fornece um endpoint compatível com a OpenAI; -ngl 99/ descarrega todas as camadas para a GPU.
llama-server -m ./qwen-unc/Qwen3.8-27B-Uncensored-Q4_K_M.gguf --mmproj ./qwen-unc/mmproj-Qwen3.8-27B-Uncensored-f16.gguf -ngl 99 -c 16384 --jinja --host 0.0.0.0 --port 8080
3. (Opcional) ative a cabeça MTP de decodificação especulativa. Adicione --spec-type draft-mtp/ — a cabeça nextn está embutida em cada quant; portanto, não é necessário um modelo de rascunho separado.

Execuções de pesquisa somente com texto podem dispensar --mmproj/; a entrada de imagem precisa dele, porque este é um modelo nativo de visão-linguagem. O endpoint é http://localhost:8080/v1/chat/completions, então o código existente do SDK da OpenAI funciona com uma troca da URL base.
Sem GPU? A mesma linha sem censura está hospedada
Local GGUF não custa nada por token, mas precisa de aproximadamente 17 GB de VRAM para a camada Q4_K_M. Se você não possui o hardware, o card hospedado obsidian/Qwen3.8-27B no OrcaRouter serve a mesma linha 27B sem censura — visão, raciocínio, contexto de 262K — a US$ 0,40 por milhão de tokens de entrada e US$ 4,21 por milhão de tokens de saída, com acesso restrito a pesquisadores de segurança, red teams e pesquisadores de segurança de IA. Mesma família de pesos, dois runtimes: GGUF localmente, FP8 na nuvem. A decisão de moderação permanece do seu lado em ambos os casos.
O limite de segurança — leia isto antes de baixar
Este modelo teve seu alinhamento de segurança substancialmente removido. Ele atenderá a solicitações prejudiciais, antiéticas, ofensivas ou ilegais que o Qwen3.8-27B base recusaria, e não possui salvaguardas significativas incorporadas. Ele é lançado estritamente para pesquisa legítima — interpretabilidade, estudo de mecanismos de recusa, red-teaming, avaliação de robustez e teste de salvaguardas. Você assume total responsabilidade e responsabilização pelo uso que fizer dele e por tudo o que ele gerar, e não deve implantá-lo para usuários finais ou em produção sem adicionar suas próprias camadas de segurança, moderação e prevenção de abuso. Os autores não aceitam nenhuma responsabilidade. A licença é Apache 2.0.

O comportamento medido mostra o que "não censurado" custa. Da suíte de avaliação de segurança do model card — executada na build FP8 e datada de 15 de agosto de 2026, que são os pesos que este GGUF converte: a recusa de prompts nocivos cai de 64–99% na base para 0–6% nos pesos abliterados, o excesso de recusa benigna cai de 5,6% para 0,4%, e as pontuações de capacidade permanecem dentro de ±1,3 pontos da base. Esses números são o motivo pelo qual essa classe de modelo é um objeto de pesquisa legítimo — e também são o aviso.
Este artigo deliberadamente não contém prompts prejudiciais. Se você está avaliando o modelo, execute os benchmarks padrão de recusa — AdvBench, HarmBench, StrongREJECT, XSTest-safe — e leia os números você mesmo. Essa é a forma sancionada de estudar um modelo sem recusa.
Quando este build for a resposta errada
1. Você quer um assistente normal. Modelo errado. Ele não tem salvaguardas e atenderá a solicitações prejudiciais. Em vez disso, use o Qwen3.8-27B alinhado.
2. Qualquer coisa que você colocaria na frente dos usuários finais. Modelo errado, independentemente da intenção. O Apache 2.0 não transfere sua responsabilidade, e disponibilizar um modelo sem proteções aos usuários não é uma estratégia de implantação.
3. Você está em Apple Silicon. O GGUF rodará, mas a conversão MLX do modelo base é a opção mais natural — veja nosso guia separado de MLX.
4. Você não quer rodá-lo de jeito nenhum. Use a placa hospedada — os mesmos pesos, sem 17 GB de VRAM e o mesmo acesso restrito à pesquisa.
Conclusão
"Qwen 3.8 27B uncensored GGUF" tem uma resposta, e é um download concreto: Qwen3.8-27B-Uncensored-GGUF — F16 mais 12 níveis de quantização para llama.cpp, os pesos abliterados da nossa build FP8, contexto de 262K, visão e MTP, sob Apache 2.0 e somente para pesquisa. Escolha Q4_K_M em uma placa de 24 GB, atualize o llama.cpp além de maio de 2026 e execute-o como um servidor local compatível com OpenAI. É um instrumento de pesquisa para estudar recusas e testar guardrails — não um chatbot, nem algo para distribuir. Os pesos são gratuitos; a responsabilidade pelo que você faz com eles é inteiramente sua.
Para pesquisa legítima, o F16 e todos os 12 níveis de quantização estão no Hugging Face: Baixe o GGUF do Hugging Face
