Ilustração editorial em vetor plano para o hero de um blog de tecnologia sobre executar um modelo de linguagem amplo não censurado e abliterado localmente no seu próprio hardware: um grande chip de modelo arredondado em azul profundo com um brilho ciano suave flutua no centro-esquerda, seu circuito interno se dissolvendo de um formato de cadeado fechado para um aberto. À direita, uma placa GPU compacta sobre uma bancada e uma janela de terminal esbelta com barras de comando horizontais abstratas e uma pequena silhueta de lhama ao lado. No canto superior, um pequeno ícone de microscópio e um escudo arredondado com um triângulo de aviso, sugerindo uso em pesquisa e limites de segurança. Fundo azul-claro suave e branco, amplo espaço vazio no terço inferior. Sem texto legível.
Guides & Insights

Como executar o Qwen3.8-27B-Uncensored localmente: GGUF Quants, llama.cpp e Ollama

Autor

Rowan Sterling

Data de publicação

Modelos mais recentes · 20Ver todos os modelos
Benchmarks: Artificial Analysis · atualizado diariamente
Voltar para todas as publicações

Para executar o Qwen3.8-27B-Uncensored localmente, baixe o repositório GGUF com acesso restrito orcarouter/Qwen3.8-27B-Uncensored-GGUF do Hugging Face, escolha uma quantização de acordo com sua VRAM — Q4_K_M (16,8 GB) para uma GPU de 24 GB, IQ4_XS (15,3 GB) para uma GPU de 16 GB, Q3_K_M (13,5 GB) quando quiser margem de contexto — e sirva-o com uma compilação atual do llama.cpp usando a flag --jinja, adicionando --mmproj se precisar de visão. O mesmo arquivo importa no Ollama com três comandos. Esta é a versão GGUF da compilação Qwen3.8 27B abliterada, lançada em 16 de agosto de 2026, com o contexto nativo de 262K, o projetor de visão e a cabeça de decodificação especulativa MTP preservados em cada quantização. É uma ferramenta de pesquisa, não um assistente: teve seu comportamento de recusa removido, não possui proteções integradas e a licença é Apache 2.0. Leia o limite de segurança na parte inferior desta página antes de baixar — esse é o propósito do repositório com acesso restrito.

Qual GGUF baixar, por VRAM

O repositório inclui um par de precisão total e doze arquivos quantizados, portanto a decisão de download é realmente uma decisão de VRAM. Os números abaixo são os tamanhos de arquivo lidos do repositório Hugging Face em 16/08/2026.

A quant-picker card titled 'Qwen3.8-27B-Uncensored GGUF — pick by VRAM', sourced to the Hugging Face repo orcarouter/Qwen3.8-27B-Uncensored-GGUF checked 2026-08-16. It lists: 24 GB GPU — Q4_K_M at 16.8 GB, the recommended default; 16 GB GPU — IQ4_XS at 15.3 GB (tight) or Q3_K_M at 13.5 GB (context headroom); 12 GB GPU — Q2_K at 10.9 GB only, quality drops; 48 GB+ — Q8_0 at 29.0 GB or F16 at 54.7 GB; plus a vision line reading add mmproj 0.9 GB for image input. Footer: only 16 of 64 layers use full attention, so the KV cache stays ~2 GB at 32K context and Q4_K_M fits a 24 GB card with long context.

O que está realmente no repositório

orcarouter/Qwen3.8-27B-Uncensored-GGUF contém quinze arquivos de modelo: os pesos F16 divididos em duas partes, doze GGUFs quantizados — Q2_K, Q3_K_S, Q3_K_M, Q3_K_L, Q4_K_S, Q4_K_M, Q5_K_S, Q5_K_M, Q6_K, Q8_0, IQ3_M e IQ4_XS — e o projetor de visão mmproj. É a exportação GGUF da mesma compilação abliterada do Qwen3.8-27B-Uncensored-FP8, reempacotada para runtimes locais da classe llama.cpp, e herda a licença Apache 2.0 do modelo base e seu contexto nativo de 262.144 tokens.

Três propriedades se aplicam a todos os quants. A arquitetura é qwen35 — atenção híbrida com 48 camadas lineares Gated DeltaNet e 16 camadas de atenção total — e é por isso que o repositório se recusa a carregar em versões antigas do llama.cpp e por que o cache KV permanece pequeno. A cabeça de decodificação especulativa MTP (nextn) é preservada em todos os quants, tanto K-quant quanto IQ. E o template de chat é o template Qwen Jinja, que você deve habilitar explicitamente (veja abaixo) ou as conversas de múltiplos turnos quebram.

Por que o cache KV permanece pequeno o suficiente para importar

Este é o detalhe que faz a história local funcionar. Das 64 camadas, apenas 16 usam atenção total; as outras 48 usam atenção linear Gated DeltaNet, que não mantém cache KV convencional. O efeito prático, medido no runbook original para esta arquitetura, é um cache KV de aproximadamente 2 GB em contexto de 32K — cerca de um quarto do que um 27B convencional precisaria. É por isso que um arquivo Q4_K_M de 16,8 GB ainda cabe em uma placa de 24 GB com uma janela de contexto longa, e por que a linha GGUF sem censura é rodável em hardware que não poderia hospedar o checkpoint BF16 de 55,6 GB.

Execute-o com llama.cpp

llama.cpp é o caminho pretendido. Você precisa de uma build atual: o trunk registra a arquitetura qwen35, e builds mais antigas recusam o arquivo diretamente. O formato do comando, a partir das notas de uso do model card e do runbook desta arquitetura, é:

A command card titled 'llama.cpp — serve the uncensored GGUF' showing the run command llama-server -m Qwen3.8-27B-Uncensored-Q4_K_M.gguf --ctx-size 32768 --n-gpu-layers 99 --jinja, an optional vision line adding --mmproj mmproj-Qwen3.8-27B-Uncensored-f16.gguf, and notes: a current build is required because the qwen35 architecture is refused by older llama.cpp versions; the MTP nextn head is preserved in every quant but needs a build with MTP support, stock builds ignore it. Footer: the Ollama path is a Modelfile with FROM ./Qwen3.8-27B-Uncensored-Q4_K_M.gguf, then ollama create qwen3.8-27b-uncensored -f Modelfile, then ollama run qwen3.8-27b-uncensored.

llama-server -m Qwen3.8-27B-Uncensored-Q4_K_M.gguf --ctx-size 32768 --n-gpu-layers 99 --jinja

Isso fornece um endpoint compatível com OpenAI em localhost:8080. Para entrada de imagem, adicione --mmproj mmproj-Qwen3.8-27B-Uncensored-f16.gguf. Troque Q4_K_M pela quantização que corresponde à sua VRAM; as flags são idênticas.

Rode com Ollama

O Ollama executa o mesmo arquivo importando-o de um Modelfile, que é a forma suportada de adicionar um GGUF que não está na biblioteca. No diretório que contém o quant que você baixou:

FROM ./Qwen3.8-27B-Uncensored-Q4_K_M.gguf

Salve essa linha como Modelfile e depois ollama create qwen3.8-27b-uncensored -f Modelfile e ollama run qwen3.8-27b-uncensored. Para visão, adicione a linha mmproj ao Modelfile (FROM ... Q4_K_M.gguf mais o caminho do mmproj) e o Ollama conecta o projetor. As mesmas ressalvas de --ctx e template se aplicam: defina o tamanho de contexto que você realmente pode comportar e lembre-se de que um modelo sem recusas responde sem barreira de proteção entre você e a saída.

O que a remoção da recusa realmente mudou

O model card publica uma suíte de avaliação de segurança para esta compilação. Com o raciocínio desativado, a taxa de recusa nos benchmarks padrão de prompts prejudiciais cai de 64–99% no modelo base para 0–6% nos pesos abliterados; com o raciocínio ativado, ele praticamente nunca recusa — 1.7% ou menos. Os benchmarks de capacidade permanecem dentro de ±1.3 pontos do modelo base. Esse é o padrão de todos os lançamentos abliterados desta linha: recusas removidas, capacidades intactas, e a ressalva de que uma boa fração das respostas ainda antepõe um pequeno aviso antes de responder — um artefato de treinamento, não uma recusa.

O outro lado é exatamente o propósito do limite de segurança abaixo: um modelo que nunca recusa não é um assistente melhor — é um tipo diferente de objeto. É um instrumento de teste para medir mecanismos de recusa e para descobrir se a sua própria salvaguarda funciona.

O que realmente fazer com isso em pesquisa

Três projetos legítimos que são o uso sancionado de um modelo sem recusa:

Quando este build for a resposta errada

Se você quer um assistente normal, ou qualquer coisa que você colocaria diante de usuários finais, este é o modelo errado — ele não tem proteções integradas significativas, ele atenderá a solicitações que o modelo base recusa, e o Apache 2.0 não transfere sua responsabilidade. Use o Qwen3.8-27B alinhado original para isso. Se você quer desviar recusas em um chatbot, um pacote de prompt de sistema alcança mais com menos risco do que uma edição de pesos. E se você não tem nenhuma GPU, mas ainda quer estudar o modelo, o card hospedado obsidian/Qwen3.8-27B no OrcaRouter serve a mesma linha sem censura a US$ 0,40 por milhão de tokens de entrada e US$ 4,21 por milhão de tokens de saída, com o mesmo contexto de 262K; ele é restrito a pesquisadores de segurança e de IA-safety da mesma forma que o repositório, e a decisão de moderação continua do seu lado. O cartão do modelo tem os detalhes de preços e benchmarks.

O limite de segurança — leia isto antes de baixar

A safety-boundary card for Qwen3.8-27B-Uncensored with two columns: under Research use it lists refusal-mechanism study, interpretability, red-teaming, robustness evaluation and guardrail testing; under Never deploy it lists end-user chatbots, production applications and consumer services, with a warning that this model has had its safety alignment removed and will comply with harmful, unethical or illegal requests the base model refuses, and a footer reading Apache 2.0, research-only, you assume full responsibility.

Este modelo teve seu alinhamento de segurança {{1}}substancialmente removido{{/1}}. Ele atenderá solicitações {{2}}prejudiciais, antiéticas, ofensivas ou ilegais{{/2}} que o Qwen3.8-27B original recusaria, e não possui salvaguardas significativas integradas. Ele é disponibilizado estritamente para {{3}}pesquisa legítima{{/3}} — {{4}}interpretabilidade, estudo de segurança de IA e mecanismos de recusa, red-teaming, avaliação de robustez e experimentos controlados{{/4}}. Você assume {{5}}total responsabilidade e obrigação legal{{/5}} pelo uso que fizer dele e por tudo o que ele gerar, e {{6}}não deve implantá-lo para usuários finais ou em produção{{/6}} sem adicionar suas próprias camadas de segurança, moderação e prevenção de abuso. Os autores {{7}}não aceitam responsabilidade alguma{{/7}} por uso indevido. Baixar o repositório significa que você aceita estas condições; a licença é {{KEEP}}Apache 2.0{{/KEEP}}.

Este artigo, deliberadamente, não contém prompts prejudiciais. Os números de recusa acima vêm da própria suíte de avaliação de segurança do model card, que é a maneira correta de medir um modelo desta classe: execute os benchmarks padrão de recusa, leia os números e planeje sua pesquisa em torno do que eles mostram.

Fontes e data

Todos os fatos acima foram verificados em 2026-08-16. A lista de arquivos e os tamanhos são lidos do repositório Hugging Face orcarouter/Qwen3.8-27B-Uncensored-GGUF (criado em 16 de agosto de 2026; arquitetura qwen35; Apache 2.0; gated). Os números de recusa e capacidade são da suíte de avaliação de segurança do model card. A medição de KV-cache (~2 GB em contexto de 32K) é do runbook da OrcaRouter para esta arquitetura, How to Run Qwen 3.8 27B Locally. Os preços e o gating hospedados são da página do modelo obsidian/Qwen3.8-27B, verificados no mesmo dia. Os tamanhos dos arquivos quantizados são em GB decimais, conforme armazenados no Hugging Face.

Para pesquisa legítima, os pesos estão no Hugging Face: Baixar do Hugging Face — sem cartão de crédito, no ar em 60 segundos.

© 2026 OrcaRouter

Para provedores

Opera uma plataforma de inferência? Traga seus modelos para o OrcaRouter.

providers@orcarouter.ai

Junte-se à comunidade

Discordsupport@orcarouter.aiXGitHubYouTube