
Qwen3.8-27B-Uncensored-MLX em Apple Silicon: Como Escolher Sua Build, Carregá-la no LM Studio ou no mlx-vlm, e Domar o Contexto de 262K
- AlibabaNOVOQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 por 1M de tokens
- z-aiNOVOZ.ai: GLM 5.3 Flash2026-08-2658Inteligência72Código
- DeepSeekNOVODeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.15 / $0.29 por 1M de tokens
- z-aiNOVOZ.ai: GLM 5.32026-08-1860Inteligência75Código
- obsidianQwen3.8 27B2026-08-1552Inteligência68Código
- qwenQwen: Qwen3.8 27B (free)2026-08-13qwen/qwen3.8-27b-free
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1253Inteligência69Código
- grokSpaceXAI: Grok 4.62026-08-1261Inteligência77Código
- metaMeta: Muse Spark 1.22026-08-0557Inteligência72Código
- qwenQwen: Qwen3.8 Max2026-08-0358Inteligência72Código
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3152Inteligência69Código
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 por 1M de tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2463Inteligência78Código
- googleGoogle: Gemini 3.6 Flash2026-07-2152Inteligência69Código
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2137Inteligência49Código
- metaMeta: Muse Spark 1.12026-07-1653Inteligência71Código
- kimiMoonshotAI: Kimi K32026-07-1560Inteligência76Código
- openaiOpenAI: GPT-5.6 Luna2026-07-0952Inteligência71Código
A coisa mais útil de se saber sobre orcarouter/Qwen3.8-27B-Uncensored-MLX é que você não precisa escolher uma subpasta para executá-lo. A build abliterada para Apple Silicon do Qwen/Qwen3.8-27B da OrcaRouter — publicada no Hugging Face em 17 de agosto de 2026, então não é nova, apenas pouco documentada — mantém uma cópia da build de 4 bits na raiz do repositório, justamente para que ferramentas que tratam um repositório como um único modelo, principalmente o LM Studio, o carreguem sem nenhuma configuração. Foi essa decisão que fez este card acumular cerca de 83.000 downloads no último mês, enquanto conversões MLX comparáveis recebem uma pequena fração disso. Todo o resto é uma escolha real: qual das quatro precisões cabe na memória unificada do seu Mac, qual runner você usa, se a visão e a chamada de ferramentas sobrevivem na sua largura de bits e se a janela de contexto de 262.144 tokens vale o que custa no seu hardware. Este runbook percorre essas decisões em ordem. É documentação de primeira parte — os tamanhos, precisões e índices de fidelidade abaixo são da própria OrcaRouter, medidos nesta build exata, e todo número da comunidade está identificado como tal.

O que exatamente há neste repositório
Esta é uma compilação abliterada do Qwen/Qwen3.8-27B — um modelo denso de 27B, com atenção híbrida (atenção linear Gated DeltaNet mais atenção total), nativamente visão-linguagem, com controle de pensamento, chamada de ferramentas, uma cabeça de previsão multi-token (MTP) e uma janela de contexto de 262.144 tokens. A abliteração remove o comportamento de recusa do modelo ao ortogonalizar a direção de recusa do fluxo residual; se isso é novo para você, nosso primer sobre a técnica é o melhor lugar para começar do que esta página, que trata de executar a compilação, não do método. Os pesos são Apache-2.0, herdados do modelo base.
Não confunda este repositório com qwen-3-8-27b-mlx, que é o mesmo modelo base em formato MLX sem a abliteração. Os leitores costumam baixar um quando queriam o outro: este é o build de pesquisa com a recusa removida; aquele é o Qwen/Qwen3.8-27B padrão no Apple Silicon. Verifique o nome do repositório antes de gastar o tempo de download.
Um detalhe estrutural importa mais do que parece: a torre de visão, todas as normas e o conv1d de atenção linear permanecem em BF16, e apenas as camadas lineares do modelo de linguagem — incluindo embed_tokens e lm_head — são quantizadas. É por isso que a compreensão de imagens sobrevive à quantização, e também é por isso que os tamanhos em disco abaixo são um pouco maiores do que uma estimativa ingênua de "27B em N bits": uma parte do modelo nunca é comprimida.
A decisão: qual build se adequa a qual Mac

Quatro precisões são fornecidas como subpastas — 8-bit/, 6-bit/, 4-bit/, 2-bit/ — todas em quantização afim MLX com tamanho de grupo 64. A versão de 4 bits também é espelhada na raiz do repositório. Escolha primeiro pela memória unificada do seu Mac, e depois pela qualidade:
• 8-bit — ~27,5 GB em disco, exige um Mac de 64 GB (uma máquina de 32 GB consegue carregá-lo, mas deixa pouca memória livre para qualquer outra coisa). Fidelidade de cosseno medida em relação à fonte BF16: 0,9997, praticamente sem perdas. Escolha-o quando a qualidade for o que importa e houver memória de sobra.
• 6-bit — ~22 GB, adequado para Macs de 24–32 GB. Fidelidade 0,9996, excelente. A melhor relação qualidade/gigabyte para a maioria dos proprietários de uma máquina de 48 GB.
• 4-bit — ~15 GB, confortável em um Mac de 24 GB. Fidelidade 0.996, muito boa. Este é o nosso padrão recomendado, e é a cópia na raiz do repositório por esse motivo.
• 2-bit — ~8,7 GB, cabe em um Mac de 16 GB. Fidelidade 0,92 e, em 27B, severamente degradado: loops de repetição, texto embaralhado, código e chinês, visão parcial. O cartão diz claramente — apenas para arquivamento, não para trabalho real. Um Mac de 16 GB pode tecnicamente carregá-lo; isso não o torna utilizável.
O tamanho em disco não é o número de memória. Os pesos precisam caber na memória unificada junto com o macOS, o cache KV e os buffers temporários do Metal, então deixe uma margem. Uma execução comunitária da versão de 4 bits em um Mac M1 Pro de 32 GB mediu ~16 GB de pesos em disco, mas um pico de inferência de 18,5–21,7 GB; execuções comunitárias de versões MLX de 8 bits relatam picos em torno de 34–36 GB, mesmo quando os pesos são ~29,5 GB. A orientação prática desse mesmo teste comunitário é: 16 GB não é uma opção real para um modelo de 27B, 24 GB pode tentar 4-bit com contexto curto, e 32 GB é o ponto de partida confortável. Nosso artigo de planejamento de VRAM percorre a mesma matemática para toda a família.
Como a listagem completa do repositório totaliza cerca de 94 GB em todas as precisões, baixe apenas a subpasta necessária usandohf download orcarouter/Qwen3.8-27B-Uncensored-MLX --include "4-bit/*" --local-dir ./Qwen3.8-27B-Uncensored-MLX — substituindo pela precisão escolhida. A cópia 4-bit na raiz é uma duplicata da subpasta 4-bit, portanto nunca é necessário baixar ambas.
Caminho um — LM Studio, zero configuração
A cópia raiz de 4 bits existe especificamente para que o LM Studio possa tratar todo o repositório como um único modelo. Pesquise o ID do modelo, selecione a precisão desejada (a cópia raiz é de 4 bits), e o aplicativo cuida do resto. Três pegadinhas, todas do nosso cartão, e elas são toda a diferença entre isso funcionar e falhar:

• O repositório é restrito.Downloads anônimos recebem HTTP 401. Aceite os termos na página do modelo, cole um token de leitura do Hugging Face em Configurações → Integrações → Hugging Face do LM Studio. Se pular esta etapa, o carregamento simplesmente falha.
• Desative a quantização do cache KV. Os modelos de visão MLX não são compatíveis com isso nesta arquitetura e o carregamento falha durante a inicialização se estiver habilitado (rastreado como mlx-engine#286). Isso é o oposto da recomendação para os builds GGUF, em que quantizar o cache K/V é uma economia legítima de VRAM — os dois formatos não são intercambiáveis aqui.
• Atualize o runtime. qwen3_5 o suporte à arquitetura chegou no mlx-vlm 0.6.x; um runtime incluído mais antigo não consegue carregar esses pesos de forma alguma. O selo "Provavelmente grande demais" do LM Studio, por outro lado, é apenas um aviso de RAM, não um erro — ignore-o se a sua memória unificada atender às orientações acima.
Qual precisão no LM Studio: 8 bits ocupa ~29,5 GB em disco e exige um Mac de 64 GB; 6 bits, ~22 GB, é adequado para uma máquina de 48 GB; 4 bits, com ~16 GB, é a escolha certa em um Mac de 32 GB. Se você quiser seguir a rota llama.cpp / Ollama em outro hardware, nosso guia de execução local para o modelo sem censura cobre esse caminho separadamente.
Caminho dois — mlx-vlm e mlx-lm a partir de uma subpasta
A rota de linha de comando fornece a precisão diretamente e um servidor compatível com OpenAI para ferramentas de agente. Requisitos: pip install -U mlx-vlm (mlx-vlm ≥ 0.6.13 e mlx ≥ 0.32; o backend Metal é selecionado automaticamente em Apple Silicon). Após o download da subpasta acima:
python -m mlx_vlm generate --model ./Qwen3.8-27B-Uncensored-MLX/4-bit --prompt "Explique o emaranhamento quântico em uma frase." --max-tokens 256
Adicione --image path/to/image.png para entrada de visão, ou sirva-a:
python -m mlx_vlm server --model ./Qwen3.8-27B-Uncensored-MLX/4-bit --port 8080
For agent frameworks that speak OpenAI-compatible APIs, mlx_lm.server is the lighter path — uv tool install mlx-lm then mlx_lm.server --model "orcarouter/Qwen3.8-27B-Uncensored-MLX", which serves at http://localhost:8080/v1 with api type openai-completions. Our card carries self-reported community configs pointing Pi, Hermes and OpenClaw at that endpoint. Those are user-supplied setups we have not reproduced, so treat them as starting points, not guarantees.
A visão sobrevive à quantização.
Como a torre de visão e a conv1d permanecem em BF16, a compreensão de imagens é preservada em 4/6/8 bits. Em nossa imagem de teste — formas, cores, posição, fundo e texto dentro da imagem — as versões de 4/6/8 bits descreveram tudo corretamente; a de 2 bits foi apenas parcial. Se você está escolhendo uma versão e a visão é importante, 4 bits é o mínimo que você deve usar. Não publicamos uma taxa de transferência de visão específica para Apple Silicon nesta versão, então não confie em um valor de tok/s para ela, a menos que venha de uma execução nomeada na sua própria classe de chip.
A torre de visão preservada também faz parte da superfície de risco, e vale a pena dizer isso claramente: um modelo abliterado que também consegue ler imagens não é um problema de segurança apenas textual.
Chamada de ferramentas e uso de agentes
Chamada de ferramentas é uma capacidade do modelo base e sobrevive à abliteração, o que torna esta compilação genuinamente útil para red-teaming de sistemas agênticos — e genuinamente perigosa se apontada para serviços reais. A configuração padrão é o mlx_lm.server endpoint acima, que qualquer agente compatível com OpenAI pode acessar. Se você a executar como um agente, entenda o que você habilitou: um modelo sem recusas com chamada de função e contexto de 262K é uma postura de segurança diferente de um modelo de chat, e o enquadramento do card como de uso exclusivo para pesquisa existe por esse motivo.
O contexto de 262K e o que ele realmente custa
A arquitetura dá a este modelo um contexto longo incomumente barato. Atenção híbrida aqui significa 48 camadas de atenção linear (Gated DeltaNet) intercaladas com 16 camadas de atenção total, e apenas as 16 camadas de atenção total carregam um cache KV clássico — as camadas lineares mantêm um estado recorrente compacto em vez disso. Portanto, 262.144 tokens custam materialmente menos do que custariam em um modelo de 27B com atenção total. Isso é um fato estrutural sobre o modelo base, não uma promessa sobre o seu Mac.
Na prática, a janela é uma capacidade, não um nível gratuito. Um teste comunitário de contexto longo em um M4 Max mediu aproximadamente 63 tok/s em contexto curto, caindo para cerca de 11 tok/s em 31 mil tokens — a decodificação degrada bruscamente conforme o cache se enche, e a latência do primeiro token em prompts muito longos costuma ser o obstáculo maior do que a taxa de transferência bruta. O prefill especulativo e baseado em ANE melhora a ingestão, não a decodificação. Nossos próprios números de custo do cache KV em Apple Silicon para esta build não foram publicados; se você precisa de números concretos para o seu hardware, as execuções da comunidade são a fonte honesta, e o consenso da comunidade é tratar os 262K completos como algo a que se recorre deliberadamente, não como um padrão que se deixa ativado.
Velocidade — o que é realmente medido
Nós publicamos exatamente um valor de velocidade para esta versão e ele não é Apple Silicon: ~32–37 tok/s em estado estável em um único H200 via backend MLX CUDA, o que confirma que os pesos também funcionam fora do macOS. Em Macs, nossa ficha técnica deliberadamente não publica tok/s, porque isso depende do chip, da precisão e do executor. Números de profissionais que valem a pena conhecer, todos rotulados como tal:
• Esta build exata, 4-bit, M1 Pro 32 GB: ~8,7 tok/s de geração e ~41,7 tok/s de prefill em uma execução curta (teste da comunidade, agosto de 2026). Um chip mais antigo, mas um piso realista.
• oMLX com MTP nativo em um M4 Max, checkpoint padrão não-abliterado: 53.3 tok/s para prosa e 72.1 tok/s para código, com pré-preenchimento de ~273.7 tok/s a 4K; decodificação bruta sem MTP ~24.6 tok/s. Medido por profissional em um checkpoint e runtime diferentes, portanto trate isso como um limite superior ao qual os pesos abliterados podem se aproximar, em vez de uma promessa.
{{1}}oMLX dual-ANE prefill{{/1}} em um M3 Ultra, abliterated oQ4e-MTP: prefill até {{2}}~17,7%{{/2}} em 16K e {{3}}~18,9%{{/3}} em 32K, e decodificação via {{4}}Lightning MTP{{/4}} até {{5}}~75 tok/s{{/5}} em 16K. As ressalvas são reais: usa interfaces privadas de runtime da Apple e pesos INT8 aproximados, adiciona cerca de 4 GB de pico de memória e aumenta o tempo de carregamento do modelo de {{6}}~3,4 s{{/6}} para {{7}}~28 s{{/7}}. Isso é uma otimização de ingestão de prompt, não um acelerador de geração.
A cabeça MTP — uma aceleração gratuita se o seu runner suportar
Esta build inclui o drafter de predição multi-token do modelo base na subpasta mtp/ (arquitetura qwen3_5_mtp), e funciona com qualquer precisão do modelo principal. A aceitação é sem perdas — com decodificação greedy, a saída é idêntica à execução sem o drafter — portanto, é uma aceleração genuína sem custo de qualidade quando ativado. Duas notas de configuração do nosso cartão: requer uma build do mlx-vlm que inclua o qwen3_5_mtp drafter (o branch main), e você deve passar tanto --draft-model ./Qwen3.8-27B-Uncensored-MLX/mtp quanto --draft-kind mtp. Definir mtp_enabled sozinho não faz nada. Se o seu runner não suportar o drafter, ele é ignorado e o modelo funciona normalmente — nada quebra.
Segurança — leia isto antes de executar, não depois
O aviso do próprio cartão do modelo é incomumente direto, e esta página não vai amenizá-lo. O alinhamento de segurança desta compilação foi substancialmente removido. Ele atenderá a solicitações prejudiciais, antiéticas, ofensivas ou ilegais que o Qwen/Qwen3.8-27B base recusaria, e não possui salvaguardas integradas significativas. Ele é disponibilizado estritamente para pesquisa legítima — interpretabilidade, estudo de segurança de IA e mecanismos de recusa, red-teaming, avaliação de robustez e experimentos controlados. Se não é isso que você está fazendo, este é o modelo errado.
Dois avisos do cartão merecem destaque. Primeiro, jailbreak e sondas de segurança “funcionam” trivialmente em um modelo abliterado, e isso não é uma avaliação de segurança aprovada — é o comportamento esperado de um modelo cuja direção de recusa foi removida. A ausência de recusas não é evidência de segurança. Segundo, a visão preservada, a chamada de ferramentas e o contexto de 262K expandem a superfície de ataque para compreensão de imagens e uso agêntico: um modelo sem censura que pode ler capturas de tela e chamar ferramentas é um risco mais amplo do que uma versão apenas com chat e remoção de recusa. A quantização de baixa precisão adiciona uma terceira camada de instabilidade — em 2 bits, a saída distorcida pode até ser confundida com recusa, o que é um tipo próprio de falha confusa.
Você assume total responsabilidade e responsabilização pelo uso e pelas saídas. A licença Apache-2.0 é herdada do modelo base e não muda isso: ela permite o uso; não torna a sua implantação segura. Qualquer pessoa que implante isto para usuários finais, menores de idade ou qualquer ambiente de produção deve adicionar suas próprias camadas de moderação, segurança e prevenção de abuso primeiro, e cumprir a legislação aplicável. Para pesquisadores que realmente o executam, as salvaguardas práticas são: um ambiente isolado, idealmente offline; ferramentas de agente não apontadas para serviços reais; nenhuma exposição a usuários finais; e revisão das saídas antes que vão para qualquer lugar.
Quando o local não é a resposta
Local é o ponto central desta build — os pesos ficam no seu disco, não há custo por token e nada sai da máquina. Mas local também é um teto: é exclusivo para Apple Silicon, você convive com a qualidade da quantização e não há redundância se a máquina estiver ocupada. Se você precisa de um modelo classe 27B não-abliterado via API para uma carga de trabalho real, ou quer fazer um teste A/B desta build local contra um modelo hospedado com os mesmos prompts, essa é a lacuna que uma camada de roteamento existe para preencher. O OrcaRouter coloca mais de 200 modelos atrás de uma única chave de API pelo preço de lista do provedor, com failover automático e um DSL de roteamento — um corte de preço do fornecedor entra no ar do nosso lado no mesmo dia em que é anunciado, porque repassamos o preço de lista. Uma API, uma integração, e você pode comparar uma configuração local não comprovada contra um modelo hospedado sem precisar criar uma segunda conta. Nós não hospedamos esta build MLX — ela é pesos locais por design — então a API é o caminho complementar, não um substituto para ela.
O guia rápido de decisão
• 16 GB Mac — honestamente, não este modelo. 2-bit cabe e é somente para arquivamento; você vai enfrentar problemas de memória de qualquer forma. Procure um modelo menor sem censura, ou a conversão mista de 3/6-bit da comunidade feita para máquinas de 18–24 GB.
• Mac de 24 GB — 4-bit, e mantenha o contexto curto; não execute visão e contexto longo ao mesmo tempo.
• Mac de 32 GB — 4 bits é o ponto ideal; 6 bits se você mantiver o contexto enxuto.
• Mac de 48 GB — 6-bit com folga; 8-bit se você não forçar a janela.
• 64 GB ou mais — 8-bit, quase sem perdas e contexto de 262K ao alcance, com as ressalvas acima.
Esse é o runbook completo. O modelo é de 17 de agosto de 2026, não é notícia de lançamento, e não precisa ser: 83.000 downloads aconteceram porque as pessoas queriam um tutorial, e esta página é esse tutorial. Comece na raiz do repositório, carregue o 4-bit no LM Studio e só saia da build padrão quando souber o que está trocando em termos de qualidade. Se você veio do ramo GGUF ou FP8 da família, os guias relacionados cobrem esses caminhos — o framework de decisão aqui é o mesmo; a matemática de quantização não é.
Não é outra compilação deste modelo — Qwen3.8-Flash-Next-Uncensored é um lançamento separado: abliterado do Qwen3.8-Flash-Next, uma prévia de mistura de especialistas com 176B armazenados / 6B ativos da arquitetura Qwen4. Mesma técnica de abliteração, pesos diferentes, coleção própria.
Todas as seis versões 27B — BF16, GGUF, MLX, FP8, INT8 e NVFP4 — estão reunidas na coleção Qwen3.8-27B-Uncensored no Hugging Face.
Estes pesos são apenas locais por design. Para medir a versão abliterada em relação a uma linha de base hospedada, Qwen3.8-27B é servido no OrcaRouter ao preço de tabela do provedor com margem de 0% — o modelo original, com alinhamento de segurança intacto.
