Cartão de título principal para o artigo 'Qwen3.8-27B-Uncensored-MLX no Apple Silicon' exibindo o título 'Qwen3.8-27B-Uncensored-MLX', o subtítulo 'O Runbook do Apple Silicon', uma fileira de chips de quantização rotulados como 2-bit, 4-bit, 6-bit e 8-bit, com o 4-bit em destaque, uma janela estilizada do LM Studio mostrando 'build de 4-bit na raiz do repositório', e um motivo de contexto de 262K, com o logotipo da OrcaRouter composto no canto.
Guides & Insights

Qwen3.8-27B-Uncensored-MLX em Apple Silicon: Como Escolher Sua Build, Carregá-la no LM Studio ou no mlx-vlm, e Domar o Contexto de 262K

Autor

Magnus Corvin

Data de publicação

Modelos mais recentes · 20Ver todos os modelos
Benchmarks: Artificial Analysis · atualizado diariamente
Voltar para todas as publicações

A coisa mais útil de se saber sobre orcarouter/Qwen3.8-27B-Uncensored-MLX é que você não precisa escolher uma subpasta para executá-lo. A build abliterada para Apple Silicon do Qw​en/Qwen3.8-27B da OrcaRouter — publicada no Hugging Face em 17 de agosto de 2026, então não é nova, apenas pouco documentada — mantém uma cópia da build de 4 bits na raiz do repositório, justamente para que ferramentas que tratam um repositório como um único modelo, principalmente o LM Studio, o carreguem sem nenhuma configuração. Foi essa decisão que fez este card acumular cerca de 83.000 downloads no último mês, enquanto conversões MLX comparáveis recebem uma pequena fração disso. Todo o resto é uma escolha real: qual das quatro precisões cabe na memória unificada do seu Mac, qual runner você usa, se a visão e a chamada de ferramentas sobrevivem na sua largura de bits e se a janela de contexto de 262.144 tokens vale o que custa no seu hardware. Este runbook percorre essas decisões em ordem. É documentação de primeira parte — os tamanhos, precisões e índices de fidelidade abaixo são da própria OrcaRouter, medidos nesta build exata, e todo número da comunidade está identificado como tal.

Screenshot of the Hugging Face model card for orcarouter/Qwen3.8-27B-Uncensored-MLX showing the model title, the description 'An abliterated (refusal-removed) MLX build of Qwen's Qwen3.8-27B — 2/4/6/8-bit for Apple Silicon', the apache-2.0 license, tag chips, and the 'Downloads last month' statistic of 83,352.

O que exatamente há neste repositório

Esta é uma compilação abliterada do Qw​en/Qwen3.8-27B — um modelo denso de 27B, com atenção híbrida (atenção linear Gated DeltaNet mais atenção total), nativamente visão-linguagem, com controle de pensamento, chamada de ferramentas, uma cabeça de previsão multi-token (MTP) e uma janela de contexto de 262.144 tokens. A abliteração remove o comportamento de recusa do modelo ao ortogonalizar a direção de recusa do fluxo residual; se isso é novo para você, nosso primer sobre a técnica é o melhor lugar para começar do que esta página, que trata de executar a compilação, não do método. Os pesos são Apache-2.0, herdados do modelo base.

Não confunda este repositório com qwen-3-8-27b-mlx, que é o mesmo modelo base em formato MLX sem a abliteração. Os leitores costumam baixar um quando queriam o outro: este é o build de pesquisa com a recusa removida; aquele é o Qwen/Qwen3.8-27B padrão no Apple Silicon. Verifique o nome do repositório antes de gastar o tempo de download.

Um detalhe estrutural importa mais do que parece: a torre de visão, todas as normas e o conv1d de atenção linear permanecem em BF16, e apenas as camadas lineares do modelo de linguagem — incluindo embed_tokens e lm_head — são quantizadas. É por isso que a compreensão de imagens sobrevive à quantização, e também é por isso que os tamanhos em disco abaixo são um pouco maiores do que uma estimativa ingênua de "27B em N bits": uma parte do modelo nunca é comprimida.

A decisão: qual build se adequa a qual Mac

A generated scoreboard titled 'Qwen3.8-27B-Uncensored-MLX — pick your build' comparing the four MLX builds: 8-bit at 27.5 GB near-lossless cos 0.9997, 6-bit at 22 GB excellent cos 0.9996, 4-bit at 15 GB recommended default cos 0.996, 2-bit at 8.7 GB archival only cos 0.92, plus 'Repo root: 4-bit copy, zero-config in LM Studio' and 'BF16 kept: vision tower, norms, conv1d', with a footer noting sizes and fidelity per the OrcaRouter model card and Mac RAM guidance per card and community tests, and the OrcaRouter logo composited in the corner.

Quatro precisões são fornecidas como subpastas — 8-bit/, 6-bit/, 4-bit/, 2-bit/ — todas em quantização afim MLX com tamanho de grupo 64. A versão de 4 bits também é espelhada na raiz do repositório. Escolha primeiro pela memória unificada do seu Mac, e depois pela qualidade:

8-bit — ~27,5 GB em disco, exige um Mac de 64 GB (uma máquina de 32 GB consegue carregá-lo, mas deixa pouca memória livre para qualquer outra coisa). Fidelidade de cosseno medida em relação à fonte BF16: 0,9997, praticamente sem perdas. Escolha-o quando a qualidade for o que importa e houver memória de sobra.

6-bit — ~22 GB, adequado para Macs de 24–32 GB. Fidelidade 0,9996, excelente. A melhor relação qualidade/gigabyte para a maioria dos proprietários de uma máquina de 48 GB.

4-bit — ~15 GB, confortável em um Mac de 24 GB. Fidelidade 0.996, muito boa. Este é o nosso padrão recomendado, e é a cópia na raiz do repositório por esse motivo.

2-bit — ~8,7 GB, cabe em um Mac de 16 GB. Fidelidade 0,92 e, em 27B, severamente degradado: loops de repetição, texto embaralhado, código e chinês, visão parcial. O cartão diz claramente — apenas para arquivamento, não para trabalho real. Um Mac de 16 GB pode tecnicamente carregá-lo; isso não o torna utilizável.

O tamanho em disco não é o número de memória. Os pesos precisam caber na memória unificada junto com o macOS, o cache KV e os buffers temporários do Metal, então deixe uma margem. Uma execução comunitária da versão de 4 bits em um Mac M1 Pro de 32 GB mediu ~16 GB de pesos em disco, mas um pico de inferência de 18,5–21,7 GB; execuções comunitárias de versões MLX de 8 bits relatam picos em torno de 34–36 GB, mesmo quando os pesos são ~29,5 GB. A orientação prática desse mesmo teste comunitário é: 16 GB não é uma opção real para um modelo de 27B, 24 GB pode tentar 4-bit com contexto curto, e 32 GB é o ponto de partida confortável. Nosso artigo de planejamento de VRAM percorre a mesma matemática para toda a família.

Como a listagem completa do repositório totaliza cerca de 94 GB em todas as precisões, baixe apenas a subpasta necessária usandohf download orcarouter/Qwen3.8-27B-Uncensored-MLX --include "4-bit/*" --local-dir ./Qwen3.8-27B-Uncensored-MLX — substituindo pela precisão escolhida. A cópia 4-bit na raiz é uma duplicata da subpasta 4-bit, portanto nunca é necessário baixar ambas.

Caminho um — LM Studio, zero configuração

A cópia raiz de 4 bits existe especificamente para que o LM Studio possa tratar todo o repositório como um único modelo. Pesquise o ID do modelo, selecione a precisão desejada (a cópia raiz é de 4 bits), e o aplicativo cuida do resto. Três pegadinhas, todas do nosso cartão, e elas são toda a diferença entre isso funcionar e falhar:

Screenshot of the Hugging Face files-and-versions page for orcarouter/Qwen3.8-27B-Uncensored-MLX showing the repo tree with the 4-bit build's files at the repo root (config.json and model-00001 through model-00003-of-00003 safetensors shards) alongside the 2-bit, 4-bit, 6-bit, 8-bit and mtp subfolders.

O repositório é restrito.Downloads anônimos recebem HTTP 401. Aceite os termos na página do modelo, cole um token de leitura do Hugging Face em Configurações → Integrações → Hugging Face do LM Studio. Se pular esta etapa, o carregamento simplesmente falha.

Desative a quantização do cache KV. Os modelos de visão MLX não são compatíveis com isso nesta arquitetura e o carregamento falha durante a inicialização se estiver habilitado (rastreado como mlx-engine#286). Isso é o oposto da recomendação para os builds GGUF, em que quantizar o cache K/V é uma economia legítima de VRAM — os dois formatos não são intercambiáveis aqui.

Atualize o runtime. qwen3_5 o suporte à arquitetura chegou no mlx-vlm 0.6.x; um runtime incluído mais antigo não consegue carregar esses pesos de forma alguma. O selo "Provavelmente grande demais" do LM Studio, por outro lado, é apenas um aviso de RAM, não um erro — ignore-o se a sua memória unificada atender às orientações acima.

Qual precisão no LM Studio: 8 bits ocupa ~29,5 GB em disco e exige um Mac de 64 GB; 6 bits, ~22 GB, é adequado para uma máquina de 48 GB; 4 bits, com ~16 GB, é a escolha certa em um Mac de 32 GB. Se você quiser seguir a rota llama.cpp / Ollama em outro hardware, nosso guia de execução local para o modelo sem censura cobre esse caminho separadamente.

Caminho dois — mlx-vlm e mlx-lm a partir de uma subpasta

A rota de linha de comando fornece a precisão diretamente e um servidor compatível com Open​AI para ferramentas de agente. Requisitos: pip install -U mlx-vlm (mlx-vlm ≥ 0.6.13 e mlx ≥ 0.32; o backend Metal é selecionado automaticamente em Apple Silicon). Após o download da subpasta acima:

python -m mlx_vlm generate --model ./Qwen3.8-27B-Uncensored-MLX/4-bit --prompt "Explique o emaranhamento quântico em uma frase." --max-tokens 256

Adicione --image path/to/image.png para entrada de visão, ou sirva-a:

python -m mlx_vlm server --model ./Qwen3.8-27B-Uncensored-MLX/4-bit --port 8080

For agent frameworks that speak Open​AI-compatible APIs, mlx_lm.server is the lighter path — uv tool install mlx-lm then mlx_lm.server --model "orcarouter/Qwen3.8-27B-Uncensored-MLX", which serves at http://localhost:8080/v1 with api type openai-completions. Our card carries self-reported community configs pointing Pi, Hermes and OpenClaw at that endpoint. Those are user-supplied setups we have not reproduced, so treat them as starting points, not guarantees.

A visão sobrevive à quantização.

Como a torre de visão e a conv1d permanecem em BF16, a compreensão de imagens é preservada em 4/6/8 bits. Em nossa imagem de teste — formas, cores, posição, fundo e texto dentro da imagem — as versões de 4/6/8 bits descreveram tudo corretamente; a de 2 bits foi apenas parcial. Se você está escolhendo uma versão e a visão é importante, 4 bits é o mínimo que você deve usar. Não publicamos uma taxa de transferência de visão específica para Apple Silicon nesta versão, então não confie em um valor de tok/s para ela, a menos que venha de uma execução nomeada na sua própria classe de chip.

A torre de visão preservada também faz parte da superfície de risco, e vale a pena dizer isso claramente: um modelo abliterado que também consegue ler imagens não é um problema de segurança apenas textual.

Chamada de ferramentas e uso de agentes

Chamada de ferramentas é uma capacidade do modelo base e sobrevive à abliteração, o que torna esta compilação genuinamente útil para red-teaming de sistemas agênticos — e genuinamente perigosa se apontada para serviços reais. A configuração padrão é o mlx_lm.server endpoint acima, que qualquer agente compatível com Open​AI pode acessar. Se você a executar como um agente, entenda o que você habilitou: um modelo sem recusas com chamada de função e contexto de 262K é uma postura de segurança diferente de um modelo de chat, e o enquadramento do card como de uso exclusivo para pesquisa existe por esse motivo.

O contexto de 262K e o que ele realmente custa

A arquitetura dá a este modelo um contexto longo incomumente barato. Atenção híbrida aqui significa 48 camadas de atenção linear (Gated DeltaNet) intercaladas com 16 camadas de atenção total, e apenas as 16 camadas de atenção total carregam um cache KV clássico — as camadas lineares mantêm um estado recorrente compacto em vez disso. Portanto, 262.144 tokens custam materialmente menos do que custariam em um modelo de 27B com atenção total. Isso é um fato estrutural sobre o modelo base, não uma promessa sobre o seu Mac.

Na prática, a janela é uma capacidade, não um nível gratuito. Um teste comunitário de contexto longo em um M4 Max mediu aproximadamente 63 tok/s em contexto curto, caindo para cerca de 11 tok/s em 31 mil tokens — a decodificação degrada bruscamente conforme o cache se enche, e a latência do primeiro token em prompts muito longos costuma ser o obstáculo maior do que a taxa de transferência bruta. O prefill especulativo e baseado em ANE melhora a ingestão, não a decodificação. Nossos próprios números de custo do cache KV em Apple Silicon para esta build não foram publicados; se você precisa de números concretos para o seu hardware, as execuções da comunidade são a fonte honesta, e o consenso da comunidade é tratar os 262K completos como algo a que se recorre deliberadamente, não como um padrão que se deixa ativado.

Velocidade — o que é realmente medido

Nós publicamos exatamente um valor de velocidade para esta versão e ele não é Apple Silicon: ~32–37 tok/s em estado estável em um único H200 via backend MLX CUDA, o que confirma que os pesos também funcionam fora do macOS. Em Macs, nossa ficha técnica deliberadamente não publica tok/s, porque isso depende do chip, da precisão e do executor. Números de profissionais que valem a pena conhecer, todos rotulados como tal:

• Esta build exata, 4-bit, M1 Pro 32 GB: ~8,7 tok/s de geração e ~41,7 tok/s de prefill em uma execução curta (teste da comunidade, agosto de 2026). Um chip mais antigo, mas um piso realista.

• oMLX com MTP nativo em um M4 Max, checkpoint padrão não-abliterado: 53.3 tok/s para prosa e 72.1 tok/s para código, com pré-preenchimento de ~273.7 tok/s a 4K; decodificação bruta sem MTP ~24.6 tok/s. Medido por profissional em um checkpoint e runtime diferentes, portanto trate isso como um limite superior ao qual os pesos abliterados podem se aproximar, em vez de uma promessa.

{{1}}oMLX dual-ANE prefill{{/1}} em um M3 Ultra, abliterated oQ4e-MTP: prefill até {{2}}~17,7%{{/2}} em 16K e {{3}}~18,9%{{/3}} em 32K, e decodificação via {{4}}Lightning MTP{{/4}} até {{5}}~75 tok/s{{/5}} em 16K. As ressalvas são reais: usa interfaces privadas de runtime da Apple e pesos INT8 aproximados, adiciona cerca de 4 GB de pico de memória e aumenta o tempo de carregamento do modelo de {{6}}~3,4 s{{/6}} para {{7}}~28 s{{/7}}. Isso é uma otimização de ingestão de prompt, não um acelerador de geração.

A cabeça MTP — uma aceleração gratuita se o seu runner suportar

Esta build inclui o drafter de predição multi-token do modelo base na subpasta mtp/ (arquitetura qwen3_5_mtp), e funciona com qualquer precisão do modelo principal. A aceitação é sem perdas — com decodificação greedy, a saída é idêntica à execução sem o drafter — portanto, é uma aceleração genuína sem custo de qualidade quando ativado. Duas notas de configuração do nosso cartão: requer uma build do mlx-vlm que inclua o qwen3_5_mtp drafter (o branch main), e você deve passar tanto --draft-model ./Qwen3.8-27B-Uncensored-MLX/mtp quanto --draft-kind mtp. Definir mtp_enabled sozinho não faz nada. Se o seu runner não suportar o drafter, ele é ignorado e o modelo funciona normalmente — nada quebra.

Segurança — leia isto antes de executar, não depois

O aviso do próprio cartão do modelo é incomumente direto, e esta página não vai amenizá-lo. O alinhamento de segurança desta compilação foi substancialmente removido. Ele atenderá a solicitações prejudiciais, antiéticas, ofensivas ou ilegais que o Qw​en/Qwen3.8-27B base recusaria, e não possui salvaguardas integradas significativas. Ele é disponibilizado estritamente para pesquisa legítima — interpretabilidade, estudo de segurança de IA e mecanismos de recusa, red-teaming, avaliação de robustez e experimentos controlados. Se não é isso que você está fazendo, este é o modelo errado.

Dois avisos do cartão merecem destaque. Primeiro, jailbreak e sondas de segurança “funcionam” trivialmente em um modelo abliterado, e isso não é uma avaliação de segurança aprovada — é o comportamento esperado de um modelo cuja direção de recusa foi removida. A ausência de recusas não é evidência de segurança. Segundo, a visão preservada, a chamada de ferramentas e o contexto de 262K expandem a superfície de ataque para compreensão de imagens e uso agêntico: um modelo sem censura que pode ler capturas de tela e chamar ferramentas é um risco mais amplo do que uma versão apenas com chat e remoção de recusa. A quantização de baixa precisão adiciona uma terceira camada de instabilidade — em 2 bits, a saída distorcida pode até ser confundida com recusa, o que é um tipo próprio de falha confusa.

Você assume total responsabilidade e responsabilização pelo uso e pelas saídas. A licença Apache-2.0 é herdada do modelo base e não muda isso: ela permite o uso; não torna a sua implantação segura. Qualquer pessoa que implante isto para usuários finais, menores de idade ou qualquer ambiente de produção deve adicionar suas próprias camadas de moderação, segurança e prevenção de abuso primeiro, e cumprir a legislação aplicável. Para pesquisadores que realmente o executam, as salvaguardas práticas são: um ambiente isolado, idealmente offline; ferramentas de agente não apontadas para serviços reais; nenhuma exposição a usuários finais; e revisão das saídas antes que vão para qualquer lugar.

Quando o local não é a resposta

Local é o ponto central desta build — os pesos ficam no seu disco, não há custo por token e nada sai da máquina. Mas local também é um teto: é exclusivo para Apple Silicon, você convive com a qualidade da quantização e não há redundância se a máquina estiver ocupada. Se você precisa de um modelo classe 27B não-abliterado via API para uma carga de trabalho real, ou quer fazer um teste A/B desta build local contra um modelo hospedado com os mesmos prompts, essa é a lacuna que uma camada de roteamento existe para preencher. O OrcaRouter coloca mais de 200 modelos atrás de uma única chave de API pelo preço de lista do provedor, com failover automático e um DSL de roteamento — um corte de preço do fornecedor entra no ar do nosso lado no mesmo dia em que é anunciado, porque repassamos o preço de lista. Uma API, uma integração, e você pode comparar uma configuração local não comprovada contra um modelo hospedado sem precisar criar uma segunda conta. Nós não hospedamos esta build MLX — ela é pesos locais por design — então a API é o caminho complementar, não um substituto para ela.

O guia rápido de decisão

• 16 GB Mac — honestamente, não este modelo. 2-bit cabe e é somente para arquivamento; você vai enfrentar problemas de memória de qualquer forma. Procure um modelo menor sem censura, ou a conversão mista de 3/6-bit da comunidade feita para máquinas de 18–24 GB.

• Mac de 24 GB — 4-bit, e mantenha o contexto curto; não execute visão e contexto longo ao mesmo tempo.

• Mac de 32 GB — 4 bits é o ponto ideal; 6 bits se você mantiver o contexto enxuto.

• Mac de 48 GB — 6-bit com folga; 8-bit se você não forçar a janela.

• 64 GB ou mais — 8-bit, quase sem perdas e contexto de 262K ao alcance, com as ressalvas acima.

Esse é o runbook completo. O modelo é de 17 de agosto de 2026, não é notícia de lançamento, e não precisa ser: 83.000 downloads aconteceram porque as pessoas queriam um tutorial, e esta página é esse tutorial. Comece na raiz do repositório, carregue o 4-bit no LM Studio e só saia da build padrão quando souber o que está trocando em termos de qualidade. Se você veio do ramo GGUF ou FP8 da família, os guias relacionados cobrem esses caminhos — o framework de decisão aqui é o mesmo; a matemática de quantização não é.

Não é outra compilação deste modelo — Qwen3.8-Flash-Next-Uncensored é um lançamento separado: abliterado do Qwen3.8-Flash-Next, uma prévia de mistura de especialistas com 176B armazenados / 6B ativos da arquitetura Qwen4. Mesma técnica de abliteração, pesos diferentes, coleção própria.

Todas as seis versões 27B — BF16, GGUF, MLX, FP8, INT8 e NVFP4 — estão reunidas na coleção Qwen3.8-27B-Uncensored no Hugging Face.

Estes pesos são apenas locais por design. Para medir a versão abliterada em relação a uma linha de base hospedada, Qwen3.8-27B é servido no OrcaRouter ao preço de tabela do provedor com margem de 0% — o modelo original, com alinhamento de segurança intacto.

© 2026 OrcaRouter

Para provedores

Opera uma plataforma de inferência? Traga seus modelos para o OrcaRouter.

providers@orcarouter.ai

Junte-se à comunidade

Discordsupport@orcarouter.aiXGitHubYouTube