
Qwen3.8-27B com MLX no Apple Silicon: Sim, roda — aqui está o que você realmente precisa
- obsidianNOVOQwen3.8 27B Uncensored (Aggressive)2026-08-15$0.40 / $4.21 por 1M de tokens · 22 tok/s
- qwenNOVOQwen: Qwen3.8 27B (free)2026-08-1343 tok/s
- deepseekNOVODeepSeek: DeepSeek V4 Pro 08132026-08-1253Inteligência69Código
- grokNOVOSpaceXAI: Grok 4.62026-08-1261Inteligência77Código
- metaNOVOMeta: Muse Spark 1.22026-08-0557Inteligência72Código
- qwenQwen: Qwen3.8 Max2026-08-0358Inteligência72Código
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3152Inteligência69Código
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 por 1M de tokens · 273 tok/s
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2463Inteligência78Código
- googleGoogle: Gemini 3.6 Flash2026-07-2152Inteligência69Código
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2137Inteligência49Código
- metaMeta: Muse Spark 1.12026-07-1653Inteligência71Código
- kimiMoonshotAI: Kimi K32026-07-1560Inteligência76Código
- openaiOpenAI: GPT-5.6 Luna2026-07-0952Inteligência71Código
- openaiOpenAI: GPT-5.6 Terra2026-07-0957Inteligência77Código
- openaiOpenAI: GPT-5.6 Sol2026-07-0961Inteligência77Código
- grokxAI: Grok 4.52026-07-0856Inteligência72Código
- tencentTencent: Hy32026-07-0642Inteligência59Código
O Qwen3.8 27B roda em Apple Silicon hoje através do MLX. A tag é qwen3.8:27b-mlx no Ollama, adicionada no Ollama v0.32.12, e a versão de 4 bits baixa cerca de 18 GB e precisa de aproximadamente 16–19 GB de memória unificada — o que torna um Mac de 24 GB+ o mínimo realista e um Mac de 16 GB inviável. Os pesos são Apache 2.0, gratuitos no ponto de uso em hardware que você possui, que é exatamente o propósito do modelo. O lançamento da Alibaba tem dois dias (13–14 de agosto de 2026), então cada número abaixo está rotulado: o que vem da ficha técnica do modelo da Alibaba, o que verificamos na página do Ollama hoje e o que é projeção ou medição de terceiros.
A ficha informativa de 30 segundos
Qwen3.8 27B é o modelo denso de 27 bilhões de parâmetros da Alibaba, lançado de 13 a 14 de agosto de 2026 sob a licença Apache 2.0 — os pesos foram disponibilizados no Hugging Face e no ModelScope no dia 13, com o arquivo LICENSE aparecendo na manhã seguinte. É a versão densa e implantável do Qwen3.8-Max, de 2,4T de parâmetros. Pelo model card, tudo o que é relatado pela Alibaba ainda não foi reproduzido de forma independente:
• Tamanho — 27B denso, 27,78B de parâmetros totais incluindo o codificador de visão.
• Arquitetura — 64 camadas, tamanho oculto 5.120, vocabulário 248.320.
• Atenção híbrida — 16 camadas de atenção total mais 48 camadas lineares Gated DeltaNet, numa proporção de 3:1.
• Contexto — 262.144 tokens nativos, expansível para 1M via YaRN (Ollama lista a tag em 256K).
• Entrada — compreensão nativa de imagens e vídeos além de texto, de documentos a vídeos de até uma hora.
• Pesos — 55,6 GB em BF16, cabeça MTP de decodificação especulativa incluída.

No lado do MLX, verificado hoje: Ollama oferece o qwen3.8:27b-mlx — uma compilação nativa de MLX para Apple Silicon com download de ~18 GB em 4 bits — e as notas de versão v0.32.12 destacam a otimização para Apple Silicon. mlx-lm, a ferramenta Python da Apple, suporta a arquitetura para geração e conversão, e as quantizações MLX (3/5/6 bits, além de MXFP4 e NVFP4) apareceram em poucas horas após os pesos. O restante deste artigo assume um Mac da série M com 24 GB ou mais de memória unificada.
O que o MLX muda em relação à memória
No Apple Silicon não há VRAM separada. O MLX roda no pool de memória unificada da série M, então o número que importa é a RAM total do seu Mac menos o que o macOS e todo o resto ocupam. Um modelo que "cabe em 17 GB" precisa de uma máquina com confortavelmente mais do que isso.
A boa notícia é que o Qwen3.8 27B é mais barato de manter do que sua contagem de parâmetros sugere. Como apenas as 16 camadas de atenção total mantêm um cache KV — as 48 camadas lineares não —, o cache custa cerca de 64 KB por token, aproximadamente um quarto do que um modelo denso convencional de 64 camadas paga. No extremo, a janela completa de 262K precisa de ~16.4 GB de cache além dos pesos, o que é um orçamento de servidor, não um orçamento de laptop.
A escada realista para um Mac, tamanho do arquivo mais folga de cache:
• MLX de 4 bits — total de ~16–19 GB. Cabe em um Mac de 24 GB com aproximadamente uma janela de 64K–96K; o padrão sensato.
• 6-bit MLX — ~21–22 GB. Máquinas de 32 GB; o salto de qualidade em relação ao 4-bit é modesto.
• MLX de 8 bits — ~27–30 GB. Máquinas com 48 GB+; quase sem perdas.
• BF16 — ~55,6 GB. Apenas as máquinas de estúdio M-series Max e Ultra de ponta.

Fontes: o valor de 4 bits acompanha o GGUF Q4_K_M medido (17,1 GB, unsloth, 14 de agosto) e o download de 18 GB do Ollama; os valores de 8 bits e BF16 acompanham o próprio cartão BF16 da Alibaba e a linhagem Qwen3.6-27B. O valor de cache de 64 KB por token é derivado da arquitetura, não consta em uma ficha técnica e só é válido para runtimes que pulam o cache KV nas camadas lineares, da mesma forma que o MLX faz.
Três maneiras de executá-lo, do mais simples ao maior controle.
Caminho A — Ollama, o mais simples
Atualize para Ollama 0.32.12 ou mais recente, então:
• ollama pull qwen3.8:27b-mlx — baixa o build MLX de ~18 GB.
• ollama run qwen3.8:27b-mlx — chat interativo com o template de pensamento integrado.
• ollama serve — expõe a API compatível com OpenAI em localhost:11434 para seus aplicativos.

Um problema conhecido, de uma issue do GitHub ainda aberta no momento em que escrevo: o qwen3.8:27b-mlx rejeita o papel "developer" no endpoint /v1/responses, o que quebra ollama launch codex para este modelo — enquanto usar diretamente ollama run funciona normalmente. Se você está construindo um loop de agente no estilo Codex na versão MLX, teste o endpoint exato que planeja usar antes de basear o loop nele.
Caminho B — mlx-lm, o máximo controle
O toolkit da própria Apple. Instale-o com pip install mlx-lm, em seguida baixe um checkpoint MLX pré-quantizado ou converta você mesmo os pesos BF16 oficiais:
• mlx_lm.generate --model <checkpoint> — execute um checkpoint diretamente; quantizações de 4 bits e 8 bits da comunidade para o 27B ainda estavam chegando ao mlx-community dentro de dias após o lançamento.
• mlx_lm.convert --hf-path Qwen/Qwen3.8-27B --q-bits 4 — converta uma vez; custa cerca de um download.
• mlx_lm.server --model <checkpoint> — servidor compatível com OpenAI que aplica o template de chat com bloco de pensamento para você.
Se a quantização exata que você quer ainda não está disponível, converter a partir dos pesos oficiais é uma tarefa rápida em qualquer Mac da série M e elimina qualquer dúvida sobre o que um terceiro disponibilizou.
Caminho C — LM Studio, a opção de um clique.
O LM Studio usa o backend MLX no Apple Silicon e adotou o Qwen3.8 27B no lançamento: pesquise pelo modelo, escolha uma quantização que caiba na sua RAM, e ele baixa e executa. Se você prefere uma GUI, esse é o caminho mais amigável, e nosso guia passo a passo complementar aborda tudo do início ao fim — veja "Como executar Qwen3.8 27B localmente" nas leituras relacionadas abaixo.
A armadilha do template
Qwen3.8 27B pensa por padrão, e os blocos de pensamento são renderizados pelo template de chat, não pelo núcleo do modelo. Testes de terceiros das primeiras 48 horas observam que o template oficial envolve cada resposta do assistente em um bloco de pensamento — mesmo os vazios — e que em loops de agente com múltiplas voltas os blocos se aninham e o histórico é truncado, o que parece amnésia. Não é a quantização. Se um runtime enviar um template corrigido, use-o; quando você estiver construindo um loop de agente e não precisar do raciocínio, desative o pensamento por solicitação — o template de chat expõe uma flag enable_thinking, e o modelo aceita um reasoning_effort de xhigh, medium ou low.
O que realmente se sente
Um teste independente em um Mac mini M4 com 32 GB de memória unificada, executando a compilação MLX de 4 bits, mediu aproximadamente 5–6 tokens/s de geração. Esse é o número que deve definir as expectativas: adequado para rascunho interativo, raciocínio extenso e chamadas ocasionais de agente; problemático para loops agênticos longos e trabalhos em lote. A anedota do mesmo testador — uma reflexão de vários minutos seguida por um pequeno aplicativo que parecia correto, mas não batia certo — é um bom lembrete de que um 27B em um laptop é um assistente capaz, mas não infalível.
A velocidade escala com o nível do chip: um Max da série M com mais largura de banda de memória e núcleos roda consideravelmente mais rápido que o M4 básico no mini. Mas 5–6 tok/s no modelo de entrada é a referência honesta, e você deve avaliar qualquer manchete de "roda em Apple Silicon" com base nisso.
O contexto de 262K é um recurso de servidor
A janela nativa de 262K do Qwen3.8 27B é genuinamente útil — mas em um Mac ela é limitada pela memória, não pelo modelo. Com 64 KB de cache KV por token, uma janela de 8K custa cerca de 0,5 GB; 32K, cerca de 2 GB; 128K, cerca de 8 GB; e os 262K completos, cerca de 16,4 GB além dos pesos. Em uma máquina de 24 GB rodando em 4 bits, o teto realista é de aproximadamente 64K–96K tokens; chegar perto de 128K+ exige uma máquina de 32 GB+, e a janela completa exige uma máquina cuja memória unificada seja em sua maior parte cache. Planeje o contexto que você realmente precisa e defina um limite na configuração de execução — o modelo fica satisfeito e o arquivo de swap permanece quieto.
Quando o Apple Silicon é a resposta errada
Escolha um caminho diferente se alguma destas for sua carga de trabalho:
Você tem um Mac de 8 GB ou 16 GB. A versão de 4 bits já precisa de ~17 GB de memória unificada; qualquer coisa abaixo disso causa swap e o modelo fica inutilizável. Essa é a falha mais comum de todas, e nenhuma artimanha de quantização resolve isso.
• Você precisa da janela completa de 262K ou da extensão YaRN de 1M. Esse orçamento de KV é um orçamento de servidor, não de laptop.
• Você está atendendo outras pessoas. Um laptop é um único assento; a capacidade de processamento para múltiplos usuários exige um servidor com GPU ou uma API hospedada.
• Você precisa agir rápido em loops agênticos longos. 5–6 tok/s é bom para um humano acompanhando a leitura, mas lento para um sub-agente.
O enquadramento honesto: a proposta do Qwen3.8 27B é que ele é gratuito no ponto de uso em hardware que você possui — o oposto de um modelo de API que cobra por token. É exatamente por isso que ele não está no catálogo do OrcaRouter (o catálogo roteia a geração anterior Qwen3.6/3.5-27B e a linha de API hospedada Qwen). Nós somos a ferramenta errada para a história de gratuidade local, e é esse o ponto: quando uma carga de trabalho supera um Mac, as alternativas são uma caixa GPU, uma GPU alugada ou uma API Qwen hospedada — não um roteador que por acaso carrega esse 27B específico.
Conclusão
O Qwen3.8 27B no Apple Silicon é real, é bom e tem escopo restrito. A versão MLX de 4 bits cabe em um Mac com 24 GB ou mais, é baixada como qwen3.8:27b-mlx no Ollama, não custa nada por token e é o primeiro modelo aberto de nível agente realmente utilizável que cabe em um laptop. As desvantagens são a velocidade (5–6 tok/s em um M4 mini) e o contexto (limite-o bem abaixo de 262K, a menos que você tenha RAM suficiente). Se você tem um Mac com 24 GB ou mais e uma carga de trabalho que um 27B pode suportar, este é o melhor modelo local gratuito disponível esta semana. Se você tem um Mac de 16 GB ou precisa de throughput de produção, ele não é — e a alternativa é um caminho pago, o que é uma decisão totalmente diferente.
