Um cartão de título para o Qwen3.8-27B com MLX no Apple Silicon, mostrando um ícone minimalista de laptop com um selo do mecanismo MLX e uma etiqueta de preço que diz grátis, no seu Mac.
Guides & Insights

Qwen3.8-27B com MLX no Apple Silicon: Sim, roda — aqui está o que você realmente precisa

Autor

Magnus Corvin

Data de publicação

Modelos mais recentes · 20Ver todos os modelos
Benchmarks: Artificial Analysis · atualizado diariamente
Voltar para todas as publicações

O Qwen3.8 27B roda em Apple Silicon hoje através do MLX. A tag é qwen3.8:27b-mlx no Ollama, adicionada no Ollama v0.32.12, e a versão de 4 bits baixa cerca de 18 GB e precisa de aproximadamente 16–19 GB de memória unificada — o que torna um Mac de 24 GB+ o mínimo realista e um Mac de 16 GB inviável. Os pesos são Apache 2.0, gratuitos no ponto de uso em hardware que você possui, que é exatamente o propósito do modelo. O lançamento da Ali​baba tem dois dias (13–14 de agosto de 2026), então cada número abaixo está rotulado: o que vem da ficha técnica do modelo da Ali​baba, o que verificamos na página do Ollama hoje e o que é projeção ou medição de terceiros.

A ficha informativa de 30 segundos

Qwen3.8 27B é o modelo denso de 27 bilhões de parâmetros da Ali​baba, lançado de 13 a 14 de agosto de 2026 sob a licença Apache 2.0 — os pesos foram disponibilizados no Hugging Face e no ModelScope no dia 13, com o arquivo LICENSE aparecendo na manhã seguinte. É a versão densa e implantável do Qwen3.8-Max, de 2,4T de parâmetros. Pelo model card, tudo o que é relatado pela Ali​baba ainda não foi reproduzido de forma independente:

Tamanho — 27B denso, 27,78B de parâmetros totais incluindo o codificador de visão.

Arquitetura — 64 camadas, tamanho oculto 5.120, vocabulário 248.320.

Atenção híbrida — 16 camadas de atenção total mais 48 camadas lineares Gated DeltaNet, numa proporção de 3:1.

Contexto — 262.144 tokens nativos, expansível para 1M via YaRN (Ollama lista a tag em 256K).

Entrada — compreensão nativa de imagens e vídeos além de texto, de documentos a vídeos de até uma hora.

Pesos — 55,6 GB em BF16, cabeça MTP de decodificação especulativa incluída.

A single-column scoreboard for Qwen3.8-27B: 27B dense (27.78B with vision), 64 layers with 16 full plus 48 linear attention, 262K native context (1M via YaRN), text plus image plus video input, Apache 2.0 weights at 55.6 GB BF16, released August 13-14 2026.

No lado do MLX, verificado hoje: Ollama oferece o qwen3.8:27b-mlx — uma compilação nativa de MLX para Apple Silicon com download de ~18 GB em 4 bits — e as notas de versão v0.32.12 destacam a otimização para Apple Silicon. mlx-lm, a ferramenta Python da Apple, suporta a arquitetura para geração e conversão, e as quantizações MLX (3/5/6 bits, além de MXFP4 e NVFP4) apareceram em poucas horas após os pesos. O restante deste artigo assume um Mac da série M com 24 GB ou mais de memória unificada.

O que o MLX muda em relação à memória

No Apple Silicon não há VRAM separada. O MLX roda no pool de memória unificada da série M, então o número que importa é a RAM total do seu Mac menos o que o macOS e todo o resto ocupam. Um modelo que "cabe em 17 GB" precisa de uma máquina com confortavelmente mais do que isso.

A boa notícia é que o Qwen3.8 27B é mais barato de manter do que sua contagem de parâmetros sugere. Como apenas as 16 camadas de atenção total mantêm um cache KV — as 48 camadas lineares não —, o cache custa cerca de 64 KB por token, aproximadamente um quarto do que um modelo denso convencional de 64 camadas paga. No extremo, a janela completa de 262K precisa de ~16.4 GB de cache além dos pesos, o que é um orçamento de servidor, não um orçamento de laptop.

A escada realista para um Mac, tamanho do arquivo mais folga de cache:

MLX de 4 bits — total de ~16–19 GB. Cabe em um Mac de 24 GB com aproximadamente uma janela de 64K–96K; o padrão sensato.

6-bit MLX — ~21–22 GB. Máquinas de 32 GB; o salto de qualidade em relação ao 4-bit é modesto.

MLX de 8 bits — ~27–30 GB. Máquinas com 48 GB+; quase sem perdas.

BF16 — ~55,6 GB. Apenas as máquinas de estúdio M-series Max e Ultra de ponta.

An Apple Silicon MLX memory ladder for Qwen3.8-27B: 4-bit at roughly 16-19 GB fits 24 GB and up Macs, 6-bit at roughly 21-22 GB fits 32 GB Macs, 8-bit at roughly 27-30 GB fits 48 GB and up Macs, and BF16 at 55.6 GB is for Max and Ultra studio machines only.

Fontes: o valor de 4 bits acompanha o GGUF Q4_K_M medido (17,1 GB, unsloth, 14 de agosto) e o download de 18 GB do Ollama; os valores de 8 bits e BF16 acompanham o próprio cartão BF16 da Ali​baba e a linhagem Qwen3.6-27B. O valor de cache de 64 KB por token é derivado da arquitetura, não consta em uma ficha técnica e só é válido para runtimes que pulam o cache KV nas camadas lineares, da mesma forma que o MLX faz.

Três maneiras de executá-lo, do mais simples ao maior controle.

Caminho A — Ollama, o mais simples

Atualize para Ollama 0.32.12 ou mais recente, então:

ollama pull qwen3.8:27b-mlx — baixa o build MLX de ~18 GB.

ollama run qwen3.8:27b-mlx — chat interativo com o template de pensamento integrado.

ollama serve — expõe a API compatível com OpenAI em localhost:11434 para seus aplicativos.

The Ollama library page for qwen3.8, showing the qwen3.8:27b-mlx tag with an MLX badge, an 18 GB download size and a 256K context, alongside the qwen3.8:27b and qwen3.8:latest tags.

Um problema conhecido, de uma issue do GitHub ainda aberta no momento em que escrevo: o qwen3.8:27b-mlx rejeita o papel "developer" no endpoint /v1/responses, o que quebra ollama launch codex para este modelo — enquanto usar diretamente ollama run funciona normalmente. Se você está construindo um loop de agente no estilo Codex na versão MLX, teste o endpoint exato que planeja usar antes de basear o loop nele.

Caminho B — mlx-lm, o máximo controle

O toolkit da própria Apple. Instale-o com pip install mlx-lm, em seguida baixe um checkpoint MLX pré-quantizado ou converta você mesmo os pesos BF16 oficiais:

mlx_lm.generate --model <checkpoint> — execute um checkpoint diretamente; quantizações de 4 bits e 8 bits da comunidade para o 27B ainda estavam chegando ao mlx-community dentro de dias após o lançamento.

mlx_lm.convert --hf-path Qwen/Qwen3.8-27B --q-bits 4 — converta uma vez; custa cerca de um download.

mlx_lm.server --model <checkpoint> — servidor compatível com O​penAI que aplica o template de chat com bloco de pensamento para você.

Se a quantização exata que você quer ainda não está disponível, converter a partir dos pesos oficiais é uma tarefa rápida em qualquer Mac da série M e elimina qualquer dúvida sobre o que um terceiro disponibilizou.

Caminho C — LM Studio, a opção de um clique.

O LM Studio usa o backend MLX no Apple Silicon e adotou o Qwen3.8 27B no lançamento: pesquise pelo modelo, escolha uma quantização que caiba na sua RAM, e ele baixa e executa. Se você prefere uma GUI, esse é o caminho mais amigável, e nosso guia passo a passo complementar aborda tudo do início ao fim — veja "Como executar Qwen3.8 27B localmente" nas leituras relacionadas abaixo.

A armadilha do template

Qwen3.8 27B pensa por padrão, e os blocos de pensamento são renderizados pelo template de chat, não pelo núcleo do modelo. Testes de terceiros das primeiras 48 horas observam que o template oficial envolve cada resposta do assistente em um bloco de pensamento — mesmo os vazios — e que em loops de agente com múltiplas voltas os blocos se aninham e o histórico é truncado, o que parece amnésia. Não é a quantização. Se um runtime enviar um template corrigido, use-o; quando você estiver construindo um loop de agente e não precisar do raciocínio, desative o pensamento por solicitação — o template de chat expõe uma flag enable_thinking, e o modelo aceita um reasoning_effort de xhigh, medium ou low.

O que realmente se sente

Um teste independente em um Mac mini M4 com 32 GB de memória unificada, executando a compilação MLX de 4 bits, mediu aproximadamente 5–6 tokens/s de geração. Esse é o número que deve definir as expectativas: adequado para rascunho interativo, raciocínio extenso e chamadas ocasionais de agente; problemático para loops agênticos longos e trabalhos em lote. A anedota do mesmo testador — uma reflexão de vários minutos seguida por um pequeno aplicativo que parecia correto, mas não batia certo — é um bom lembrete de que um 27B em um laptop é um assistente capaz, mas não infalível.

A velocidade escala com o nível do chip: um Max da série M com mais largura de banda de memória e núcleos roda consideravelmente mais rápido que o M4 básico no mini. Mas 5–6 tok/s no modelo de entrada é a referência honesta, e você deve avaliar qualquer manchete de "roda em Apple Silicon" com base nisso.

O contexto de 262K é um recurso de servidor

A janela nativa de 262K do Qwen3.8 27B é genuinamente útil — mas em um Mac ela é limitada pela memória, não pelo modelo. Com 64 KB de cache KV por token, uma janela de 8K custa cerca de 0,5 GB; 32K, cerca de 2 GB; 128K, cerca de 8 GB; e os 262K completos, cerca de 16,4 GB além dos pesos. Em uma máquina de 24 GB rodando em 4 bits, o teto realista é de aproximadamente 64K–96K tokens; chegar perto de 128K+ exige uma máquina de 32 GB+, e a janela completa exige uma máquina cuja memória unificada seja em sua maior parte cache. Planeje o contexto que você realmente precisa e defina um limite na configuração de execução — o modelo fica satisfeito e o arquivo de swap permanece quieto.

Quando o Apple Silicon é a resposta errada

Escolha um caminho diferente se alguma destas for sua carga de trabalho:

Você tem um Mac de 8 GB ou 16 GB. A versão de 4 bits já precisa de ~17 GB de memória unificada; qualquer coisa abaixo disso causa swap e o modelo fica inutilizável. Essa é a falha mais comum de todas, e nenhuma artimanha de quantização resolve isso.

• Você precisa da janela completa de 262K ou da extensão YaRN de 1M. Esse orçamento de KV é um orçamento de servidor, não de laptop.

• Você está atendendo outras pessoas. Um laptop é um único assento; a capacidade de processamento para múltiplos usuários exige um servidor com GPU ou uma API hospedada.

• Você precisa agir rápido em loops agênticos longos. 5–6 tok/s é bom para um humano acompanhando a leitura, mas lento para um sub-agente.

O enquadramento honesto: a proposta do Qwen3.8 27B é que ele é gratuito no ponto de uso em hardware que você possui — o oposto de um modelo de API que cobra por token. É exatamente por isso que ele não está no catálogo do OrcaRouter (o catálogo roteia a geração anterior Qwen3.6/3.5-27B e a linha de API hospedada Qwe​n). Nós somos a ferramenta errada para a história de gratuidade local, e é esse o ponto: quando uma carga de trabalho supera um Mac, as alternativas são uma caixa GPU, uma GPU alugada ou uma API Qwe​n hospedada — não um roteador que por acaso carrega esse 27B específico.

Conclusão

O Qwen3.8 27B no Apple Silicon é real, é bom e tem escopo restrito. A versão MLX de 4 bits cabe em um Mac com 24 GB ou mais, é baixada como qwen3.8:27b-mlx no Ollama, não custa nada por token e é o primeiro modelo aberto de nível agente realmente utilizável que cabe em um laptop. As desvantagens são a velocidade (5–6 tok/s em um M4 mini) e o contexto (limite-o bem abaixo de 262K, a menos que você tenha RAM suficiente). Se você tem um Mac com 24 GB ou mais e uma carga de trabalho que um 27B pode suportar, este é o melhor modelo local gratuito disponível esta semana. Se você tem um Mac de 16 GB ou precisa de throughput de produção, ele não é — e a alternativa é um caminho pago, o que é uma decisão totalmente diferente.

© 2026 OrcaRouter

Para provedores

Opera uma plataforma de inferência? Traga seus modelos para o OrcaRouter.

Fale conosco

Junte-se à comunidade

DiscordEmailXGitHubYouTube