Um card de título para o artigo Qwen3.8-27B no Ollama, mostrando uma janela de terminal minimalista com o comando 'ollama run qwen3.8:27b' e um cursor piscante, três badges com os dizeres '18 GB de download', 'Q4_K_M padrão' e 'contexto de 262K', e a legenda 'grátis para rodar, no seu hardware'.
Guides & Insights

Qwen3.8-27B no Ollama: Um Comando, Quatro Quants, e o Que "Grátis" Realmente Custa

Autor

Rowan Sterling

Data de publicação

Modelos mais recentes · 20Ver todos os modelos →
Benchmarks: Artificial Analysis · atualizado diariamente
Voltar para todas as publicações

Execute com um único comando: ollama run qwen3.8:27b. Essa é a resposta completa à pergunta sobre a qual esta página trata. Qwen3.8 27B — o modelo denso de 27 bilhões de parâmetros da Ali​baba, com pesos lançados em 14 de agosto de 2026 sob a licença Apache 2.0 — entrou no ar na biblioteca do Ollama esta semana, e a build padrão já é um quant Q4_K_M sensato de 18 GB (17 GB de pesos mais um codificador de visão de 931 MB). Ele roda totalmente em uma GPU de 24 GB com comprimentos de contexto normais, é dividido para a CPU quando sua placa é menor e não custa nada por token.

Tudo aqui tem data de 15 de agosto de 2026. As especificações vêm do model card do Qwen3.8 27B; os tamanhos de download, as tags e as contagens de downloads vêm da página ativa da biblioteca do Ollama; os números de benchmark são relatados pela Alibaba e ainda não têm replicação independente. O modelo foi lançado há poucos dias, então trate tudo que possa mudar como provisório.

A frase de uma linha que realmente funciona

Se você já tem o Ollama instalado, faltam apenas duas palavras:

ollama run qwen3.8:27b

O suporte ao Ollama chegou na v0.32.12 — a nota de lançamento diz, sem rodeios: "Esta versão adiciona o suporte ao Qwe​n 3.8 27B." A primeira execução baixa a build padrão (cerca de 18 GB, Q4_K_M) e, em seguida, coloca você em um REPL de chat com o modo de pensamento ativado por padrão. A página da biblioteca lista a build com as tags de capacidade "vision tools thinking 27b", que é como você sabe que os caminhos de visão e de chamada de ferramentas estão integrados ao mesmo download. Até o momento em que escrevo, a página mostra mais de 40.000 downloads e uma lista de tags que já abrange onze variantes.

Screenshot of the Ollama library page for qwen3.8:27b, showing the default Q4_K_M build at 18 GB total — 17 GB for the 27.3B weights plus 931 MB for the 461M-parameter vision projector — the model ID 'ollama run qwen3.8:27b' and capability tags vision, tools, thinking, 27b.

Duas variantes que você realmente vai usar:

• ollama run qwen3.8:27b-mlx — a build para Apple Silicon, mesmo consumo de 18 GB, mas compilada para Metal; é a que a nota de lançamento do Ollama otimiza especificamente "para o máximo desempenho e qualidade de saída adequados a tarefas repetitivas e agentes de codificação."

• ollama run qwen3.8:27b-q8_0 — uma quantização de 8 bits de 30 GB, para quando você tem VRAM de sobra e quer os pesos mais próximos da precisão total.

O que você está realmente baixando

O nome diz 27B, mas a contagem total de parâmetros é 28B: um modelo de linguagem denso de 27,3B mais um codificador de visão de 461M que lhe dá entrada nativa de imagem e vídeo. O resto da especificação de destaque, direto da ficha do modelo:

• 64 camadas, tamanho oculto 5.120, vocabulário 248.320.

• Atenção híbrida: 16 camadas completas de Gated Attention e 48 camadas lineares de Gated DeltaNet — uma mistura 3:1 com predominância linear, e o motivo pelo qual um 27B consegue manter um contexto nativo de 262.144 tokens (expansível para 1M) sem que o cache KV consuma um data center inteiro.

• Compreensão nativa de imagens e vídeos — "de diagramas e documentos STEM a vídeos de horas de duração" é a formulação da Alibaba.

• Apache 2.0. Baixe-o, modifique-o, venda um produto com base nele. Essa licença é o fato jurídico do qual depende a economia do restante deste artigo.

A referência de precisão total é BF16, e é por isso que as tags de 56 GB existem; cada tag menor é uma troca de precisão por espaço ocupado, e os próprios benchmarks do cartão do modelo são a referência contra a qual você está trocando.

Escolha um quant, depois verifique sua VRAM, não o contrário.

O Ollama oferece onze tags, mas a decisão se resume a três tamanhos.

• 18 GB — Q4_K_M (padrão). Cabe totalmente em uma placa de 24 GB (classe RTX 4090 / 5090) com contexto normal, e em placas de 16 GB com offload parcial para CPU — mais lento, mas funciona. Esta é a versão para "só rodar".

• 30 GB — Q8_0. Pesos próximos da precisão total, precisa de aproximadamente 40 GB de VRAM para permanecer totalmente na GPU. Em um 27B, você já deve saber por que quer a fidelidade extra antes de pagar por ela.

• 56 GB — BF16. A build de referência. Requer hardware da classe H100 ou de 96 GB. Ninguém está rodando isso em uma GPU de consumidor, e isso não é problema.

A self-built card comparing the Qwen3.8-27B Ollama quantization tiers: Q4_K_M at 18 GB fitting a 24 GB card, Q8_0 at 30 GB needing roughly 40 GB of VRAM, BF16 at 56 GB requiring H100-class hardware, and the Apple Silicon MLX build at 18 GB of unified memory, with a footer noting the KV cache adds several GB at long context.

O número que confunde as pessoas é o cache KV. O download de 18 GB não significa que 18 GB de VRAM sejam suficientes para uma sessão com contexto de 262K — em contexto longo, o cache adiciona vários gigabytes além dos pesos, e é por isso que uma placa de 24 GB comporta este modelo tranquilamente em contexto de 8K–32K, mas não em 262K. Em uma placa no limite, reduza o contexto, não a quantização.

O Apple Silicon é um alvo de primeira classe aqui.

A nota de versão v0.32.12 do Ollama menciona o macOS especificamente. Concretamente, ollama run qwen3.8:27b-mlx precisa de cerca de 18 GB de memória unificada, portanto um Mac com 24 GB ou mais o executa totalmente na GPU, com folga para o contexto. Há também uma tag MLX mxfp8 de 32 GB e uma tag mlx-bf16 de 56 GB para as máquinas de 64–128 GB. Se o seu Mac da série M tem acompanhado as notícias sobre modelos de desktop, esta é a build que você estava esperando.

Contexto: 262K na ficha técnica, menos no seu assento.

O cartão do modelo lista 262.144 tokens nativos, extensíveis para 1M; a página da biblioteca do Ollama informa a mesma janela como 256K. Ambas as informações são verdadeiras — 262.144 é 256K vezes 1024 — e nenhuma delas significa que você deve digitar esse número em --num-ctx em uma placa de 24 GB. O cache KV cresce aproximadamente de forma linear com o contexto, então em hardware de consumidor você vai viver na faixa de 16K–64K, não em 262K. Comece com o padrão do Ollama, aumente --num-ctx apenas quando uma tarefa realmente precisar, e lembre-se de que o número de 1M exige o mecanismo de extensão mais a VRAM para alimentá-lo.

O que ainda está instável — leia isto antes de apostar nisso

• Ainda não há benchmarks independentes.Todos os números na ficha do modelo são apenas a palavra da Ali​baba com data de 15 de agosto. Os ganhos alegados em relação ao Qwen3.6-27B são grandes — SWE-bench Pro 61,7 vs 53,5, Terminal Bench 2.1 73,0 vs 63,4, LiveCodeBench v6 90,3 vs 83,9, GPQA Diamond 89,2 vs 87,8 — e todos parecem plausíveis, e nenhum deles foi reproduzido por um harness externo. Não baseie uma decisão de produção apenas neles.

• A pilha de visão tem apenas alguns dias. Um relatório de bug inicial (problema #17753 do ollama) mostrou que a build Q4 encaminhava a entrada de visão pelo parser do Qwen3.5 e falhava com imagens; foi corrigido em poucos dias no PR #17755, mas o caminho multimodal em um modelo com uma semana de vida é exatamente onde você deve testar antes de confiar nele.

• A build padrão inclui MTP. A tag q4_K_M também é a build de previsão de múltiplos tokens — decodificação mais rápida, e a razão pela qual "18 GB" e "27B" podem coexistir sem contradição.

• Os rótulos de quantização podem ser enganosos na Apple. As tags "mlx" e "nvfp4" de 18 GB diferem na quantização — NVFP4 é um formato FP4 da NVIDIA — então, em um Mac, prefira a build -mlx simples, a menos que você precise especificamente de uma variante FP8/FP4 para uma GPU Blackwell.

"Grátis" está fazendo um trabalho e tanto nessa manchete.

A auto-hospedagem de um 27B é gratuita por token, mas não é gratuita. O enquadramento honesto consiste em três opções que custam moedas diferentes:

• Rode você mesmo (Ollama). US$ 0 por token, offline, ilimitado, privado — e o hardware é seu. Uma GPU de 24 GB ou um Mac de 18 GB+ é uma compra de verdade, e o mesmo vale para a energia elétrica e o tempo de configuração. Esta é a escolha certa quando o Qwen3.8 27B se tornar uma ferramenta de uso diário.

• Chame uma API com limite de taxa de $0. O OrcaRouter disponibiliza o Qwen3.8 27B em sua própria infraestrutura a custo zero (ID do modelo qwen/qwen3.8-27b-free, $0 por requisição, com limite de taxa) — como os pesos são abertos, não há custo de fornecedor por token a repassar. Esta é a escolha certa quando você quer experimentar o modelo sem comprar hardware para testar uma versão lançada há uma semana.

• Acesse uma API ilimitada. O mesmo modelo sem o limite de requisições custa US$ 0,33 por milhão de tokens de entrada e US$ 2,40 por milhão de tokens de saída no OrcaRouter (qwen/qwen3.8-27b, contexto de 262K, entrada de texto, imagem e vídeo). Esta é a escolha certa quando você precisa de escala de produção e não quer ficar de olho em uma GPU.

Screenshot of the OrcaRouter model page for qwen/qwen3.8-27b, showing the model ID, the 'by Qwen' vendor label, a 262K-token context window, text, image and video input, and a p50 first-token latency of 225 ms.

A matemática que decide entre eles: o uso ocasional se paga melhor a $0 ou a $0,33/$2,40 do que ao preço de uma GPU; o uso interativo diário é mais barato localmente; a capacidade de produção sustentada é mais barata como uma API que você não precisa manter ativa. Requisitos de privacidade e uso offline levam você para a primeira coluna, não importa o que a matemática diga.

Quando esta recomendação estiver errada

• Você realmente precisa de contexto de 100K+. O modelo consegue; sua placa de 24 GB não. Em contexto longo de verdade, uma GPU de 40 GB+ ou uma API com contexto maior não são luxo.

• Você precisa de vídeo em produção hoje. O caminho da visão acabou de ter seu bug de parser corrigido; vídeo em produção em um modelo multimodal de uma semana de vida é uma aposta que você não deveria fazer sem um plano B.

• Você quer concorrência. Uma GPU de consumidor transmite uma ou duas gerações por vez. Um 27B não é um servidor.

• Você está usando hardware apenas com CPU. Um modelo 27B em 4 bits na CPU é uma demonstração lenta, não uma ferramenta. Uma API é a escolha honesta até você ter uma GPU.

A conclusão

Qwen3.8 27B no Ollama é a maneira mais fácil de executar um 27B de geração atual que alguém já lançou até agora: um comando, um padrão de 18 GB que cabe em uma placa de 24 GB, uma build de primeira classe para Apple Silicon e a liberdade da Apache 2.0. O quant que você deve escolher é quase sempre o Q4_K_M padrão — mude para q8_0 apenas quando conseguir medir a diferença. E o “grátis” é condicional: se você for mexer no modelo ocasionalmente, a API com limite de taxa de $0 é mais livre do que comprar hardware; se ele se tornar seu uso diário, a cópia local é a coisa mais barata que você possui. Verifique os números antes de se basear neles — tudo neste artigo era verdade em 15 de agosto de 2026, e este modelo está mudando a cada dia.