Um cartão de título para o artigo Qwen3.8-27B no Ollama, mostrando uma janela de terminal minimalista com o comando 'ollama run qwen3.8:27b' e um cursor piscando, três selos com os textos 'download de 18 GB', 'Q4_K_M padrão' e 'contexto de 262K', e a legenda 'grátis para executar, seu hardware'.
Guides & Insights

Qwen3.8-27B no Ollama: Um Comando, Quatro Quants, e o Que "Grátis" Realmente Custa

Autor

Rowan Sterling

Data de publicação

Modelos mais recentes · 20Ver todos os modelos
Benchmarks: Artificial Analysis · atualizado diariamente
Voltar para todas as publicações

Execute com um único comando: ollama run qwen3.8:27b. Essa é toda a resposta para a pergunta desta página. Qwen3.8 27B — o modelo denso de 27 bilhões de parâmetros da Ali​baba, cujos pesos foram lançados em 14 de agosto de 2026 sob a licença Apache 2.0 — entrou na biblioteca do Ollama esta semana, e a construção padrão já é uma quantização Q4_K_M de 18 GB (17 GB de pesos mais um codificador de visão de 931 MB). Ele roda totalmente em uma GPU de 24 GB em comprimentos de contexto normais, divide para a CPU quando sua placa é menor e não custa nada por token.

Tudo aqui é datado de 15 de agosto de 2026. As especificações vêm da ficha do modelo Qwen3.8 27B; tamanhos de download, tags e contagens de downloads vêm da página ao vivo da biblioteca Ollama; os números de benchmark são relatados pela Ali​baba e ainda não têm replicação independente. O modelo foi lançado há poucos dias, então trate qualquer coisa que possa mudar como provisória.

A frase de uma linha que realmente funciona

Se você já tem o Ollama instalado, faltam apenas duas palavras:

ollama run qwen3.8:27b

O suporte a Ollama chegou na v0.32.12 — a nota de versão diz, simplesmente, "Esta versão adiciona o suporte ao Qwe​n 3.8 27B." A primeira execução baixa a build padrão (cerca de 18 GB, Q4_K_M) e, em seguida, leva você a um REPL de chat com o modo de raciocínio ativado por padrão. A página da biblioteca lista a build com as tags de capacidade "vision tools thinking 27b", que é como você sabe que os caminhos de visão e chamada de ferramentas estão integrados no mesmo download. No momento em que este texto foi escrito, a página mostra mais de 40.000 downloads e uma lista de tags que já abrange onze variantes.

Screenshot of the Ollama library page for qwen3.8:27b, showing the default Q4_K_M build at 18 GB total — 17 GB for the 27.3B weights plus 931 MB for the 461M-parameter vision projector — the model ID 'ollama run qwen3.8:27b' and capability tags vision, tools, thinking, 27b.

Duas variantes que você realmente vai usar:

• ollama run qwen3.8:27b-mlx — a versão para Apple Silicon, com o mesmo tamanho de 18 GB, mas compilada para Metal; é a que a nota de versão do Ollama otimiza especificamente "para desempenho máximo e qualidade de saída adequada para tarefas repetidas e agentes de codificação."

• ollama run qwen3.8:27b-q8_0 — uma quantização de 8 bits de 30 GB, para quando você tem VRAM e quer os pesos mais próximos da precisão total.

O que você está realmente baixando

O nome diz 27B, mas a contagem total de parâmetros é 28B: um modelo de linguagem denso de 27,3B mais um codificador visual de 461M que lhe dá entrada nativa de imagem e vídeo. O restante das especificações principais, direto do model card:

• 64 camadas, tamanho oculto 5.120, vocabulário 248.320.

Atenção híbrida: 16 camadas completas de Gated Attention e 48 camadas lineares de Gated DeltaNet — uma mistura 3:1 enxuta-linear, e a razão pela qual um 27B pode manter um contexto nativo de 262.144 tokens (extensível a 1M) sem que o cache KV consuma um datacenter inteiro.

• Compreensão nativa de imagem e vídeo — "de diagramas STEM e documentos a vídeos de horas" é a expressão da Ali​baba.

• Apache 2.0. Baixe-o, modifique-o, venda um produto baseado nele. Essa licença é o fato legal do qual depende a economia do restante deste artigo.

A referência de precisão total é o BF16, e é por isso que existem as tags de 56 GB; cada tag menor é uma troca de precisão por tamanho, e os benchmarks do próprio model card são a referência contra a qual você está fazendo essa troca.

Escolha um quant, depois verifique sua VRAM, não o contrário.

Ollama oferece onze tags, mas a decisão se resume a três tamanhos.

18 GB — Q4_K_M (padrão). Cabe totalmente em uma placa de 24 GB (classe RTX 4090 / 5090) em contexto normal, e em placas de 16 GB com offload parcial de CPU — mais lento, mas funciona. Esta é a versão para "é só rodar".

30 GB — Q8_0. Pesos com precisão quase total, precisa de aproximadamente 40 GB de VRAM para permanecer totalmente na GPU. Em um 27B, você já deve saber por que quer a fidelidade extra antes de pagar por ela.

56 GB — BF16.A build de referência. Requer hardware da classe H100 ou 96 GB. Ninguém roda isso em uma GPU de consumo, e tudo bem.

A self-built card comparing the Qwen3.8-27B Ollama quantization tiers: Q4_K_M at 18 GB fitting a 24 GB card, Q8_0 at 30 GB needing roughly 40 GB of VRAM, BF16 at 56 GB requiring H100-class hardware, and the Apple Silicon MLX build at 18 GB of unified memory, with a footer noting the KV cache adds several GB at long context.

O número que confunde as pessoas é o cache KV. O download de 18 GB não significa que 18 GB de VRAM são suficientes para uma sessão com contexto de 262K — em contexto longo, o cache adiciona vários gigabytes além dos pesos, por isso uma placa de 24 GB aguenta este modelo com folga em contexto de 8K–32K, mas não em 262K. Em uma placa no limite, reduza o contexto, não a quantização.

Apple Silicon é um target de primeira classe aqui

A nota de versão v0.32.12 do Ollama menciona o macOS especificamente. Concretamente, o comando `ollama run qwen3.8:27b-mlx` precisa de cerca de 18 GB de memória unificada, então um Mac com 24 GB ou mais executa o modelo totalmente na GPU, com folga para o contexto. Também existe uma tag MLX mxfp8 de 32 GB e uma tag mlx-bf16 de 56 GB para as máquinas de 64 a 128 GB. Se o seu Mac com chip M-series vem acompanhando as novidades dos modelos de desktop, esta é a versão que você estava esperando.

262K na ficha técnica, menos no seu assento.

O model card lista 262.144 tokens nativos, extensíveis para 1M; a página da biblioteca do Ollama informa a mesma janela como 256K. Ambas as afirmações são verdadeiras — 262.144 é 256K vezes 1024 — e nenhuma delas significa que você deva digitar esse número em --num-ctx em uma placa de 24 GB. O cache KV cresce aproximadamente de forma linear com o contexto; portanto, em hardware de consumo, você vai operar na faixa de 16K–64K, não em 262K. Comece pelo padrão do Ollama, aumente o --num-ctx somente quando uma tarefa realmente precisar dele e lembre-se de que o número de 1M exige o mecanismo de extensão, além da VRAM para alimentá-lo.

O que ainda é instável — leia isto antes de apostar nisso

Ainda não há benchmarks independentes. Todos os números do cartão do modelo são afirmações da Ali​baba, em 15 de agosto. Os ganhos declarados em relação ao Qwen3.6-27B são grandes — SWE-bench Pro 61.7 vs 53.5, Terminal Bench 2.1 73.0 vs 63.4, LiveCodeBench v6 90.3 vs 83.9, GPQA Diamond 89.2 vs 87.8 — e todos parecem plausíveis, mas nenhum deles foi reproduzido por um harness externo. Não baseie uma decisão de produção apenas neles.

A stack de visão tem apenas alguns dias. Um relatório de bug inicial (ollama issue #17753) mostrou que a build Q4 roteava a entrada de visão através do parser Qwen3.5 e falhava ao processar imagens; foi corrigido em poucos dias no PR #17755, mas o caminho multimodal de um modelo de apenas uma semana é exatamente onde você deve testar antes de confiar nele.

O build padrão inclui MTP. A tag q4_K_M é também o build de predição multi-token — decodificação mais rápida, e a razão pela qual "18 GB" e "27B" podem coexistir sem contradição.

Rótulos de quantização podem enganar no Apple. As tags "mlx" e "nvfp4" de 18 GB diferem na quantização — NVFP4 é um formato FP4 da NVIDIA — portanto, no Mac, prefira a build -mlx simples, a menos que você precise especificamente de uma variante FP8/FP4 para uma GPU Blackwell.

"Free" está fazendo muito trabalho nesse título.

Auto-hospedar um 27B é gratuito por token, mas não é gratuito. A abordagem honesta é que existem três opções que custam moedas diferentes:

Rode você mesmo (Ollama). $0 por token, offline, ilimitado, privado — e o hardware é seu. Uma GPU de 24 GB ou um Mac com 18 GB+ é uma compra real, assim como a eletricidade e o tempo de configuração. Esta é a escolha certa quando o Qwen3.8 27B se torna uma ferramenta do dia a dia.

Chame uma API com limite de taxa e custo $0.O OrcaRouter serve o Qwen3.8 27B em sua própria infraestrutura a custo zero (ID do modelo qwen/qwen3.8-27b-free, $0 por solicitação, com limite de taxa) — como os pesos são abertos, não há custo por token de fornecedor a repassar. Essa é a decisão certa quando você quer experimentar o modelo sem comprar hardware para testar uma versão lançada há uma semana.

Chame uma API ilimitada. O mesmo modelo sem o limite de taxa custa $0,33 por milhão de tokens de entrada e $2,40 por milhão de saída no OrcaRouter (qwen/qwen3.8-27b, contexto de 262K, entrada de texto, imagem e vídeo). Esta é a escolha certa quando você precisa de escala de produção e não quer cuidar de uma GPU.

Screenshot of the OrcaRouter model page for qwen/qwen3.8-27b, showing the model ID, the 'by Qwen' vendor label, a 262K-token context window, text, image and video input, and a p50 first-token latency of 225 ms.

A matemática que decide entre eles: o uso ocasional compensa mais a $0 ou a $0,33/$2,40 do que ao preço de uma GPU; o uso interativo diário é mais barato localmente; a produção contínua é mais barata como uma API que você não precisa manter ativa. Requisitos de privacidade e offline levam você para a primeira coluna, não importa o que a matemática diga.

Quando esta recomendação está errada

Você realmente precisa de contexto de 100K+. O modelo pode fazer isso; sua placa de 24 GB não pode. Em contexto realmente longo, uma GPU de 40 GB+ ou uma API de contexto mais longo não é um luxo.

Você precisa de vídeo em produção hoje. O caminho de visão acabou de ter o bug do parser corrigido; vídeo em produção em um modelo multimodal de uma semana é uma aposta que você não deveria fazer sem um plano B.

Você quer concorrência. Uma GPU de consumo processa uma ou duas gerações por vez. Um 27B não é um servidor de inferência.

Você está em hardware apenas com CPU. Um 27B em 4-bit na CPU é uma demonstração lenta, não uma ferramenta. Uma API é a escolha honesta até você ter uma GPU.

O resultado final

Qwen3.8 27B no Ollama é a maneira mais fácil de executar um 27B de geração atual que alguém já lançou: um comando, um padrão de 18 GB que cabe em uma placa de 24 GB, uma build de primeira classe para Apple Silicon e a liberdade do Apache 2.0. O quant que você deve escolher é quase sempre o padrão Q4_K_M — mude para q8_0 apenas quando puder medir a diferença. E o "grátis" é condicional: se você for usar o modelo ocasionalmente, a API de $0 com limite de taxa é mais gratuita do que comprar hardware; se ele se tornar sua ferramenta do dia a dia, a cópia local é a coisa mais barata que você tem. Verifique os números antes de construir algo com base neles — tudo neste artigo era verdadeiro em 15 de agosto de 2026, e este modelo está mudando a cada dia.

© 2026 OrcaRouter

Para provedores

Opera uma plataforma de inferência? Traga seus modelos para o OrcaRouter.

Fale conosco

Junte-se à comunidade

DiscordEmailXGitHubYouTube