
Qwen3.8-27B GGUF: Qual Quant baixar para sua GPU
- DeepSeekNOVODeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.15 / $0.29 por 1M de tokens
- z-aiNOVOZ.ai: GLM 5.32026-08-1860Inteligência75Código
- obsidianNOVOQwen3.8 27B2026-08-1552Inteligência68Código
- qwenNOVOQwen: Qwen3.8 27B (free)2026-08-13qwen/qwen3.8-27b-free
- deepseekNOVODeepSeek: DeepSeek V4 Pro 08132026-08-1253Inteligência69Código
- grokNOVOSpaceXAI: Grok 4.62026-08-1261Inteligência77Código
- metaMeta: Muse Spark 1.22026-08-0557Inteligência72Código
- qwenQwen: Qwen3.8 Max2026-08-0358Inteligência72Código
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3152Inteligência69Código
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 por 1M de tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2463Inteligência78Código
- googleGoogle: Gemini 3.6 Flash2026-07-2152Inteligência69Código
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2137Inteligência49Código
- metaMeta: Muse Spark 1.12026-07-1653Inteligência71Código
- kimiMoonshotAI: Kimi K32026-07-1560Inteligência76Código
- openaiOpenAI: GPT-5.6 Luna2026-07-0952Inteligência71Código
- openaiOpenAI: GPT-5.6 Terra2026-07-0957Inteligência77Código
- openaiOpenAI: GPT-5.6 Sol2026-07-0961Inteligência77Código
Baixe o pacote unsloth/Qwen3.8-27B-GGUF e escolha o arquivo correspondente à placa que você realmente possui. Essa é a resposta completa: uma GPU de 24GB (RTX 4090 ou 3090) deve baixar o Q4_K_M de 17,1GB; uma GPU de 16GB deve baixar o IQ4_XS de 15,7GB (ou o Q3_K_M de 13,8GB se você quiser folga de contexto); uma GPU de 12GB está limitada aos arquivos de 2 bits, o UD-IQ2_XXS de 9,0GB, e essa é uma concessão que se faz conscientemente. Qwen3.8 27B — o modelo denso de 27 bilhões de parâmetros da Alibaba, com pesos sob licença Apache 2.0, lançados em 13–14 de agosto de 2026 — roda localmente de forma excepcionalmente barata porque sua atenção híbrida armazena em cache apenas 16 de suas 64 camadas, então um quant de 4 bits em 24GB suporta confortavelmente 32K–64K tokens de contexto. E o GGUF é a única via com custo marginal zero: sem chave de API, sem cobrança por token, sem dados saindo da sua máquina.
Sobre as fontes: a arquitetura, a janela de contexto e a licença são oficiais, da ficha técnica do modelo Qwen3.8 27B no Hugging Face, verificadas em 15 de agosto de 2026. Os tamanhos GGUF vêm dos repositórios GGUF da unsloth e da ggml-org, no mesmo dia. A orientação de VRAM por GPU é a recomendação oficial da unsloth. As estimativas de bytes do cache KV e os números de tokens por segundo foram medidos pela comunidade nos primeiros dias após o lançamento, não são especificações do fornecedor. Todos os benchmarks mencionados abaixo são relatados pela Alibaba e não foram reproduzidos de forma independente.
O seletor de arquivos, uma linha por quant
• UD-IQ2_XXS — 9.0GB — a única opção que cabe confortavelmente em um cartão de 12GB; espere perda visível de qualidade.
• UD-Q2_K_XL — 10.7GB — placas de 12GB, com quase nenhum contexto de sobra.
• Q3_K_M — 13,8GB — placas de 16GB que querem espaço para contexto.
• IQ4_XS — 15.7GB — placas de 16GB: o maior quant que cabe por inteiro.
• Q4_K_M — 17.1GB — placas de 24GB: o ponto ideal, e o arquivo para o qual este artigo aponta.
• Q5_K_M — 19.8GB — 24GB, trocando espaço de contexto por um pequeno ganho de qualidade.
• Q6_K — 22,9GB — cabe em 24GB se você espremer; quase sem perdas.
• Q8_0 — 29.0GB — 32GB, uma divisão em duas placas, ou offload para CPU.
• BF16 — 54.7GB — placas de servidor e configurações de CPU com muita RAM; precisão de referência.
Dois pacotes, dois tamanhos Q4_K_M: o da unsloth é 17,1 GB{{1}}; o da ggml-org é 19,0 GB{{/1}}. O pacote da unsloth usa quantização Dynamic V3.0 (prévia) para seus arquivos UD-* e {{2}}é o que a maioria dos apps locais usa por padrão{{/2}}; o pacote da ggml-org traz os K-quants padrão além do cabeçalho separado de previsão de múltiplos tokens, usado para decodificação especulativa. Qualquer um dos Q4_K_M funciona — a diferença é de algumas centenas de megabytes e do arquivo MTP.

Por que este 27B cabe em placas menores que a maioria
O Qwen3.8 27B tem 64 camadas, mas apenas 16 usam atenção completa. As outras 48 usam atenção linear Gated DeltaNet, que mantém um estado recorrente de tamanho fixo em vez de um cache de chave-valor crescente. O layout de blocos da própria ficha do modelo é 3×(Gated DeltaNet → FFN) para cada 1×(Gated Attention → FFN) — uma proporção híbrida de 3:1. O efeito prático: o cache KV é aproximadamente um quarto do que um modelo denso convencional de 27B precisa para o mesmo contexto. Medições da comunidade nesta semana colocam o cache em cerca de 0,5GB em contexto de 8K, 2,0GB em 32K e 16,4GB na janela nativa completa de 262K. Isso inverte o conselho usual — a maior parte do seu orçamento de VRAM vai para os pesos, não para o contexto, e uma placa de 24GB pode rodar Q4_K_M com contexto de 64K–96K sem suar. Você pode reduzir ainda mais o cache com a flag --cache-type-k do llama.cpp, que quantiza o próprio cache.

Três pegadinhas que vão fazer você tropeçar no primeiro dia
• Versões antigas do llama.cpp rejeitam o arquivo. O GGUF registra a nova arquitetura qwen35, então você precisa de uma versão atual — qualquer coisa anterior à semana de lançamento se recusa a carregá-lo com um erro de arquitetura. Atualize o llama.cpp primeiro, antes de baixar.
• A armadilha do template.O template de chat oficial do Jinja envolve cada turno do assistente em um bloco de pensamento mesmo quando o trace de raciocínio está vazio, o que produz blocos aninhados e histórico truncado em conversas de múltiplos turnos — parece que o modelo esqueceu o que você disse. Execute o llama.cpp com --jinja e prefira um pacote que inclua um chat_template.jinja corrigido.
• Vision precisa de um arquivo separado. O texto funciona de imediato; imagens e vídeo não fazem nada, silenciosamente, a menos que você também carregue o projetor mmproj, com aproximadamente 0,9 GB. Ele não está listado na página do repositório GGUF da unsloth — baixe-o do repositório base ou do pacote ggml-org. Se você planeja fornecer documentos ou capturas de tela, acrescente --mmproj ao comando do servidor.
Rode: os comandos
llama.cpp, depois que você tiver uma build atual:
llama-server -m Qwen3.8-27B-Q4_K_M.gguf --ctx-size 32768 --n-gpu-layers 99 --jinja --cache-type-k q8_0
...e adicione --mmproj Qwen3.8-27B-mmproj-bf16.gguf se você precisar de visão.
Ollama, se você quiser a entrada da biblioteca: ollama pull qwen3.8:27b, depois ollama run qwen3.8:27b. O LM Studio e o Unsloth Desktop captam automaticamente o modelo de chat e o offloading de RAM — eles são o caminho mais simples para uma primeira execução.
Local vs API: a economia honesta
O GGUF é o caminho gratuito: custo marginal zero, sem limites de taxa, nada sai da sua máquina. Não é o caminho barato em termos absolutos — você fornece a GPU de 24GB (uma RTX 3090 usada ou uma RTX 4090 nova, mais eletricidade), e um arquivo de 2 bits em uma placa de 12GB é uma experiência comprometida.
A rota de API existe porque os pesos são Apache 2.0, portanto o custo marginal de servir é quase zero e qualquer um pode hospedar. O Qwen3.8 27B está ativo no OrcaRouter hoje por US$ 0,33 por milhão de tokens de entrada e US$ 2,40 por milhão de saída — o preço de tabela do provedor repassado sem margem — e, como os pesos são abertos, há também um nível gratuito com limite de uso que cobra US$ 0 por requisição e retorna HTTP 429 quando você excede o limite. Um mês representativo de 10 milhões de tokens com 70% de participação de entrada custa cerca de US$ 9,51 no nível pago. Se você já tem a GPU, o local vence em custo; se não tem, alugar os tokens compensa mais do que comprar uma placa para um projeto paralelo.

Quando esta recomendação está errada
Q4_K_M em 24GB é o padrão, não a resposta universal. Escolha outra coisa quando:
• Você precisa de qualidade máxima em um servidor ou estação de trabalho — Q8_0 com 29GB ou BF16 com 54,7GB, com offload de CPU e RAM, não um arquivo de 4 bits.
• Você está em uma placa da série Blackwell RTX 50 — a variante NVFP4 é aproximadamente 1,5× mais rápida nos mesmos 24GB de VRAM e usa um cache KV FP8 para contexto mais longo. Em uma 5090, a NVFP4 supera qualquer GGUF neste modelo.
• Você precisa do contexto completo de 262K — planeje cerca de 16GB de cache além dos pesos; isso reduz uma placa de 24GB para Q3_K_M, ou força a quantização KV.
• Você depende de decodificação especulativa — escolha o pacote ggml-org, que mantém a cabeça de predição de múltiplos tokens; alguns quants a removem para economizar cerca de 0.5GB.
• Você só tem 12GB — uma resposta honesta: um 27B de 2 bits é visivelmente pior do que o mesmo modelo servido corretamente. Experimente o nível gratuito da API antes de se comprometer com uma configuração local de 2 bits; se for bom o suficiente, o GGUF pode esperar até que o hardware esteja à altura.
Conclusão
Qwen3.8 27B é o raro 27B que cabe em uma placa de 24GB sem compromisso: um download Q4_K_M de 17,1GB, uma build atual do llama.cpp e um KV cache barato o bastante para que contexto longo custe quase nada. Baixe esse arquivo se você possui o hardware, lembre-se de que a visão requer o mmproj separado, e espere a armadilha do template na primeira vez que uma conversa multi-turno parecer esquecida. Se você não possui o hardware, o mesmo modelo é uma API de $0,33/$2,40 com um nível gratuito com limite de requisições, então não há motivo para rodar um arquivo de 2 bits com o qual você não está satisfeito. O GGUF é o caminho gratuito; só não é mais o único caminho.
