
Requisitos de VRAM do Qwen3.8-27B: De Quanto Hardware Você Realmente Precisará
- deepseekNOVODeepSeek: DeepSeek V4 Pro 08132026-08-1253Inteligência69Código
- grokNOVOSpaceXAI: Grok 4.62026-08-1261Inteligência77Código
- metaNOVOMeta: Muse Spark 1.22026-08-0557Inteligência72Código
- qwenNOVOQwen: Qwen3.8 Max2026-08-0358Inteligência72Código
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3152Inteligência69Código
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 por 1M de tokens · 2382 tok/s
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2463Inteligência78Código
- googleGoogle: Gemini 3.6 Flash2026-07-2152Inteligência69Código
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2137Inteligência49Código
- metaMeta: Muse Spark 1.12026-07-1653Inteligência71Código
- kimiMoonshotAI: Kimi K32026-07-1560Inteligência76Código
- openaiOpenAI: GPT-5.6 Luna2026-07-0952Inteligência71Código
- openaiOpenAI: GPT-5.6 Terra2026-07-0957Inteligência77Código
- openaiOpenAI: GPT-5.6 Sol2026-07-0961Inteligência77Código
- grokxAI: Grok 4.52026-07-0856Inteligência72Código
- tencentTencent: Hy32026-07-0642Inteligência59Código
- obsidianQwen3.6 35B A3B Uncensored (Aggressive)2026-07-0232Inteligência42Código
- obsidianGemma4 26B A4B Uncensored (Balanced)2026-07-0226Inteligência39Código
Cerca de 17 GB de VRAM é o número que circula para o Qwen3.8-27B — Daniel Han, da Unsloth, disse que ele "deve caber em aproximadamente 17GB de VRAM no lançamento" — e vale a pena ser preciso sobre o que isso é e o que não é. Trata-se de uma projeção baseada no predecessor do 27B, não de uma especificação da Alibaba, porque o modelo ainda não foi lançado; o repositório oficial foi prometido para a semana de 10 de agosto de 2026 e não havia aparecido até o momento desta escrita. Este artigo organiza a questão da VRAM entre o que você pode planejar, o que é genuinamente incerto e como o número varia conforme sua quantização, sua janela de contexto e seu runtime.
A resposta honesta primeiro
Não há especificação oficial de hardware para o Qwen3.8-27B ainda. Tudo abaixo é projetado a partir do Qwen3.6-27B, o modelo que o 27B sucede — mesma contagem de parâmetros, mesma provável arquitetura híbrida e a coisa mais próxima de uma referência de dimensionamento. Trate os números como um envelope de planejamento, não como uma folha de requisitos. As primeiras medições reais virão de quantizadores e mantenedores de frameworks de inferência em poucos dias após a publicação dos pesos, e esses são os números para basear sua compra.
A escada quant
A quantidade de VRAM que você precisa depende quase inteiramente de qual quantização você executa. Partindo da tabela Qwen3.6-27B medida pela comunidade:
• Q4_K_M — aproximadamente 16 GB de VRAM. O ponto ideal para placas de 24 GB e a provável origem do número "17 GB". Padrão da maioria das equipes.
• Q3_K_M / IQ3 — aproximadamente 13 GB de VRAM. Cabe em placas de 16 GB e até 12 GB, com uma redução visível de qualidade.
• Q6_K — aproximadamente 21 GB de VRAM. Quase sem perdas, e um ajuste apertado, mas real, em uma placa de 24 GB.
• Q8_0 — aproximadamente 27–30 GB de VRAM. Para placas de 48 GB, quando você quer extrair até a última gota de qualidade.
• Serving FP8 — aproximadamente 27 GB de VRAM para os pesos, razão pela qual uma única L40S é a escolha comum de GPU para inferência.
• Precisão total (BF16) — aproximadamente 54 GB de VRAM. Realisticamente, uma placa da classe H100, e o território onde as pessoas param de chamar isso de "local".
A versão resumida: uma GPU de 24 GB é a compra segura para este modelo, uma placa de 16 GB só consegue rodá-lo se você aceitar os quants baixos, e qualquer coisa com 8 GB ou menos está descartada, a menos que o modelo se revele dramaticamente mais enxuto que seu antecessor.

A variável que ninguém cita: o comprimento do contexto
Cada número acima é para um contexto modesto. A VRAM escala com o contexto porque o cache KV precisa ficar junto aos pesos. No Qwen3.6-27B, um contexto de 2K rodou em cerca de 11 GB, um contexto de 32K levou a mesma quantização para além de 14 GB, e 128K mais que dobrou a pegada do cache. Se o Qwen3.8-27B mantiver uma grande janela de contexto nativa — e a geração Qwen vem seguindo essa tendência — planeje alguns GB de folga além do tamanho da quantização, ou limite o contexto na configuração do seu runtime. Escolher um tamanho de contexto que você não usa de fato é a forma mais comum de equipes acabarem comprando uma placa maior do que precisavam.
O curinga da arquitetura híbrida
Qwen3.6-27B era um modelo híbrido: apenas 16 das suas 65 camadas usavam um cache KV tradicional, enquanto 48 usavam um estado recorrente fixo. O resultado era {{1}}aproximadamente quatro vezes menos memória KV do que um modelo denso do mesmo tamanho{{/1}} — o que explica em grande parte por que um 27B parecia um modelo para placa de 24 GB em vez de uma de 48 GB. Se o Qwen3.8-27B mantiver o design híbrido (provável, mas não confirmado), a matemática de comprimento de contexto acima fica mais favorável do que parece. O problema é o suporte em tempo de execução: um build de llama.cpp ou vLLM que não implemente as camadas recorrentes reportará um uso de memória muito maior. Verifique quais runtimes já têm suporte integrado antes de assumir que as projeções se mantêm.
Quais GPUs realmente funcionam
Concretamente, para as cartas comuns:
• RTX 4090 / 3090 / 5090 (24 GB) — Q4_K_M confortavelmente, Q6_K se você estiver disposto a apertar. Este é o público-alvo.
RTX 3060 / 4060 Ti 16 GB — apenas quants de nível IQ4 ou Q3, com contexto modesto. Funcional, mas não agradável.
• Cartões de 12 GB — Q3_K_M com qualidade reduzida. Bom para experimentação, não para servir.
• Apple Silicon — um Mac de 24 GB executa os mesmos arquivos Q4 via MLX ou llama.cpp; os modelos base de 16 GB sofrem com swap-thrash e estão efetivamente fora, como estavam com o Qwen3.6-27B.
• 48 GB e acima (A6000, L40S, configurações de duas placas) — Q8_0 ou FP8 serving com folga real.

Ou pule a GPU completamente
Se a matemática do hardware não funcionar para você, o modelo não precisa. A OrcaRouter é uma única API que abrange mais de 200 modelos — incluindo a família Qwen — e repassa o preço de tabela do provedor sem nenhum markup, então o Qwen3.8-Max atualmente custa US$ 2,00 por milhão de tokens de entrada e US$ 6,00 por milhão de tokens de saída, o mesmo que na própria página de preços do fornecedor. O próprio 27B será um modelo local, mas quando seus pesos forem lançados e ele conquistar confiança, a mesma chave roteará para qualquer provedor que o hospede — você pode desenvolver para a geração agora e nunca precisar tocar no mercado de revenda de GPUs.

O ponto principal para a questão do hardware: planeje 16 GB para uma execução confortável de 4 bits, 24 GB para ficar seguro e ter folga para contexto e quantizações mais altas, e trate todos os números aqui como provisórios até que o repositório seja lançado e as primeiras medições reais apareçam. A projeção de "17 GB" é um número de planejamento sensato — simplesmente ainda não é um fato.
