
Qwen3.8-27B no vLLM: Sirva-o em produção com uma ou duas GPUs
- obsidianNOVOQwen3.8 27B Uncensored (Aggressive)2026-08-15$0.40 / $4.21 por 1M de tokens · 42 tok/s
- qwenNOVOQwen: Qwen3.8 27B (free)2026-08-1326 tok/s
- deepseekNOVODeepSeek: DeepSeek V4 Pro 08132026-08-1253Inteligência69Código
- grokNOVOSpaceXAI: Grok 4.62026-08-1261Inteligência77Código
- metaNOVOMeta: Muse Spark 1.22026-08-0557Inteligência72Código
- qwenNOVOQwen: Qwen3.8 Max2026-08-0358Inteligência72Código
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3152Inteligência69Código
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 por 1M de tokens · 3320 tok/s
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2463Inteligência78Código
- googleGoogle: Gemini 3.6 Flash2026-07-2152Inteligência69Código
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2137Inteligência49Código
- metaMeta: Muse Spark 1.12026-07-1653Inteligência71Código
- kimiMoonshotAI: Kimi K32026-07-1560Inteligência76Código
- openaiOpenAI: GPT-5.6 Luna2026-07-0952Inteligência71Código
- openaiOpenAI: GPT-5.6 Terra2026-07-0957Inteligência77Código
- openaiOpenAI: GPT-5.6 Sol2026-07-0961Inteligência77Código
- grokxAI: Grok 4.52026-07-0856Inteligência72Código
- tencentTencent: Hy32026-07-0642Inteligência59Código
Sim — o Qwen3.8 27B é servido em produção no vLLM atualmente, e na maioria dos casos em uma única GPU. A versão que importa é a vLLM 0.17.0 ou mais recente: ela inclui a receita oficial, os kernels de atenção híbrida que este modelo precisa e um endpoint /v1 compatível com OpenAI. Para uma GPU Blackwell, use a quantização NVFP4 — a receita do próprio vLLM mede 24,6 GiB de VRAM com tensor-parallel de tamanho 1. Para uma única placa de 48 GB, use FP8. O BF16 completo, um checkpoint de 51,7 GB, exige uma GPU de 80 GB ou duas placas de 48 GB em tensor-parallel. Os comandos exatos estão abaixo; o primeiro é de uma linha só.
Tudo aqui foi verificado em 15 de agosto de 2026, o terceiro dia em que os pesos estavam no ar. Arquitetura, contexto e licença vêm do card do modelo Qwen3.8 27B no Hugging Face; o tamanho do checkpoint é a soma dos 18 shards safetensors do repositório; os comandos vLLM e o valor de 24.6 GiB vêm da própria página de receita do vLLM para este modelo. Qwen3.8 27B é o modelo multimodal denso de 27 bilhões de parâmetros da Alibaba — pesos Apache 2.0, lançado em 13–14 de agosto — e, como os pesos são abertos, você pode servir o modelo você mesmo em vez de alugar tokens. Esse fork é o verdadeiro assunto deste artigo.
Os fatos que importam, com fontes
• Arquitetura — 27B denso (27,8B contando a torre de visão e o vocabulário com padding), 64 camadas, tamanho oculto 5.120, vocabulário 248.320. Ficha técnica oficial do modelo, verificada hoje.
• Atenção — híbrido: 16 camadas de atenção total, 48 camadas lineares Gated DeltaNet em um padrão de bloco 3:1. Apenas 16 camadas mantêm um cache de chave-valor crescente; as outras 48 mantêm um estado recorrente de tamanho fixo.
• Contexto — 262.144 tokens nativamente, extensível a aproximadamente 1M via escalonamento YaRN RoPE. Ficha do modelo, verificada hoje.
• Entrada — texto, imagem e vídeo nativos; saída de texto. O vLLM expõe todos os três por meio da API padrão de chat-completions, sem arquivo de projetor separado.
• Licença — Apache 2.0. Este único fato é o motivo pelo qual a questão "servir você mesmo vs alugar os tokens" sequer existe.
• Pesos — o checkpoint BF16 totaliza 51,7 GB em 18 shards safetensors (Hugging Face, verificado hoje). A Qwen também publica checkpoints FP8 e NVFP4 criados para vLLM.
• requisito vLLM — 0.17.0 ou mais recente, com transformers ≥ 5.8.0. A página de receitas do vLLM, verificada hoje. "Qualquer vLLM" não é uma instrução segura; os kernels da camada recorrente são o que a nova versão adiciona.
• Predição multi-token — uma cabeça de rascunho de decodificação especulativa vem embutida no checkpoint, então você não precisa de um modelo de rascunho separado. O vLLM documenta a flag; ainda não existe um valor independente de aceleração.
A escada de GPU — qual quant em qual placa
Três formatos de serviço cobrem a faixa prática. Escolha pela VRAM que você realmente tem, não pelo "melhor quant".
• NVFP4 — 24,6 GiB no total (pesos mais um cache KV FP8), conforme a receita do vLLM em TP1. Cabe em uma única GPU da classe Blackwell — na prática, uma RTX 5090 de 32GB ou uma B200. Este é o caminho de menor latência e o que mantém mais contexto por placa: a receita do vLLM relata capacidade de 6,6M de tokens KV mesmo na extensão de 1M de contexto.
• FP8 — cerca de 26 GB de pesos. Uma placa de 48 GB (L40S, RTX A6000, RTX 6000 Ada) atende com espaço para contexto; duas placas de 48 GB em tensor-parallel oferecem margem para contexto mais longo ou maior concorrência. A própria receita do vLLM executa FP8 em TP4 em uma bandeja GB300 com quatro GPUs quando você quer o maior cache de KV possível.
• BF16 — 51,7 GB de pesos, então uma única GPU de 80 GB (H100, A100 80GB, B200, GB300) ou duas placas de 48 GB em TP2. Esta é a opção de precisão de referência, e é a que o comando de extensão de contexto de 1M abaixo realmente usa.
• MXFP4 — não usar na NVIDIA. O caminho MXFP4 do vLLM atualmente está sem suporte ao método linear; os mesmos pesos são publicados como NVFP4, que é o formato que a receita da NVIDIA realmente usa.

Execute-o — os comandos vLLM
O padrão de baixa latência para uma única GPU (NVFP4, uma GPU Blackwell), verbatim da receita do vLLM:
vllm serve Inferact/Qwen3.8-27B-NVFP4 --tensor-parallel-size 1 --max-model-len 262144 --kv-cache-dtype fp8 --reasoning-parser qwen3 --enable-auto-tool-choice --tool-call-parser qwen3_coder
O comando FP8 da mesma receita (TP4, uma bandeja GB300, maior cache KV):
vllm serve Qwen/Qwen3.8-27B-FP8 --tensor-parallel-size 4 --max-model-len 262144 --kv-cache-dtype fp8 --reasoning-parser qwen3
Para duas placas de 48GB, mantenha o comando FP8 e defina --tensor-parallel-size 2 em vez de 4.
Anexe isto a qualquer um dos comandos para ativar a decodificação especulativa MTP:
--speculative-config '{"method":"mtp","num_speculative_tokens":3}'
A extensão de contexto de 1M (também da receita do vLLM):
vllm serve Qwen/Qwen3.8-27B --max-model-len 1010000 --hf-overrides '{"text_config": {"max_position_embeddings": 1010000}}'

Point any OpenAI client at http://localhost:8000/v1 — the endpoint is a drop-in replacement. Two runtime details matter once it is up: thinking is on by default at reasoning_effort xhigh, so turn it off per request with chat_template_kwargs {"enable_thinking": false} or drop it to {"reasoning_effort": "low"} for faster answers. And the checkpoint ships temperature 1.0, top_p 0.95, top_k 20 in its generation config — pass those unless your app already overrides sampling.
O que as próprias páginas do vLLM prometem e não prometem
• Ainda não há números de throughput para o 27B.Em 15 de agosto, a página de receitas do vLLM não publica benchmarks de throughput ou latência para o Qwen3.8 27B. O número de "4.000+ tokens por segundo por GPU" que circula por aí pertence ao Qwen3.8 2.4T-A95B em um rack GB300 NVL72 com 72 GPUs, é relatado pelo fornecedor e não é deste modelo. Os números de tokens por segundo da comunidade que você verá circulando para GGUF sob llama.cpp ou Ollama — um runtime diferente e uma carga de trabalho diferente do serviço de inferência do vLLM.
• A alegação sobre o cache-KV barato depende do runtime. O card do modelo diz que apenas 16 das 64 camadas mantêm cache, mas isso só ajuda se o mecanismo de inferência realmente implementar as camadas Gated DeltaNet. vLLM 0.17+ é a versão que faz isso; é por isso que a fixação da versão é a primeira coisa neste artigo, em vez de uma nota de rodapé.
• O MTP está integrado, mas não foi medido aqui. A cabeça de rascunho está no checkpoint e o vLLM documenta a flag, mas ainda ninguém publicou um número de aceleração independente para este 27B no vLLM. Planeje medir isso no seu próprio tráfego.
• NVIDIA é o caminho testado. A receita do vLLM é escrita para GPUs NVIDIA (NVFP4 e FP8). Implantações deste modelo de atenção híbrida em AMD Instinct ou Intel Gaudi ainda são experimentais, e este artigo não finge o contrário.
Sirva você mesmo, ou alugue os tokens.
É aqui que o Apache 2.0 faz o seu trabalho. Não há taxa de licença por token no Qwen3.8 27B, então a única questão real é se você possui o hardware ou aluga os tokens.
• Auto-hospedagem (este artigo) — você paga pela GPU uma vez, e cada token depois disso é gratuito. Uma RTX 5090 que você já possui torna o comando NVFP4 um endpoint de custo marginal zero, sem que nenhum dado saia da máquina. Se você precisar alugar a GPU, uma 5090 na nuvem ou um par de A6000s é o item de custo, e todo o argumento só se sustenta se você já tiver a placa ou o volume contínuo.
• Alugue os tokens — porque os pesos são abertos, vários hosts o executam, e o piso de preço é o custo de hardware. Qwen3.8 27B está disponível no OrcaRouter hoje a US$ 0,33 por milhão de tokens de entrada e US$ 2,40 por milhão de saída — sem margem de revenda para repassar, já que o OrcaRouter executa os pesos abertos em sua própria infraestrutura — e os mesmos pesos abertos financiam um nível gratuito com limite de taxa que cobra US$ 0 por solicitação e retorna HTTP 429 quando você excede seu limite. Um mês representativo de 10 milhões de tokens com 70% de entrada custa cerca de US$ 9,51 no nível pago.
• A regra de decisão — se você já possui a GPU, faça self-host. Se precisar comprar ou alugar uma, a API atinge o ponto de equilíbrio rapidamente em volumes de projeto paralelo, e o mesmo cliente compatível com OpenAI aponta para qualquer um dos endpoints, então o código não muda quando você migrar.

Quando o vLLM é a resposta errada
• Você é uma pessoa em um laptop — vLLM é um mecanismo de serviço, não um aplicativo de desktop. Para uma execução local de um único usuário, llama.cpp ou Ollama com um Q4 GGUF é mais simples e precisa de uma placa de 24GB, não uma GPU Blackwell; nosso guia para executar o Qwen3.8-27B localmente percorre esse caminho do início ao fim.
• Você precisa de throughput garantido com zero ops — auto-hospedagem significa que o paging, as filas e o failover ficam por sua conta. Se "a API está fora do ar" não é uma frase que você quer no seu vocabulário, alugue os tokens e deixe outra pessoa operar a frota.
• Você realmente precisa do contexto completo de ~1M com qualidade de ponta — essa é a função do Qwen3.8 2.4T-A95B, servido por vLLM ou SGLang em um rack GB300 NVL72 com 72 GPUs. O Qwen3.8 27B em uma ou duas GPUs não vai corresponder; nosso artigo sobre como servir o 2.4T explica por que esse modelo é uma classe diferente de problema.
• Você está em uma placa de 24GB mais antiga — NVFP4 é um formato Blackwell; em placas de 24GB Ampere (RTX 3090) ou Ada (RTX 4090), o caminho FP8 é a opção vLLM, e além disso uma quantização GGUF no llama.cpp é a parada pragmática. O mesmo modelo em uma placa de 24GB é outra história.
• Você deve atender ao máximo de concorrência em uma única placa — os valores padrão de GPU única acima são o ponto de partida, não a configuração de produção. Ajuste --max-num-seqs, o cache KV e a configuração do MTP de acordo com seu próprio mix de requisições antes de dar por concluído.
Conclusão
Qwen3.8 27B é o raro modelo denso de 27B que a vLLM serve em uma única GPU em produção. Atualize para a vLLM 0.17.0+, baixe o quant NVFP4 para uma placa Blackwell de 32GB a 24,6 GiB, o quant FP8 para uma placa de 48GB ou duas em tensor-parallel, e reserve o BF16 para uma GPU de 80GB. Os comandos são de uma linha, o endpoint é compatível com OpenAI e, como os pesos são Apache 2.0, você pode servir você mesmo ou alugar por $0,33/$2,40 por milhão de tokens com um nível gratuito — o mesmo código de cliente em ambos os casos. A única coisa que ninguém tem ainda é um número independente de throughput para o 27B na vLLM, então reserve uma hora de benchmarking depois de iniciá-lo antes de prometer a qualquer pessoa um número de latência.
