Um cartão de título principal exibindo Qwen3.8-27B em vLLM, com o subtítulo "implante-o em produção em uma ou duas GPUs", um ícone de servidor e chips de formato rotulados NVFP4 24.6 GiB, FP8 48GB e BF16 80GB.
Guides & Insights

Qwen3.8-27B no vLLM: Sirva-o em produção com uma ou duas GPUs

Autor

Rowan Sterling

Data de publicação

Modelos mais recentes · 20Ver todos os modelos
Benchmarks: Artificial Analysis · atualizado diariamente
Voltar para todas as publicações

Sim — o Qwen3.8 27B é servido em produção no vLLM atualmente, e na maioria dos casos em uma única GPU. A versão que importa é a vLLM 0.17.0 ou mais recente: ela inclui a receita oficial, os kernels de atenção híbrida que este modelo precisa e um endpoint /v1 compatível com OpenAI. Para uma GPU Blackwell, use a quantização NVFP4 — a receita do próprio vLLM mede 24,6 GiB de VRAM com tensor-parallel de tamanho 1. Para uma única placa de 48 GB, use FP8. O BF16 completo, um checkpoint de 51,7 GB, exige uma GPU de 80 GB ou duas placas de 48 GB em tensor-parallel. Os comandos exatos estão abaixo; o primeiro é de uma linha só.

Tudo aqui foi verificado em 15 de agosto de 2026, o terceiro dia em que os pesos estavam no ar. Arquitetura, contexto e licença vêm do card do modelo Qwen3.8 27B no Hugging Face; o tamanho do checkpoint é a soma dos 18 shards safetensors do repositório; os comandos vLLM e o valor de 24.6 GiB vêm da própria página de receita do vLLM para este modelo. Qwen3.8 27B é o modelo multimodal denso de 27 bilhões de parâmetros da Ali​baba — pesos Apache 2.0, lançado em 13–14 de agosto — e, como os pesos são abertos, você pode servir o modelo você mesmo em vez de alugar tokens. Esse fork é o verdadeiro assunto deste artigo.

Os fatos que importam, com fontes

Arquitetura — 27B denso (27,8B contando a torre de visão e o vocabulário com padding), 64 camadas, tamanho oculto 5.120, vocabulário 248.320. Ficha técnica oficial do modelo, verificada hoje.

Atenção — híbrido: 16 camadas de atenção total, 48 camadas lineares Gated DeltaNet em um padrão de bloco 3:1. Apenas 16 camadas mantêm um cache de chave-valor crescente; as outras 48 mantêm um estado recorrente de tamanho fixo.

Contexto — 262.144 tokens nativamente, extensível a aproximadamente 1M via escalonamento YaRN RoPE. Ficha do modelo, verificada hoje.

Entrada — texto, imagem e vídeo nativos; saída de texto. O vLLM expõe todos os três por meio da API padrão de chat-completions, sem arquivo de projetor separado.

Licença — Apache 2.0. Este único fato é o motivo pelo qual a questão "servir você mesmo vs alugar os tokens" sequer existe.

Pesos — o checkpoint BF16 totaliza 51,7 GB em 18 shards safetensors (Hugging Face, verificado hoje). A Qwe​n também publica checkpoints FP8 e NVFP4 criados para vLLM.

requisito vLLM — 0.17.0 ou mais recente, com transformers ≥ 5.8.0. A página de receitas do vLLM, verificada hoje. "Qualquer vLLM" não é uma instrução segura; os kernels da camada recorrente são o que a nova versão adiciona.

Predição multi-token — uma cabeça de rascunho de decodificação especulativa vem embutida no checkpoint, então você não precisa de um modelo de rascunho separado. O vLLM documenta a flag; ainda não existe um valor independente de aceleração.

A escada de GPU — qual quant em qual placa

Três formatos de serviço cobrem a faixa prática. Escolha pela VRAM que você realmente tem, não pelo "melhor quant".

NVFP4 — 24,6 GiB no total (pesos mais um cache KV FP8), conforme a receita do vLLM em TP1. Cabe em uma única GPU da classe Blackwell — na prática, uma RTX 5090 de 32GB ou uma B200. Este é o caminho de menor latência e o que mantém mais contexto por placa: a receita do vLLM relata capacidade de 6,6M de tokens KV mesmo na extensão de 1M de contexto.

FP8 — cerca de 26 GB de pesos. Uma placa de 48 GB (L40S, RTX A6000, RTX 6000 Ada) atende com espaço para contexto; duas placas de 48 GB em tensor-parallel oferecem margem para contexto mais longo ou maior concorrência. A própria receita do vLLM executa FP8 em TP4 em uma bandeja GB300 com quatro GPUs quando você quer o maior cache de KV possível.

BF16 — 51,7 GB de pesos, então uma única GPU de 80 GB (H100, A100 80GB, B200, GB300) ou duas placas de 48 GB em TP2. Esta é a opção de precisão de referência, e é a que o comando de extensão de contexto de 1M abaixo realmente usa.

MXFP4 — não usar na NVIDIA. O caminho MXFP4 do vLLM atualmente está sem suporte ao método linear; os mesmos pesos são publicados como NVFP4, que é o formato que a receita da NVIDIA realmente usa.

A GPU ladder card for Qwen3.8-27B on vLLM: NVFP4 at 24.6 GiB on one 32GB Blackwell card at TP1 highlighted as the single-GPU pick, FP8 at about 26GB on one 48GB card or two at TP2, BF16 at 51.7GB on one 80GB GPU or two 48GB at TP2, plus a warning that MXFP4 does not run on NVIDIA.

Execute-o — os comandos vLLM

O padrão de baixa latência para uma única GPU (NVFP4, uma GPU Blackwell), verbatim da receita do vLLM:

vllm serve Inferact/Qwen3.8-27B-NVFP4 --tensor-parallel-size 1 --max-model-len 262144 --kv-cache-dtype fp8 --reasoning-parser qwen3 --enable-auto-tool-choice --tool-call-parser qwen3_coder

O comando FP8 da mesma receita (TP4, uma bandeja GB300, maior cache KV):

vllm serve Qwen/Qwen3.8-27B-FP8 --tensor-parallel-size 4 --max-model-len 262144 --kv-cache-dtype fp8 --reasoning-parser qwen3

Para duas placas de 48GB, mantenha o comando FP8 e defina --tensor-parallel-size 2 em vez de 4.

Anexe isto a qualquer um dos comandos para ativar a decodificação especulativa MTP:

--speculative-config '{"method":"mtp","num_speculative_tokens":3}'

A extensão de contexto de 1M (também da receita do vLLM):

vllm serve Qwen/Qwen3.8-27B --max-model-len 1010000 --hf-overrides '{"text_config": {"max_position_embeddings": 1010000}}'

A terminal-style card showing the vLLM serve command for Qwen3.8-27B NVFP4 on one GPU with the flags tensor-parallel-size 1, max-model-len 262144, kv-cache-dtype fp8, reasoning-parser qwen3, and tool-call-parser qwen3_coder.

Point any O​penAI client at http://localhost:8000/v1 — the endpoint is a drop-in replacement. Two runtime details matter once it is up: thinking is on by default at reasoning_effort xhigh, so turn it off per request with chat_template_kwargs {"enable_thinking": false} or drop it to {"reasoning_effort": "low"} for faster answers. And the checkpoint ships temperature 1.0, top_p 0.95, top_k 20 in its generation config — pass those unless your app already overrides sampling.

O que as próprias páginas do vLLM prometem e não prometem

Ainda não há números de throughput para o 27B.Em 15 de agosto, a página de receitas do vLLM não publica benchmarks de throughput ou latência para o Qwen3.8 27B. O número de "4.000+ tokens por segundo por GPU" que circula por aí pertence ao Qwen3.8 2.4T-A95B em um rack GB300 NVL72 com 72 GPUs, é relatado pelo fornecedor e não é deste modelo. Os números de tokens por segundo da comunidade que você verá circulando para GGUF sob llama.cpp ou Ollama — um runtime diferente e uma carga de trabalho diferente do serviço de inferência do vLLM.

A alegação sobre o cache-KV barato depende do runtime. O card do modelo diz que apenas 16 das 64 camadas mantêm cache, mas isso só ajuda se o mecanismo de inferência realmente implementar as camadas Gated DeltaNet. vLLM 0.17+ é a versão que faz isso; é por isso que a fixação da versão é a primeira coisa neste artigo, em vez de uma nota de rodapé.

O MTP está integrado, mas não foi medido aqui. A cabeça de rascunho está no checkpoint e o vLLM documenta a flag, mas ainda ninguém publicou um número de aceleração independente para este 27B no vLLM. Planeje medir isso no seu próprio tráfego.

NVIDIA é o caminho testado. A receita do vLLM é escrita para GPUs NVIDIA (NVFP4 e FP8). Implantações deste modelo de atenção híbrida em AMD Instinct ou Intel Gaudi ainda são experimentais, e este artigo não finge o contrário.

Sirva você mesmo, ou alugue os tokens.

É aqui que o Apache 2.0 faz o seu trabalho. Não há taxa de licença por token no Qwen3.8 27B, então a única questão real é se você possui o hardware ou aluga os tokens.

Auto-hospedagem (este artigo) — você paga pela GPU uma vez, e cada token depois disso é gratuito. Uma RTX 5090 que você já possui torna o comando NVFP4 um endpoint de custo marginal zero, sem que nenhum dado saia da máquina. Se você precisar alugar a GPU, uma 5090 na nuvem ou um par de A6000s é o item de custo, e todo o argumento só se sustenta se você já tiver a placa ou o volume contínuo.

Alugue os tokens — porque os pesos são abertos, vários hosts o executam, e o piso de preço é o custo de hardware. Qwen3.8 27B está disponível no OrcaRouter hoje a US$ 0,33 por milhão de tokens de entrada e US$ 2,40 por milhão de saída — sem margem de revenda para repassar, já que o OrcaRouter executa os pesos abertos em sua própria infraestrutura — e os mesmos pesos abertos financiam um nível gratuito com limite de taxa que cobra US$ 0 por solicitação e retorna HTTP 429 quando você excede seu limite. Um mês representativo de 10 milhões de tokens com 70% de entrada custa cerca de US$ 9,51 no nível pago.

A regra de decisão — se você já possui a GPU, faça self-host. Se precisar comprar ou alugar uma, a API atinge o ponto de equilíbrio rapidamente em volumes de projeto paralelo, e o mesmo cliente compatível com O​penAI aponta para qualquer um dos endpoints, então o código não muda quando você migrar.

The OrcaRouter model page for Qwen3.8 27B, showing the input price of 0.33 dollars per million tokens, output price of 2.40 dollars per million tokens, a 262K-token context window, text image and video input, and p50 time-to-first-token of 225 milliseconds.

Quando o vLLM é a resposta errada

Você é uma pessoa em um laptop — vLLM é um mecanismo de serviço, não um aplicativo de desktop. Para uma execução local de um único usuário, llama.cpp ou Ollama com um Q4 GGUF é mais simples e precisa de uma placa de 24GB, não uma GPU Blackwell; nosso guia para executar o Qwen3.8-27B localmente percorre esse caminho do início ao fim.

Você precisa de throughput garantido com zero ops — auto-hospedagem significa que o paging, as filas e o failover ficam por sua conta. Se "a API está fora do ar" não é uma frase que você quer no seu vocabulário, alugue os tokens e deixe outra pessoa operar a frota.

Você realmente precisa do contexto completo de ~1M com qualidade de ponta — essa é a função do Qwen3.8 2.4T-A95B, servido por vLLM ou SGLang em um rack GB300 NVL72 com 72 GPUs. O Qwen3.8 27B em uma ou duas GPUs não vai corresponder; nosso artigo sobre como servir o 2.4T explica por que esse modelo é uma classe diferente de problema.

Você está em uma placa de 24GB mais antiga — NVFP4 é um formato Blackwell; em placas de 24GB Ampere (RTX 3090) ou Ada (RTX 4090), o caminho FP8 é a opção vLLM, e além disso uma quantização GGUF no llama.cpp é a parada pragmática. O mesmo modelo em uma placa de 24GB é outra história.

Você deve atender ao máximo de concorrência em uma única placa — os valores padrão de GPU única acima são o ponto de partida, não a configuração de produção. Ajuste --max-num-seqs, o cache KV e a configuração do MTP de acordo com seu próprio mix de requisições antes de dar por concluído.

Conclusão

Qwen3.8 27B é o raro modelo denso de 27B que a vLLM serve em uma única GPU em produção. Atualize para a vLLM 0.17.0+, baixe o quant NVFP4 para uma placa Blackwell de 32GB a 24,6 GiB, o quant FP8 para uma placa de 48GB ou duas em tensor-parallel, e reserve o BF16 para uma GPU de 80GB. Os comandos são de uma linha, o endpoint é compatível com O​penAI e, como os pesos são Apache 2.0, você pode servir você mesmo ou alugar por $0,33/$2,40 por milhão de tokens com um nível gratuito — o mesmo código de cliente em ambos os casos. A única coisa que ninguém tem ainda é um número independente de throughput para o 27B na vLLM, então reserve uma hora de benchmarking depois de iniciá-lo antes de prometer a qualquer pessoa um número de latência.

© 2026 OrcaRouter

Para provedores

Opera uma plataforma de inferência? Traga seus modelos para o OrcaRouter.

Fale conosco

Junte-se à comunidade

DiscordEmailXGitHubYouTube