
API gratuita do Qwen 3.8 27B: ainda não — o que rodar em vez disso
- deepseekNOVODeepSeek: DeepSeek V4.1 Flash2026-09-1040Inteligência
- openaiNOVOOpenAI: GPT-6 Astra2026-09-0453Inteligência77Código
- googleNOVOGoogle: Gemini 3.8 Flash2026-09-0241Inteligência76Código
- qwenNOVOQwen: Qwen3.8 Max (0902)2026-09-0240Inteligência72Código
- anthropicNOVOAnthropic: Claude Fable 5.12026-09-0153Inteligência82Código
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 por 1M de tokens
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Inteligência72Código
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.24 / $0.73 por 1M de tokens
- z-aiZ.ai: GLM 5.32026-08-1845Inteligência75Código
- obsidianQwen3.8 27B2026-08-1534Inteligência68Código
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Inteligência69Código
- grokSpaceXAI: Grok 4.62026-08-1244Inteligência77Código
- metaMeta: Muse Spark 1.22026-08-0540Inteligência72Código
- qwenQwen: Qwen3.8 Max2026-08-0340Inteligência72Código
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135Inteligência69Código
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 por 1M de tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2451Inteligência78Código
- googleGoogle: Gemini 3.6 Flash2026-07-2134Inteligência69Código
Não — até 12 de agosto de 2026, não existe API gratuita do Qwen3.8-27B, nem paga. O modelo foi anunciado em 3 de agosto, com pesos abertos prometidos para Hugging Face e ModelScope "na semana de 10 de agosto", mas a organização oficial Qwen ainda não tem repositório do Qwen3.8. Até que os pesos sejam liberados, ninguém pode hospedar o Qwen3.8-27B, então "grátis" é irrelevante. Aqui estão as três rotas para o grátis assim que os pesos forem disponibilizados (e o que cada uma realmente custa), além dos modelos que você pode executar gratuitamente localmente hoje.
Ainda não há API gratuita — os pesos são a porta.
A Alibaba anunciou a família Qwen3.8 em 3 de agosto de 2026: o Qwen3.8-Max com 2,4 trilhões de parâmetros (cerca de 95 bilhões de parâmetros ativos, contexto de 1 milhão de tokens, com preço de US$ 2 por milhão de tokens de entrada e US$ 6 por milhão de tokens de saída no Alibaba Cloud Model Studio) e o denso Qwen3.8-27B para máquina única. Ambos foram prometidos como pesos abertos no Hugging Face e no ModelScope na mesma semana.
Essa promessa já está com dois dias de atraso. Verifiquei o Hugging Face diretamente em 12 de agosto: a organização oficial Qwen não possui repositório Qwen3.8 algum. Os repositórios Qwen3.8-27B-GGUF, -FP8, -NVFP4A16 e -NInfer que aparecem na busca de modelos são cards de espaço reservado — zero arquivos de pesos, contagens de download de um dígito, cards de modelo que literalmente dizem "reservado antes do lançamento do Qwen/Qwen3.8-27B". Não trate esses cards como evidência de que o modelo existe; trate-os como pessoas reservando vagas de estacionamento.
Há duas coisas que você não pode supor. Primeiro, {{1}}a licença: nenhuma foi anunciada para o Qwen3.8-27B. Os pesos abertos recentes do Qwen foram lançados sob a licença Tongyi Qianwen, cuja cláusula de 100 milhões de usuários ativos mensais desencadeia conversas sobre licença comercial em escala — Apache 2.0 não é um padrão seguro{{/1}}. Segundo, {{2}}as especificações: a Alibaba não publicou nenhuma tabela de benchmarks, janela de contexto ou requisito de hardware confirmado para o 27B. Tudo o que está sendo repetido sobre ele hoje é especulação{{/2}}.
Abordamos o checklist pré-lançamento — o que é confirmado, o que é boato, o que verificar antes de baixar — em Qwen3.8-27B Open Weights: What We Know Before the Drop. Este artigo é a parte que aquele texto não cobriu: como "grátis" funcionará de fato quando o modelo for lançado.
Depois que os pesos caem: três rotas para a liberdade, e o que cada uma realmente custa.
"Grátis" nunca é grátis. Todas as três rotas para um Qwen3.8-27B gratuito transferem o custo para algum lugar; a diferença é onde ele recai. O 27B é um modelo denso — cada um de seus ~27 bilhões de parâmetros está ativo em cada token — portanto, os custos abaixo são sobre hardware real, não marketing.

Rota 1: Faça você mesmo — sem custo em dinheiro, com preço em hardware.
{{1}}O único caminho onde "grátis" se torna literalmente verdadeiro depois que o hardware é comprado.{{/1}} O cofundador da Unsloth, Daniel Han, espera que o 27B rode em cerca de 17GB de VRAM no lançamento — uma meta, não uma especificação final. {{2}}Usando a escada de quantização medida do Qwen3.6-27B como referência:{{/2}} Q4_K_M fica em torno de 16GB, Q6_K em torno de 21GB, FP8 em torno de 27GB, e BF16 completo em torno de 54–56GB. {{3}}O mínimo realista hoje é uma placa de 24GB — RTX 3090, RTX 4090, ou classe A6000 — em Q4.{{/3}}
O timing é importante: pesos oficiais com vLLM ou SGLang geralmente funcionam em poucos dias após um lançamento, mas quantizações comunitárias GGUF e AWQ ficam uma a duas semanas para trás, então um "puxar e executar" ao estilo Ollama não existirá no dia do lançamento. Os custos ocultos são energia, uma máquina silenciosa e seu tempo. A vantagem é privacidade — nada sai da sua máquina — e um custo marginal de zero que se acumula se você usar a GPU para outros modelos também.
Rota 2: Camadas gratuitas hospedadas — grátis em dinheiro, com preço em limites
Assim que os pesos forem lançados, espere uma cota de avaliação da Alibaba Cloud e camadas gratuitas dos hosts serverless de sempre. O padrão esperado é o que a Alibaba já adota para o Qwen3.8-Max: cota de 1M de tokens para novos usuários, somente na região de Singapura, válida por 90 dias, sem rollover — e tokens de raciocínio são cobrados como saída, então um modelo que raciocina por padrão pode consumir toda a cota em um fim de semana de prototipagem. O que você realmente paga é em limites de taxa, trava regional, data de expiração e seus prompts indo para um terceiro. Uma camada gratuita é uma porta de entrada para avaliar o modelo, não um lugar para implantá-lo.
Rota 3: camada gratuita do OrcaRouter — planejada, não ativa.
Como a consulta de busca é literalmente "grátis", vamos ser explícitos: a OrcaRouter planeja uma camada gratuita para o Qwen3.8-27B assim que os pesos forem lançados. Não está no ar. Não há endpoint para chamar, e não vou colar um exemplo placeholder. Anunciaremos quando houver algo a anunciar. O que de fato hospedamos hoje é o Qwen3.8-Max a US$ 2/US$ 6 por 1 milhão de tokens, sem margem de lucro — e o 27B não está na plataforma, porque ninguém consegue servi-lo ainda.
O que você pode usar gratuitamente agora
Se a sua necessidade é "um modelo aberto da classe 27B que eu possa executar sem pagar", você não precisa esperar. A resposta honesta de mesmo nível é Qwen3.6-27B, o predecessor direto do modelo que você está esperando.

Qwen3.6-27B é Apache 2.0, um modelo denso de 27.8B com contexto de 262K e entrada nativa de texto, imagem e vídeo. Um GGUF Q4_K_M tem cerca de 16.5GB e roda a aproximadamente 25 tokens por segundo em uma GPU de consumo de 24GB (16–18 tokens por segundo em um M4 Max). Números divulgados pelo fornecedor na ficha do modelo: SWE-Bench Verified 77.2, MMLU-Pro 86.2, AIME 2026 94.1, GPQA Diamond 87.8 e MMMU 82.9. Se o Qwen3.8-27B é "um 27B", este é o 27B que você pode realmente usar hoje — mesma família, mesmo design denso, já aberto.
Nemotron 3.5 Lightning 30B A3B é um formato diferente, também gratuito: lançado em 11 de agosto de 2026 sob a licença OpenMDW 1.1 da NVIDIA. É um modelo Mixture-of-Experts com 30B no total e ~3B ativos, com arquitetura híbrida Mamba-2 e contexto de até 1M — os checkpoints NVFP4 têm cerca de 21,6 GB e um GGUF Q4 cerca de 25 GB. Ele precisa de uma placa com 24 GB ou mais, porque todos os 30 bilhões de parâmetros ficam na memória, mesmo que apenas cerca de 3 bilhões sejam ativados por token. Os primeiros relatos o colocam perto de 45 tokens por segundo em uma única GPU. Ele é feito para a camada de execução de agentes — chamadas de ferramentas, validação, formatação — não para raciocínio de fronteira. Se sua carga é trabalho braçal de agente em alto volume, ele pode superar um 27B denso no seu trabalho real.
E se o que você quer especificamente é uma API hospedada gratuita hoje, em vez de uma instalação local, o único "grátis" honesto é a cota do Qwen3.8-Max da Alibaba: 1M de tokens, região de Singapura, 90 dias. Não é o 27B, e é um crédito de avaliação, não um serviço — use-o para testar o comportamento do Qwen3.8 agora e depois migre.
Quando este conselho está errado
Se você já possui uma GPU de 24GB+, a abordagem de "esperar pelos níveis gratuitos" está errada para você. No dia em que os pesos forem lançados, o vLLM com os pesos oficiais é o seu nível gratuito; você estaria esperando por uma conveniência de que não precisa. Espere cerca de duas semanas apenas se você quiser especificamente a escada de quantização GGUF polida.
Se você está prototipando contra um contrato de API, as cotas gratuitas hospedadas (uma vez que a 27B as tenha) podem custar menos que o seu tempo — mesmo com o prazo de 90 dias e a trava de região, alugar uma máquina com GPU por uma semana de prototipagem geralmente é a opção mais cara.
Se a licença acabar sendo Tongyi Qianwen em vez de Apache,"pesos livres" não significará livre para comercializar acima do limite de 100 milhões de MAU. Leia o arquivo LICENSE no repositório real antes de desenvolver qualquer coisa com base nele — essa é a maneira mais comum de "pesos abertos livres" se transformarem em uma fatura.
E se a Alibaba adiar a data novamente — já são dois dias além do prazo prometido — cada semana que passa torna Qwen3.6-27B a escolha correta em vez do paliativo.

Conclusão
Não existe API gratuita do Qwen3.8-27B porque não existe Qwen3.8-27B em lugar nenhum. Quando os pesos forem lançados, as três rotas gratuitas são: auto-hospedagem (paga-se em hardware), camadas gratuitas hospedadas (pagam-se em limites) e a camada gratuita planejada da OrcaRouter — que ainda não está ativa, e diremos quando estiver. Hoje, a coisa gratuita mais próxima é o Qwen3.6-27B no seu próprio hardware. Esperar não custa nada além do 27B; executar o predecessor não custa nada além de uma GPU que você pode colocar para trabalhar em todo o resto enquanto isso.
Comparados neste artigo1
Detectado a partir deste artigo · Benchmarks: Artificial Analysis · atualizado diariamente
