Um cartão de título com o texto 'Qwen3.8-27B' como título, o subtítulo 'Pesos Abertos Chegam Esta Semana', o texto de apoio 'Alibaba Qwen - O Que Sabemos Até Agora' e a linha de data 'Semana de 10 de agosto de 2026', ao lado de um ícone de caixa aberta e um ícone de calendário.
Guides & Insights

Qwen3.8-27B Pesos Abertos: O Max Foi Lançado, o 27B Não — O Que Sabemos Agora

Autor

Rowan Sterling

Data de publicação

Modelos mais recentes · 20Ver todos os modelos →
Benchmarks: Artificial Analysis · atualizado diariamente
Voltar para todas as publicações

Em 13 de agosto de 2026, a semana de pesos abertos que a Alibaba prometeu para sua geração Qwe​n3.8 se dividiu em duas. Os pesos do carro-chefe da classe Max — Qwen3.8-2.4T-A95B, um modelo esparso de mistura de especialistas com 2,4 trilhões de parâmetros e o primeiro lançamento da Q​wen em nível Max já disponibilizado para download — na verdade, foram disponibilizados, no Hugging Face e no ModelScope, anunciados na noite anterior através da comunidade ModelScope. O modelo menor sobre o qual trata esta página, Qwen3.8-27B, não: prometido para a mesma semana de 10 de agosto, ainda não possui repositório oficial, model card, arquivo de licença ou benchmark próprio, e rastreadores de terceiros agora descrevem seu lançamento como atrasado, sem nova data fornecida. A pergunta que esta página do "o que sabemos até agora" foi criada para responder — "quando o 27B realmente será lançado?" — tornou-se duas: por que os pesos do Max foram lançados primeiro, e o que aconteceu com o 27B?

Este continua sendo um texto do tipo "o que sabemos até agora", não uma análise. Qwen3.8-Max, o carro-chefe da API, está no ar desde 3 de agosto a US$ 2/US$ 6 por milhão de tokens; sua base de pesos abertos subjacente, Qwen3.8-2.4T-A95B, ficou disponível para download em 13 de agosto; e os pesos do Qwen3.8-27B ainda não foram publicados. Cada afirmação abaixo é rotulada como confirmada, relatada pelo fornecedor ou estimada pela comunidade, conforme o caso.

O sinal, e o que a semana de fato entregou

O primeiro sinal foi um post no X de @kimmonismus, que apontou "semana que vem" como a semana a observar: "Q​wen-3.8 27b - Grok 4.6", com a Astra notadamente ausente da lista. A metade Grok dessa semana foi lançada em 12 de agosto. A metade Q​wen se dividiu em duas. O que o post capturou foi o clima entre as pessoas cujo trabalho é acompanhar lançamentos de modelos — o lançamento de pesos abertos do Qwe​n3.8 era o evento do calendário, e a semana chegou com os detalhes ainda indefinidos. Uma semana depois, os detalhes foram parcialmente resolvidos: um dos dois lançamentos de pesos abertos prometidos chegou, e não foi o que o post mencionou.

O que está confirmado

• A família é real e foi oficialmente anunciada. A Alibaba revelou a família de modelos-base Qwen3.8 em 3 de agosto de 2026, após uma iteração de pré-visualização em meados de julho.

• O Qwen3.8-Max foi lançado no mesmo dia. O carro-chefe da API — um modelo de mistura de especialistas com 2,4 trilhões de parâmetros, cerca de 95 bilhões de parâmetros ativos, janela de contexto de 1 milhão de tokens e entrada de texto, imagem e vídeo — entrou no ar na API da Q​wen por US$ 2/US$ 6 por milhão de tokens. Ele também está disponível por meio do OrcaRouter pelo mesmo preço de tabela, com repasse a 0% de markup.

• Os pesos abertos do Max foram disponibilizados em 13 de agosto. Qwen3.8-2.4T-A95B — o modelo base sobre o qual a API Qwen3.8-Max é construída — tornou-se disponível para download no Hugging Face e no ModelScope, com uma versão quantizada em FP8 ao lado. Esta é a primeira versão de pesos abertos de nível Max da Q​wen já lançada. O modelo disponível para download é somente texto, com o modo de raciocínio sempre ativado, possui contexto nativo de 256 mil tokens, expansível para cerca de 1 milhão, e pode ser implantado em SGLang, vLLM e TokenSpeed.

• Qwen3.8-27B é o modelo de pesos abertos menor da família — ainda não lançado. A Alibaba o posicionou como o caminho realista para implantação local e on-premise e se comprometeu a disponibilizar seus pesos no Hugging Face e no ModelScope, juntamente com os do Max. Até 13 de agosto, ainda não há repositório oficial do Qwen3.8-27B. O compromisso era real; a entrega ainda não aconteceu.

• A primeira pontuação independente para a geração existe. Artificial Analysis coloca o Qwen3.8-Max em um Índice de Inteligência de 56 a aproximadamente $1,14 por tarefa — genuinamente bom, com as ressalvas que qualquer carro-chefe recém-lançado carrega.

O que sabemos de fato sobre o 27B

O resumo honesto é que "Qwen3.8-27B" ainda é principalmente um nome e uma contagem de parâmetros. Os fatos confirmados são que é um modelo de aproximadamente 27 bilhões de parâmetros, que é o membro de pesos abertos da geração Qwe​n3.8, e que é dimensionado para trabalho em GPU única e on-premise, em vez de um cluster com centenas de GPUs. Daniel Han, da Unsloth, relata que ele deve caber em cerca de 17GB de VRAM no lançamento — uma única placa prosumer.

Tudo o resto não foi confirmado. A Alibaba não publicou se o 27B é um modelo denso ou uma mistura de especialistas, sua janela de contexto, quais modalidades ele aceita, ou quaisquer pontuações de benchmark próprias. O que mudou esta semana foi o cronograma: o Max e o 27B foram prometidos para a mesma semana, e apenas o Max chegou. Rastreadores de terceiros agora relatam o 27B como atrasado, sem nova data — uma leitura da comunidade, não uma declaração oficial da Alibaba, e é possível que o repositório ainda seja lançado antes de a semana prometida terminar completamente. Mas, até o momento em que escrevo, a organização oficial Q​wen no Hugging Face não lista nenhum Qwen3.8-27B, e os poucos repositórios "Qwen3.8-27B-FP8", "-GGUF" e "-MLX" que aparecem na busca são cartões provisórios da comunidade com contagens de downloads de um dígito, não o lançamento oficial.

O ponto de referência útil ainda é o 27B da geração anterior: o Qwen3.5-27B, um modelo denso de pesos abertos com janela de contexto de 32K. É um limite inferior razoável para o que o Qwen3.8-27B precisa superar, e um lembrete de que os modelos da classe 27B da Q​wen foram historicamente criados para rodar em hardware que o desenvolvedor realmente possui.

O Max é o ponto de referência para o que o 27B pode herdar

A comparison scoreboard for Qwen3.8-Max and Qwen3.8-27B, contrasting the Max's 2.4T MoE total parameters, ~95B active params, 1M-token context, / pricing and AA Index 56 with the 27B's ~27B params, TBD context, TBD architecture, self-host and no independent score yet.

O {{1}}27B não vai igualar o teto bruto do Max, mas os números do Max — agora publicados em um model card real — definem as expectativas para o que as melhorias da geração representam. Nas próprias avaliações da Alibaba do modelo de pesos abertos, o {{2}}Qwen3.8-2.4T-A95B{{/2}} marca 93.0 no PaperBench, 86.1 no OSworld-Verified, 91.5 em CAD paramétrico, 67.7 no SWE-bench Pro e 86.6 no Terminal-Bench 2.1, com o fornecedor alegando paridade com {{3}}Claude Opus 4.8{{/3}}, {{4}}Claude Fable 5{{/4}}, {{5}}GPT-5.6 Sol{{/5}} e {{6}}Gemini 3.1 Pro{{/6}}. Esses são números divulgados pelo fornecedor, publicados nos materiais de lançamento e ainda não reproduzidos por um laboratório independente. O ganho agêntico que o lançamento da API reivindicou — o FrontierSWE saltando de 40.7 para 73.5 em uma única geração — se reflete nos mesmos materiais de lançamento. Se pelo menos parte dessa melhoria chegar a um 27B, isso redefiniria o que significa "bom modelo local de codificação" na sua classe.

Uma nuance a ter em mente: o Max para download não é idêntico ao Max da API. O Qwen3.8-2.4T-A95B é apenas texto, com o modo de raciocínio sempre ativado, enquanto a API Qwen3.8-Max adiciona entrada de visão, um modo sem raciocínio e um contexto padrão de 1M de tokens. Essa lacuna é exatamente o tipo de coisa que um 27B provavelmente herdará — e vale a pena lembrar ao ler manchetes de benchmark "Qwe​n3.8" sem verificar qual variante elas descrevem.

O preço é onde o Max é mais defensável: US$ 2/US$ 6 por milhão de tokens em todo o contexto de 1M de tokens na API, sem sobretaxa para prompts longos. Isso é agressivo para uma API de fronteira, e importa para a matemática de roteamento — com esses números, a geração 3.8 se torna uma opção para cargas de trabalho que costumavam recorrer a carros-chefe mais caros.

O que pode realmente executá-lo

A hardware reality-check card for Qwen3.8-27B showing community-projected VRAM requirements: Q4_K_M ~16GB, Q3_K_M ~13GB, Q6_K ~21GB, FP8 ~27GB, full precision H100 80GB, with a footer noting these are community projections based on Qwen 3.6-27B quant sizes.

Para o 27B, a Alibaba ainda não publicou requisitos de hardware, então os números em circulação continuam sendo projeções da comunidade com base na tabela de quantização do Q​wen 3.6-27B — estimativas, não especificações. As faixas de trabalho que a maioria das pessoas está considerando em seus planejamentos permanecem inalteradas:

• Quantização Q4_K_M, ~16GB de VRAM — uma RTX 4090 ou equivalente, o ponto ideal que a maioria dos desenvolvedores locais irá almejar.

• Quantização Q3_K_M, ~13GB de VRAM — cabe em uma placa de 12GB como a RTX 3060 com qualidade reduzida.

• Quantização Q6_K, ~21GB de VRAM — quase sem perdas em placas de 24GB.

• Servindo FP8, ~27GB de VRAM — uma única L40S, conforme a projeção anterior, para inferência de nível de produção.

• Precisão total, H100 80GB — o caminho de qualidade de benchmark, e não algo que a maioria das equipes executará.

A novidade é que "você pode auto-hospedar a geração Qwen3.8 agora" é verdade, mas não para o modelo em que as pessoas estavam planejando. Os pesos abertos do Max são uma classe de hardware totalmente diferente: o modelo BF16 de precisão total tem cerca de 4,9TB, e a quantização seletiva em camadas de 1-bit da Unsloth o reduz para aproximadamente 397GB — executável, mas somente com 410GB ou mais de RAM e VRAM combinadas. Isso é infraestrutura séria, não uma placa prosumer. É exatamente a lacuna que o 27B foi projetado para preencher, o que faz da ausência contínua do 27B o motivo pelo qual o caminho local de GPU única para esta geração ainda não existe.

A questão da licença: o Max acabou de estabelecer o precedente.

A questão da licença para o 27B ainda está sem resposta, mas "como seria" não é mais um palpite. Os pesos abertos do Max foram lançados sob uma licença personalizada rotulada como "qwen3.8-max" — e não Apache 2.0. Conforme relatado no card do modelo, ela é geralmente livre para uso comercial e hospedagem, mas aciona requisitos adicionais em escala: produtos com mais de 100 milhões de usuários ativos mensais ou mais de US$ 20 milhões em receita mensal devem exibir o nome do modelo, e empresas com mais de US$ 50 milhões em receita anual que oferecem serviços de modelo-como-serviço ou assistentes de trabalho com IA precisam de licenciamento separado. Uma alegação que circula de que a licença proíbe o uso nos EUA, na UE, no Reino Unido e na Coreia é falsa — a licença não contém restrições territoriais.

Especificamente para o 27B, nenhuma licença foi nomeada. Mas o Max foi distribuído sob uma licença Qwen personalizada, e não Apache 2.0, o que torna Apache 2.0 uma suposição ruim para o modelo irmão também. A antiga licença Tongyi Qianwen — com sua cláusula de 100 milhões de MAU — não é o que o Max recebeu; a do Max é uma licença nova, em camadas por escala. Leia o arquivo LICENSE no repositório real antes de planejar em torno dele, e espere que a do 27B seja decidida apenas quando seu repositório for publicado.

Cronograma do toolchain: o suporte no primeiro dia acabou de ser comprovado.

Os mecanismos de serving avançaram tão rápido quanto o esperado — para o modelo que foi lançado. O Qwen3.8-2.4T-A95B foi lançado com suporte funcional em SGLang, vLLM e TokenSpeed, que é a cara de "servível via API quase imediatamente" para um grande lançamento de pesos abertos. Para o 27B, os mesmos mecanismos são os mais prováveis a dar o primeiro passo assim que o repositório aparecer, e a cobertura do Max desde o primeiro dia torna razoável esperar que o 27B herde esse suporte. As quantizações comunitárias GGUF e AWQ ainda costumam atrasar de uma a duas semanas, então a experiência "baixar e rodar" no estilo Ollama provavelmente ainda não existirá no dia do lançamento do 27B — uma configuração manual com vLLM ou llama.cpp é o provável caminho local no início.

O que ainda não se sabe

Uma matéria de vazamento honesta limita-se ao que é realmente público, e a fronteira é mais ampla do que era há uma semana em uma direção e mais estreita em outra: as perguntas do Max foram respondidas, as da 27B não.

• A nova data de lançamento."A semana de 10 de agosto" foi o compromisso; a semana está quase no fim e o repositório não apareceu. Rastreadores de terceiros relatam um atraso sem nova data, mas a Alibaba não fez nenhuma declaração oficial.

• Arquitetura. Dense ou MoE para o 27B e, se for MoE, o número de parâmetros ativos.

• A ficha técnica. Janela de contexto, modalidades, limites de saída, modo de raciocínio.

• Benchmarks. O 27B não tem pontuações oficiais nem avaliação independente.

• A licença. Indefinida até que o repositório do 27B seja lançado; a licença personalizada do Max é o precedente a observar.

• Risco de mirror. O problema dos placeholders agora está visível publicamente — existem cards da comunidade "Qwen3.8-27B-FP8", "-GGUF" e "-MLX" com zero arquivos oficiais. Até que a organização oficial Q​wen publique o repositório, baixe apenas da página da organização oficial.

O que isso significa para os construtores

A divisão prática para a geração Qwen3.8 agora é tripla, em vez de dupla. Se você quer a API de ponta hoje, o Qwen3.8-Max está no ar por meio do OrcaRouter pelo preço de tabela de US$ 2/US$ 6 do provedor, repassado com margem de 0% — o preço que você vê é o preço que a Alibaba definiu. Se você quer hospedar por conta própria o modelo da classe Max, os pesos abertos já podem ser baixados, mas você precisa de hardware para um modelo de precisão total de aproximadamente 4,9 TB ou um quantizado de aproximadamente 397 GB. E se você quer a implantação local com uma única GPU que esta geração deveria proporcionar, você ainda está esperando o Qwen3.8-27B, que não foi lançado. Uma chave compatível com OpenAI cobre o lado da API hoje, e quando a hospedagem do 27B estiver definida, a mesma chave pode rotear para ele.

Screenshot of the OrcaRouter model page for Qwen3.8-Max, showing model id qwen/qwen3.8-max, .00/1M input token pricing, a 1M-token context window, and an OpenAI-compatible Python code sample.

Essa última parte é o ponto mais geral, e é exatamente para isso que um lançamento de pesos abertos não comprovado e atrasado é o caso de teste. Um modelo que ainda nem foi lançado não tem histórico, nem suíte de benchmarks independente, nem histórico de incidentes — e quando finalmente for lançado, será totalmente novo. O roteamento é como você pode experimentá-lo sem arriscar um caminho voltado ao cliente: envie para ele o tráfego que pode tolerar surpresas, faça failover automaticamente para um modelo comprovado quando ele se comportar mal e mude toda a carga de trabalho assim que ele tiver conquistado confiança. A camada de roteamento também é o que torna o cálculo de preços honesto — quando a Alibaba corta o preço de um modelo que você chama por meio de um endpoint, a mudança entra em vigor no mesmo dia, porque o preço de tabela é repassado diretamente.

O que assistir

• Se o repositório do 27B aparece de todo. Uma listagem na organização oficial Q​wen no Hugging Face ou ModelScope é o evento que encerra o atraso — e a semana de 10 de agosto quase terminou sem uma.

• O arquivo de licença do 27B.O Max foi lançado com uma licença personalizada em camadas de escala, não Apache 2.0. Se o 27B seguir esse precedente é a linha mais consequente de seu eventual anúncio.

• Arquitetura e comprimento do contexto. Denso versus MoE e a janela de contexto determinam para que serve o 27B.

• O primeiro benchmark independente. O 56 do Max no Artificial Analysis Intelligence Index estabeleceu o padrão; a primeira avaliação externa do 27B dirá quanto dos ganhos da geração sobrevive no tamanho de consumidor.

• Cobertura do toolchain. Se o 27B herda o suporte de primeira hora do Max para SGLang/vLLM/TokenSpeed, e com que rapidez as quantizações da comunidade o acompanham.

Perguntas Frequentes

O Qwen3.8-27B já foi lançado?

Não. A Alibaba anunciou isso em 3 de agosto de 2026 e comprometeu os pesos com Hugging Face e ModelScope para a semana de 10 de agosto, mas até 13 de agosto não há repositório oficial, model card ou licença do Qwen3.8-27B. Os pesos abertos da classe Max — Qwen3.8-2.4T-A95B — foram lançados em 13 de agosto; o 27B não foi, e rastreadores de terceiros relatam que está adiado sem nova data.

Qual hardware eu preciso para executar o Qwen3.8-27B?

Não confirmado, mas projeções da comunidade com base na tabela de quantização do Q​wen 3.6-27B estimam um quant Q4_K_M em cerca de 16GB de VRAM (uma RTX 4090), um quant Q3_K_M em cerca de 13GB (placas de 12GB), um quant Q6_K em cerca de 21GB (placas de 24GB) e servir FP8 em cerca de 27GB (uma única L40S). Daniel Han, da Unsloth, relata cerca de 17GB no lançamento. Trate estes valores como estimativas até que o cartão de modelo oficial publique as diretrizes de hardware.

O Qwen3.8-27B está disponível através do OrcaRouter?

Ainda não. O Qwen3.8-27B é um modelo de peso aberto, auto-hospedado, e não está na plataforma hoje. O carro-chefe da mesma família — Qwen3.8-Max — está disponível agora por meio do OrcaRouter pelo preço de tabela de US$ 2/US$ 6 por milhão de tokens do provedor, com 0% de margem, e quando a hospedagem do 27B se estabilizar, ele poderá ser adicionado à mesma chave compatível com OpenAI.

Devo esperar pelo Qwen3.8-27B ou usar o Qwen3.8-Max hoje?

Depende de onde a carga de trabalho roda. Se você precisa de uma API de ponta agora, o Qwen3.8-Max está disponível e com preço agressivo de US$ 2/US$ 6 por milhão de tokens. Se você quiser fazer self-host da classe Max hoje, o Qwen3.8-2.4T-A95B já está disponível para download, mas exige hardware robusto — aproximadamente um modelo de precisão total de 4,9 TB, ou cerca de 397 GB quantizado, com mais de 410 GB de RAM e VRAM combinadas. Se você precisar de um modelo local ou on-premise em uma única GPU de consumidor, o Qwen3.8-27B ainda é o modelo para o qual vale a pena esperar — é o caminho realista de self-host nesta geração, e seu lançamento agora é a questão em aberto em vez de uma data fixa.

A semana prometida está quase no fim, e metade dela não chegou. {{1}}O Qwen3.8-2.4T-A95B está disponível para download, licenciado e operacional;{{/1}} {{2}}O Qwen3.8-27B tem existência confirmada, segue comprometido com pesos abertos e ainda não tem repositório, licença, benchmark ou nova data.{{/2}} {{3}}Fique de olho se o repositório do 27B chega antes do fim da semana prometida, o que o arquivo de licença dele diz ao lado do do Max, e como as primeiras avaliações independentes o pontuam.{{/3}} {{4}}Esses três sinais dirão se este é um lançamento rotineiro de pesos abertos em duas etapas, com o modelo menor ainda por vir, ou um atraso que vale a pena planejar.{{/4}}

Comparados neste artigo1

Detectado a partir deste artigo · Benchmarks: Artificial Analysis · atualizado diariamente