Um card de título hero para “Qwen 4 Max anunciado na Apsara 2026”, com o subtítulo “O que a Alibaba confirmou, e o que não confirmou”, três badges em formato de pílula com os textos “4 níveis pré-visualizados”, “0 especificações publicadas” e “22 de setembro de 2026”, e o logotipo da OrcaRouter no canto inferior direito.
Guides & Insights

Qwen 4 Max anunciado na Apsara 2026: o que a Alibaba confirmou, e o que não confirmou

Autor

Alistair Wren

Data de publicação

Modelos mais recentes · 20Ver todos os modelos
Benchmarks: Artificial Analysis · atualizado diariamente
Voltar para todas as publicações

A conferência Yunqi em Hangzhou — a Apsara Conference — foi usada em 22 de setembro de 2026 para mostrar quatro modelos que ainda não foram lançados. O líder de LLM do laboratório, Liu Da Yiheng, apresentou no palco o Qwen 4 Max, o Qwen 4 Flash, o Qwen 4 Plus e o Qwen 4 27B, descreveu a família como treinada em uma arquitetura de nova geração e disse apenas que ela chegaria em breve. No momento em que escrevo, não há ficha de modelo para nenhum dos quatro, nem pesos abertos, nem identificador de API, nem janela de contexto, nem preço e nem pontuação de benchmark. O mais novo modelo principal que você pode realmente chamar hoje é o Qwen3.8-Max, disponível de forma geral desde 3 de agosto de 2026, e essa distância entre um anúncio de palco e um endpoint chamável é a parte desta história que vale a pena ler com atenção.

Os quatro níveis, e o que cada um deve ser

A linha Qwen da Alibaba tem sido organizada em níveis de capacidade desde a geração Qwen 3, e o anúncio do Qwen 4 manteve essa estrutura em vez de substituí-la. O que foi mostrado no palco foi uma lista, não uma ficha de especificações:

• Qwen 4 Max — o nível de ponta, e aquele que a Alibaba posiciona contra o principal modelo de todos os outros laboratórios de fronteira

• Qwen 4 Flash — o nível de alto rendimento, criado para cargas de trabalho sensíveis à latência e de grande volume, em vez de raciocínio de pico

• Qwen 4 Plus — o nível intermediário equilibrado, historicamente o que tem a maior amplitude de suporte multimodal

• Qwen 4 27B — o nível local de pesos abertos, aquele que é baixado, ajustado finamente e quantizado por pessoas que nunca tocam em uma API hospedada

• Arquitetura — descrita como uma nova geração, e descrita como estando em treinamento, o que não é o mesmo que estar concluída

• Carga de trabalho principal — tarefas agênticas e com uso de ferramentas, conforme o enquadramento da conferência, em vez de chat

• Disponibilidade — nenhuma. Nenhum nível tem data de lançamento, preço, janela de contexto, lista de modalidades ou pontuação publicada.

O nível de 27B é o que merece atenção por um motivo que não tem nada a ver com benchmarks. É o único nível da família que historicamente foi disponibilizado sob pesos abertos, e a geração Qwen 3.8 mostrou quanto trabalho independente isso desbloqueia: poucos dias após os pesos de 27B serem lançados, a comunidade já tinha produzido conversões MLX, quantizações NVFP4 e fine-tunes sem censura. Um 27B anunciado é a promessa de todo um ecossistema a jusante, e é a parte deste roadmap com a entrega mais previsível.

O número de 5 a 10 trilhões de parâmetros não pertence ao Qwen 4

A cobertura da conferência tem sido imprecisa em relação a um número. A meta de "5 a 10 trilhões de parâmetros" que circulou junto com as notícias do Qwen 4 não é uma especificação do Qwen 4 — é uma declaração prospectiva sobre as gerações posteriores a ele, o período do Qwen 4.5 e do Qwen 5. A Alibaba não atribuiu nenhuma contagem de parâmetros ao Qwen 4 Max e, com as evidências disponíveis, seria um erro publicar uma.

Isto é importante porque a contagem de parâmetros é o número em que os leitores se fixam e o número que se propaga. Uma alegação de 5T de parâmetros atribuída a um modelo sem arquitetura publicada é infalsificável em ambas as direções: ninguém pode confirmá-la, e ninguém pode corrigi-la depois de ela ter sido repetida. Se você vir o Qwen 4 Max descrito como um modelo de vários trilhões de parâmetros esta semana, o número foi emprestado de um slide diferente.

O que pode ser dito com honestidade é que o carro-chefe antecessor é uma mistura de especialistas de 2,4 trilhões de parâmetros, com 95 bilhões de parâmetros ativos por token, confirmado na ficha oficial do modelo para o Qwen3.8-Max e no lançamento de pesos abertos que se seguiu. Seja o que for que o Qwen 4 Max venha a ser, essa é a linha de base que ele precisa superar, e é um número publicado e verificável, não uma aspiração de roadmap.

A two-column scoreboard titled "Qwen 4 Max vs the model you can call today". Left column Qwen 4 Max: Release date not given, Input price not given, Output price not given, Context window not given, Open weights not given, Benchmarks not given. Right column Qwen3.8-Max: Release date August 3 2026, Input price $2.00 per 1M tokens, Output price $6.00 per 1M tokens, Context window 1M tokens, Open weights published August 12 2026, Benchmarks vendor and independent. Footer reads "Qwen 4 Max status per Alibaba's September 22 2026 conference; Qwen3.8-Max from its published model card.", with the OrcaRouter logo bottom-right.

A arquitetura não é um boato: uma prévia dela já foi lançada

O mais útil no anúncio do Qwen 4 é que parte da arquitetura já havia sido lançada sob um nome diferente. O Qwen3.8-Flash-Next foi disponibilizado como código aberto no final de agosto de 2026, e seu model card o rotula claramente como uma prévia da arquitetura do Qwen 4. Isso o torna a única evidência concreta que alguém fora da Alibaba tem sobre como a família Qwen 4 é construída.

É um modelo esparso com 125 bilhões de parâmetros principais mais 51 bilhões de parâmetros de embeddings de N-gram, ativando cerca de 6 bilhões por etapa de inferência. Ele possui um contexto nativo de 262.000 tokens que, segundo a ficha, se estende em direção a 1 milhão, e a Alibaba relata que ele foi treinado com um custo cerca de 90% menor do que o Qwen3.7-Plus. Três técnicas são citadas na ficha:

• QSA, um esquema de atenção esparsa específico do Qwen, que é o mecanismo por trás da alegação de treinamento de contexto longo barato

• Conexões residuais com portões, uma medida de estabilidade para redes esparsas profundas

• Embeddings de N-gramas, um armazenamento de parâmetros separado com 51 bilhões de parâmetros que é consultado em vez de calculado densamente

Se os quatro níveis do Qwen 4 herdarem esse design, a consequência interessante é econômica, e não arquitetural. Uma família projetada para alcançar qualidade próxima da fronteira com cerca de um décimo do custo de treinamento é uma família que pode ser precificada de forma agressiva, e a precificação agressiva por parte da Alibaba tem sido a força mais confiável na economia de modelos de pesos abertos nos últimos dois anos. Isso é uma previsão, não um fato, e deve ser rotulada como tal — mas é o motivo para acompanhar este roadmap em vez de descartá-lo.

O que executar enquanto você espera

Nada no anúncio do Qwen 4 muda o que está disponível esta semana, e a resposta honesta para quem está construindo hoje é a geração Qwen 3.8. O Qwen3.8-Max está em disponibilidade geral desde 3 de agosto de 2026 a US$ 2,00 por milhão de tokens de entrada e US$ 6,00 por milhão de tokens de saída, com preço fixo em todo o contexto completo de 1 milhão de tokens, sem sobretaxa para prompts longos, e seus pesos foram publicados em 12 de agosto de 2026 como Qwen3.8-2.4T-A95B em BF16 e FP8 sob uma licença personalizada da Qwen. É o modelo que servirá de referência para os níveis do Qwen 4, e está atendendo tráfego de produção hoje.

Se você quer comparar a geração Qwen já lançada com o restante da fronteira sem gerenciar uma conta, uma chave e uma fatura separadas para cada laboratório, a OrcaRouter carrega a família Qwen 3.8 — Qwen3.8-Max, Qwen3.8-Flash e Qwen3.8-27B — ao lado de Claude Opus 5, DeepSeek V4 Pro, Gemini 3.1 Pro Preview e GLM 5.3 em um único endpoint compatível com OpenAI. Isso é uma API para quase 200 modelos com 0% de markup, o que significa que o preço de tabela do provedor é repassado sem alteração, de modo que um corte de preço do fornecedor chega à sua chave no mesmo dia, e não no próximo ciclo de faturamento. Quando uma linha Qwen 4 for lançada, é nesse mesmo catálogo que ela apareceria; hoje, nenhuma delas aparece.

A screenshot of the OrcaRouter model page for Qwen3.8 Max (qwen/qwen3.8-max, English UI), showing the on-page nav, the 1M token context badge, the model ID qwen/qwen3.8-max, multi-modality shown as text plus image plus video input with text output, the Vision, Tools, JSON, Reasoning and Thinking capability tags, the listing date 2026-08-03, a p50 time-to-first-token of 3.29s, the code-samples panel with the OpenAI-compatible Python import, the Public benchmarks and Community buzz blocks, and the opening line of the model description calling Qwen3.8-Max Alibaba's newest flagship and highest-capability tier to date.

O resultado final

Qwen 4 Max é um anúncio real e não um produto real, e ambas as metades dessa frase importam. A lista está confirmada: quatro níveis, uma arquitetura de nova geração, um foco agêntico e um nível de 27B com pesos abertos que importará mais para mais pessoas do que o modelo principal. Tudo o que uma decisão de compra precisa — preço, contexto, modalidade, pesos, pontuações, uma data — está faltando.

Trate isto como um sinal de roadmap com uma trilha documental excepcionalmente boa, porque o lançamento do Qwen3.8-Flash-Next lhe dá a prévia da arquitetura gratuitamente e o Qwen3.8-Max lhe dá a linha de base do incumbente com pesos publicados e um preço publicado. Acompanhe o nível de 27B pelo ecossistema que ele vai criar e o nível Flash pela economia de throughput. Não republique o número de 5 a 10 trilhões de parâmetros como um fato do Qwen 4, e não planeje uma migração em torno de um modelo que não tem data de lançamento — planeje-a em torno do Qwen3.8-Max, e mude quando houver um endpoint para o qual migrar.

A screenshot of the OrcaRouter model catalogue at www.orcarouter.ai/models (English UI), showing the header reading "199 models, 15 providers, one API key, one bill", the sort and filter rail with Newest selected alongside controls for input modalities and context length, the "How to call any model" panel showing a POST to api.orcarouter.ai/v1/chat/completions with a model and messages JSON body, and the first catalogue cards including openai/gpt-5-mini with a 200 Status badge.

Comparados neste artigo2

Detectado a partir deste artigo · Benchmarks: Artificial Analysis · atualizado diariamente