Um cartão de título hero para 'Qwen3.8-Max vs Qwen 3.8' com o subtítulo 'Um único núcleo de 2.4T — API alugada ou pesos abertos', selos para a atualização 0902 de 2 de setembro de 2026, a API hospedada a US$ 2/US$ 6 por 1M de tokens e os pesos abertos de 12 de agosto, e um rodapé observando o Code Arena WebDev independente nº 1, com 1.691 para a versão 0902, e que o checkpoint aberto ainda não possui pontuações independentes.
Guides & Insights

Qwen3.8-Max vs Qwen 3.8: Um Núcleo de 2.4T, Alugado ou Executado — Após a Atualização 0902

Autor

Gideon Frost

Data de publicação

Modelos mais recentes · 20Ver todos os modelos
Benchmarks: Artificial Analysis · atualizado diariamente
Voltar para todas as publicações

Em 2 de setembro de 2026, a Alibaba lançou uma atualização datada do Qwen3.8-Max — a versão que ela designa como Qwen3.8-Max-0902 — e um ranking independente de codificação colocou o novo snapshot em #1 na mesma semana. A versão para download desse mesmo núcleo de 2,4 trilhões de parâmetros, o modelo que a maioria das pessoas tem em mente quando escreve "Qwen 3.8" sem sufixo, ainda está parada no checkpoint de 12 de agosto: somente texto, raciocínio permanentemente ativado e centenas de gigabytes aquém do necessário para rodar em qualquer coisa menor que um rack de GPUs. Essa lacuna entre o carro-chefe hospedado e os pesos abertos não existia em agosto. Hoje, a comparação se resume a isso, e é por isso que o mesmo modelo continua sendo vendido a você sob dois nomes.

Qwen3.8-Max é o principal modelo hospedado da Alibaba: um modelo esparso de mistura de especialistas com 2,4 trilhões de parâmetros, com cerca de 95 bilhões de parâmetros ativos por token, disponível em uma API paga desde 3 de agosto e com uma janela de contexto multimodal de 1 milhão de tokens. Qwen 3.8, tomado como nome independente, é o lançamento aberto da mesma geração — mais notavelmente o Qwen3.8-2.4T-A95B, os pesos que a Alibaba publicou em 12 de agosto sob uma licença personalizada. Eles não são um irmão mais barato e um irmão premium. São o mesmo cérebro vendido de duas formas, e uma rodada de pós-treinamento em setembro começou a separar as duas entregas. Este artigo esclarece qual "Qwen 3.8" você está realmente vendo, o que a atualização 0902 mudou e qual caminho — alugar a API ou executar os pesos — você deveria seguir hoje.

A combinação que não é uma rivalidade

Antes das datas e das tabelas de preços, a arquitetura: Qwen3.8-Max e Qwen3.8-2.4T-A95B compartilham um design MoE de granulação fina com 512 especialistas por camada (10 roteados mais um compartilhado, por camada), 92 camadas e uma pilha híbrida na qual 69 das 92 camadas usam atenção linear — Gated DeltaNet combinado com atenção gated — com atenção total intercalada para o trabalho de contexto longo. É por isso que a ficha do modelo pode reivindicar o contexto de um milhão de tokens na API e por que a versão aberta alcança um 262K nativo que se estende até um milhão com a configuração de servir correta. As diferenças entre os dois nomes não estão na arquitetura dos pesos; estão nas bordas, e as bordas mudaram desde 2 de setembro.

• Parâmetros — Qwen3.8-Max: 2,4T no total / ~95B ativos, MoE. Qwen3.8-2.4T-A95B: o mesmo núcleo, a mesma contagem de parâmetros ativos.

• Entrega — Qwen3.8-Max: API hospedada, no ar desde 3 de agosto, atualizada como Qwen3.8-Max-0902 em 2 de setembro. Qwen3.8-2.4T-A95B: pesos para download, publicados pela primeira vez em 12 de agosto, sem checkpoint mais novo desde então.

• Modalidade — Qwen3.8-Max: entrada de texto, imagem e vídeo. Qwen3.8-2.4T-A95B: somente texto.

• Controle de raciocínio — Qwen3.8-Max: pensamento alternável, incluindo um modo sem pensamento. Qwen3.8-2.4T-A95B: pensamento sempre ativado, com apenas um controle de esforço de raciocínio (baixo / alto / extra-alto).

• Ferramentas — Qwen3.8-Max: chamada de função nativa, cinco ferramentas integradas e saída estruturada. Qwen3.8-2.4T-A95B: sem camada de ferramentas nativa; o que você obtém depende do framework de inferência com o qual você o serve.

O que a atualização de 2 de setembro mudou

A build 0902 é uma etapa de pós-treinamento, não uma nova arquitetura. A Alibaba a direcionou para as duas coisas pelas quais o Qwen3.8-Max já era conhecido — codificação e "cowork", seu nome para trabalho agêntico de longo horizonte e trabalho de escritório — e os números que surgiram em torno dela são o motivo pelo qual esta atualização importa. No leaderboard independente Code Arena: WebDev, o Qwen3.8-Max-0902 estreou com 1.691 Elo, um salto de 22 pontos em relação à build anterior e suficiente para conquistar o primeiro lugar logo na chegada. A Alibaba também enquadra a build como o modelo com maior pontuação na fronteira de Pareto custo-desempenho desse ranking, a uma taxa combinada de cerca de US$ 5 por milhão de tokens — o preço de tabela de US$ 2 e US$ 6 ponderado pelo tráfego agêntico com alta geração de saída, aproximadamente um quarto do que uma chamada de fronteira comparável custa em outros lugares. Esses números são uma mistura que o leitor deve manter em perspectiva: os 1.691 Elo são um resultado independente de arena; o enquadramento da fronteira de Pareto é a própria caracterização da Alibaba desse ranking independente.

As avaliações internas da Alibaba para a passagem 0902, relatadas pelo fornecedor e não reproduzidas, mostram a mesma direção: Terminal-Bench 3.0 subindo de 11,3 para 29,0, ProgramBench de 10,5 para 28,0, JobBench de 53,4 para 64,0 e WorkArena Elo de 1.348 para 1.468. Leia isso como "a atualização moveu os eixos agentivos e de codificação", não como pontuações verificadas. No lado da inteligência geral, o Índice de Inteligência da Artificial Analysis tem Qwen3.8-Max em 56 — competitivo, mas não é o motivo para recorrer a ele; os resultados de codificação e de agentes são.

A parte que a maioria das coberturas deixou passar é que o pós-treinamento de 0902 é, até o momento em que escrevo, apenas via API. A Alibaba não publicou um checkpoint aberto do modelo atualizado — os pesos Qwen3.8-2.4T-A95B no Hugging Face ainda remontam ao lançamento de 12 de agosto. Isso significa que o Qwen3.8-Max hospedado e o núcleo para download não são mais o mesmo modelo como eram em meados de agosto. A API tem o pós-treinamento de setembro; os pesos não. Se toda a sua razão para executar a versão aberta era reproduzir exatamente o que o modelo principal faz, essa premissa silenciosamente deixou de ser verdadeira em 2 de setembro.

A comparison scoreboard for Qwen3.8-Max (0902) and Qwen 3.8 (2.4T-A95B open): left column shows Hosted API with a Sep-2 build tag, Text + image + video, 1M native context, a thinking toggle including off, native tools and JSON, and $2/$6 per 1M with a $0.25 cache tag; right column shows Open weights with an Aug-12 tag, Text only, 262K native context, thinking always on, framework-level tools and JSON, and weights plus your own GPUs; the footer notes independent Code Arena WebDev 1,691 and AA Index 56 for the Max, and that the open checkpoint has no independent scores yet.

Os cinco lugares onde eles genuinamente divergem

Deixando a arquitetura compartilhada de lado, as diferenças práticas se alinham de forma clara. A modalidade é o primeiro filtro: se sua carga de trabalho inclui imagens ou vídeo — capturas de tela, gráficos, documentos com figuras, quadros de vídeo — somente o Qwen3.8-Max os aceita, e sua janela de 1 milhão de tokens é nativa, não uma extensão. Os pesos abertos são apenas texto. O controle de raciocínio é o segundo: a API hospedada pode ser executada com o raciocínio desativado, o que importa para extração sensível à latência e de alto volume, em que uma cadeia de raciocínio é puro custo adicional; a versão de pesos abertos não pode desativá-lo. O terceiro é o ferramental: chamada de funções, as cinco ferramentas integradas e o modo JSON fazem parte do produto hospedado, enquanto a versão de pesos abertos depende do que sua camada de serviço fornece.

O contexto é mais sutil do que a ficha técnica sugere. Ambos os lados podem alcançar cerca de um milhão de tokens, mas o modelo hospedado faz isso nativamente com entrada multimodal, enquanto o contexto nativo de 262K da versão aberta precisa ser estendido na configuração, e cada token dessa janela estendida é texto. Os limites de saída também diferem — a API permite até cerca de 131 mil tokens de saída, e a versão aberta é normalmente configurada com um teto semelhante, mas o teto prático do lado aberto é definido pela sua stack de serviço, não pelo modelo.

Quanto cada rota realmente custa

É aqui que as duas entregas deixam de ser comparáveis. O Qwen3.8-Max tem um preço de tabela: US$ 2,00 por milhão de tokens de entrada, US$ 6,00 por milhão de tokens de saída e US$ 0,25 por milhão de tokens de entrada em cache. Como o OrcaRouter repassa os preços de tabela dos provedores com margem de 0%, essa é a tarifa que você paga aqui; e quando a Alibaba a altera, o novo valor entra em vigor no mesmo dia. O snapshot 0902 é fixado separadamente como qwen/qwen3.8-max-0902 para equipes que querem comportamento reproduzível — mesmo preço, mesmas capacidades, mas um checkpoint fixo em vez do modelo contínuo. No tráfego do OrcaRouter, a mediana de 7 dias do tempo até o primeiro token do Qwen3.8-Max é de aproximadamente 2 a 4 segundos, e a Artificial Analysis mede cerca de 45 a 48 tokens de saída por segundo: não é lento, mas é verboso, e é por isso que tarefas de agente nesse modelo podem consumir quantidades surpreendentes de tokens apesar da tarifa barata.

A screenshot of the OrcaRouter model page for Qwen3.8-Max (qwen/qwen3.8-max), showing the flagship description, the price card at $2.00 per 1M input and $6.00 per 1M output tokens, a 1,000,000-token context window, and 7-day median time-to-first-token and traffic figures.

O Qwen3.8-2.4T-A95B não tem preço de tabela, porque o preço é a sua infraestrutura. Os pesos BF16 chegam a aproximadamente 4,9 TB, e até mesmo a versão oficial em FP8 tem cerca de 2,4 TB; portanto, estamos falando de hardware em escala de rack: as menores configurações documentadas para servir o modelo começam em oito GPUs B300 ou GB300, e um rack GB300 NVL72 completo é a implantação de referência. A quantização agressiva muda o piso mínimo — uma versão NVFP4 cabe em cerca de 1,3 TB, e a quantização em camadas de 1 bit da Unsloth comprime o modelo para cerca de 397 GB, o que finalmente torna viável um único nó bem provisionado —, mas todas essas alternativas pressupõem que você opera GPUs em escala de datacenter. Provedores terceiros que servem o checkpoint aberto vendem tokens abaixo do preço por token do Max, mas, nesse processo, você abre mão da entrada multimodal, do modo sem raciocínio, das ferramentas nativas e do pós-treinamento 0902; além disso, nenhum benchmark independente desse checkpoint para download foi publicado até agora. O próprio model card da Alibaba é franco sobre a relação: descreve o Qwen3.8-Max como a versão oficial construída sobre o Qwen3.8-2.4T-A95B, adicionando entrada de visão, suporte ao modo sem raciocínio, contexto padrão de 1M e ferramentas integradas por cima do núcleo aberto.

A screenshot of the Hugging Face model card for Qwen/Qwen3.8-2.4T-A95B, showing the Text Generation and Transformers tags and the card text explaining that Qwen3.8-Max is the official version built on Qwen3.8-2.4T-A95B with vision input, non-thinking support, a 1M default context, and built-in tools.

Números independentes versus alegações de fornecedores.

A honestidade na origem das informações importa mais aqui do que na maioria das comparações, porque os dois lados têm evidências com idades muito diferentes. O Qwen3.8-Max já foi avaliado de forma independente: o resultado de 1.691 no Code Arena: WebDev para a build 0902 e o Intelligence Index de 56 da Artificial Analysis são medições de terceiros, e o preço que torna interessante a alegação de fronteira de Pareto é uma tabela de preços publicada. O Qwen3.8-2.4T-A95B ainda não tem isso: a tabela de benchmarks que a Alibaba publicou descreve o núcleo da classe Max, não uma execução independente do checkpoint baixável. Portanto, o lado aberto desta comparação ainda é, em grande parte, "o fornecedor diz que o núcleo pontua assim". Se você está decidindo entre eles com base em capacidades, trate os números de destaque dos pesos abertos como alegações até que um terceiro os rode.

Quem deve escolher qual

A decisão decorre da lista acima. Recorra ao Qwen3.8-Max hospedado — hoje, especificamente a build 0902 — quando precisar do pós-treinamento de setembro, entrada de imagem ou vídeo, um modo sem raciocínio, ferramentas nativas e saída estruturada, ou uma janela de um milhão de tokens sem precisar provisionar infraestrutura. Essa é a posição de fronteira em codificação e agentes, e a $2/$6 com $0,25 de entrada em cache, o preço é agressivo pelo que oferece.

Escolha Qwen3.8-2.4T-A95B quando o controle supera a conveniência: você precisa dos pesos em seu próprio hardware ou em um provedor que já opera, quer um checkpoint fixo que possa auditar e reproduzir, ou seu volume sustentado torna o custo por token o termo dominante e você está preparado para executar um MoE de 2,4T. Aceite a lista de concessões — somente texto, raciocínio sempre ativo, sem ferramentas nativas, ainda sem pós-treinamento 0902 — e verifique os termos da licença para a sua faixa de receita, porque a licença personalizada Qwen3.8-Max não é Apache 2.0 e adiciona condições para grandes operadores comerciais.

Se a sua carga de trabalho for de alto volume, de uma única GPU ou sensível à latência, nenhuma dessas pode ser a pista certa — o irmão de 27 bilhões de parâmetros da geração, Qwen3.8-27B, é o indicado para isso, e ele é abordado separadamente na nossa comparação entre Qwen3.8-27B e Qwen3.8-Max.

Como experimentar ambos sem apostar todas as suas fichas

A maneira limpa de fazer essa comparação é executar os dois lados com seus próprios prompts, e é exatamente aí que uma camada de roteamento mostra seu valor em vez de ser simplesmente acoplada por cima. O Qwen3.8-Max e o snapshot fixado Qwen3.8-Max-0902 ficam ambos atrás de um único endpoint compatível com OpenAI no OrcaRouter; portanto, alternar entre o carro-chefe em atualização contínua e o checkpoint reproduzível é uma mudança de model-id, não um novo deploy. Quando uma equipe decide trazer os pesos abertos para o ambiente interno, a DSL de roteamento pode servir de frontend para um endpoint auto-hospedado de vLLM ou SGLang que atende o Qwen3.8-2.4T-A95B e colocá-lo no mesmo grafo de chamadas — tráfego em massa para sua própria implantação, prompts difíceis e solicitações multimodais encaminhados ao Qwen3.8-Max hospedado, com failover automático entre eles. Testar um novo checkpoint desse jeito custa uma mudança de configuração, não uma migração, que é exatamente o que você quer quando os dois lados dessa comparação ainda se movem em velocidades diferentes.

O resultado final

Qwen3.8-Max e Qwen 3.8 não são dois modelos disputando o mesmo trabalho. São um mesmo núcleo de 2,4 trilhões de parâmetros, entregue como uma API alugada e como pesos para download — e a atualização de 2 de setembro fez com que as duas entregas passassem a significar coisas diferentes. Alugue a API e você terá o pós-treinamento 0902, que assumiu a liderança no Code Arena: WebDev, além de visão, um modo sem raciocínio, ferramentas nativas e uma janela nativa de um milhão de tokens, por US$ 2/US$ 6, com US$ 0,25 para entrada em cache. Execute os pesos abertos e você terá a mesma arquitetura congelada no estado de 12 de agosto — somente texto, com o raciocínio sempre ativo — ainda sem pontuações independentes e com a conta de hardware de data center para pagar. Se os ganhos de codificação e de capacidades agênticas de setembro são importantes para você, apenas um dos dois nomes os tem hoje. Se o controle reproduzível importa mais, apenas um dos dois nomes é seu para manter.

Comparados neste artigo1

Detectado a partir deste artigo · Benchmarks: Artificial Analysis · atualizado diariamente