Um cartão de título principal para 'Qwen3.8-Max vs Qwen3.7-Max', com o subtítulo 'Dois níveis Max, 16 pontos de índice e uma promoção que inverte o preço', e um rodapé observando que os números do Qwen3.8-Max vêm da divulgação da Alibaba de 22 de setembro de 2026 e da Artificial Analysis, enquanto os números do Qwen3.7-Max vêm da Artificial Analysis.
Guides & Insights

Qwen3.8-Max vs Qwen3.7-Max: Dois Níveis Max, 16 Pontos de Índice e uma Promoção Que Inverte o Preço

Autor

Alistair Wren

Data de publicação

Modelos mais recentes · 20Ver todos os modelos →
Benchmarks: Artificial Analysis · atualizado diariamente
Voltar para todas as publicações

Quatro dias atrás, o fornecedor nos disse que Qwen3.8-Max não é o modelo que ele lançou em agosto. Em um comunicado à imprensa datado de 22 de setembro de 2026, da Conferência Apsara em Hangzhou, a empresa revelou que seu carro-chefe concluiu 33 ciclos iterativos de trabalho de treinamento e pós-treinamento totalmente automatizados ao longo de mais de um mês, e que a versão resultante elevou seu Artificial Analysis Intelligence Index de 40 para 45. O ID do modelo nunca mudou. O número por trás dele, sim.

Isso importa mais em um lugar específico: a comparação entre Qwen3.8-Max e Qwen3.7-Max, o nível Max que ele substituiu. O Qwen3.8-Max chegou à disponibilidade geral em 3 de agosto de 2026; o Qwen3.7-Max foi lançado em maio. No papel, isso parece uma decisão geracional fácil — modelo principal mais novo, pontuação mais alta, seguir em frente. Os números dizem algo mais incômodo. O nível mais antigo é de três a quatro vezes mais rápido, cerca de cinco vezes mais barato por tarefa concluída e idêntico ao mais novo em benchmarks de conhecimento puro. O nível mais novo é multimodal, dramaticamente melhor em trabalho agêntico e mais barato na tabela de preços internacional. Qual deles você deve usar depende de uma pergunta que a maioria das comparações ignora: se você está comprando conhecimento ou comprando chamadas de ferramentas.

O que a divulgação da Apsara realmente afirma

A divulgação é uma declaração de fornecedor, publicada pela Alibaba em seu próprio site de imprensa, e deve ser lida como tal. O que ela diz é específico: ao longo de um mês de execuções totalmente automatizadas abrangendo projeto de pipeline, validação de dados, experimentação iterativa e diagnóstico de erros, o Qwen3.8-Max completou 33 ciclos, e a otimização autônoma de treinamento somada a técnicas de pós-treinamento produziram a variação da pontuação. A Alibaba também descreveu um segundo experimento em projeto de chips, no qual o modelo executou mais de 60 horas de autoaperfeiçoamento ao longo de um ciclo de vida de design, fez mais de 10.000 chamadas de ferramentas EDA e produziu módulos de barramento de chip de nível de produção, ao mesmo tempo que reduziu a área do chip em 42%, sem qualquer comprometimento de desempenho declarado. Tudo isso é o relato da Alibaba sobre seu próprio modelo, não reproduzido por ninguém fora da empresa.

A mudança de pontuação em si, porém, não é uma alegação do fornecedor. O Index é da Artificial Analysis, e o 45 está na página do Qwen3.8 Max (0902) desse terceiro. O 40 de onde ele partiu está na página da mesma organização referente à compilação de 3 de agosto, que agora está marcada como obsoleta e aponta para a atual. Assim, o delta é uma causa relatada pelo fornecedor associada a um efeito pontuado de forma independente, o que é uma posição mais forte do que qualquer uma das metades isoladamente. É também, no momento em que escrevo, a evidência pública mais concreta de que um laboratório de fronteira alterou a capacidade medida do seu carro-chefe sem lançar um novo número de versão.

Duas outras coisas sobre o lançamento são fáceis de passar despercebidas e ambas são fundamentais. Primeiro, a Alibaba confirmou que Qwen 4 está em treinamento, com as séries Qwen 4.5 e Qwen 5 projetadas para escalar para 5–10 trilhões de parâmetros. Segundo, há um snapshot datado do modelo atualizado. A Alibaba fixou a versão pós-treinada como qwen3.8-max-0902 em 2 de setembro, e é roteável separadamente. Esse pin é a resposta prática para tudo o que a divulgação do RSI implica, e voltaremos a isso.

O placar

Seis dimensões, ambos os lados, com a disciplina de fontes mantida explícita porque as duas colunas não são igualmente verificadas.

• Janela de contexto — Qwen3.8-Max 1.000.000 de tokens vs. Qwen3.7-Max 1.000.000 de tokens (idêntica)

• Saída máxima — 131.072 tokens vs. 131.072 tokens de acordo com as próprias páginas de modelo da Alibaba (idênticos; observe que nossa página de catálogo do Qwen3.7-Max traz 64.000, uma divergência que sinalizamos em vez de mascarar)

• Modalidade de entrada — texto, imagem e vídeo vs apenas texto

• Preço de tabela internacional por 1 milhão de tokens — US$ 2,00 de entrada / US$ 6,00 de saída vs. US$ 2,50 de entrada / US$ 7,50 de saída; a mesma tabela de preços já cobra de ambos os modelos US$ 1,65 / US$ 4,951 em Pequim, Frankfurt e Virgínia

• Artificial Analysis Intelligence Index — 45 vs 29

• Velocidade de saída independente — 39,7 tokens/seg vs 211,3 tokens/seg, medida em relação à mesma classe de comparação de 211 modelos, na qual a Artificial Analysis classifica o nível mais recente como notavelmente lento e o mais antigo como notavelmente rápido

As duas últimas linhas são o artigo inteiro. Na mesma família de índices, o nível mais recente está 16 pontos à frente. Em velocidade, está mais de cinco vezes atrás.

A two-column comparison scoreboard: left column 'Qwen3.8-Max' lists Context window 1,000,000 tokens, Max output 131,072 tokens, Input text / image / video, International price per 1M $2.00 / $6.00, AA Intelligence Index 45 and Output speed 39.7 tok/s; right column 'Qwen3.7-Max' lists Context window 1,000,000 tokens, Max output 131,072 tokens, Input text only, International price per 1M $2.50 / $7.50, AA Intelligence Index 29 and Output speed 211.3 tok/s; a footer credits Alibaba's 22 Sep 2026 disclosure and Artificial Analysis.

De onde vêm os 16 pontos — e de onde não vêm

Divida o Index em suas partes e a forma do upgrade fica clara, e não é a forma que o marketing sugere.

Em conhecimento e raciocínio, os dois modelos estão efetivamente empatados. GPQA Diamond: 92,8 vs 92,3. Humanity's Last Exam: 43,1 vs 40,5. Recall de contexto longo: 80,33 vs 79. SciCode: 52,1 vs 49,5. Se sua carga de trabalho for responder a perguntas sobre um grande corpus, o salto geracional é um erro de arredondamento. Pagar várias vezes mais por isso seria difícil de justificar.

No trabalho com agentes e de programação, a diferença se abre de forma acentuada. Terminal-Bench 2.1: 88,76 vs 74,53. O índice de codificação da Artificial Analysis: 76,2 vs 66. E a divergência mais ampla do conjunto é a tarefa de uso de ferramentas bancárias, em que o Qwen3.8-Max registra 47,84 contra o Qwen3.7-Max, que fez 11,75 — uma diferença de quatro vezes exatamente na capacidade que a descrição do RSI diz que os ciclos automatizados estavam otimizando: design de pipeline, validação de dados, experimentação iterativa, diagnóstico de erros. Um modelo que passa um mês melhorando seu próprio loop de treinamento é um modelo que ficou melhor em loops.

Uma ressalva honesta sobre essas linhas individuais. Ambas as páginas dos modelos pertencem à mesma família de revisões do Intelligence Index (v4.3 e v4.3.2), o que torna justa a comparação principal de 45 contra 29. As linhas por benchmark não são da mesma coorte: os números em nível de tarefa do Qwen3.7-Max datam da janela de avaliação de maio, enquanto os do Qwen3.8-Max vêm da série de setembro. Leia a direção da tendência, não o terceiro algarismo significativo.

A questão do preço são duas perguntas.

Na tabela de preços internacional da Alibaba, o Max mais recente é mais barato do que aquele que substituiu: $2.00 / $6.00 para o Qwen3.8-Max, contra $2.50 / $7.50 para o Qwen3.7-Max, por milhão de tokens. Um corte de 20% em ambas as direções conforme a geração avança é incomum e digno de nota por si só. A economia de cache também favorece a camada mais recente — cache implícito a $0.25 contra $0.50, leitura de cache explícito a $0.17 contra $0.25.

Essa é a primeira pergunta, e ela tem uma resposta regional que a maior parte da cobertura simplifica. A Alibaba cobra de ambos os modelos $1.65 input / $4.951 output em Pequim, Frankfurt e Virgínia. A diferença de 20% existe apenas no cartão internacional de Singapura. Se o seu tráfego cai nas outras três regiões, os tokens de entrada e de saída custam o mesmo para os dois níveis Max hoje, e a decisão se reduz a pura capacidade — e nesse ponto o modelo mais novo vence em tudo, exceto no throughput, e não sobra nenhuma aritmética a fazer.

A segunda pergunta é a armadilha. O Qwen3.7-Max não custa atualmente US$ 2,50 / US$ 7,50. Ele é oferecido a US$ 1,25 / US$ 3,75 — metade do preço de tabela, uma tarifa promocional. Isso faz com que o nível da geração anterior seja a opção mais barata hoje, por uma margem ampla. Também significa que o preço que você consegue medir nesta semana não é o preço com o qual você estaria se comprometendo. A própria página do modelo da Alibaba afirma claramente que a tabela publicada mostra os preços originais "excluindo quaisquer promoções por tempo limitado" e direciona você ao console para ofertas atuais. Uma promoção é, por construção, uma tarifa que pode acabar. Se ela acabar, o Qwen3.7-Max não se torna apenas mais caro do que é hoje; ele se torna 25% mais caro do que o modelo que o supera.

Repassamos a tarifa do provedor com 0% de margem, então tanto o preço de tabela quanto a promoção ficam ativos do nosso lado no mesmo dia em que mudam — o que é conveniente para uma comparação e não ajuda em nada se você está tentando fazer um orçamento. Monte o modelo com base na tabela de preços, e trate a tarifa promocional como ganho adicional.

A screenshot of Alibaba Cloud Model Studio's 'Recommended models' documentation overview page, showing the console navigation on the left, the line 'Alibaba Cloud Model Studio offers Qwen and third-party models for text, image, audio, and video.', an 'Updated at: 2026-09-24 20:17:58' stamp, and category cards covering Text generation (listing qwen3.8-max and qwen3.7), Image & video, World models, and Audio & speech.

O número que inverte o argumento de custo

O preço dos tokens não é o que uma tarefa custa. A Artificial Analysis publica um valor de custo por tarefa que incorpora a economia de cache, o volume de raciocínio e o comprimento da resposta e, nessa métrica, o ranking se inverte completamente: $5,41 por tarefa do Intelligence Index para o Qwen3.8-Max contra $1,15 para o Qwen3.7-Max. Um prêmio de 4,7×, contra uma tarifa de tokens que é 20% mais barata ou idêntica, dependendo da sua região.

A diferença é principalmente a verbosidade. Na mesma avaliação, o modelo mais novo gerou 190 milhões de tokens de saída contra 120 milhões do modelo mais antigo, e ele raciocina longamente para chegar às suas respostas. Se você paga por token de saída para uma carga de trabalho de alto volume e moderadamente difícil, o Max mais novo não é o modelo mais barato a qualquer preço por token em qualquer uma das duas tabelas de preços. Ele é o mais caro, e o preço de tabela do token é o instrumento errado para decidir isso.

Velocidade, e o que o nosso próprio tráfego mostra

A diferença de throughput é grande o suficiente para mudar arquiteturas. A Artificial Analysis coloca o Qwen3.8-Max a 39,7 tokens por segundo — seu resumo classifica o modelo como notavelmente lento — contra 211,3 do Qwen3.7-Max, que ela classifica como notavelmente rápido. Essa é a diferença entre um modelo que você coloca atrás de uma superfície interativa e um que você coloca atrás de uma fila — e no Qwen3.8-Max é a primeira coisa que nosso próprio painel de estatísticas mostra a você.

Nossa própria telemetria do playground nos sete dias até 25 de setembro conta uma história um pouco mais nuançada sobre latência, e vem com uma ressalva: são nossas medições em nosso roteamento, não um benchmark controlado. Qwen3.8-Max apresentou uma mediana de 2.611 ms até a primeira resposta a 54,7 tokens por segundo, com taxa de erro de 2,45%; a build 0902 fixada apresentou uma mediana de 3.360 ms a 46,2 tokens por segundo, com uma taxa de erro notavelmente mais limpa de 0,66%. Qwen3.7-Max ficou em uma mediana de 4.509 ms, mas 169,8 tokens por segundo, com uma taxa de erro de 3,80%. Então, a camada mais antiga responde mais lentamente no início e depois transmite três vezes mais rápido, embora falhe com mais frequência. Se sua carga de trabalho for em rajadas, essa diferença na taxa de erro merece mais atenção do que a mediana.

Ambos os níveis estão ativos em uma única chave OrcaRouter junto com o snapshot fixado, com failover automático entre provedores. Para uma comparação como esta, esse é o ponto prático: medir seus próprios prompts em ambas as gerações Max é uma alteração de configuração, não um segundo contrato.

A screenshot of OrcaRouter's own model page for Qwen3.7-Max (models/qwen/qwen3.7-max) in the dark theme, showing the Qwen3.7-Max heading, its model description, and the stat and price panel for the tier.

A Reprodutibilidade é agora o fator decisivo

Aqui está a parte da divulgação da Apsara que ninguém precificou. Um ID de modelo ativo cuja capacidade medida passou de 40 para 45 ao longo de um mês, sem mudança de versão e sem anúncio na época, é uma ameaça à reprodutibilidade. Se o comportamento do seu produto é função de um ID em movimento, você tem um modelo que pode melhorar — ou mudar — por baixo de uma suíte de avaliação congelada, de uma biblioteca de prompts em cache ou de um conjunto de regressão aprovado.

Ambas as gerações oferecem snapshots datados, e essa é a mitigação. O Qwen3.7-Max é documentado pela Alibaba como funcionalmente equivalente a qwen3.7-max-2026-05-20, com outras builds datadas em 2026-05-17 e 2026-06-08. O Qwen3.8-Max tem qwen3.8-max-0902, a build de setembro pós-treinada, que é aquela à qual o 45 se refere. Se você estiver publicando algo que precise ser reproduzível, fixe o ID datado e trate o flutuante como um alvo de staging. Os ciclos de RSI são uma característica do ID flutuante; a fixação é como você opta por não participar deles.

Um detalhe de nomenclatura que vale a pena conhecer para não interpretar mal o catálogo. A Alibaba lista uma terceira forma com data, qwen3.8-max-2026-09-02, juntamente com o alias 0902; referem-se à mesma compilação. A versão original de 3 de agosto já não é encaminhável do nosso lado — servimos Qwen3.8-Max, o seu pin 0902, e Qwen3.7-Max.

Quem deve escolher qual

A decisão não se prende a qual modelo é melhor. Prende-se ao que você está comprando.

Fique com o Qwen3.7-Max se sua carga de trabalho for somente de texto, mais intensiva em conhecimento do que em ferramentas, e sensível à vazão — classificação em alto volume, extração, recuperação de contexto longo, sumarização em lote. No GPQA Diamond e na recuperação de contexto longo, ele fica a um ponto do modelo mais novo, transmite de três a quatro vezes mais rápido e custa US$ 1,15 por tarefa contra US$ 5,41. Também é a resposta certa para quem quer uma segunda opinião barata em uma configuração de fusão ou roteamento, porque, com sua tarifa promocional, ele está em uma classe de preço totalmente diferente. Duas ressalvas: a promoção é uma promoção, e a Artificial Analysis já sinalizou o modelo como descontinuado, substituído pelo Qwen3.8-Max. Não comece um compromisso de vários anos com ele.

Mude para Qwen3.8-Max se qualquer uma destas condições for verdadeira: você precisa de entrada de imagem ou vídeo, que o Qwen3.7-Max não aceita de forma alguma; sua carga de trabalho é agêntica, com longas cadeias de chamadas de ferramentas ou loops de codificação em várias etapas, onde 88,76 versus 74,53 no Terminal-Bench 2.1 e a diferença de quatro vezes no uso de ferramentas são a diferença entre entregar ou não; ou você programa com base na tabela de preços internacional de Singapura, onde o modelo mais novo é simplesmente 20% mais barato e não há trade-off a ponderar. Fixe qwen3.8-max-0902 se você precisar que o comportamento se mantenha estável.

Se você está em Pequim, Frankfurt ou Virgínia, a escolha é mais clara do que qualquer comparação sugere: ambos os níveis Max custam $1.65 / $4.951 por milhão de tokens. Idêntico. A essas taxas, não pagar nada a mais por entrada multimodal, um Índice 16 pontos maior e uma pontuação de uso de ferramentas quatro vezes melhor não é uma decisão, é de graça — e a única razão para permanecer no Qwen3.7-Max passa a ser a taxa de transferência bruta.

Duas perguntas que vale a pena responder diretamente

A execução de treinamento de 33 ciclos significa que o modelo mudou sob o tráfego de API existente? É o que a divulgação sugere, e é por isso que o pin datado existe. A Alibaba descreve o modelo aprimorado como "o Qwen3.8-Max atualizado", que é o ID flutuante, não um novo. Se você tinha cargas de trabalho no ID flutuante até setembro, elas eram atendidas por um modelo cuja capacidade medida mudou durante essa janela. A Alibaba não publicou um changelog para as builds intermediárias, então a única maneira confiável de saber qual comportamento você tem é fixar a versão.

A alegação de RSI foi verificada de forma independente? A pontuação que ela produziu é — o Index é da Artificial Analysis, e o 45 está na página deles. O mecanismo por trás disso é a própria descrição da Alibaba sobre seu próprio processo de treinamento, sem replicação externa, sem protocolo de avaliação publicado e sem terceiros observando os 33 ciclos. Trate "33 ciclos iterativos" como uma alegação do fornecedor e "45 depois de 40" como um par medido. Não são o mesmo tipo de afirmação, e a diferença é a razão pela qual a manchete merece ser lida com atenção em vez de repetida.

A próxima coisa a observar não é o Qwen 4. É se a promoção de metade do preço do Qwen3.7-Max sobrevive à chegada do modelo que deveria substituí-lo. Se não sobreviver, um grande número de equipes vai descobrir que estava comparando um preço de tabela com um desconto, e que o mais velho dos dois irmãos era o mais caro desde o início.