Cartão de título principal para o Qwen3.8 Max Prime, a camada de serviço com throughput de 1,5-2x da Alibaba para o carro-chefe Qwen3.8-Max, com chips de especificações mostrando o mesmo total de 2,4T e ~95B ativos, Prime a $3.301/$9.902, padrão a $1.65/$4.951.
Guides & Insights

Qwen3.8 Max Prime: Alibaba coloca uma segunda tabela de preços ao lado de seu carro-chefe

Autor

Rowan Sterling

Data de publicação

Modelos mais recentes · 20Ver todos os modelos →
Benchmarks: Artificial Analysis · atualizado diariamente
Voltar para todas as publicações

Em 22 de setembro de 2026, na Conferência Yunqi em Hangzhou, a linha de negócios MaaS da Alibaba anunciou um nível de serviço que chama de modo Prime — 优速模式 — e colocou um novo ID de modelo na tabela de preços para ele: qwen3.8-max-prime. Esse ID não é um novo modelo. Ele é o Qwen3.8-Max, o modelo carro-chefe de mistura esparsa de especialistas com 2,4 trilhões de parâmetros que chegou à disponibilidade geral em 3 de agosto de 2026, entregue por uma via mais rápida. Qwen3.8 Max Prime traz os mesmos pesos, a mesma janela de contexto, as mesmas ferramentas e os mesmos limites de uso que o modelo base. O que difere é a vazão e o preço, e o preço praticamente dobra.

Esta é a segunda vez em sete semanas que a Alibaba muda a forma como o Qwen3.8-Max é vendido sem mudar o que ele é. Em 2 de setembro, a empresa lançou uma atualização pós-treinada identificada como Qwen3.8-Max-0902, focada em codificação e trabalho agêntico, somente via API. Em 22 de setembro, adicionou o nível de velocidade. Nenhuma delas foi um lançamento, e interpretar qualquer uma como tal vai custar-lhe dinheiro.

Scoreboard infographic for Qwen3.8 Max Prime: underlying model Qwen3.8-Max GA August 3 2026, 2.4T total and ~95B active parameters, throughput 1.5-2x standard, Prime price $3.301/$9.902, standard price $1.65/$4.951, no independent Prime score yet.

O que o modo Prime realmente é

A documentação do próprio Alibaba descreve o modo Prime como um canal para "cenários sensíveis à velocidade de saída" — assistentes de codificação com IA, raciocínio de agente em várias etapas, conversa em tempo real — e afirma o benefício de forma clara: o TPS é elevado para 1,5 a 2 vezes o da API padrão. Não há um novo parâmetro para definir. Você muda o valor de model para o ID Prime e está na via rápida.

A documentação é igualmente explícita sobre o que não muda: "As capacidades compatíveis com o modelo e as restrições de uso são as mesmas do modelo original." Portanto, não há um contexto maior, nem um modo de raciocínio melhor, nem uma superfície de ferramentas extra. É a mesma pilha de serviço, com mais capacidade de sobra por trás.

The endpoint shape is worth noting because it tells you who this is for. Prime requests go to a workspace-scoped Beijing address of the form https://{workspace_id}.cn-beijing.maas.aliyuncs.com/compatible-mode/v1, on the OpenAI-compatible path. This is a production traffic decision, not an experiment.

A tabela de preços, leia com atenção

A página internacional de preços da Aliba​ba lista os dois IDs lado a lado, o que torna a comparação excepcionalmente simples. Por milhão de tokens:

• Entrada — qwen3.8-max-prime $3.301 vs qwen3.8-max $1.65

• Saída — qwen3.8-max-prime $9.902 vs qwen3.8-max $4.951

• Acerto no cache — qwen3.8-max-prime $0.413 vs. uma taxa de leitura de cache no ID padrão que a mesma página apresenta como linha de desconto

• Proporção — 2,0× tanto na entrada quanto na saída, não uma aproximação arredondada, mas a aritmética literal dos números publicados

Na tabela de preços da China, a mesma proporção de 2× se aplica em yuan: ¥24 de entrada e ¥72 de saída por milhão para o Prime ID, contra ¥12 e ¥36 para a versão padrão, com acertos de cache a ¥3.

A cifra de lançamento amplamente citada para o Qwen3.8-Max é de US$ 2 de entrada e US$ 6 de saída por milhão. Essa é a manchete que a cobertura de agosto usou, e não é o número que consta na tabela de preços internacional hoje. Se estiver modelando gastos, use a tabela de preços da sua região em vez da manchete de lançamento, e verifique-a novamente antes de se comprometer — a Aliba​ba revisou esta página duas vezes desde 2 de setembro.

Screenshot of Alibaba Cloud's international Model Studio pricing page listing the qwen3.8-max-prime and qwen3.8-max model IDs side by side, with Prime at $3.301 per million input tokens and $9.902 per million output tokens against $1.65 and $4.951 for the standard ID.

A regra de throttling é a verdadeira funcionalidade

A linha que a maioria das pessoas ignora é a que mais importa para produção. A documentação do Alibaba Prime afirma que, quando seu uso atinge o limite de taxa, se a plataforma ainda tiver recursos livres, você não será limitado, então a taxa de transferência realmente disponível para você não ficará abaixo do limite declarado.

Esse é um teto flexível com um piso rígido, o que é um formato diferente de um limite de nível padrão. Isso significa que o número de 1,5–2× é uma promessa sobre o piso, não um limite máximo para o teto: sob contenção, você obtém o limite, e, sob capacidade ociosa, você pode obter mais. Para um loop de agente que dispara dezenas de chamadas sequenciais, essa assimetria vale mais do que o multiplicador bruto de TPS, porque é a latência de cauda na chamada mais lenta que determina se o seu fluxo de trabalho termina.

Os limites dinâmicos de TPM para modelos padrão são escalonados pelo gasto mensal no Model Studio — a mesma família de documentação mostra o ID base qwen3.8-max em 5.000.000, 10.000.000 e 20.000.000 TPM entre os níveis, atualizados mensalmente. O Prime não remove essa estrutura; ele muda a forma como ela atinge.

Screenshot of the Artificial Analysis model page for Qwen3.8-Max on the 0902 build, showing an Intelligence Index of 45 and a measured cost per task of $5.41 on the standard ID.

O que ninguém mediu ainda

Aqui está a lacuna honesta. O número de 1,5–2× é declarado pelo fornecedor. Não há nenhuma medição independente de throughput do modo Prime que consigamos encontrar, e isso importa porque os próprios números independentes da versão padrão não são lisonjeiros em termos de velocidade.

A Artificial Analysis, que avalia modelos em seu próprio harness, atualmente atribui ao Qwen3.8-Max, na build 0902, um Intelligence Index de 45, com GPQA Diamond em 92,8%, Terminal-Bench Hard em 38,9% e Humanity's Last Exam em 43,1% — e estima seu custo medido por tarefa em $5,41. Esses são números independentes no SKU padrão, capturados em 2026-09-24. Eles também são um lembrete de que o índice foi revisado desde a cobertura do lançamento de agosto, então não coloque um valor de índice mais antigo ao lado de um atual e chame isso de tendência.

O que a AA não tem é uma linha Prime. Até que alguém a meça, a alegação de velocidade é exclusiva da Alibaba, e a postura correta é testá-la na sua própria carga de trabalho em vez de presumir o topo de linha.

Onde isso deixa a decisão de roteamento

O Prime é um nível que a Aliba​ba vende na própria API dela, e esse é o único lugar para obtê-lo. Não hospedamos o qwen3.8-max-prime aqui. O que o OrcaRouter roteia é o Qwen3.8-Max padrão e seu pin datado Qwen3.8-Max-0902, ambos na mesma chave que o resto da família Qwen3.8 — Qwen3.8, Qwen3.8-Flash, Qwen3.8-27B — junto com mais de 200 outros modelos, com o preço de tabela do provedor repassado com 0% de margem. Essa última parte é o motivo pelo qual a atualização de 2 de setembro e qualquer futura mudança de tarifa do Max chegam ao nosso lado no mesmo dia em que chegam ao da Aliba​ba.

A divisão prática é mais ou menos assim. Rode seu tráfego padrão no ID padrão através de um roteador, onde o failover protege você se o caminho de um único provedor se degradar. Mova as chamadas específicas em que a latência de tempo real é o produto — a conclusão interativa, a etapa de agente mais apertada — para o Prime, e precifique essa decisão com base no 2× em vez do 1,5×.

Quem deve mudar e quem deve esperar

Mude se os seus usuários estão esperando por tokens: um preenchimento automático, um turno de chat, um ciclo de edição de código em que um humano está observando. No topo da faixa de velocidade, o Prime tem custo neutro por segundo de latência removido — você paga exatamente o dobro por exatamente metade do tempo. Na base da faixa, você está pagando 2× por 1,5×, o que representa um prêmio de 33% por segundo economizado. Se a sua carga de trabalho for um job em lote que roda durante a noite, esse prêmio não lhe rende nada.

Cuidado se seu modelo de custos foi construído com base na manchete de lançamento de $2/$6, ou se suas requisições são pesadas em entrada. A alegação de velocidade do fornecedor é sobre TPS — tokens de saída por segundo — e o prefill é um estágio diferente do pipeline. Uma requisição de contexto longo paga em dobro pelos tokens de entrada, independentemente de a saída chegar mais rápido. Meça esse caso antes de migrá-lo.

E confira a data na sua tabela de preços. O Qwen3.8-Max está no mercado desde 3 de agosto, já foi atualizado uma vez e reembalado uma vez, e ainda assim continua com apenas sete semanas. O tier é a novidade; o modelo, não.

Comparados neste artigo1

Detectado a partir deste artigo · Benchmarks: Artificial Analysis · atualizado diariamente