
Qwen3.8 Max Prime: Alibaba coloca uma segunda tabela de preços ao lado de seu carro-chefe
- typesafeNOVOTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 por 1M de tokens · 584 tok/s
- openaiNOVOOpenAI: GPT-6 Luna2026-09-2237Inteligência
- openaiNOVOOpenAI: GPT-6 Sol2026-09-2248Inteligência
- anthropicNOVOAnthropic: Claude Opus 5.52026-09-2258Inteligência
- grokNOVOGrok 4.72026-09-2146Inteligência
- OrcaNOVOOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 por 1M de tokens · 187 tok/s
- orcaNOVOOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 por 1M de tokens · 1306 tok/s
- deepseekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Inteligência
- openaiOpenAI: GPT-6 Astra2026-09-0453Inteligência77Código
- googleGoogle: Gemini 3.8 Flash2026-09-0241Inteligência76Código
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Inteligência76Código
- anthropicAnthropic: Claude Fable 5.12026-09-0153Inteligência82Código
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 por 1M de tokens · 113 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Inteligência72Código
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 por 1M de tokens · 224 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Inteligência75Código
- obsidianQwen3.8 27B2026-08-1534Inteligência68Código
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Inteligência69Código
- grokSpaceXAI: Grok 4.62026-08-1244Inteligência77Código
- metaMeta: Muse Spark 1.22026-08-0540Inteligência72Código
Em 22 de setembro de 2026, na Conferência Yunqi em Hangzhou, a linha de negócios MaaS da Alibaba anunciou um nível de serviço que chama de modo Prime — 优速模式 — e colocou um novo ID de modelo na tabela de preços para ele: qwen3.8-max-prime. Esse ID não é um novo modelo. Ele é o Qwen3.8-Max, o modelo carro-chefe de mistura esparsa de especialistas com 2,4 trilhões de parâmetros que chegou à disponibilidade geral em 3 de agosto de 2026, entregue por uma via mais rápida. Qwen3.8 Max Prime traz os mesmos pesos, a mesma janela de contexto, as mesmas ferramentas e os mesmos limites de uso que o modelo base. O que difere é a vazão e o preço, e o preço praticamente dobra.
Esta é a segunda vez em sete semanas que a Alibaba muda a forma como o Qwen3.8-Max é vendido sem mudar o que ele é. Em 2 de setembro, a empresa lançou uma atualização pós-treinada identificada como Qwen3.8-Max-0902, focada em codificação e trabalho agêntico, somente via API. Em 22 de setembro, adicionou o nível de velocidade. Nenhuma delas foi um lançamento, e interpretar qualquer uma como tal vai custar-lhe dinheiro.

O que o modo Prime realmente é
A documentação do próprio Alibaba descreve o modo Prime como um canal para "cenários sensíveis à velocidade de saída" — assistentes de codificação com IA, raciocínio de agente em várias etapas, conversa em tempo real — e afirma o benefício de forma clara: o TPS é elevado para 1,5 a 2 vezes o da API padrão. Não há um novo parâmetro para definir. Você muda o valor de model para o ID Prime e está na via rápida.
A documentação é igualmente explícita sobre o que não muda: "As capacidades compatíveis com o modelo e as restrições de uso são as mesmas do modelo original." Portanto, não há um contexto maior, nem um modo de raciocínio melhor, nem uma superfície de ferramentas extra. É a mesma pilha de serviço, com mais capacidade de sobra por trás.
The endpoint shape is worth noting because it tells you who this is for. Prime requests go to a workspace-scoped Beijing address of the form https://{workspace_id}.cn-beijing.maas.aliyuncs.com/compatible-mode/v1, on the OpenAI-compatible path. This is a production traffic decision, not an experiment.
A tabela de preços, leia com atenção
A página internacional de preços da Alibaba lista os dois IDs lado a lado, o que torna a comparação excepcionalmente simples. Por milhão de tokens:
• Entrada — qwen3.8-max-prime $3.301 vs qwen3.8-max $1.65
• Saída — qwen3.8-max-prime $9.902 vs qwen3.8-max $4.951
• Acerto no cache — qwen3.8-max-prime $0.413 vs. uma taxa de leitura de cache no ID padrão que a mesma página apresenta como linha de desconto
• Proporção — 2,0× tanto na entrada quanto na saída, não uma aproximação arredondada, mas a aritmética literal dos números publicados
Na tabela de preços da China, a mesma proporção de 2× se aplica em yuan: ¥24 de entrada e ¥72 de saída por milhão para o Prime ID, contra ¥12 e ¥36 para a versão padrão, com acertos de cache a ¥3.
A cifra de lançamento amplamente citada para o Qwen3.8-Max é de US$ 2 de entrada e US$ 6 de saída por milhão. Essa é a manchete que a cobertura de agosto usou, e não é o número que consta na tabela de preços internacional hoje. Se estiver modelando gastos, use a tabela de preços da sua região em vez da manchete de lançamento, e verifique-a novamente antes de se comprometer — a Alibaba revisou esta página duas vezes desde 2 de setembro.

A regra de throttling é a verdadeira funcionalidade
A linha que a maioria das pessoas ignora é a que mais importa para produção. A documentação do Alibaba Prime afirma que, quando seu uso atinge o limite de taxa, se a plataforma ainda tiver recursos livres, você não será limitado, então a taxa de transferência realmente disponível para você não ficará abaixo do limite declarado.
Esse é um teto flexível com um piso rígido, o que é um formato diferente de um limite de nível padrão. Isso significa que o número de 1,5–2× é uma promessa sobre o piso, não um limite máximo para o teto: sob contenção, você obtém o limite, e, sob capacidade ociosa, você pode obter mais. Para um loop de agente que dispara dezenas de chamadas sequenciais, essa assimetria vale mais do que o multiplicador bruto de TPS, porque é a latência de cauda na chamada mais lenta que determina se o seu fluxo de trabalho termina.
Os limites dinâmicos de TPM para modelos padrão são escalonados pelo gasto mensal no Model Studio — a mesma família de documentação mostra o ID base qwen3.8-max em 5.000.000, 10.000.000 e 20.000.000 TPM entre os níveis, atualizados mensalmente. O Prime não remove essa estrutura; ele muda a forma como ela atinge.

O que ninguém mediu ainda
Aqui está a lacuna honesta. O número de 1,5–2× é declarado pelo fornecedor. Não há nenhuma medição independente de throughput do modo Prime que consigamos encontrar, e isso importa porque os próprios números independentes da versão padrão não são lisonjeiros em termos de velocidade.
A Artificial Analysis, que avalia modelos em seu próprio harness, atualmente atribui ao Qwen3.8-Max, na build 0902, um Intelligence Index de 45, com GPQA Diamond em 92,8%, Terminal-Bench Hard em 38,9% e Humanity's Last Exam em 43,1% — e estima seu custo medido por tarefa em $5,41. Esses são números independentes no SKU padrão, capturados em 2026-09-24. Eles também são um lembrete de que o índice foi revisado desde a cobertura do lançamento de agosto, então não coloque um valor de índice mais antigo ao lado de um atual e chame isso de tendência.
O que a AA não tem é uma linha Prime. Até que alguém a meça, a alegação de velocidade é exclusiva da Alibaba, e a postura correta é testá-la na sua própria carga de trabalho em vez de presumir o topo de linha.
Onde isso deixa a decisão de roteamento
O Prime é um nível que a Alibaba vende na própria API dela, e esse é o único lugar para obtê-lo. Não hospedamos o qwen3.8-max-prime aqui. O que o OrcaRouter roteia é o Qwen3.8-Max padrão e seu pin datado Qwen3.8-Max-0902, ambos na mesma chave que o resto da família Qwen3.8 — Qwen3.8, Qwen3.8-Flash, Qwen3.8-27B — junto com mais de 200 outros modelos, com o preço de tabela do provedor repassado com 0% de margem. Essa última parte é o motivo pelo qual a atualização de 2 de setembro e qualquer futura mudança de tarifa do Max chegam ao nosso lado no mesmo dia em que chegam ao da Alibaba.
A divisão prática é mais ou menos assim. Rode seu tráfego padrão no ID padrão através de um roteador, onde o failover protege você se o caminho de um único provedor se degradar. Mova as chamadas específicas em que a latência de tempo real é o produto — a conclusão interativa, a etapa de agente mais apertada — para o Prime, e precifique essa decisão com base no 2× em vez do 1,5×.
Quem deve mudar e quem deve esperar
Mude se os seus usuários estão esperando por tokens: um preenchimento automático, um turno de chat, um ciclo de edição de código em que um humano está observando. No topo da faixa de velocidade, o Prime tem custo neutro por segundo de latência removido — você paga exatamente o dobro por exatamente metade do tempo. Na base da faixa, você está pagando 2× por 1,5×, o que representa um prêmio de 33% por segundo economizado. Se a sua carga de trabalho for um job em lote que roda durante a noite, esse prêmio não lhe rende nada.
Cuidado se seu modelo de custos foi construído com base na manchete de lançamento de $2/$6, ou se suas requisições são pesadas em entrada. A alegação de velocidade do fornecedor é sobre TPS — tokens de saída por segundo — e o prefill é um estágio diferente do pipeline. Uma requisição de contexto longo paga em dobro pelos tokens de entrada, independentemente de a saída chegar mais rápido. Meça esse caso antes de migrá-lo.
E confira a data na sua tabela de preços. O Qwen3.8-Max está no mercado desde 3 de agosto, já foi atualizado uma vez e reembalado uma vez, e ainda assim continua com apenas sete semanas. O tier é a novidade; o modelo, não.
Comparados neste artigo1
Detectado a partir deste artigo · Benchmarks: Artificial Analysis · atualizado diariamente
