
Step 5 Preview vs Qwen 3.8 Max: Um Ponto de Índice, Quatro Dólares e Trinta Centavos
- OrcaNOVOOrca: OrcaCyber Zero 1.52026-10-10$3.00 / $7.50 por 1M de tokens
- openaiNOVOOpenAI: GPT-6.1 Sol2026-09-2952Inteligência
- anthropicNOVOAnthropic: Claude Sonnet 5.52026-09-2856Inteligência
- typesafeTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 por 1M de tokens · 113 tok/s
- OpenAIOpenAI: GPT-6 Luna2026-09-2238Inteligência
- OpenAIOpenAI: GPT-6 Sol2026-09-2248Inteligência
- AnthropicAnthropic: Claude Opus 5.52026-09-2258Inteligência
- xAIGrok 4.72026-09-2146Inteligência
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 por 1M de tokens · 52 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 por 1M de tokens · 423 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Inteligência
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Inteligência77Código
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Inteligência76Código
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Inteligência76Código
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Inteligência82Código
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 por 1M de tokens · 62 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 por 1M de tokens · 399 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Inteligência72Código
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 por 1M de tokens · 230 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Inteligência75Código
Comece pelo que uma caixa de busca não vai te dizer. Qwen 3.8 Max Prime não é um modelo. É uma faixa de serviço — os mesmos Qwen3.8-Max pesos que o fornecedor levou à disponibilidade geral em 3 de agosto de 2026, vendidos sob um segundo ID de modelo exatamente pelo dobro da tabela de preços internacional. Step 5 Preview, o flagship fechado da StepFun, abriu sua API em 20 de setembro de 2026 e é um modelo no sentido comum: um endpoint, um preço, um conjunto de pesos que você não pode segurar. Então a versão honesta dessa comparação coloca um modelo medido contra um nível não medido, e a aritmética que daí resulta é mais direta do que qualquer um dos fornecedores colocaria num slide. No índice independente Artificial Analysis Intelligence Index, os dois ficam a um ponto de distância, 44 contra 45, e no que custa uma tarefa concluída ficam a US$ 1,03 contra US$ 5,41 de distância. Um ponto, quatro dólares e trinta e oito centavos, por tarefa — e isso antes de você ter comprado qualquer parte da velocidade pela qual o Prime de fato cobra.
O que segue é esse número destrinchado: de onde ele vem, por que o Qwen ID padrão já é a metade mais cara da comparação antes de o Prime dobrar qualquer coisa, e o que os quatro dólares extras por tarefa compram e não compram.
O nome está fazendo um trabalho que o produto não faz
A Alibaba anunciou o Prime — 优速模式, modo rápido — na Yunqi Conference em 22 de setembro de 2026 e o publicou como uma linha na tabela de preços do Model Studio. A documentação da própria Alibaba é inequívoca sobre o que muda: a velocidade de saída sobe para 1,5 a 2 vezes a da API padrão e, nas palavras do fornecedor, os recursos e o uso são idênticos aos do modelo original. Nenhuma nova contagem de parâmetros, nenhum novo contrato de endpoint, nenhum recurso que falte ao ID padrão. Você altera o nome do modelo no corpo da requisição e já está na via rápida.

Isso transforma o termo de busca em uma armadilha. Quem procura um modelo principal da Qwen mais novo que o Qwen3.8-Max encontra “Prime” e interpreta isso como um número de versão. É um preço. Tudo o que o nome sugere sobre capacidade é fornecido pelo próprio Qwen3.8-Max: um modelo esparso de mistura de especialistas com 2,4 trilhões de parâmetros, com cerca de 95 bilhões de parâmetros ativos por token, 512 especialistas por camada e um contexto de 983.616 tokens na configuração testada pelo conselho independente.
O Step 5 Preview não tem ambiguidade equivalente e tem o problema oposto. A StepFun o lista com cerca de 600 bilhões de parâmetros totais e 27 bilhões ativos, entrada de texto, imagem e vídeo, uma janela de contexto de 1M de tokens e um teto de saída documentado de 64.000 tokens, com esforço de raciocínio selecionável em baixo, médio ou alto. Ele é proprietário. Um checkpoint BF16 foi prometido para 15 de outubro de 2026 e ainda não foi lançado; espelhos comunitários de uma build BF16 circulam no Hugging Face desde o dia em que a API foi aberta, mas reuploads não são um lançamento, e a StepFun não publicou nenhum anúncio de pesos abertos.
Então, o par é genuinamente desequilibrado antes mesmo de um único benchmark ser divulgado: um modelo em prévia que pode se tornar um download, contra uma camada de serviço com preço reajustado de um modelo que não vai.
Quanto custa um ponto do índice
Ambos os modelos foram executados pelo mesmo avaliador independente, e é aqui que a comparação se torna desconfortável para a narrativa do custo mais baixo por token. Continue lendo em 10 de outubro de 2026:
• Index — Step 5 Preview 44, bem acima de uma mediana de 26 de modelos comparáveis. Qwen3.8-Max na build 0902, 45. Um ponto.
• Custo por tarefa de indexação concluída — US$ 1,03 contra US$ 5,41. Mais de cinco vezes melhor.
• Preço de saída — $2.70 contra $6.00 por milhão de tokens no ID padrão, que passa a $9.902 quando você migra para o Prime. O Step 5 Preview é 2.2 vezes mais barato que o padrão e 3.7 vezes mais barato que o Prime.
• Preço de entrada — US$ 1,00 contra US$ 2,00 no padrão e US$ 3,301 no Prime. O espelho da coluna de saída, e o que mais importa depois que você ler o detalhamento de custos abaixo.
• Acerto de cache — $0,10 por milhão de tokens no Step 5 Preview, um desconto de 90 por cento; $0,25 no Qwen3.8-Max, um desconto de 87,5 por cento que a própria página do fornecedor arredonda para 88 por cento.
• Tokens de saída por segundo — 87 contra 35,4. Aqui, o Qwen é o lento, e por um fator de aproximadamente dois e meio.
As colunas por token e a coluna por tarefa discordam, e é a coluna por tarefa que se deve acreditar, por um motivo que só aparece se você abrir o detalhamento de custos. Na execução de índice do Step 5 Preview, US$ 0,85 dos US$ 1,03 são do lado da entrada e US$ 0,17 são da saída. Na do Qwen3.8-Max, US$ 4,76 dos US$ 5,41 são do lado da entrada e US$ 0,65 são da saída. Os preços de tabela estão separados por um fator de aproximadamente dois; as contas por tarefa estão separadas por um fator de cinco, porque a execução do Qwen empurrou cerca de 9,9 bilhões de tokens de entrada pelo harness, contra 5,5 bilhões do Step 5 Preview, e porque a maior parte desse volume é tráfego de cache sendo relido com o desconto que o fornecedor conceder, e não pela tarifa anunciada.
O Step 5 Preview é descrito pelo ranking como muito verboso, com cerca de 160 milhões de tokens de saída em toda a suíte, contra uma mediana de 82 milhões — e o Qwen3.8-Max é descrito exatamente com as mesmas palavras, com cerca de 190 milhões contra a mesma mediana. Nenhum deles é um modelo que responde brevemente. Se o comprimento da saída é o que você esperava otimizar, nenhuma das colunas ajuda você.

A comparação tem uma lacuna, e ela tem o formato da Prime.
Todos os números da seção anterior foram medidos no Qwen3.8-Max ID padrão. Nada disso foi medido no Prime.
Isso não é um detalhe técnico. Toda a proposta do Prime é que os tokens cheguem mais rápido, e o único número de velocidade do ranking para esta família é o do ID padrão: 35,4 tokens de saída por segundo — o mais lento dos três IDs discutidos aqui, por uma ampla margem, e a única linha em que o Qwen3.8-Max não é apenas caro, mas visivelmente abaixo do esperado. Se o Prime entregar o topo da faixa declarada pela Alibaba, esses 35,4 passam a ser algo como 70, ainda abaixo dos 87 do Step 5 Preview, embora o Prime custe 3,7 vezes mais por token de saída. Se entregar o limite inferior da faixa, passa a ser aproximadamente 53.
Essas são estimativas baseadas num multiplicador declarado pelo fornecedor, não medições, e deveriam ser rotuladas como tal. Ninguém que conseguimos encontrar publicou um teste independente de throughput do modo Prime. O número de 1,5 a 2× é do próprio Alibaba, e é a única alegação que sustenta todo o nível.
O único detalhe estrutural que favorece o Prime é a regra de limitação de taxa, e é fácil passar por ela sem perceber. A documentação da Alibaba afirma que, no Prime, quando o volume de chamadas atinge o limite de taxa, se a plataforma ainda tiver recursos disponíveis, a requisição não é limitada — de modo que a taxa de transferência disponível para você não cai abaixo do limite declarado. Trata-se de um teto flexível com um piso rígido: em momentos de contenção, você obtém o limite; com capacidade ociosa, é possível obter mais. Para um loop de agente disparando dezenas de chamadas sequenciais, isso importa mais do que a mediana, porque é a chamada mais lenta que determina quando o loop termina. É também a explicação mais clara de por que o Prime existe como produto. A Alibaba está vendendo posição na fila de uma capacidade que já construiu, e cobrando o dobro pelo direito de ser atendido primeiro a partir dela.
O que as duas tabelas de tarifas dizem quando você as coloca lado a lado
A Alibaba publica as suas linhas do Qwen uma ao lado da outra, o que torna a aritmética do nível invulgarmente limpa. Na página internacional, a linha Prime indica $3.301 de entrada e $9.902 de saída por milhão de tokens, contra $1.65 e $4.951 para o ID padrão e para o seu pin 0902. Isso é exatamente 2,0 em ambas as colunas — não uma aproximação arredondada, mas a razão literal dos números publicados. A página de preços em inglês da StepFun lista o Step 5 Preview a $1.00 de entrada, $0.10 num acerto de cache e $2.70 de saída, com a entrada em caso de falha de cache a incluir o custo de escrever novo conteúdo no cache. O valor de acerto de cache publicado pelo fornecedor é um desconto de 90 por cento; o painel independente registra 95 por cento a partir dos mesmos materiais, e vale a pena saber qual dos dois você está usando como referência.
Coloque os três cartões em uma única coluna e a forma fica clara. Saída do Prime, $9.902. Saída do Qwen padrão, $6.00 no registro do painel e $4.951 na própria página internacional da Alibaba. Saída do Step 5 Preview, $2.70. E na faixa barata que ninguém anuncia, a leitura de cache do Step 5 Preview é $0.10 contra $0.25 do Qwen — o que importa mais do que a coluna de saída para qualquer carga de trabalho que repita seu prefixo.
Um aviso sobre números desatualizados, porque esta família teve o preço reajustado mais de uma vez em sete semanas. O valor amplamente citado de $2 de entrada e $6 de saída para o Qwen3.8-Max é a manchete de lançamento de agosto, e ainda é o que a aba de Singapura da Alibaba mostra. As linhas internacional e global agora indicam $1,65 e $4,951. Se você estiver modelando gastos, use a tabela de preços da sua região e releia-a no dia em que assumir o compromisso.
Duas maneiras de ler o 2×
Como o Prime é o mesmo modelo pelo dobro do preço do standard ID, o prêmio é fácil de precificar e difícil de justificar. No topo da linha da Alibaba, você paga 2× por 2× a velocidade, o que é neutro em custo por segundo de latência removida. Na base, você paga 2× por 1,5×, um prêmio de 33 por cento por segundo economizado. Nenhum dos extremos é irracional para trabalho interativo; nenhum é defensável para um lote noturno. É por isso que o conselho padrão sobre o nível — chamadas sensíveis à latência no Prime, todo o resto no standard ID — também é o conselho correto.
A comparação com o Step 5 Preview é onde o raciocínio muda de forma, e é essa a parte que o enquadramento "vs" torna visível. O Prime não compete com o Step 5 Preview em preço de modo algum. O ID padrão já é mais caro por token de saída do que o Step 5 Preview, cinco vezes mais caro por tarefa concluída, e pontua um ponto a mais. O Prime multiplica o lado do custo de uma equação que já estava perdendo e recompra velocidade que o Step 5 Preview tem mais, de graça. Se velocidade é o que você precisa desta família, a afirmação honesta é que o modelo do outro lado desta página oferece 87 tokens por segundo a US$ 2,70 por milhão de tokens de saída, e a via rápida oferece uma faixa que atinge o teto, segundo os próprios números da Alibaba, em cerca de 70 a US$ 9,902.
Isso não é um argumento de que o Step 5 Preview vence. É um argumento de que o valor do Prime é totalmente interno à própria linha de produtos da Alibaba, e de que a justificativa a favor dele se baseia em cargas de trabalho nas quais a liderança de um ponto no índice do Qwen3.8-Max, seu contexto de 983.616 tokens ou seu perfil de tarefas diferente fazem um trabalho que um contexto de 1M tokens do Step 5 Preview não faz. Trata-se da comparação que ninguém pode executar ainda, porque a linha Prime não existe em nenhum ranking independente.

Onde isso se encaixa para um comprador
Nenhum destes dois está no OrcaRouter. O Step 5 Preview é acessível através da própria API da StepFun e de um punhado de plataformas de terceiros; o Prime é um nível do Alibaba Cloud Model Studio servido num endpoint com âmbito de workspace; e pode verificar ambas as afirmações no nosso catálogo no mesmo minuto em que as lê, o que é um teste melhor do que acreditar na nossa palavra.
A rota do que fazemos é um produto diferente da mesma família, e acontece que é aquele para o qual a aritmética deste artigo não deixa de apontar. O Qwen3.8-Max padrão e o seu pin datado Qwen3.8-Max-0902 estão no catálogo sob a mesma chave que os seus irmãos Qwen3.8-Max-Preview, Qwen3.8-Flash e Qwen3.8-27B, a par de mais de 200 outros modelos, com preço de tabela do fornecedor repassado com 0 por cento de margem. Duas coisas decorrem disso, e ambas têm impacto na decisão acima. A primeira é que uma alteração à tabela de preços na Alibaba aparece do nosso lado no mesmo dia em que a Alibaba a publica — precisamente a propriedade que se quer de um fornecedor que já reprecificou esta família duas vezes em sete semanas. A segunda é que a sua base deixa de ser uma aposta num único fornecedor: o ID padrão é o nível que mais provavelmente manterá no seu caminho predefinido, e mantê-lo atrás de uma camada de encaminhamento em vez de uma integração direta é o que torna a decisão Prime reversível por endpoint em vez de por contrato.
Se você está escolhendo entre os dois nomes no título deste artigo, a divisão é direta. Opte pelo Step 5 Preview quando você quiser a pontuação, a entrada de vídeo e imagem e o desconto de cache de 90 por cento, e aceite que você está alugando uma prévia cujo checkpoint é uma promessa para 15 de outubro, e não uma licença. Opte pelo Qwen 3.8 Max Prime apenas se você já estiver comprometido com o Qwen3.8-Max e tiver medido, com seus próprios prompts, que os 35 tokens por segundo do ID padrão são o que está custando dinheiro — e precifique essa decisão com base no 2× em vez do 1,5×, porque o topo da faixa de um fornecedor não é o número que você verá em produção.
A medição que resolveria isto não existe, e vale a pena dizê-lo sem rodeios em vez de o embelezar. Alguém precisa de correr o Prime num harness que também corra o Step 5 Preview, publicar uma distribuição de throughput em vez de um multiplicador, e colocar um valor de custo por tarefa ao lado do ponto de índice que ele compra. Até lá, os únicos números que ambos os lados partilham são os dois tarifários, e dizem a mesma coisa a partir de direções opostas: a via rápida é a forma mais cara de comprar um token do Qwen3.8-Max, e a forma mais lenta de comprar um segundo de tempo de relógio face ao que a alternativa cobra pelo mesmo segundo.
Comparados neste artigo1
Detectado a partir deste artigo · Benchmarks: Artificial Analysis · atualizado diariamente
