qwen/qwen3-max-preview vs Qwen: Qwen3 VL 235B A22B Instruct

Uma comparação direta entre qwen/qwen3-max-preview (qwen) e Qwen: Qwen3 VL 235B A22B Instruct (qwen) no OrcaRouter — preços, janela de contexto, latência, throughput e qualidade de benchmark, lado a lado, para você escolher o modelo certo para sua carga de trabalho.

Modo Batalha — experimente ambos lado a ladoAo vivo
Abrir no playground
qwen/qwen3-max-preview
$0.86 /M · p50 3142ms
Qwen: Qwen3 VL 235B A22B Instruct
$0.40 /M · p50 10000ms

Comparação de modelos

Preços, contexto, latência, throughput e qualidade para qwen/qwen3-max-preview e Qwen: Qwen3 VL 235B A22B Instruct.
Métricaqwen/qwen3-max-previewQwen: Qwen3 VL 235B A22B InstructConclusão
Entrada $/M$0.86$0.40Qwen: Qwen3 VL 235B A22B Instruct é 54% mais barato que qwen/qwen3-max-preview nos tokens de entrada.
Saída $/M$3.44$1.60Qwen: Qwen3 VL 235B A22B Instruct é 54% mais barato que qwen/qwen3-max-preview nos tokens de saída.
Contexto262K
Latência p503142 ms10000 msqwen/qwen3-max-preview responde 69% mais rápido que Qwen: Qwen3 VL 235B A22B Instruct na mediana.
Throughput129 tok/s70 tok/sqwen/qwen3-max-preview transmite tokens 46% mais rápido que Qwen: Qwen3 VL 235B A22B Instruct.
Qualidade8.0

Em preço, Qwen: Qwen3 VL 235B A22B Instruct é a opção mais barata — cerca de 54% abaixo de qwen/qwen3-max-preview nos tokens de entrada. Para cargas de trabalho sensíveis à latência, qwen/qwen3-max-preview retorna o primeiro token mais cedo. Escolha Qwen: Qwen3 VL 235B A22B Instruct para minimizar o custo, ou qwen/qwen3-max-preview quando a velocidade de resposta importa mais.

Tanto qwen/qwen3-max-preview quanto Qwen: Qwen3 VL 235B A22B Instruct estão disponíveis pelo mesmo endpoint do OrcaRouter ao custo do provedor e sem qualquer acréscimo sobre os tokens, então alternar entre eles é uma mudança de uma linha e os números abaixo são o que você realmente paga. Esta comparação puxa preços ao vivo, a context window publicada e as próprias medições de latency e throughput do OrcaRouter, para que você possa ponderar custo contra desempenho para a sua carga de trabalho específica em vez de confiar no benchmark de vitrine de um fornecedor. A escolha certa quase sempre depende do formato do seu tráfego — comprimento dos prompts, quanto texto você gera, quão sensíveis à latency são seus usuários e quão difícil é o raciocínio — por isso as seções abaixo destrincham a decisão uma dimensão de cada vez e terminam com uma recomendação concreta. Sempre que faltar uma métrica para um dos dois modelos, essa linha é omitida em vez de adivinhada, de modo que toda afirmação aqui é respaldada por um número real.

Preços e análise de custos

Em tokens de entrada, qwen/qwen3-max-preview custa $0.86 por milhão contra $0.40 de Qwen: Qwen3 VL 235B A22B Instruct, e na saída $3.44 contra $1.60 por milhão. A conta costuma ser decidida nos tokens de saída: uma carga de chat ou de agent que gera completions longas é dominada pela taxa de saída, então um modelo que parece mais barato na entrada ainda pode ser a escolha mais cara de ponta a ponta. Estime sua real proporção entrada-saída antes de escolher só pelo preço — um prompt intensivo em recuperação com resposta curta e um prompt curto com geração longa caem em extremos opostos desta tabela. Uma forma prática de dimensionar isso é pegar uma amostra representativa dos seus prompts, contar a média de tokens de entrada e de saída, e multiplicar cada uma pelas respectivas taxas dos dois modelos; o modelo com o menor custo combinado (blended) no seu mix real é o que precisa ser superado. Lembre-se de que ambos os preços aqui são a taxa bruta do provedor — o OrcaRouter não adiciona acréscimo — então a comparação é de igual para igual e a economia que você calcula é a economia que você fica.

Latency e throughput decidem como o modelo se sente em produção. A latency de resposta mediana (p50) é quanto uma requisição típica espera antes do primeiro token; o throughput (tokens por segundo) define a que velocidade a resposta é transmitida depois de iniciada. Para chat interativo e loops de agent, uma latency p50 baixa importa mais porque o usuário está esperando o primeiro token; para geração em lote e saída de formato longo, o throughput domina o tempo total porque a resposta é longa. Os gráficos de tendência de 7 dias acima mostram se a latency de cada modelo é estável ou está derivando, algo que um único número de destaque esconde — um modelo com ótima média mas cauda ruidosa ainda pode não cumprir um SLA p95 rígido. Se o seu produto tem um orçamento de latency, leia tanto a mediana quanto o formato da curva, e lembre-se de que a latency de ponta a ponta também inclui o seu salto de rede e qualquer recuperação ou chamada de ferramenta que você faça em torno do modelo.

Pontuações de benchmark aproximam a capacidade, mas não substituem testes com seus próprios prompts. Os índices compostos mostrados aqui agregam várias avaliações públicas, e o percentil marca onde cada modelo se posiciona frente a todos os modelos comparáveis do catálogo — um sinal útil de pré-seleção, não uma garantia para a sua tarefa. Um modelo que lidera num índice de inteligência geral pode ficar para trás no seu domínio (código, extração, multilíngue, raciocínio de contexto longo), então use os benchmarks para estreitar o campo e depois rode ambos os modelos numa fatia representativa do seu tráfego. Preste atenção ao índice específico que corresponde ao seu caso de uso em vez do número principal: um produto com muito código deve pesar o índice de código, um assistente de pesquisa o índice de raciocínio. Os benchmarks também envelhecem à medida que os modelos são atualizados, então trate-os como uma hipótese inicial que você confirma com o seu próprio conjunto de avaliação.

Se o custo é a restrição decisiva, comece com o modelo mais barato no seu mix real entrada-saída e só suba de nível se a qualidade não atender. Se a prioridade é a capacidade de resposta — chat voltado ao usuário, agents, qualquer caso em que alguém esteja esperando — dê mais peso à latency p50 e ao throughput do que a uma pequena diferença de preço. Se você está forçando o raciocínio, o código ou o trabalho de contexto longo mais exigentes, deixe o vencedor em benchmark e context window liderar e aceite a taxa mais alta onde ela se paga. Como ambos os modelos ficam atrás da mesma API, a jogada de baixo risco é rotear uma fração do tráfego real para cada um e comparar custo, latency e qualidade das respostas nos seus próprios prompts antes de se comprometer. Um padrão comum é escalonar (tier): envie o grosso das requisições fáceis e de alto volume para o modelo mais barato ou mais rápido e reserve o modelo mais forte para as requisições que realmente precisam dele, o que captura a maior parte do ganho de qualidade por uma fração do custo. Seja qual for a sua escolha, mantenha a troca reversível — com uma mudança de nome de modelo de uma linha você pode devolver o tráfego assim que os números ou seus requisitos mudarem.

Comparação de desempenho

qwen/qwen3-max-preview
25.5
AA Coding
Melhor que 27% dos modelos comparados
nº 90 de 123
19.2
AA Intelligence
Melhor que 18% dos modelos comparados
nº 102 de 125
75.0
AA Math
Melhor que 69% dos modelos comparados
nº 25 de 81
Qwen: Qwen3 VL 235B A22B Instruct
16.5
AA Coding
Melhor que 11% dos modelos comparados
nº 109 de 123
14.3
AA Intelligence
Melhor que 15% dos modelos comparados
nº 106 de 125
70.7
AA Math
Melhor que 64% dos modelos comparados
nº 29 de 81

Nos últimos 7 dias, qwen/qwen3-max-preview mantém a menor latência de resposta mediana.

FAQ qwen/qwen3-max-preview vs Qwen: Qwen3 VL 235B A22B Instruct

qwen/qwen3-max-preview ou Qwen: Qwen3 VL 235B A22B Instruct, qual é mais barato?
Qwen: Qwen3 VL 235B A22B Instruct é mais barato nos tokens de entrada a $0.40 por 1M contra $0.86 por 1M.
Qual é mais barato em tokens de saída, qwen/qwen3-max-preview ou Qwen: Qwen3 VL 235B A22B Instruct?
Qwen: Qwen3 VL 235B A22B Instruct tem o preço de saída mais baixo, a $1.60 por milhão contra $3.44 por milhão. O preço de saída costuma importar mais que o de entrada para cargas com muita geração, então pondere de acordo.
Qual é mais rápido, qwen/qwen3-max-preview ou Qwen: Qwen3 VL 235B A22B Instruct?
qwen/qwen3-max-preview tem a menor latência de resposta mediana (p50) nas medições ao vivo do OrcaRouter.
Qual transmite mais rápido, qwen/qwen3-max-preview ou Qwen: Qwen3 VL 235B A22B Instruct?
qwen/qwen3-max-preview tem o throughput medido (tokens por segundo) mais alto, então completions longas terminam mais cedo uma vez iniciada a geração.
Devo usar qwen/qwen3-max-preview ou Qwen: Qwen3 VL 235B A22B Instruct?
Escolha qwen/qwen3-max-preview ou Qwen: Qwen3 VL 235B A22B Instruct conforme sua prioridade: custo, janela de contexto, latência ou qualidade de benchmark. A tabela acima mostra qual modelo vence em cada quesito; associe o vencedor à dimensão mais importante para sua carga de trabalho.
Como qwen/qwen3-max-preview e Qwen: Qwen3 VL 235B A22B Instruct são cobrados no OrcaRouter?
Ambos são cobrados à taxa do provedor upstream sem qualquer acréscimo sobre os tokens — você paga o mesmo preço por token que pagaria diretamente ao provedor, por meio de uma única chave API e um único endpoint do OrcaRouter.
Posso chamar qwen/qwen3-max-preview e Qwen: Qwen3 VL 235B A22B Instruct com o mesmo código?
Sim. Ambos são expostos pela API OpenAI-compatible do OrcaRouter, então você muda apenas o nome do modelo para rotear entre eles — sem troca de SDK, sem credenciais separadas.

Saiba mais