Qwen3.5-27B vs Qwen3.5 397B A17B: benchmarks, preços e velocidade (setembro de 2026)

Uma comparação direta entre Qwen3.5-27B (qwen) e Qwen3.5 397B A17B (qwen) no OrcaRouter — preços, janela de contexto, latência, throughput e qualidade de benchmark, lado a lado, para você escolher o modelo certo para sua carga de trabalho.

Conclusão

Em preço, Qwen3.5-27B é a opção mais barata — cerca de 50% abaixo de Qwen3.5 397B A17B nos tokens de entrada. Para cargas de trabalho sensíveis à latência, Qwen3.5 397B A17B retorna o primeiro token mais cedo. Em qualidade de benchmark, Qwen3.5 397B A17B lidera o índice composto. Escolha Qwen3.5-27B para minimizar o custo, ou Qwen3.5 397B A17B quando a velocidade de resposta importa mais.

Comece grátis · os dois modelos numa chave · cobrado ao custo do provedor, sem markup de tokens

Tanto Qwen3.5-27B quanto Qwen3.5 397B A17B estão disponíveis pelo mesmo endpoint do OrcaRouter ao custo do provedor e sem qualquer acréscimo sobre os tokens, então alternar entre eles é uma mudança de uma linha e os números abaixo são o que você realmente paga.

Ler a análise completa

Esta comparação puxa preços ao vivo, a context window publicada e as próprias medições de latency e throughput do OrcaRouter, para que você possa ponderar custo contra desempenho para a sua carga de trabalho específica em vez de confiar no benchmark de vitrine de um fornecedor. A escolha certa quase sempre depende do formato do seu tráfego — comprimento dos prompts, quanto texto você gera, quão sensíveis à latency são seus usuários e quão difícil é o raciocínio — por isso as seções abaixo destrincham a decisão uma dimensão de cada vez e terminam com uma recomendação concreta. Sempre que faltar uma métrica para um dos dois modelos, essa linha é omitida em vez de adivinhada, de modo que toda afirmação aqui é respaldada por um número real.

Visão geral

  • Entrada $/M$0.09Qwen3.5-27B 50%
  • Latência p503663 msQwen3.5 397B A17B 7%
  • Qualidade8.0Qwen3.5 397B A17B 33%

Comparação de modelos

Preços, contexto, latência, throughput e qualidade para Qwen3.5-27B e Qwen3.5 397B A17B.
MétricaQwen3.5-27BQwen3.5 397B A17BConclusão
Entrada $/M$0.09$0.17Qwen3.5-27B é 50% mais barato que Qwen3.5 397B A17B nos tokens de entrada.
Saída $/M$0.69$1.03Qwen3.5-27B é 33% mais barato que Qwen3.5 397B A17B nos tokens de saída.
Contexto33K33KQwen3.5-27B e Qwen3.5 397B A17B compartilham a mesma janela de contexto.
Latência p503956 ms3663 msQwen3.5 397B A17B responde 7% mais rápido que Qwen3.5-27B na mediana.
Throughput66 tok/s857 tok/sQwen3.5 397B A17B transmite tokens 1206% mais rápido que Qwen3.5-27B.
Qualidade6.08.0Qwen3.5 397B A17B pontua 33% mais que Qwen3.5-27B no índice de qualidade composto.

Em preço, Qwen3.5-27B é a opção mais barata — cerca de 50% abaixo de Qwen3.5 397B A17B nos tokens de entrada. Para cargas de trabalho sensíveis à latência, Qwen3.5 397B A17B retorna o primeiro token mais cedo. Em qualidade de benchmark, Qwen3.5 397B A17B lidera o índice composto. Escolha Qwen3.5-27B para minimizar o custo, ou Qwen3.5 397B A17B quando a velocidade de resposta importa mais.

Os dois modelos, uma chave de API. Comece por qualquer um e alterne mudando uma string.

Obter uma chave de API

Use Qwen3.5-27B e Qwen3.5 397B A17B numa só chave de API

Não precisa de escolher um. Ambos os modelos são expostos pelo mesmo endpoint compatível com OpenAI no OrcaRouter, cobrados à tarifa do fornecedor a montante e sem markup de tokens. Alternar entre eles é mudar o nome do modelo — sem segunda conta, sem segundo SDK, sem credenciais separadas.

É isso que torna o compromisso acima gerível em produção: envie a maior parte do tráfego para o modelo que vence na dimensão que lhe interessa, reserve o outro para os pedidos que precisam dele e mude a divisão sempre que os seus números mudarem.

curl
# Uma chave, um endpoint, os dois modelos.
curl https://api.orcarouter.ai/v1/chat/completions \
  -H "Authorization: Bearer $ORCAROUTER_API_KEY" \
  -H "Content-Type: application/json" \
  -d '{
    "model": "qwen/qwen3.5-27b",
    "messages": [{"role":"user","content":"..."}]
  }'

# Mude de modelo alterando uma string.
#     "model": "qwen/qwen3.5-397b-a17b"

Teste ao vivo: Qwen3.5-27B vs Qwen3.5 397B A17B no modo Battle

Modo Batalha — experimente ambos lado a ladoAo vivo
Abrir no playground
Qwen: Qwen3.5-27B
$0.09 /M · p50 3956ms
Qwen: Qwen3.5 397B A17B
$0.17 /M · p50 3663ms

Preços e análise de custos

Em tokens de entrada, Qwen3.5-27B custa $0.09 por milhão contra $0.17 de Qwen3.5 397B A17B, e na saída $0.69 contra $1.03 por milhão.

Ler a análise completa

A conta costuma ser decidida nos tokens de saída: uma carga de chat ou de agent que gera completions longas é dominada pela taxa de saída, então um modelo que parece mais barato na entrada ainda pode ser a escolha mais cara de ponta a ponta. Estime sua real proporção entrada-saída antes de escolher só pelo preço — um prompt intensivo em recuperação com resposta curta e um prompt curto com geração longa caem em extremos opostos desta tabela. Uma forma prática de dimensionar isso é pegar uma amostra representativa dos seus prompts, contar a média de tokens de entrada e de saída, e multiplicar cada uma pelas respectivas taxas dos dois modelos; o modelo com o menor custo combinado (blended) no seu mix real é o que precisa ser superado. Lembre-se de que ambos os preços aqui são a taxa bruta do provedor — o OrcaRouter não adiciona acréscimo — então a comparação é de igual para igual e a economia que você calcula é a economia que você fica.

Qwen3.5-27B aceita até 33K tokens de contexto e Qwen3.5 397B A17B aceita 33K. A context window limita quanto material de origem — documentos, código, conversa anterior — você pode enviar em uma única requisição.

Ler a análise completa

Uma janela maior permite dispensar o fatiamento e o encanamento de recuperação para entradas longas, mas você ainda paga a taxa de tokens de entrada por tudo o que envia, então uma janela maior é uma capacidade, não um desconto. Ajuste a janela à maior requisição individual que sua carga de trabalho produz de forma realista, não ao maior número da página. Tenha também em mente que a qualidade pode degradar-se perto do fim de um contexto muito longo em qualquer modelo, então uma janela grande é melhor tratada como margem para entradas longas ocasionais e não como uma licença para encher cada requisição até o limite.

Ambas as tarifas são o preço bruto do fornecedor — o OrcaRouter não acrescenta markup, por isso a poupança que calcula é a poupança que fica.

Comece grátis

Tarifas por token lado a lado

Entrada $/M
Qwen3.5-27B$0.09
Qwen3.5 397B A17B$0.17
Saída $/M
Qwen3.5-27B$0.69
Qwen3.5 397B A17B$1.03

por 1M de tokens

Velocidade e latência

Latency e throughput decidem como o modelo se sente em produção. A latency de resposta mediana (p50) é quanto uma requisição típica espera antes do primeiro token; o throughput (tokens por segundo) define a que velocidade a resposta é transmitida depois de iniciada.

Ler a análise completa

Para chat interativo e loops de agent, uma latency p50 baixa importa mais porque o usuário está esperando o primeiro token; para geração em lote e saída de formato longo, o throughput domina o tempo total porque a resposta é longa. Os gráficos de tendência de 7 dias acima mostram se a latency de cada modelo é estável ou está derivando, algo que um único número de destaque esconde — um modelo com ótima média mas cauda ruidosa ainda pode não cumprir um SLA p95 rígido. Se o seu produto tem um orçamento de latency, leia tanto a mediana quanto o formato da curva, e lembre-se de que a latency de ponta a ponta também inclui o seu salto de rede e qualquer recuperação ou chamada de ferramenta que você faça em torno do modelo.

Nos últimos 7 dias, Qwen3.5 397B A17B mantém a menor latência de resposta mediana.

Qwen3.5-27B
Qwen3.5 397B A17B

Benchmarks e qualidade

Pontuações de benchmark aproximam a capacidade, mas não substituem testes com seus próprios prompts.

Ler a análise completa

Os índices compostos mostrados aqui agregam várias avaliações públicas, e o percentil marca onde cada modelo se posiciona frente a todos os modelos comparáveis do catálogo — um sinal útil de pré-seleção, não uma garantia para a sua tarefa. Um modelo que lidera num índice de inteligência geral pode ficar para trás no seu domínio (código, extração, multilíngue, raciocínio de contexto longo), então use os benchmarks para estreitar o campo e depois rode ambos os modelos numa fatia representativa do seu tráfego. Preste atenção ao índice específico que corresponde ao seu caso de uso em vez do número principal: um produto com muito código deve pesar o índice de código, um assistente de pesquisa o índice de raciocínio. Os benchmarks também envelhecem à medida que os modelos são atualizados, então trate-os como uma hipótese inicial que você confirma com o seu próprio conjunto de avaliação.

Qwen3.5-27B
59.3
AA Coding
Melhor que 69% dos modelos comparados
nº 43 de 138
22.9
AA Intelligence
Melhor que 40% dos modelos comparados
nº 85 de 141
62.3
AA Math
Melhor que 48% dos modelos comparados
nº 43 de 82
Qwen3.5 397B A17B
48.2
AA Coding
Melhor que 51% dos modelos comparados
nº 68 de 138
18.4
AA Intelligence
Melhor que 30% dos modelos comparados
nº 98 de 141
Confronto direto da comunidade (Design Arena)Fonte: Elo do Design Arena
Qwen3.5-27B1430Pontuação Elo80.4% de vitórias
Qwen3.5 397B A17B1239Pontuação Elo56.7% de vitórias

Nos torneios de confronto direto da comunidade, Qwen3.5-27B tem a pontuação Elo mais alta (1430 contra 1239), o que significa que vence mais confrontos diretos contra modelos comparáveis.

Qual você deve escolher?

Se o custo é a restrição decisiva, comece com o modelo mais barato no seu mix real entrada-saída e só suba de nível se a qualidade não atender.

Ler a análise completa

Se a prioridade é a capacidade de resposta — chat voltado ao usuário, agents, qualquer caso em que alguém esteja esperando — dê mais peso à latency p50 e ao throughput do que a uma pequena diferença de preço. Se você está forçando o raciocínio, o código ou o trabalho de contexto longo mais exigentes, deixe o vencedor em benchmark e context window liderar e aceite a taxa mais alta onde ela se paga. Como ambos os modelos ficam atrás da mesma API, a jogada de baixo risco é rotear uma fração do tráfego real para cada um e comparar custo, latency e qualidade das respostas nos seus próprios prompts antes de se comprometer. Um padrão comum é escalonar (tier): envie o grosso das requisições fáceis e de alto volume para o modelo mais barato ou mais rápido e reserve o modelo mais forte para as requisições que realmente precisam dele, o que captura a maior parte do ganho de qualidade por uma fração do custo. Seja qual for a sua escolha, mantenha a troca reversível — você pode devolver o tráfego assim que os números ou seus requisitos mudarem.

Ou não escolha — encaminhe pedido a pedido entre os dois, com uma chave e um endpoint.

Obter os dois

Ideal para

  • Sensível a custo, alto volumeQwen3.5-27B
  • Chat e agentes sensíveis à latênciaQwen3.5 397B A17B
  • Raciocínio e programação mais exigentesQwen3.5 397B A17B

FAQ Qwen3.5-27B vs Qwen3.5 397B A17B

Qwen3.5-27B ou Qwen3.5 397B A17B, qual é mais barato?
Qwen3.5-27B é mais barato nos tokens de entrada a $0.09 por 1M contra $0.17 por 1M.
Qual é mais barato em tokens de saída, Qwen3.5-27B ou Qwen3.5 397B A17B?
Qwen3.5-27B tem o preço de saída mais baixo, a $0.69 por milhão contra $1.03 por milhão. O preço de saída costuma importar mais que o de entrada para cargas com muita geração, então pondere de acordo.
Qual é mais rápido, Qwen3.5-27B ou Qwen3.5 397B A17B?
Qwen3.5 397B A17B tem a menor latência de resposta mediana (p50) nas medições ao vivo do OrcaRouter.
Qual transmite mais rápido, Qwen3.5-27B ou Qwen3.5 397B A17B?
Qwen3.5 397B A17B tem o throughput medido (tokens por segundo) mais alto, então completions longas terminam mais cedo uma vez iniciada a geração.
Qual pontua mais alto nos benchmarks, Qwen3.5-27B ou Qwen3.5 397B A17B?
Qwen3.5 397B A17B lidera no índice de qualidade composto mostrado acima, mas vantagens em benchmark nem sempre se transferem para um domínio específico — valide com seus próprios prompts antes de padronizar.
Quem vence mais confrontos diretos, Qwen3.5-27B ou Qwen3.5 397B A17B?
Qwen3.5-27B tem a pontuação Elo do Design Arena mais alta (1430 contra 1239), portanto vence mais comparações diretas às cegas contra modelos comparáveis.
Devo usar Qwen3.5-27B ou Qwen3.5 397B A17B?
Escolha Qwen3.5-27B ou Qwen3.5 397B A17B conforme sua prioridade: custo, janela de contexto, latência ou qualidade de benchmark. A tabela acima mostra qual modelo vence em cada quesito; associe o vencedor à dimensão mais importante para sua carga de trabalho.
Como Qwen3.5-27B e Qwen3.5 397B A17B são cobrados no OrcaRouter?
Ambos são cobrados à taxa do provedor upstream sem qualquer acréscimo sobre os tokens — você paga o mesmo preço por token que pagaria diretamente ao provedor, por meio de uma única chave API e um único endpoint do OrcaRouter.
Posso chamar Qwen3.5-27B e Qwen3.5 397B A17B com o mesmo código?
Sim. Ambos são expostos pela API OpenAI-compatible do OrcaRouter, então você muda apenas o nome do modelo para rotear entre eles — sem troca de SDK, sem credenciais separadas.

Comece com Qwen3.5-27B ou Qwen3.5 397B A17B

Uma chave. Os dois modelos. Mais de 40 fornecedores.

Cobrado ao custo do fornecedor, sem markup de tokens. Comece grátis, mude de modelo com uma string e mantenha a decisão reversível.

Criar uma conta grátis