
Claude Sonnet 5.5 vs Qwen3.8 Max: Seis Semanas, Dois Níveis, Um Veredito sobre Custo
- typesafeNOVOTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 por 1M de tokens · 984 tok/s
- openaiNOVOOpenAI: GPT-6 Luna2026-09-2237Inteligência
- openaiNOVOOpenAI: GPT-6 Sol2026-09-2248Inteligência
- anthropicNOVOAnthropic: Claude Opus 5.52026-09-2258Inteligência
- grokNOVOGrok 4.72026-09-2146Inteligência
- OrcaNOVOOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 por 1M de tokens · 195 tok/s
- orcaNOVOOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 por 1M de tokens · 1327 tok/s
- deepseekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Inteligência
- openaiOpenAI: GPT-6 Astra2026-09-0453Inteligência77Código
- googleGoogle: Gemini 3.8 Flash2026-09-0241Inteligência76Código
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Inteligência76Código
- anthropicAnthropic: Claude Fable 5.12026-09-0153Inteligência82Código
- tencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 por 1M de tokens
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 por 1M de tokens · 109 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Inteligência72Código
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 por 1M de tokens · 221 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Inteligência75Código
- obsidianQwen3.8 27B2026-08-1534Inteligência68Código
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Inteligência69Código
- grokSpaceXAI: Grok 4.62026-08-1244Inteligência77Código
Faça as contas com três prompts e a comparação praticamente se resolve antes de você chegar aos benchmarks. Um prompt curto de resposta de suporte: 2.000 tokens de entrada, 500 de saída. No Qwen3.8 Max, a $2 por milhão de entrada e $6 por milhão de saída, isso dá quatro décimos de centavo; no Claude 5.5, a $2 e $6, é nove décimos de centavo. Um prompt de 400.000 tokens de entrada e 30.000 de saída — quarenta e três centavos contra oitenta e três centavos. Uma longa sessão agêntica que realmente gasta seu orçamento: dois milhões de tokens de entrada, 200.000 de saída, então $5,20 contra $6,30 — quando os números ficam grandes o suficiente para o lado da entrada dominar.
A disparidade que começa como uma diferença de 2,25× no preço de saída diminui para cerca de 1,2× em escala agêntica, e essa escalabilidade não é uma curiosidade. Qwen3.8 Max e Claude Sonnet 5.5 são ambos modelos de 1M de tokens com tetos de saída elevados, ambos com preço de US$ 2 por milhão na entrada, e ambos lançados com oito semanas de diferença um do outro — o do fornecedor em 3 de agosto de 2026, com uma atualização datada em 2 de setembro, e o da Anthropic em 28 de setembro. A diferença entre eles não está na tabela de preços. Está naquilo que cada um gasta para concluir.
O que foi lançado e quando
O Qwen3.8 Max é o nível de maior capacidade da Alibaba até o momento. A Alibaba posiciona o modelo diretamente contra o GPT-5.5, o Claude Opus 4.7 e o Gemini 3.1 Pro em seu próprio guia de migração, e recomenda o modelo sempre que uma tarefa exigir o raciocínio mais forte disponível. Ele possui uma janela de contexto de 1 milhão de tokens, aceita entrada de texto, imagem e vídeo e emite texto — a capacidade de entrada de vídeo é a única aqui que o Claude Sonnet 5.5 não possui. O preço é de US$ 2 por milhão de tokens de entrada e US$ 6 por milhão de tokens de saída, com leituras de cache a US$ 0,25 e gravações de cache a US$ 2,50. À entrada de 3 de agosto do nosso catálogo junta-se uma atualização de 2 de setembro listada como Qwen3.8 Max (0902), que traz os mesmos preços anunciados e um limite de saída de 131K.

O Claude Sonnet 5.5 é o segundo modelo da geração 5.5 da Anthropic, lançado em 28 de setembro de 2026, seis dias após o Claude Opus 5.5. Ele é disponibilizado como claude-sonnet-5-5 na API da Claude e em Amazon Bedrock, Google Cloud e Foundry, com uma janela de 1M de tokens, um teto de saída síncrona de 128K que se estende a 300K na Message Batches API por trás do cabeçalho output-300k-2026-03-24, e com as tarifas do Claude Sonnet 5 mantidas exatamente: US$ 2 de entrada, US$ 10 de saída, US$ 0,20 para leituras de cache, US$ 2,50 para gravações de cache. Retenção zero de dados desde o lançamento, descontinuação não antes de 28 de setembro de 2027.
Portanto, a tarifa de entrada é idêntica, as janelas de contexto têm o mesmo tamanho, e os dois fornecedores lançaram atualizações com um mês de diferença. Tudo o que os separa está no lado da saída da fatura ou nos benchmarks.
Benchmarks: tabela do fornecedor versus índice independente
Existem dois tipos de evidência aqui e eles não são intercambiáveis.
A tabela de lançamento da Anthropic é relatada pelo fornecedor, não foi reproduzida por nenhum terceiro e abrange oito avaliações. As linhas que importam
• Terminal-Bench 4.0 — Claude Sonnet 5.5 70,6% contra os 10,3% do Claude Sonnet 5
• CursorBench 4.0 — 55,5% contra os 34,1% do Claude Sonnet 5
• GDPval-AA v2.1 — 1844 contra 1449 para Claude Sonnet 5, 1846 para Claude Opus 5.5 e 1487 para GPT-6 Sol
• Exame Final da Humanidade, com ferramentas — 64,5% contra 54,9%; Claude Opus 5.5 fica em 67,7%
• OSWorld 2.1, parcial — 80,1% contra 57,0%
• Cartografia, sem ferramentas — 61,6% contra 15,6%
A Alibaba não publica uma tabela de quatro colunas diretamente equivalente, então os únicos números que podem ser colocados no mesmo eixo são os independentes. Artificial Analysis, revisão v4.3.2
• Índice de Inteligência Composta — Claude Sonnet 5.5 56 na 3.ª posição de 216; Qwen3.8 Max 45 na 27.ª posição
• Custo por tarefa do Intelligence Index — US$ 7,60 contra US$ 5,41
• Velocidade de saída — o modelo da Anthropic é avaliado em relação a uma referência Claude Sonnet 5 medida em 78,7 tokens por segundo; o Qwen3.8 Max é medido em 39,1
• Verbosidade — 410M tokens de saída no Index contra 190M
As pontuações do próprio Qwen3.8 Max por avaliação são respeitáveis, e não marginais: 92,8% no GPQA Diamond, 88,8% no Terminal-Bench 2.1, 80,3% em recall de contexto longo, 47,8% no tau-banking. Ele perde terreno na pontuação composta porque não vence nada de forma decisiva, e o nível mais recente da Anthropic vence várias coisas de forma categórica. Observe também que a página independente do Qwen3.8 Max traz uma data de lançamento de 2 de setembro de 2026 e uma leitura de contexto de 984K — ela descreve a atualização (0902), não a versão de agosto, e misturar os números entre as duas seria um erro.

O que falta em ambas as colunas é tão importante quanto o que está nelas. Ninguém reproduziu de forma independente os números do OSWorld ou do Terminal-Bench da Anthropic. Ninguém publicou um valor de Chartography ou CursorBench para o Qwen3.8 Max. O compósito é o único número medido da mesma forma nos dois modelos, e é exatamente por isso que a cifra de custo por tarefa abaixo dele tem tanto peso.
O número que decide isso, e ele não está em nenhuma das duas tabelas de preços.
A Artificial Analysis cobra os dois modelos da mesma forma: executa as dez avaliações do Índice, conta os tokens, multiplica pelo preço de tabela. O Claude Sonnet 5.5 fica em US$ 7,60 por tarefa e o Qwen3.8 Max em US$ 5,41, um prêmio de 40% para o modelo da Anthropic, apesar de uma pontuação composta mais alta. As leituras de verbosidade explicam a direção — 410M de tokens contra 190M — e as leituras de velocidade explicam o resto: um modelo que emite menos tokens e demora mais por token não é o que paga pela saída ao dobro da tarifa.
A própria alegação de eficiência da Anthropic se encaixa na mesma narrativa, em vez de contradizê-la. A empresa afirma que o Claude Sonnet 5.5 gera saída 30%+ mais rápido que o Claude Sonnet 5 e custa "até 30% menos por tarefa" a preços idênticos — uma alegação sobre tokens por tarefa, não sobre taxas. Se isso se sustenta contra um modelo que gasta menos da metade da quantidade de tokens é exatamente o que o número de US$ 7,60 está perguntando, e uma execução independente é um único ponto de dados.
A consequência prática: a taxa de saída de US$ 6 versus US$ 10 é o número que o pessoal de compras vai observar, e é o número menos preditivo do artigo. O número preditivo é tokens por tarefa nos seus próprios prompts, e nenhum dos fornecedores vai entregá-lo a você.
Entradas, vídeo e a armadilha da migração
A diferença de capacidade que aparece imediatamente é a modalidade. O Qwen3.8 Max aceita vídeo junto com texto e imagens; o Claude Sonnet 5.5 aceita texto e imagens. Para análise de gravação de tela, pipelines de filmagens de reuniões ou qualquer coisa que trate um vídeo como entrada de primeira classe, isso não é uma lacuna de benchmark — é uma questão binária de elegibilidade, e apenas um desses modelos passa.

A diferença que aparece uma semana depois é comportamental. O Claude Sonnet 5.5 faz cinco alterações incompatíveis no código executado no Claude Sonnet 5. Um valor não padrão de temperature, top_p ou top_k agora retorna um 400. Enviar thinking: {"type": "disabled"} retorna um 400 apontando para between_tools, a nova configuração de pensamento mais baixa, aceita nos níveis de esforço low, medium e high e rejeitada em xhigh ou max. Uso forçado de ferramentas — tool_choice de "any" ou uma ferramenta nomeada — retorna um 400 imediatamente. A ferramenta de uso de computador computer_20251124 mais antiga é recusada na Claude API e no Google Cloud. E os blocos de pensamento estão vinculados ao modelo e à conta que os produziu, então o raciocínio pode ser transportado adiante a partir do Claude Sonnet 5, mas não para outra família, e um prefixo de conversa editado pode transformar uma reprodução em erro.
O Qwen3.8 Max não exige nada disso. É um modelo em formato OpenAI, com uma superfície de requisição convencional, e migrar para ele a partir de outro nível do Qwen é uma mudança na string do modelo.
Pese os dois custos com honestidade. Escolher o modelo Qwen custa a você a lacuna composta de onze pontos e os números do fornecedor Anthropic que você não consegue verificar de forma independente de qualquer maneira. Escolher o modelo Anthropic custa a você entrada de vídeo e uma lista de quatro alterações na API que cada uma falhará ruidosamente com um erro 400 na primeira vez em que forem chamadas — o que é o tipo bom de falha, mas ainda assim um dia de trabalho.
Onde o OrcaRouter se encaixa
A razão para rotear em vez de escolher é que o fator decisivo — o custo por tonelada no seu tráfego — não pode ser calculado a partir da documentação de nenhum dos fornecedores.
O OrcaRouter é um único endpoint compatível com OpenAI sobre mais de 200 modelos, com o preço de tabela dos provedores repassado sem markup, de modo que um corte de preço ou uma mudança de faixa de qualquer um dos lados entra em vigor no mesmo dia em que é anunciado. Ambos os builds do Qwen3.8 Max estão no catálogo pelos preços da própria Alibaba de $2 / $6 — a entrada de agosto e a atualização (0902) — ao lado do Claude Sonnet 5, o modelo no qual a maior parte do tráfego da API Claude ainda roda, roteável desde 30 de junho pelos $2 / $10 da Anthropic com 150 tokens de saída por segundo medidos. O próprio Claude Sonnet 5.5 ainda não está no nosso catálogo; enquanto isso for verdade, a rota honesta até ele é a própria API do fornecedor e as três nuvens listadas pela Anthropic, e a maneira de experimentá-lo sem migrar uma carga de trabalho é uma fração do tráfego atrás de failover automático para o Claude Sonnet 5 ou o Qwen3.8 Max.
Qual deles, para qual trabalho
O Qwen3.8 Max ganha em entrada de vídeo, em taxa de saída, em custo medido por tarefa de índice e em esforço de integração. É a predefinição certa para trabalho de alto volume e bem especificado, em que uma diferença composta de doze pontos não aparece na qualidade do resultado.
O Claude Sonnet 5.5 vence no composto independente, em avaliações de programação agêntica nas quais os números do fornecedor da Anthropic mostraram um salto de 60 pontos em relação ao seu próprio antecessor no Terminal-Bench 4.0, no teto de saída em lote de 300K e numa decisão moldada pelo trabalho que uma tabela de preços não consegue tomar: é o modelo a escolher quando a tarefa é suficientemente difícil para que estar certo importe mais do que ser barato.
O que mudaria a resposta para qualquer um dos dois é a mesma coisa, e não é o lançamento de um novo benchmark. É uma contagem de tokens por tarefa nos seus próprios prompts, com as suas próprias configurações de esforço, para ambos os modelos. O parâmetro de esforço da Anthropic e o teto de saída do Qwen são ambos alavancas sobre esse número, e ambos são definidos por você, e não pela tabela de preços do fornecedor.
A única coisa que esta comparação de fato resolve: a US$ 2 por milhão na entrada, o lado da entrada da conta já não é um diferencial entre um modelo de ponta chinês e o intermediário da Anthropic. Essa corrida mudou para o lado da saída e para a contagem de tokens há meses.
Comparados neste artigo3
Detectado a partir deste artigo · Benchmarks: Artificial Analysis · atualizado diariamente
