
Claude Sonnet 5.5 vs Qwen 4 Max: Um Modelo Tem um Cartão, o Outro Tem um Nome
- typesafeNOVOTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 por 1M de tokens · 931 tok/s
- OpenAINOVOOpenAI: GPT-6 Luna2026-09-2237Inteligência
- OpenAINOVOOpenAI: GPT-6 Sol2026-09-2248Inteligência
- AnthropicNOVOAnthropic: Claude Opus 5.52026-09-2258Inteligência
- xAINOVOGrok 4.72026-09-2146Inteligência
- OrcaNOVOOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 por 1M de tokens · 192 tok/s
- OrcaNOVOOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 por 1M de tokens · 1174 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Inteligência
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Inteligência77Código
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Inteligência76Código
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Inteligência76Código
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Inteligência82Código
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 por 1M de tokens · 62 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 por 1M de tokens · 107 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Inteligência72Código
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 por 1M de tokens · 220 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Inteligência75Código
- obsidianQwen3.8 27B2026-08-1534Inteligência68Código
- DeepSeekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Inteligência69Código
- xAISpaceXAI: Grok 4.62026-08-1244Inteligência77Código
As duas metades deste título não são o mesmo tipo de objeto, e é disso que um leitor precisa primeiro. Claude Sonnet 5.5 foi lançado em 28 de setembro de 2026: tem identificador de API, tabela de preços, janela de contexto, um prazo mínimo publicado de desativação e uma linha nos rankings independentes. Qwen 4 Max foi apresentado em prévia na conferência Yunqi, em Hangzhou, no dia 22 de setembro de 2026, como o carro-chefe de uma linha Qwen 4 anunciada com quatro modelos — e, até hoje, não tem preço, nem janela de contexto, nem pontuação publicada, nem model card, nem página no Artificial Analysis para abrir. Isso não é um escândalo; é assim que um nível é anunciado. Mas isso muda o que é uma comparação útil. A comparação que vale a pena fazer é entre o Sonnet lançado mais recentemente e o modelo Qwen que você realmente pode chamar hoje, que é o Qwen3.8 Max — porque esse tem uma tabela de preços, e a tabela de preços é instrutiva.
O que a Alibaba realmente colocou na mesa
O Qwen 4 Max foi apresentado como um nome numa lista, não como um produto. A prévia da conferência introduziu a estrutura de níveis da família Qwen 4, e nada disso foi desde então convertido numa especificação com a qual um desenvolvedor pudesse planear: nenhum preço por milhão de tokens, nenhuma dimensão de janela, nenhum limite máximo de saída, nenhuma tabela de benchmarks, nenhum repositório no Hugging Face, nenhuma entrada na própria lista de modelos do fornecedor. Se será lançado como um nível de API fechada, como pesos abertos, ou em ambas as formas, não é afirmado em nenhum sítio que o fornecedor tenha publicado. Quando um nível está tão no início, a única coisa honesta que um artigo pode dizer sobre as suas especificações é que não existem — e qualquer página que apresente agora uma ficha técnica do Qwen 4 Max está a publicar uma projeção.

A única coisa que o anúncio estabelece de forma útil é a direção. O mais recente carro-chefe disponível da Alibaba, Qwen3.8 Max, é posicionado pelo próprio guia de migração do fornecedor diretamente contra GPT-5.5, Claude Opus 4.7 e Gemini 3.1 Pro, e é o nível que o Qwen 4 Max está sendo criado para substituir. Assim, o alvo do sucessor é legível mesmo quando os seus números não são, e o modelo que ele terá de superar no preço é o que já está à venda.
O Qwen que você pode chamar hoje, com preço comparado ao novo Sonnet
A Qwen3.8 Max está disponível de forma geral desde 3 de agosto de 2026. É o nível de maior capacidade da Alibaba até à data: nativamente multimodal, com entrada de texto, imagem e vídeo e saída de texto, uma janela de 1 000 000 de tokens, modo de pensamento, chamada de funções, ferramentas incorporadas e saídas estruturadas, disponibilizado através de endpoints compatíveis com a OpenAI, compatíveis com a Anthropic e nativos do DashScope. A Alibaba posiciona-o para o mesmo trabalho exigente de análise em várias etapas e de natureza agêntica para o qual o fornecedor posiciona o Claude Sonnet 5.5, e os dois apresentam quase exatamente o mesmo preço anunciado — e é aqui que a comparação se torna interessante.
• Preço de entrada — Claude Sonnet 5.5 $2,00 por milhão vs Qwen3.8 Max $2,00 por milhão, idêntico
• Preço de saída — Claude Sonnet 5.5 $10,00 por milhão vs Qwen3.8 Max $6,00 por milhão
• Leitura de cache — Claude Sonnet 5.5 $0,20 por milhão vs Qwen3.8 Max $0,25 por milhão
• Gravação em cache — Claude Sonnet 5.5 US$ 2,50 por milhão vs Qwen3 Max US$ 2,50 por milhão
• Contexto — Claude Sonnet 5.5 1.000.000 tokens vs. Qwen3.8 Max 1.000.000 tokens na ficha técnica do fornecedor; a Artificial Analysis registra o snapshot que mediu em 983.616
• Saída máxima — Claude Sonnet 5.5 128.000 síncrono, 300.000 em Batches vs Qwen3.8 Max não divulgado pelo fornecedor
• Modalidade de entrada — Claude Sonnet 5.5: texto, imagem e arquivo vs. Qwen3.8 Max: texto, imagem e vídeo
Uma taxa de entrada idêntica e uma taxa de saída 40% mais barata é uma posição de preço genuinamente forte, e é a razão pela qual o Qwen3.8 Max continua aparecendo em comparações com modelos de fronteira. Depois, você olha para as medições independentes e a vantagem se desloca para um lugar completamente diferente.
O que os números independentes dizem sobre a vantagem de preço
Ambos os modelos estão no mesmo Artificial Analysis Intelligence Index, revisão v4.3.2, e ambos foram medidos em vez de estimados.
• Índice de Inteligência — Claude Sonnet 5.5 56 em Max Effort vs. Qwen3.8 Max 45 no snapshot de 2 de setembro
• Custo por tarefa do Index — Claude Sonnet 5.5 $7.60 vs Qwen3.8 Max $5.41
• Velocidade de saída — Claude Sonnet 5.5 138,7 tokens/seg vs Qwen3.8 Max 38,2 tokens/seg
• Tempo até o primeiro chunk — Claude Sonnet 5.5 370,8 s em Esforço Máximo vs Qwen3.8 Max 3,0 s
• Tokens de saída gerados em todo o Índice — Claude Sonnet 5.5 410M vs Qwen3.8 Max 190M, que o painel sinaliza como muito verbosos em relação a uma mediana de 88M
• GPQA Diamond — Claude Sonnet 5.5 não publicado no quadro atual vs Qwen3.8 Max 92,8%
• Humanity's Last Exam — Claude Sonnet 5.5 55,0% vs Qwen3.8 Max 43,1%
• Recordação de contexto longo — Claude Sonnet 5.5 82,7% vs Qwen3.8 Max 80,3%
Duas coisas se destacam, e nenhuma delas é o preço. A primeira é que uma taxa de saída 40% mais barata se comprime para uma tarefa 30% mais barata quando se levam em conta as contagens de tokens — o Qwen3.8 Max emite 190M tokens em todo o índice, contra os 410M do Claude Sonnet 5.5, o que é mais enxuto, mas não o suficiente para preservar toda a diferença de taxa. A segunda é a velocidade, e aqui a direção se inverte fortemente: o Claude Sonnet 5.5 gera saída 3,6 vezes mais rápido que o Qwen3.8 Max, 138,7 tokens por segundo contra 38,2. Numa geração longa, essa é a diferença entre um minuto e vários, e não é uma diferença que qualquer desconto por token corrija.
O número do primeiro token aponta no sentido oposto e merece que sua ressalva seja explicitada. 370,8 segundos é o Claude Sonnet 5.5 Max Effort com fallback padrão, uma configuração de raciocínio que gasta um orçamento de pensamento muito grande antes de responder; quem chama com um esforço menor configurado obtém um primeiro token em segundos. Os 3,0 segundos do Qwen3.8 Max são medidos em um modelo cujo comportamento de raciocínio é diferente. A comparação é real, mas é uma comparação de configurações, não de fornecedores.

Onde recai o custo da migração Sonnet em falta
Uma diferença operacional não aparece em nenhuma das linhas acima e importa mais do que a diferença de preço para qualquer pessoa com código em execução. Claude Sonnet 5.5 mudou seis comportamentos em relação ao Claude Sonnet 5, e cinco deles quebram integrações existentes: valores não padrão de temperature, top_p e top_k agora retornam um 400; thinking: {"type": "disabled"} retorna um 400 e deve se tornar between_tools com esforço limitado a low, medium ou high; a escolha forçada de ferramenta de "any" ou de uma ferramenta nomeada é rejeitada, então os loops precisam mudar para auto com uso estrito de ferramentas ou saídas estruturadas; a computer_20251124, ferramenta de uso de computador, é recusada na Claude API e no Google Cloud; e os blocos de pensamento agora estão vinculados ao modelo e à conta que os produziram, então o raciocínio é mantido a partir do Sonnet 5, mas não para outra família. A sexta mudança não quebra nada e, por isso, é a mais fácil de ser lançada quebrada: o texto entre chamadas de ferramentas agora é retornado dentro de blocos de pensamento, então um aplicativo de streaming fica silencioso entre chamadas até definir um valor de exibição ou desabilitar o pensamento antecipado.
O Qwen3.8 Max não exige nada disso de um chamador Qwen — é um endpoint compatível com a OpenAI, com toda a superfície de amostragem e o formato padrão de chamada de ferramentas — e seu endpoint compatível com a Anthropic existe justamente para que código escrito para o Claude possa apontar para ele com uma mudança na URL base. Para uma equipe que já usa o Sonnet 5, migrar para o Sonnet 5.5 é um dia de trabalho de migração com uma lista de cinco itens a verificar; migrar para o Qwen3.8 Max é uma mudança de configuração com um conjunto diferente de riscos, principalmente em torno de desvio de comportamento, e não do formato da API.
Colocando o alcançável na mesma tecla
Um pipeline realista no final de setembro de 2026 não escolhe uma dessas opções. Ele executa um modelo Claude para o caminho agêntico e um modelo Qwen onde a entrada de vídeo ou o preço importam, e o custo dessa configuração é normalmente dois contratos, duas chaves, duas superfícies de limite de taxa e dois pontos em que uma requisição pode falhar. O OrcaRouter reduz isso a um único endpoint compatível com OpenAI em mais de 200 modelos, com o preço de tabela do provedor repassado e sem markup adicionado, de modo que uma mudança de tarifa de um fornecedor de qualquer um dos lados passa a valer aqui no mesmo dia, e não na próxima renovação, além de failover automático entre provedores upstream e uma DSL de roteamento para compor chamadas a partir de vários modelos.
Qwen3.8 Max é roteável aqui hoje como qwen/qwen3.8-max pelo preço de entrada de $2.00 e saída de $6.00 da Alibaba em toda a janela completa de 1.000.000 de tokens, e o snapshot de 2 de setembro que a Artificial Analysis mediu é endereçável como qwen/qwen3.8-max-0902 quando você precisa da revisão exata na qual uma pontuação foi obtida. Nem o Qwen 4 Max nem qualquer outro nível do Qwen 4 está em nosso catálogo, e nenhum nível do Qwen 4 estará até que a Alibaba publique algo para rotear. O Claude Sonnet 5.5 também não está no catálogo — ele tem um dia de idade, e a rota para ele é a própria API da Anthropic, comClaude Sonnet 5 disponível aqui pelos $2.00 e $10.00 da Anthropic como o alvo de failover nesse meio-tempo. Qwen3.8 Max carrega 52,0 milhões de tokens de tráfego por semana através deste catálogo e Claude Sonnet 5 carrega 7,9 milhões, o que é a versão prática do argumento acima: o nível Qwen não é um fallback apenas no nome.

A regra para um nível anunciado
Trate um nível anunciado como insumo de agendamento, não como opção de compra. Vale a pena acompanhar o Qwen 4 Max porque ele mostra para onde o carro-chefe da Alibaba está indo e porque, com o tempo, ele vai substituir o Qwen3.8 Max no topo da linha. Não vale a pena planejar em cima dele, porque não há nada em cima do que planejar: nenhum identificador, nenhum preço, nenhuma janela, nenhum peso, nenhuma pontuação medida. As evidências que vão torná-lo real são específicas e fáceis de reconhecer — uma entrada na própria lista de modelos da Alibaba, uma linha de preço, uma janela de contexto publicada, um repositório no Hugging Face caso os pesos sejam abertos, e uma página no Artificial Analysis, porque um modelo que ninguém mediu não é um modelo que se possa comparar.
Até lá, a decisão é entre dois modelos que existem ambos. Se o seu trabalho é agêntico, os dezessete pontos do Index e a velocidade de saída de 3,6× são o que você está comprando, e o custo por tarefa mais alto do Claude Sonnet 5.5 é o preço disso. Se o seu trabalho recebe entrada de vídeo, precisa de um endpoint nativo compatível com a Anthropic numa fatura da Qwen, ou simplesmente não consegue justificar uma tarifa de saída de US$ 10, o Qwen3.8 Max está em promoção neste momento pelo mesmo preço de entrada, com saída 40% mais barata e um primeiro token que chega em segundos — e a ressalva honesta é que ele vai parecer lento assim que a geração começar, que é a troca que a tarifa mais barata compra.
