
Qwen 3.8 vs Claude Opus 4.8: Escala Barata Encontra o Especialista em Raciocínio
- metaNOVOMeta: Muse Spark 1.22026-08-05$1.25 / $4.25 por 1M de tokens · 819 tok/s
- qwenNOVOQwen: Qwen3.8 Max2026-08-03$2.00 / $6.00 por 1M de tokens · 56 tok/s
- deepseekNOVODeepSeek: DeepSeek V4 Flash 07312026-07-3150Inteligência69Código
- qwenNOVOQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 por 1M de tokens · 198 tok/s
- orcaNOVOOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicNOVOAnthropic: Claude Opus 52026-07-2461Inteligência78Código
- googleGoogle: Gemini 3.6 Flash2026-07-2150Inteligência69Código
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2137Inteligência49Código
- metaMeta: Muse Spark 1.12026-07-1651Inteligência71Código
- kimiMoonshotAI: Kimi K32026-07-1557Inteligência76Código
- openaiOpenAI: GPT-5.6 Luna2026-07-0951Inteligência71Código
- openaiOpenAI: GPT-5.6 Terra2026-07-0955Inteligência77Código
- openaiOpenAI: GPT-5.6 Sol2026-07-0959Inteligência77Código
- grokxAI: Grok 4.52026-07-0854Inteligência72Código
- tencentTencent: Hy32026-07-0641Inteligência59Código
- obsidianQwen3.6 35B A3B Uncensored (Aggressive)2026-07-0232Inteligência42Código
- obsidianGemma4 26B A4B Uncensored (Balanced)2026-07-0226Inteligência39Código
- anthropicAnthropic: Claude Sonnet 52026-06-3053Inteligência72Código
- klingKling: Kling 3.0 Turbo2026-06-1757Inteligência52Código57Matemática
- z-aiZ.ai: GLM 5.22026-06-1651Inteligência69Código60Matemática
A Alibaba apresentou o Qwen3.8-Max em Xangai em 19 de julho de 2026 como um modelo de 2,4 trilhões de parâmetros, construído para escala e minúcia. O Claude Opus 4.8 da Anthropic é um animal muito diferente: um carro-chefe premium de raciocínio profundo ao qual as equipes recorrem quando uma tarefa tem muitas etapas e uma resposta errada é cara.
Durante duas semanas, era difícil fazer essa comparação com honestidade, porque a Qwen não tinha preço publicado nem benchmarks publicados. Isso mudou em 3 de agosto de 2026, quando o Qwen3.8-Max atingiu disponibilidade geral com uma tabela de preços de US$ 2 / US$ 6 por milhão de tokens e uma tabela completa de benchmarks. A questão filosófica continua a mesma — escala bruta e abertura versus confiabilidade de raciocínio —, mas agora há números em ambos os lados.
Uma nota para desenvolvedores — a maneira mais rápida de resolver uma questão como esta é executar ambos nos seus próprios fluxos de trabalho. O OrcaRouter disponibiliza 200+ modelos atrás de um único endpoint compatível com OpenAI, então você pode confrontar o Qwen 3.8 Max com o Opus 4.8 na mesma tarefa sem integrar dois SDKs.
Veredito TL;DR. Opus 4.8 continua sendo o especialista em raciocínio: auditado no cluster de topo do Artificial Analysis Intelligence Index e confiável para longas cadeias agênticas, onde uma resposta confiantemente errada custa mais do que a fatura de tokens. Seus pontos fracos são custo e verbosidade — a AA estima sua taxa combinada em cerca de $3,85/1M no esforço máximo, e ele é pesado em tokens, com o Grok 4.5 supostamente concluindo tarefas comparáveis usando cerca de 4× menos tokens de saída. O Qwen3.8-Max agora contra-ataca com algo que não tinha em julho: um preço real e baixo de $2 / $6 fixos por 1M de tokens, entrada cacheada a $0,25, e uma tabela de benchmarks do fornecedor liderada por Terminal-Bench 2.1 86.6 e OSWorld-Verified 86.1. Ele também mostrou diligência agêntica genuína no único teste de terceiros disponível. Mas ainda não foi avaliado por nenhum avaliador independente. Opus para raciocínio em que se precisa confiar; Qwen para trabalhos sensíveis a custo e que priorizam a minúcia.
Principais conclusões
• Qwen3.8-Max está em GA desde 3 de agosto de 2026 a $2 / $6 por 1M de tokens, fixo em todo o contexto de 1M de tokens — uma tabela de preços genuína, substituindo o desconto temporário de prévia de julho.
• Opus 4.8 é materialmente mais caro: A Artificial Analysis estima seu custo combinado em cerca de $3.85/1M no esforço máximo, e é intensivo em tokens — segundo relatos, ~4× mais tokens de saída por tarefa do que o Grok 4.5, então execuções longas de agentes ampliam ainda mais a diferença.
• As fontes divergem sobre o número exato de AA do Opus 4.8. Em AA v4.1, o Kimi K3 (57.1) é relatado logo acima dele, então a afirmação confiável é "cluster superior, abaixo dos líderes Fable 5 / GPT-5.6 Sol", em vez de uma pontuação única definitiva.
• Qwen agora tem números agentivos, autorrelatados: Terminal-Bench 2.1 86,6, OSWorld-Verified 86,1, FrontierSWE 73,5 (a partir de 40,7 de um predecessor). Nenhum foi verificado de forma independente.
• O único ponto de dados de agente de terceiros da Qwen é favorável: contra o Kimi K3, produziu 354 citações de repositório contra 274, usou 22 solicitações de gateway contra 53 e registrou 0 chamadas de ferramenta com falha contra 2 — enquanto pontuava 80/100 contra os 83 do Kimi.
• A abertura diverge permanentemente: A Qwen promete pesos abertos dentro da semana, além de um Qwen3.8-27B com ~17GB de VRAM; o Opus 4.8 é fechado e apenas via API.
Nota de precisão: todos os números de qualidade do Qwen3.8-Max são informados pela Alibaba e não verificados por terceiros. Os números do Opus 4.8 são atribuídos à Artificial Analysis e a fontes nomeadas e podem diferir do relato da própria Anthropic; como os rastreadores divergem sobre o índice exato do Opus, declaramos sua posição relativa em vez de um único número. A precificação do Qwen segue a tabela de preços GA e substitui o desconto de preview de julho.
Especificações e preço, lado a lado
Aqui estão os dados concretos, cada número atribuído à sua fonte.
• Fabricante / status — Qwen3.8-Max: Alibaba; GA (3 de agosto de 2026); Claude Opus 4.8: Anthropic; carro-chefe de raciocínio profundo em GA
• Arquitetura — Qwen3.8-Max: total de ~2,4T, MoE esparso (parâmetros ativos ainda não divulgados); Opus 4.8: Fechado; arquitetura não divulgada
• Janela de contexto — Qwen3.8-Max: 1M tokens (983.616 com raciocínio; saída máxima 131.072); Opus 4.8: carro-chefe de contexto longo
• AA Intelligence Index — Qwen3.8-Max: Ainda sem pontuação; Opus 4.8: Cluster superior, abaixo dos líderes (Artificial Analysis; Kimi K3 com 57,1 relatado logo acima)
• Ponto forte — Qwen3.8-Max: Escala, minúcia, economia de contexto longo; Opus 4.8: Raciocínio profundo em múltiplas etapas + confiabilidade agêntica
• Pontuações de agente relatadas pelo fornecedor — Qwen3.8-Max: Terminal-Bench 2.1 86.6, OSWorld-Verified 86.1 (relatado pela Alibaba); Opus 4.8: n/d — a reputação é conquistada na produção
• Preço (entrada / saída) — Qwen3.8-Max: $2.00 / $6.00 por 1M, fixo; entrada em cache $0.25; Opus 4.8: Premium — AA combinado ~$3.85/1M no esforço máximo
• Eficiência de tokens — Qwen3.8-Max: verboso; IFBench 82,8 é sua pontuação autorrelatada mais fraca; Opus 4.8: alto consumo de tokens — ~4× mais saída que o Grok 4.5 (relatado)
• Pesos abertos — Qwen3.8-Max: Prometido para esta semana (ainda sem licença); Opus 4.8: Não — fechado / somente API
Duas coisas enquadram a comparação, e ambas mudaram em 3 de agosto.
Primeiro, a diferença de custo agora é mensurável, e não apenas teórica. Em julho, a vantagem da Qwen era um desconto que não dava para orçar. Agora é uma taxa, e a forma da diferença é incomum: a Opus é cara e consome muitos tokens, o que significa que os dois se multiplicam. Se a Opus emite quatro vezes mais tokens de saída para a mesma tarefa e cobra um prêmio por token, uma execução agêntica longa pode custar muitas vezes mais do que as taxas anunciadas sugerem. A taxa de saída de $6 da Qwen, o contexto fixo de 1M e o input em cache a $0,25 atacam exatamente esse efeito composto.
Segundo, a coluna de benchmarks do Qwen não está mais vazia — e, pela primeira vez, parte dela é diretamente relevante. Toda a proposta do Opus 4.8 é confiabilidade agêntica, e a Alibaba acaba de publicar números agênticos: Terminal-Bench 2.1 86.6 para operação de shell, OSWorld-Verified 86.1 para controlar uma GUI real. Esses medem as coisas certas. A ressalva é a proveniência, não a relevância: a Alibaba os produziu em sua própria estrutura de testes, e nenhum terceiro os replicou. Enquanto isso, a reputação do Opus se sustenta em algo mais difícil de publicar, mas possivelmente mais valioso — uso contínuo em produção por muitas equipes, um tipo de evidência que uma tabela de fornecedor não consegue fabricar.

Confiabilidade do raciocínio vs exaustividade bruta
A diferença interessante entre esses dois não é a qualidade de uma única execução — é como eles se comportam quando uma tarefa tem muitas etapas e ferramentas reais anexadas.
A reputação do Opus 4.8 é construída sobre confiabilidade agêntica: longas cadeias de raciocínio em que ele acompanha o contexto, recupera-se de becos sem saída e retorna respostas nas quais você pode agir sem verificar cada etapa. Essa é a propriedade pela qual as equipes pagam um prêmio, porque em produção o custo de uma resposta multi-etapas confiantemente errada supera em muito a conta de tokens. A contrapartida é que o Opus consome muitos tokens — o Grok 4.5 supostamente conclui tarefas comparáveis com cerca de 4× menos tokens de saída — portanto, sua confiabilidade vem com um custo real e contínuo.
Qwen 3.8 responde com um tipo diferente de força: pura minúcia, e agora há um dado de terceiros sobre isso. Em um teste de compreensão de arquitetura conduzido pela Trilogy AI (Qwen3.8-Max vs Kimi K3), o Qwen obteve 80/100 contra os 83 da Kimi — perdendo no título — mas foi o agente mais diligente, produzindo 354 citações de repositórios contra 274 da Kimi, usando 22 solicitações de gateway contra 53, e registrando 0 chamadas de ferramenta com falha contra 2. Ambos os modelos chegaram à mesma conclusão arquitetural central; o Qwen simplesmente fez mais trabalho de fundamentação para chegar lá, com um uso de ferramentas mais limpo.
Esse {{1}}resultado de zero chamadas de ferramenta com falha{{/1}} é o {{2}}sinal de agente mais encorajador{{/2}} que a {{3}}Qwen{{/3}} tem, porque {{4}}chamadas de ferramenta com falha{{/4}} são o que realmente quebram os {{5}}agentes em produção{{/5}}. É também {{6}}um teste, em uma tarefa, por um avaliador{{/6}} — nada perto da base de evidências por trás da reputação da {{7}}Opus{{/7}}.
O custo da minuciosidade do Qwen foi latência e tokens. Avaliadores da era de preview o consideraram "muito bom e muito lento" — 30+ minutos na criação de um site, mais de uma hora em uma simulação de pôquer, o modelo mais lento que aquele avaliador já tinha usado. Duas ressalvas agora se aplicam. Isso foi infraestrutura de preview, e o serving GA é um sistema diferente; a telemetria de 7 dias do OrcaRouter atualmente mostra um p50 de tempo até o primeiro token de 1,64 segundos, embora TTFT e o throughput de ponta a ponta em builds de uma hora sejam grandezas diferentes. A constatação merece ser testada novamente, em vez de repetida.
Há também uma preocupação estrutural que vale a pena mencionar: a pontuação mais baixa relatada pela própria Alibaba é IFBench 82.8, seguimento de instruções sob restrição. Para pipelines agênticos que analisam a saída do modelo a cada etapa, um modelo que excede o escopo e adiciona trabalho não solicitado é um problema, independentemente de quão minucioso seja. É exatamente aqui que a disciplina da Opus justifica seu preço premium.

Custo na prática: onde a lacuna de 4× nos tokens pesa
Considere uma execução de agente de múltiplas etapas: 80.000 tokens de entrada de contexto e — esta é a variável-chave — volumes de saída diferentes, porque Opus é relatado como emitindo cerca de 4× mais.
• Qwen3.8-Max a 8.000 tokens de saída: 0,08M × $2 = $0,16, mais 0,008M × $6 = $0,048. ≈ $0,21 por execução.
• Opus 4.8 a um preço médio de ~$3,85/1M em 80.000 tokens de entrada + ~32.000 de saída (4× os tokens): aproximadamente $0,43 por execução com esse preço médio — e consideravelmente mais se você precificar entrada e saída separadamente nas tarifas do nível premium.
• A 3.000 execuções/dia: Qwen ≈ $630/dia; Opus ≈ $1.290/dia ou superior.
• Com a entrada em cache da Qwen a $0,25/1M em um contexto estável, seu custo por execução cai para ≈ $0,07 — aproximadamente 6× mais barato que Opus.
O contrapeso honesto é aquele que sempre se aplica às comparações com Opus: se Opus resolve uma tarefa em uma única tentativa, enquanto um modelo mais barato precisa de duas tentativas mais revisão humana, o modelo mais barato não é realmente mais barato. A verbosidade do Opus é em parte o mecanismo de sua confiabilidade — ele raciocina em voz alta, e isso custa tokens. A questão para sua carga de trabalho é se você está pagando por uma deliberação de que precisa. Em raciocínio de alto risco e baixo volume, provavelmente sim. Em análise de alto volume, onde você verifica downstream de qualquer forma, provavelmente não.
Abertura e a questão do on-premise
O Opus 4.8 é fechado e somente API, permanentemente. O Qwen3.8-Max pode não ser — os pesos são prometidos dentro de uma semana — mas o carro-chefe não é um alvo realista de auto-hospedagem: cerca de 1,2 TB em 4 bits contra aproximadamente 141 GB por H200 significa oito ou mais aceleradores de ponta, e com o número de parâmetros ativos ainda não divulgado, você não consegue modelar o throughput que esse investimento compraria. Também ainda não há texto de licença, portanto a usabilidade comercial está formalmente indeterminada.
Anunciado simultaneamente, o Qwen3.8-27B é o lançamento prático para equipes cujo interesse é controle em vez de capacidade bruta. Também com pesos abertos, ele roda, segundo relatos, em cerca de 17GB de VRAM — uma única placa de vídeo topo de linha. Se você está comparando com o Opus porque precisa de raciocínio dentro da sua própria rede, o 27B é o modelo a avaliar; o caráter aberto do carro-chefe de 2,4T é principalmente teórico.
Perguntas Frequentes
O Qwen 3.8 é melhor que o Claude Opus 4.8?
Não com base nas evidências existentes. O Opus 4.8 está no agrupamento superior do Índice de Inteligência da Artificial Analysis auditado e é comprovado em raciocínio agêntico profundo em produção. O Qwen3.8-Max tem uma forte tabela auto-relatada (Terminal-Bench 2.1 86.6, OSWorld-Verified 86.1) e um teste agêntico favorável de terceiros, mas nenhuma pontuação independente. Qwen vence no preço; Opus vence na comprovação e na confiabilidade do raciocínio.
Por que o número de benchmark do Opus 4.8 é descrito de forma tão vaga?
Porque os rastreadores realmente entram em conflito. No AA v4.1, o Kimi K3 (57.1) é relatado logo acima do Opus 4.8, colocando o Opus no cluster superior, mas abaixo dos líderes Fable 5 / GPT-5.6 Sol — porém fontes diferentes o relatam de forma distinta, então citar um número exato seria enganoso. Sua posição relativa é a afirmação confiável.
Quanto mais barato é o Qwen 3.8 do que o Claude Opus 4.8?
Significativamente, e a diferença se amplia em execuções longas. Qwen3.8-Max é US$ 2 / US$ 6 por 1M fixo, com entrada em cache a US$ 0,25. A Artificial Analysis coloca o custo combinado do Opus perto de US$ 3,85/1M no esforço máximo, e o Opus é supostamente ~4× mais intensivo em tokens do que o Grok 4.5 — portanto, a diferença de preço se multiplica com o volume de saída. Em uma execução típica de múltiplas etapas, o Qwen fica cerca de 2–6× mais barato, dependendo do cache.
O Qwen 3.8 Max saiu do preview?
Sim, em 3 de agosto de 2026. Ele tem uma tabela de preços publicada e um endpoint compatível com OpenAI e DashScope, então a campanha de créditos Qoder de julho e a oferta de 90% de desconto não descrevem mais como ele é vendido.
O Qwen 3.8 é confiável para trabalho agêntico?
Os primeiros sinais são encorajadores, mas limitados. A Alibaba reporta Terminal-Bench 2.1 86,6 e OSWorld-Verified 86,1, e em um teste de terceiros registrou zero chamadas de ferramenta falhas contra duas do concorrente. Em contrapartida, sua pontuação auto-relatada mais baixa é IFBench 82,8 em seguimento de instruções, e testadores em pré-visualização repetidamente o viram exceder o escopo — um risco real para pipelines que analisam a saída de cada etapa.
Posso hospedar o Qwen 3.8 por conta própria para evitar o preço premium da Opus?
Realisticamente, não é o carro-chefe. Os pesos são prometidos dentro da semana, mas nenhuma licença foi publicada, e com ~1,2 TB em 4 bits você precisaria de oito ou mais GPUs da classe H200. O Qwen3.8-27B, anunciado simultaneamente e com cerca de 17 GB de VRAM, é a opção viável. O Opus 4.8 é fechado, então não há nenhum caminho de auto-hospedagem por aí.
Qual devo usar hoje?
Opus 4.8 para trabalho de produção crítico para raciocínio ou agêntico, onde é preciso poder confiar, e onde uma resposta errada em várias etapas sai cara. Qwen3.8-Max para trabalho sensível a custo e focado em minúcia — especialmente análise de contexto longo, onde sua tarifa fixa de 1M e entrada em cache de US$ 0,25 tornam o custo-benefício difícil de contestar.
Conclusão
Qwen 3.8 vs Claude Opus 4.8ainda é um contraste de filosofias, mas a economia não é mais hipotética. O Qwen3.8-Max chegou ao GA com preços reais que subcotam a Opus por uma ampla margem, e a diferença se amplia porque a Opus é ao mesmo tempo de preço premium e pesada em tokens. A Qwen também publicou números de agente que falam diretamente ao território da Opus, e seu único teste de agente de terceiros mostrou um uso de ferramentas mais limpo do que um rival forte.
Opus mantém a vantagem onde sempre esteve: posição auditada no cluster superior e um histórico de produção comprovado para raciocínio confiável em múltiplas etapas, que nenhuma tabela de fornecedores pode substituir. As lacunas restantes da Qwen são as conhecidas — sem pontuação independente, sem contagem de parâmetros ativos divulgada, sem licença ainda, e uma fraqueza autorrelatada no seguimento de instruções que importa exatamente nos pipelines agênticos para os quais a Opus é escolhida. Observe dois eventos: a primeira pontuação independente do Intelligence Index e a chegada dos pesos com uma licença. Até lá, a Opus é o modelo em que você confia para decisões caras, e a Qwen 3.8 é aquela para a qual você direciona o volume — testada em seus próprios fluxos de trabalho.

Comparados neste artigo4
Detectado a partir deste artigo · Benchmarks: Artificial Analysis · atualizado diariamente
