Qwen 3.8 vs Claude Fable 5: O Build 0902 Assume a Liderança em Codificação
Guides & Insights

Qwen 3.8 vs Claude Fable 5: O Build 0902 Assume a Liderança em Codificação

Autor

Rowan Sterling

Data de publicação

Modelos mais recentes · 20Ver todos os modelos
Benchmarks: Artificial Analysis · atualizado diariamente
Voltar para todas as publicações

Quando a Alibaba apresentou em prévia Qwen3.8-Max em Xangai em 19 de julho de 2026, fez uma afirmação mais forte do que qualquer outra: este modelo de 2,4 trilhões de parâmetros está próximo do nível de fronteira e atrás apenas do Claude Fable 5. Na época, isso era impossível de avaliar. Não havia tabela de preços, nenhuma tabela de benchmarks e nenhuma licença — apenas uma declaração de posicionamento.

Em 3 de agosto de 2026, o Qwen3.8-Max ficou disponível de forma geral — uma tabela de preços real a US$ 2 / US$ 6 por milhão de tokens, uma tabela de benchmarks com números, e um endpoint compatível com OpenAI e DashScope. Em 2 de setembro, a Alibaba lançou o próximo passo sem mudar o número da versão: Qwen3.8-Max-0902, um refresh pós-treino voltado para codificação e trabalho com agentes, que estreou em 1º lugar no ranking Code Arena: WebDev com 1.691 Elo. O Claude Fable 5, o modelo atrás do qual a Alibaba passou julho se posicionando diretamente, está com 1.628 no mesmo ranking. A pergunta de julho ficou mais afiada: o Qwen 3.8 ainda é “segundo apenas para o Fable 5”, ou o eixo de codificação já virou?

Uma nota para construtores — a maneira mais rápida de resolver uma afirmação como esta é executar ambos os modelos em seus próprios prompts. O OrcaRouter disponibiliza mais de 200 modelos por trás de um endpoint compatível com OpenAI, para que você possa confrontar o Qwen 3.8 Max com o Fable 5 na mesma tarefa sem precisar configurar dois SDKs.

Resumo do veredito. O Qwen3.8-Max-0902 é a versão mais forte do carro-chefe de 2,4T da Alibaba até agora, e a nova parte do seu argumento não é mais autodeclarada: ele estreou em #1 no ranking independente Code Arena: WebDev com 1.691 de Elo, acima do Claude Fable 5 (1.628, #8) nesse ranking. O preço não mudou e continua decisivo — com US$ 2 / US$ 6 fixos por 1 milhão de tokens, o Qwen fica abaixo dos US$ 10 / US$ 50 do Fable 5 em cerca de 5× na entrada e 8× na saída. O que não se fechou é a lacuna de uso geral: a Artificial Analysis avalia o Qwen3.8-Max em 56 em seu Índice de Inteligência, contra 62 do Claude Fable 5, e na semana mais recente publicada do ranking geral da Arena (24–30 de agosto) o Fable 5 mantém o #1 (1.508 Elo), enquanto o Qwen3.8-Max está em #20 (1.479). Há, então, dois vereditos: em codificação, a atualização 0902 do Qwen agora tem um árbitro e uma vitória; em raciocínio amplo e auditado, o Claude Fable 5 — e o mais recente Claude Fable 5.1 da Anthropic, que lidera o índice da AA com 66 — ainda mantêm a posição.

Principais conclusões

Qwen3.8-Max atingiu GA em 3 de agosto de 2026, e sua atualização 0902 veio em seguida, em 2 de setembro — sem alteração de versão, mesma tabela de preços de $2 / $6, mesmo contexto de 1M de tokens.

A diferença de preço é enorme: Qwen custa US$ 2 / US$ 6 por 1M contra US$ 10 / US$ 50 do Fable 5. Isso é ~5× na entrada e ~8× na saída, e a tarifa da Qwen é fixa em todo o contexto de 1M de tokens, sem sobretaxa para prompts longos.

Ambos os lados agora têm pontuações independentes — e apontam em direções diferentes. Qwen3.8-Max marca 56 no Artificial Analysis Intelligence Index (Claude Fable 5: 62), e sua versão 0902 lidera o Code Arena: WebDev com 1.691 Elo contra 1.628 do Fable 5.

A tabela de benchmarks da própria Qwen continua forte e ainda é produzida pelo fornecedor. GPQA Diamond 92.6, PaperBench 93.0, Terminal-Bench 2.1 86.6, OSWorld-Verified 86.1 — mas a atualização de 2 de setembro é o primeiro resultado da Qwen a ser classificado em 1º lugar por uma arena independente.

A lacuna de arquitetura na ficha técnica está fechada. O Qwen3.8-2.4T-A95B tem ~95B de parâmetros ativos de um total de 2.4T, distribuídos por 512 especialistas — divulgado no lançamento dos pesos abertos em 12 de agosto. A arquitetura do Fable 5 permanece não divulgada.

Os pesos abertos foram disponibilizados, não apenas prometidos. Qwen3.8-2.4T-A95B (BF16 e FP8) chegou ao Hugging Face e ao ModelScope em 12 de agosto sob uma licença Qwen3.8-Max personalizada, com o Qwen3.8-27B sendo lançado em seguida, em 14 de agosto, sob Apache 2.0. O Fable 5 é fechado e exclusivo para API, permanentemente.

Nota de precisão: os números da própria tabela de benchmark da Alibaba são relatados pelo fornecedor e não foram replicados. Os números independentes aqui possuem carimbo de data/hora e são de terceiros: o Artificial Analysis Intelligence Index (Qwen3.8-Max 56, Claude Fable 5 62, Claude Fable 5.1 66), a listagem Code Arena: WebDev Elo e o quadro semanal geral da Arena — as pontuações da Arena mudam conforme os votos são acumulados, e o #1 do build 0902 está de acordo com o anúncio da Alibaba de uma listagem em um ponto específico no tempo. O SWE-bench Verified de 95,0% do Fable 5 é relatado pela Anthropic; o preço do Qwen é a tabela de preços GA do Alibaba Model Studio.

Especificações e preço, lado a lado

Aqui estão os dados concretos, cada número atribuído à sua fonte.

• Fabricante / status — Qwen3.8-Max: Alibaba; GA em 3 de agosto de 2026; atualização 0902 em 2 de setembro de 2026. Claude Fable 5: Anthropic; GA e carro-chefe.

• Arquitetura — Qwen3.8-Max: 2,4T no total / ~95B ativos, MoE esparso, 512 especialistas (divulgado em 12 de agosto); Fable 5: não divulgado

• Janela de contexto — Qwen3.8-Max: 1M tokens (983.616 com pensamento; saída máxima 131.072); Fable 5: carro-chefe de contexto longo

• AA Intelligence Index — Qwen3.8-Max: 56; Claude Fable 5: 62; Claude Fable 5.1 (Sep 1): 66, lidera

• SWE-bench Verified — Qwen3.8-Max: Não relatado (a Alibaba relata FrontierSWE 73.5 em vez disso); Fable 5: 95,0% (Anthropic / buildfastwithai)

• Pontos fortes independentes + relatados pelo fornecedor — Qwen3.8-Max: Code Arena WebDev #1 com 1.691 (0902, independente); tabela do fornecedor: GPQA Diamond 92,6, PaperBench 93,0, Terminal-Bench 2.1 86,6. Claude Fable 5: AA 62; SWE-bench Verified 95,0%

• Preços (entrada / saída) — Qwen3.8-Max: $2,00 / $6,00 por 1M, fixo em contexto de 1M; entrada em cache $0,25; Fable 5: $10 / $50 por 1M

• Pesos abertos — Qwen3.8-Max: lançado em 12 de agosto de 2026 (licença personalizada, não Apache); Qwen3.8-27B sob Apache 2.0 em 14 de agosto. Fable 5: não — fechado / somente API

• Multimodalidade — Qwen3.8-Max: texto, imagem, vídeo como entrada → texto como saída; Fable 5: carro-chefe multimodal

Duas coisas estruturam toda a comparação. A primeira mudou em 3 de agosto e ainda se mantém; a segunda mudou novamente em 2 de setembro.

Primeiro, a coluna de preços agora é o elemento mais chamativo da página. Em julho, a vantagem de custo da Qwen era um cupom de desconto — 90% de desconto em créditos, temporário, sem uma tarifa por token para servir de base de planejamento. Agora é uma tabela de preços, e a diferença é estrutural, não promocional. Com US$ 6 de saída contra US$ 50 da Fable, você pode fazer aproximadamente oito chamadas Qwen pelo preço de uma chamada Fable. Para qualquer carga de trabalho em que você paga pelo volume, e não pela resposta mais difícil isolada, essa proporção muda a arquitetura do que você constrói.

Segundo, a coluna de benchmarks deixou de ser unilateral. Durante a maior parte de agosto, a leitura honesta era estreita: a Alibaba informou FrontierSWE 73,5 e uma tabela de números obtidos em execução própria; a Anthropic informou 95,0% no SWE-bench Verified verificado por terceiros; e nenhum avaliador independente havia pontuado a Qwen. A build 0902 pôs fim a isso. O Code Arena: WebDev é uma arena cega de votação humana em pares — o projeto anteriormente conhecido como WebDev Arena, administrado por ninguém da Alibaba — e a Qwen3.8-Max-0902 entrou nele em #1, com 1.691 Elo, acima de Claude Opus 5 (1.688), Kimi K3 (1.674) e Claude Fable 5 (1.628, #8). Duas ressalvas mantêm isso honesto: é uma única tabela, medindo desenvolvimento front-end agêntico em vez de capacidade geral, e “estreou em #1” é o anúncio da Alibaba de uma listagem pontual. Mas a afirmação de que a Qwen não tem nenhum avaliador não é mais verdadeira, e isso muda a comparação mais do que qualquer número isolado nela.

O que a diferença de preço realmente lhe proporciona

Múltiplos exemplos abstratos são menos úteis do que um exemplo trabalhado, então aqui está um. Considere um agente de revisão de código que envia 150.000 tokens de contexto do repositório e gera 6.000 tokens de revisão por chamada.

Qwen3.8-Max: 0.15M × $2 = $0.30, mais 0.006M × $6 = $0.036. ≈ $0.34 por chamada.

Claude Fable 5: 0.15M × $10 = $1.50, mais 0.006M × $50 = $0.30. ≈ $1.80 por chamada.

• A 2.000 chamadas/dia: Qwen ≈ $672/dia; Fable ≈ $3.600/dia. Em um mês, isso é aproximadamente $20.000 contra $108.000.

• Com cache de prompt em um contexto de repositório estável, a entrada em cache da Qwen a $0,25/1M reduz o lado de entrada de $0,30 para menos de $0,04, levando a chamada para ≈ $0,08 — cerca de 22× mais barato que a Fable por chamada.

Isso não é uma economia marginal; é a diferença entre rodar um revisor em cada pull request e rodar um apenas nos arriscados. E o contexto de tarifa fixa da Qwen torna o efeito mais forte à medida que os prompts crescem: como a Alibaba não aplica sobretaxa para prompts longos, processar um contexto de 900.000 tokens custa o mesmo por token que um de 5.000 tokens.

O contrapeso honesto é que preço por token não é preço por tarefa resolvida. Se o Fable 5 resolve um problema em uma única passagem onde um modelo mais barato precisa de três tentativas mais correção humana, o modelo mais barato pode custar mais no agregado — e nos trabalhos de raciocínio mais difíceis, a classificação nº 1 auditada do Fable é a melhor evidência disponível de que ele realmente resolve mais em uma única passagem. O argumento de custo para o Qwen é mais forte em cargas de trabalho de alto volume e tolerantes, e mais fraco nas de baixo volume e alto risco.

A nomenclatura 0902: a capacidade saltou, o número da versão não.

O notável sobre 2 de setembro é o que a Alibaba não fez: lançar o Qwen 3.9. A melhoria foi distribuída como um checkpoint datado sob o mesmo nome de modelo — Qwen3.8-Max-0902 — e a API a serviu com o mesmo nome e o mesmo preço. Essa é a direção para a qual a indústria está caminhando: quando um salto de capacidade não garante mais um novo número de versão, “qual modelo devo usar” passa a ser uma questão de builds e datas, e não apenas de nomes de família.

Isso também significa que uma pontuação de benchmark atribuída a “Qwen3.8-Max” tem prazo de validade: uma pontuação medida com base na versão de julho ou agosto pode não descrever o modelo que a API retorna hoje. Verifique o identificador de build no endpoint que você realmente chama — o número 0902 é a diferença entre um modelo que ficou atrás do Claude Fable 5 e um que o lidera no Code Arena: WebDev.

Prova, e por que ainda decide este confronto.

A evidência prática mais citada para o Qwen3.8-Max vem de uma análise da era de preview (thomas-wiegold.com) que submeteu o modelo a quatro builds reais. Os resultados foram genuinamente impressionantes: o Qwen resolveu de primeira uma simulação de pôquer em Go — apenas o terceiro modelo a superar esse prompt em uma única tentativa, ao lado de Fable 5 e Grok 4.5 — e, em um prompt de site para torrefadora de café, produziu a melhor saída que o revisor já tinha visto nesse teste, adicionando, por puro zelo, um carrinho de compras não solicitado, seção de atacado e integração com Instagram.

O problema era a velocidade: mais de 30 minutos no site e 1 hora e 20 minutos na simulação de pôquer, tornando-o o modelo mais lento que aquele revisor já havia usado. Essa constatação agora precisa de uma ressalva da qual não precisava em julho. A medição foi feita na infraestrutura de preview, por um único revisor, em execuções agênticas excepcionalmente longas. O serving de GA é um sistema diferente. Para o que vale, a telemetria de 7 dias da própria OrcaRouter atualmente mostra um p50 do tempo até o primeiro token de 1,64 segundos para o Qwen3.8-Max — uma medição de primeira parte, embora o TTFT e o throughput de ponta a ponta em builds de uma hora sejam grandezas diferentes. A posição honesta é que a constatação de lentidão no preview deve ser retestada em vez de repetida como um fato atual.

O que sobrevive à atualização 0902 é que as evidências mais fortes de cada lado ainda vêm de lugares diferentes. O 1º lugar do Qwen3.8-Max-0902 no Code Arena: WebDev é um resultado independente de votação cega, mas mede um único painel, e a própria tabela de benchmarks da Alibaba continua sendo um artefato do fornecedor — os laboratórios escolhem quais benchmarks reportar, e o número mais fraco reportado pela Alibaba (IFBench 82.8, seguimento de instruções) ainda se alinha com a reclamação da prévia de que o modelo entrega demais e ignora o escopo. As evidências do Claude Fable 5 são mais amplas e em grande parte de terceiros: 62 no Índice de Inteligência AA, 1º no painel geral da Arena, 95,0% no SWE-bench Verified — e o novo Claude Fable 5.1 da própria Anthropic lidera o índice AA com 66 desde 1º de setembro. Em “qual modelo lidará com trabalho que não posso errar”, a resposta de uso geral permanece inalterada. Em “qual modelo entrega o melhor front-end por um décimo do preço”, a resposta se inverteu em 2 de setembro.

Abertura: o eixo em que a Qwen já venceu

Fable 5 nunca será auto-hospedável. Qwen3.8-Max já é: em 12 de agosto, os pesos para Qwen3.8-2.4T-A95B — variante BF16 e uma FP8 oficial — chegaram ao Hugging Face e ao ModelScope, tornando-o o primeiro Qwen da classe Max que qualquer pessoa pode baixar. Duas ressalvas merecem igual peso.

O primeiro é legal. O lançamento é distribuído sob uma licença personalizada “Qwen3.8-Max”, não Apache 2.0: provedores que operam serviços de modelo-como-serviço ou negócios de assistente de trabalho com IA com receita recorrente acima de US$ 50 milhões devem negociar uma licença separada com a Qwen, e produtos comerciais que ultrapassem 100 milhões de usuários ativos mensais ou US$ 20 milhões de receita mensal devem exibir o nome do modelo. Para uso interno e startups, os limites raramente se aplicam — mas isso não é um vale-tudo.

A segunda é física. Um MoE de 2,4T no total chega a aproximadamente 4,9 TB em BF16 (cerca de metade no checkpoint oficial em FP8) contra aproximadamente 141 GB de memória por H200 — portanto, hospedar o modelo principal por conta própria exige um rack de aceleradores antes mesmo de você servir um token. Os ~95B de parâmetros ativos divulgados ao menos permitem estimar o que esse rack proporcionaria. Para quase toda equipe, a API hospedada a US$ 2 / US$ 6 é o caminho prático.

É por isso que o Qwen3.8-27B, cujos pesos sob Apache-2.0 foram lançados em 14 de agosto e que, segundo relatos, roda em ~17GB de VRAM, continua sendo o lançamento de self-host praticamente importante. Se o seu motivo para preferir o Qwen ao Fable 5 é residência de dados ou controle on-premise, em vez de capacidade bruta, o 27B é o modelo que realmente entrega isso — e em ambos os lados a comparação de abertura deixou de ser teórica.

Perguntas Frequentes

Qwen 3.8 é melhor do que Claude Fable 5?

Agora depende do eixo, o que é uma mudança genuína em relação a agosto. Em codificação, o Qwen3.8-Max-0902 lidera: #1 no Code Arena: WebDev, com 1.691 Elo contra 1.628 do Claude Fable 5, a US$ 2 / US$ 6 versus os US$ 10 / US$ 50 do Fable 5. Em qualidade ampla e auditada, o Fable 5 ainda lidera: 62 no AA Intelligence Index contra 56 do Qwen, 95,0% SWE-bench Verified e #1 no ranking geral da Arena. Para trabalhos em que uma resposta errada é cara, o Fable 5 é a opção mais bem documentada; para codificação de alto volume e trabalho web agêntico, o Qwen mais recente é, ao mesmo tempo, mais barato e melhor classificado na arena.

A alegação de "atrás apenas de Fable 5" é verdadeira?

O posicionamento da Alibaba foi feito sem números independentes, e a build 0902 mudou o cenário desde então. O Qwen3.8-Max-0902 fica à frente do Claude Fable 5 no Code Arena: WebDev (1.691 contra 1.628), mas atrás dele no AA Intelligence Index (56 contra 62) e no leaderboard geral da Arena (Qwen nº 20, Elo 1.479; Fable 5 nº 1, Elo 1.508). Ou seja, “perde apenas para o Fable 5” virou “à frente do Fable 5 no leaderboard de codificação que esta atualização tinha em vista, e atrás dele nos leaderboards gerais de propósito amplo”.

Quanto mais barato é o Qwen 3.8 do que o Fable 5?

Substancialmente, e agora é um preço real em vez de um desconto. O Qwen3.8-Max custa US$ 2 / US$ 6 por 1M de tokens, contra US$ 10 / US$ 50 do Fable 5 — cerca de 5× mais barato na entrada e 8× na saída. A tarifa do Qwen também é fixa em todo o contexto de 1M, e a entrada em cache a US$ 0,25/1M torna cargas de trabalho de contexto repetido ainda mais baratas.

O Qwen 3.8 Max saiu do preview?

Sim. Ele atingiu disponibilidade geral em 3 de agosto de 2026 com uma tabela de preços publicada e um endpoint compatível com OpenAI e DashScope. A campanha de créditos Qoder e o enquadramento de pré-visualização com 90% de desconto que circularam em julho não descrevem mais como o modelo é vendido.

O Qwen 3.8 ainda é o modelo mais lento, como diziam as primeiras avaliações?

Essa descoberta veio de um revisor em infraestrutura de pré-visualização executando builds agênticos de uma hora, e deveria ser re-testada contra o serviço GA em vez de ser tratada como fato atual. A telemetria de 7 dias do OrcaRouter mostra um tempo p50 para o primeiro token de 1,64 segundos, embora isso meça a latência do primeiro token em vez do throughput em builds muito longos.

Posso auto-hospedar o Qwen 3.8 em vez de pagar pelo Fable 5?

Sim para Qwen, com ressalvas. O Qwen3.8-2.4T-A95B está disponível para download desde 12 de agosto sob uma licença personalizada (não Apache 2.0), e o Qwen3.8-27B sob Apache 2.0 desde 14 de agosto. A barreira prática é o hardware: um MoE de 2,4T no total precisa de aproximadamente 4,9 TB em BF16 — um rack de aceleradores — então a maioria das equipes ainda usará a API hospedada a US$ 2 / US$ 6 em vez de servir o carro-chefe. O Fable 5 está permanentemente fechado.

Qual devo usar hoje?

Para trabalhos gerais em que uma resposta errada é cara — raciocínio complexo, caminhos de produção de alto risco — o Claude Fable 5 ainda é a escolha mais bem documentada, e o Claude Fable 5.1 da Anthropic amplia essa liderança. Para codificação em grande volume e desenvolvimento web agêntico, o Qwen3.8-Max-0902 agora tem a vantagem independente na arena e um preço de saída cerca de 8× menor: revisão de código em massa, geração de front-end, análise de documentos longos. Muitas equipes devem executar ambos e rotear por tarefa.

Conclusão

Qwen 3.8 vs Claude Fable 5 é uma comparação diferente do que era há um mês, e também é diferente do que era há uma semana. Qwen3.8-Max é um modelo com disponibilidade geral e uma tabela de preços que subcotiza a Fable 5 em 5× na entrada e 8× na saída, fixa ao longo de um milhão de tokens — e desde 2 de setembro o mesmo nome serve a build 0902, que uma arena independente agora classifica como #1 para desenvolvimento web agêntico, acima da Fable 5 nesse ranking.

Nenhum dos dois modelos domina agora toda a comparação. Claude Fable 5 — e a Claude Fable 5.1 da Anthropic, que lidera o AA Intelligence Index com 66 desde 1º de setembro — mantêm a posição no campo amplo, auditado e de uso geral, e a própria tabela de benchmarks da Alibaba continua sendo um artefato de fornecedor. Mas o motivo desse confronto ter sido desequilibrado em julho — o fato de Qwen não ter nenhum árbitro independente — expirou em 2 de setembro: Qwen3.8-Max-0902 é o modelo #1 no Code Arena: WebDev. A resposta sensata ainda é dividir de acordo com o que está em jogo e a tarefa — Fable 5 para raciocínio geral, onde errar é caro; Qwen3.8-Max para codificação em alto volume, onde a diferença de preço e a vantagem na arena jogam a seu favor — e testar ambos com seus próprios prompts.

Comparados neste artigo3

Detectado a partir deste artigo · Benchmarks: Artificial Analysis · atualizado diariamente