Qwen 3.8 vs GPT-5.6: Agora que Ambos Têm Preço, Qual Vence?
Guides & Insights

Qwen 3.8 vs GPT-5.6: Agora que Ambos Têm Preço, Qual Vence?

Autor

jinhao song

Data de publicação

Modelos mais recentes · 20Ver todos os modelos
Benchmarks: Artificial Analysis · atualizado diariamente
Voltar para todas as publicações

When Alibaba previewed Qwen3.8-Max in Shanghai on July 19, 2026, the community reaction was immediate: this 2.4-trillion-parameter model was "supposedly ahead of GPT-5.6 and only slightly behind Fable 5." OpenAI's GPT-5.6 in its flagship Sol configuration sits at #2 on the independent Artificial Analysis Intelligence Index, one point below Fable 5, so that was a large claim to make with no published numbers behind it.

Duas coisas mudaram desde então. Qwen3.8-Max tornou-se geralmente disponível em 3 de agosto de 2026 com uma tabela de preços real e uma tabela de benchmarks real. E em 31 de julho, a OpenAI reduziu os preços em toda a família GPT-5.6 — Terra para US$ 2 / US$ 12, Luna para US$ 0,20 / US$ 1,20, com Sol inalterado no nível premium. Portanto, esse confronto não é mais uma afirmação contra um ranking; são dois modelos precificados e documentados que podem de fato ser comparados.

Uma nota para desenvolvedores — a maneira mais rápida de resolver uma disputa como essa é executar ambos nos seus próprios prompts. O OrcaRouter dá acesso a 200+ modelos por meio de um único endpoint compatível com OpenAI, permitindo que você compare o Qwen 3.8 Max com o GPT-5.6 na mesma tarefa sem precisar integrar dois SDKs.

Veredito TL;DR. Qwen3.8-Max no GA está com preço agressivo — $2 / $6 por 1M, tarifa fixa para 1M de tokens — o que o coloca no mesmo preço de entrada do GPT-5.6 Terra, mas metade do custo de saída do Terra, e muito abaixo do Sol. Seus números autorrelatados são fortes (GPQA Diamond 92.6, Terminal-Bench 2.1 86.6). Mas o GPT-5.6 Sol ainda vence nos dois aspectos que decidem o uso em produção: ele é o auditado nº 2 no Índice de Inteligência da Artificial Analysis (~59) e é rápido — com até 750 tokens/segundo em hardware Cerebras. O Qwen3.8-Max permanece sem pontuação de todos os avaliadores independentes. Então, o Qwen pode muito bem igualar o GPT-5.6 em qualidade one-shot e claramente vence o Terra no preço de saída; o GPT-5.6 vence em prova revisada por pares e em throughput, o que, muitas vezes, é o que mais importa.

Principais conclusões

Qwen3.8-Max está em GA desde 3 de agosto de 2026 com preços publicados de $2 / $6 por 1M de tokens, fixos em todo o contexto de 1M de tokens.

Em comparação com a GPT-5.6 Terra ($2 / $12 após o corte de 31 de julho da OpenAI), a Qwen iguala no input e reduz à metade a taxa de output. Em comparação com a Sol, a Qwen é dramaticamente mais barata.

GPT-5.6 Sol é auditado como #2 no AA Intelligence Index (~59), e a Artificial Analysis nota que ele lidera nos problemas de STEM mais difíceis. O Qwen3.8-Max está ainda sem pontuação pela AA e pelo LMArena.

A velocidade é o contraste mais acentuado. O GPT-5.6 alcança até 750 tokens/seg na Cerebras. O Qwen foi o modelo mais lento em testes práticos de prévia — uma constatação que precede o serviço GA e precisa ser retestada.

A tabela do fornecedor da Qwen é credível, mas não revisada por pares: GPQA Diamond 92.6, PaperBench 93.0, Terminal-Bench 2.1 86.6, OSWorld-Verified 86.1, FrontierSWE 73.5 (acima dos 40.7 do antecessor).

A abertura os divide permanentemente: Qwen promete pesos abertos dentro da semana, além de um Qwen3.8-27B com ~17GB de VRAM; o GPT-5.6 é fechado e somente via API.

Nota de precisão: todos os números de qualidade do Qwen3.8-Max são reportados pela Alibaba e não verificados por terceiros. Os números do GPT-5.6 vêm da Artificial Analysis e podem diferir dos relatórios da própria OpenAI. Os preços da família GPT-5.6 refletem a redução da OpenAI de 31 de julho de 2026. O preço do Qwen segue a tabela de preços GA e substitui o desconto de preview de julho.

Especificações e preço, lado a lado

Aqui estão os dados concretos, cada número atribuído à sua fonte.

• Fabricante / status — Qwen3.8-Max: Alibaba; GA (3 de agosto de 2026); GPT-5.6 Sol: OpenAI; carro-chefe fechado (variantes Sol / Terra / Luna)

• Arquitetura — Qwen3.8-Max: ~2,4T total, MoE esparso (parâmetros ativos ainda não divulgados); GPT-5.6 Sol: Fechado; arquitetura não divulgada

• Janela de contexto — Qwen3.8-Max: 1M tokens (983.616 com raciocínio; saída máxima 131.072); GPT-5.6 Sol: carro-chefe de contexto longo

• AA Intelligence Index — Qwen3.8-Max: Ainda sem pontuação; GPT-5.6 Sol: ~59 — #2 (Artificial Analysis)

• Pontos fortes auditados — Qwen3.8-Max: Nenhum de terceiros; GPT-5.6 Sol: Lidera os problemas de STEM mais difíceis (Artificial Analysis)

• Pontos fortes relatados pelo fornecedor — Qwen3.8-Max: GPQA Diamond 92.6, Terminal-Bench 2.1 86.6, OSWorld-Verified 86.1 (relatado pela Alibaba); GPT-5.6 Sol: n/d

• Velocidade — Qwen3.8-Max: p50 TTFT 1.64s (telemetria de 7 dias do OrcaRouter); modelo mais lento nos testes práticos de pré-visualização; GPT-5.6 Sol: Até 750 tok/s em Cerebras (Artificial Analysis)

• Preços (entrada / saída) — Qwen3.8-Max: $2,00 / $6,00 por 1M, fixo; entrada em cache $0,25; GPT-5.6: Terra $2 / $12, Luna $0,20 / $1,20, Sol premium (~1/3 do custo da Fable por AA)

• Pesos abertos — Qwen3.8-Max: Prometido para esta semana (sem licença ainda); GPT-5.6: Não — fechado / somente API

Dois fatores enquadram esta comparação, e ambos são novos desde julho.

Primeiro, a história dos preços ficou genuinamente interessante, e não apenas barata. Em julho, a vantagem da Qwen era um desconto imprevisível. Agora a comparação é concreta e se divide por faixa. Contra Terra a $2 / $12, a Qwen iguala exatamente a taxa de entrada e reduz pela metade a taxa de saída — uma vantagem real para trabalhos com alto uso de raciocínio, onde a saída domina o gasto. Contra Luna a $0.20 / $1.20, a Qwen é 10× mais cara, e a Luna é a melhor escolha para tarefas simples de alto volume. Contra Sol, a Qwen é muito mais barata. Então "qual é mais barata" agora tem três respostas diferentes, dependendo de qual GPT-5.6 você quer dizer — e a leitura honesta é que o corte da OpenAI em 31 de julho reduziu consideravelmente a diferença.

Em segundo lugar, a linha da velocidade ainda é onde esses dois mais divergem, e ela ainda favorece a OpenAI. A Artificial Analysis mede o GPT-5.6 Sol em até 750 tokens/seg no silício da Cerebras. Nada nos materiais de GA da Alibaba sugere que o Qwen3.8-Max seja projetado para esse tipo de throughput, e o revisor da era de preview que disse que era o modelo mais lento que já havia usado estava medindo exatamente as execuções longas de agentes em que o throughput se acumula. Se a sua carga de trabalho é interativa, baseada em agentes ou de alto volume, essa diferença pode decidir o confronto antes que a qualidade entre em pauta.

Prova: o que a tabela de benchmark GA resolve e não resolve

A decisão da Alibaba de publicar números no GA é uma melhoria real em relação à prévia, onde a frase da comunidade "à frente do GPT-5.6" não se baseava em nada publicado. A tabela é sólida: GPQA Diamond 92.6 em ciência de nível de pós-graduação, PaperBench 93.0 em reprodução de resultados de pesquisa, Terminal-Bench 2.1 86.6 em operar um shell real, OSWorld-Verified 86.1 em operar uma GUI de desktop. O salto geracional em codificação é o destaque — FrontierSWE 73.5 contra os 40.7 do antecessor, e DeepSWE 1.1 56.6 contra 21.6.

O que a tabela não faz é resolver a comparação GPT-5.6, por duas razões.

A primeira é a proveniência. Cada número foi produzido pela Alibaba em sua própria plataforma de testes. As tabelas dos fornecedores são escolhidas, não amostradas — um laboratório publica os benchmarks em que se sai bem e omite o restante. O ranking #2 do Intelligence Index da OpenAI, por outro lado, foi atribuído por um avaliador sem interesse no resultado. Notavelmente, a Artificial Analysis credita especificamente ao GPT-5.6 Sol a liderança nos mais difíceis problemas de STEM, que é exatamente o território que o GPQA Diamond 92.6 da Qwen pretende reivindicar. Uma dessas afirmações foi verificada.

O segundo é que o número mais fraco da própria Alibaba é revelador. IFBench 82.8 — seguir instruções sob restrição — é a pontuação mais baixa da sua tabela, e isso se alinha exatamente com a crítica mais consistente do período de prévia: o modelo entrega demais, excede o escopo e acrescenta coisas que ninguém pediu. Isso é charmoso em uma demo e caro quando a saída é cobrada a US$ 6 por milhão de tokens e você precisa de um formato exato. Para pipelines de agentes onde as etapas posteriores analisam a saída, a disciplina de seguir instruções importa mais do que um ponto no GPQA.

Para ancoragem: o predecessor Qwen3.7-Max obteve 46 no AA Intelligence Index contra o ~59 do GPT-5.6 Sol. Fechar treze pontos em uma geração seria um salto extraordinário. Possível — o próprio FrontierSWE da Alibaba, que quase dobrou, sugere progresso real — mas até que um árbitro publique um número, "à frente do GPT-5.6" continua uma alegação não comprovada, e não um resultado.

Custo na prática: um exemplo resolvido entre os níveis

Considere um agente de raciocínio enviando 100.000 tokens de contexto e gerando 10.000 tokens de saída por chamada — uma configuração típica de análise de documentos ou planejamento em múltiplas etapas.

Qwen3.8-Max: 0,1M × $2 = $0,20, mais 0,01M × $6 = $0,06. ≈ $0,26 por chamada.

GPT-5.6 Terra: 0.1M × $2 = $0.20, mais 0.01M × $12 = $0.12. ≈ $0.32 por chamada.

GPT-5.6 Luna: 0.1M × $0.20 = $0.02, mais 0.01M × $1.20 = $0.012. ≈ $0.03 por chamada.

• A 5.000 chamadas/dia: Qwen ≈ $1.300, Terra ≈ $1.600, Luna ≈ $160.

Duas lições emergem. Contra a Terra, a economia da Qwen é real, mas modesta — cerca de 19% neste formato — e está longe da vantagem de ordem de magnitude que a Qwen tem sobre modelos premium como Fable 5 ou Sol. Quem assumiu que a OpenAI era estruturalmente cara deve atualizar: o corte de 31 de julho fez a maior parte do trabalho de neutralizar a narrativa de preços da Qwen no nível intermediário.

Onde a Qwen se destaca nitidamente é no contexto longo e no cache. Como a taxa de $2/$6 é plana em toda a janela de 1M de tokens, um prompt de 900.000 tokens custa o mesmo por token que um curto, enquanto muitos concorrentes cobram sobretaxa por entradas longas. E a entrada em cache a $0,25 por 1M reduz o lado da entrada em 8× em cargas de trabalho com contexto repetido: a chamada acima cai de $0,26 para cerca de $0,09 depois que o contexto é armazenado em cache. Se o seu agente relê um contexto majoritariamente estável a cada turno, é aí que está a vantagem duradoura — não na taxa anunciada.

Abertura e o irmão de 27B

GPT-5.6 nunca será auto-hospedável. Qwen3.8-Max talvez seja — a Alibaba agora diz que os pesos chegam dentro da semana — mas o carro-chefe não é um alvo prático: cerca de 1,2 TB em 4-bit contra aproximadamente 141 GB por H200 significa oito ou mais aceleradores de ponta, e com a contagem de parâmetros ativos ainda não divulgada, você não consegue nem modelar o throughput que isso proporciona. Também ainda não há texto de licença, o que significa que a usabilidade comercial está formalmente indeterminada.

Anunciado simultaneamente, o Qwen3.8-27B é o lançamento mais relevante para quem se interessa pela Qwen em termos de controle, e não de capacidade bruta. Também com pesos abertos, ele roda, segundo relatos, em cerca de 17GB de VRAM — uma única placa de consumo de alto desempenho — o que o torna uma opção genuinamente on-premise, de uma forma que o carro-chefe de 2.4T nunca será. Se você está comparando Qwen com GPT-5.6 porque precisa de residência de dados, o 27B é o modelo a avaliar.

Perguntas Frequentes

O Qwen 3.8 é melhor que o GPT-5.6?

Não com base nas evidências que existem. A tabela GA da Alibaba é forte (GPQA Diamond 92.6, Terminal-Bench 2.1 86.6), mas totalmente autorrelatada, e nenhum avaliador independente pontuou o modelo. O GPT-5.6 Sol detém o 2º lugar auditado no Índice de Inteligência (~59), lidera os problemas de STEM mais difíceis segundo a Artificial Analysis e atinge até 750 tokens/seg. O GPT-5.6 vence em prova e velocidade.

A afirmação "Qwen 3.8 está à frente do GPT-5.6" é verdadeira?

Começou como um sentimento da comunidade e ainda não foi verificado. A GA trouxe a própria tabela de benchmarks da Alibaba, mas nenhuma pontuação de terceiros — Artificial Analysis e LMArena continuam sem pontuação. O predecessor Qwen3.7-Max marcou 46 contra ~59 do Sol, então a alegação precisa de um salto muito grande de uma única geração para se sustentar literalmente.

Qual é mais barato, Qwen 3.8 ou GPT-5.6?

Depende do nível, e a resposta mudou em 31 de julho quando a OpenAI reduziu os preços. Qwen3.8-Max custa $2 / $6 por 1M. GPT-5.6 Terra é $2 / $12 — mesma entrada, dobro da saída, então Qwen vence nesse quesito. Luna é $0.20 / $1.20, tornando-a cerca de 10× mais barata que a Qwen. Sol é premium, então Qwen é muito mais barata que a Sol.

Qual é mais rápido?

GPT-5.6, decisivamente em throughput. A Artificial Analysis relata até 750 tokens/segundo em hardware Cerebras. Qwen3.8-Max mostra um p50 de tempo-para-primeiro-token de 1,64 segundos na telemetria de 7 dias do OrcaRouter, mas revisores da era de prévia o acharam muito lento em builds agênticas longas — essa descoberta precede o serviço GA e merece um novo teste.

O Qwen 3.8 Max saiu do preview?

Sim, em 3 de agosto de 2026. Agora possui uma tabela de preços publicada e um endpoint compatível com OpenAI e DashScope, portanto a abordagem de julho de uma campanha de créditos Qoder com 90% de desconto não descreve mais como é vendido.

Posso hospedar o Qwen 3.8 por conta própria para evitar os preços da OpenAI?

Não é o carro-chefe, realisticamente. Os pesos são prometidos dentro da semana, mas nenhuma licença foi publicada, e com ~1,2 TB em 4 bits você precisaria de oito ou mais GPUs da classe H200. O Qwen3.8-27B, anunciado simultaneamente, com cerca de 17 GB de VRAM, é a opção prática.

Qual devo usar hoje?

GPT-5.6 Sol para qualquer coisa sensível à latência, interativa ou crítica em termos de raciocínio, onde a qualidade auditada importa. Luna para tarefas simples de alto volume, onde é a mais barata por ampla margem. Qwen3.8-Max onde contexto longo e cache de prompts dominam sua fatura — sua tarifa fixa de 1M de tokens e entrada em cache de US$ 0,25 são os pontos mais fortes de sua oferta.

Conclusão

Qwen 3.8 vs GPT-5.6é uma disputa mais equilibrada do que era em julho e um pouco menos unilateral no preço do que os fãs da Qwen esperavam. Qwen3.8-Max chegou ao GA com preços reais, uma tabela de benchmarks autorrelatados confiável e uma tarifa fixa de 1M de tokens, além de cache barato, o que o torna genuinamente atraente para trabalhos de contexto longo. Essas são vantagens estruturais, não promocionais.

Mas o corte de preços da OpenAI em 31 de julho enfraqueceu o argumento de custo no nível intermediário — a Terra agora iguala a Qwen na entrada — e a GPT-5.6 ainda detém as duas propriedades decisivas: uma classificação nº 2 auditada por um avaliador sem interesse no resultado, e throughput de até 750 tokens/seg que a Qwen não mostrou evidência de alcançar. Observe dois eventos: a primeira pontuação independente do Intelligence Index para a Qwen3.8-Max, e a chegada dos pesos com uma licença. Até lá, roteie pela forma — GPT-5.6 quando velocidade e comprovação importarem, Qwen quando comprimento de contexto e cache hits dominarem a conta — e verifique com seus próprios prompts.

Comparados neste artigo4

Detectado a partir deste artigo · Benchmarks: Artificial Analysis · atualizado diariamente

© 2026 OrcaRouter

Para provedores

Opera uma plataforma de inferência? Traga seus modelos para o OrcaRouter.

Fale conosco

Junte-se à comunidade

DiscordEmailXGitHubYouTube