
Qwen 3.8 vs GPT-5.6: Agora que Ambos Têm Preço, Qual Vence?
- OrcaNOVOOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 por 1M de tokens
- orcaNOVOOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 por 1M de tokens
- deepseekNOVODeepSeek: DeepSeek V4.1 Flash2026-09-1040Inteligência
- openaiOpenAI: GPT-6 Astra2026-09-0453Inteligência77Código
- googleGoogle: Gemini 3.8 Flash2026-09-0241Inteligência76Código
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Inteligência76Código
- anthropicAnthropic: Claude Fable 5.12026-09-0153Inteligência82Código
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 por 1M de tokens
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Inteligência72Código
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 por 1M de tokens
- z-aiZ.ai: GLM 5.32026-08-1845Inteligência75Código
- obsidianQwen3.8 27B2026-08-1534Inteligência68Código
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Inteligência69Código
- grokSpaceXAI: Grok 4.62026-08-1244Inteligência77Código
- metaMeta: Muse Spark 1.22026-08-0540Inteligência72Código
- qwenQwen: Qwen3.8 Max2026-08-0345Inteligência76Código
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3134Inteligência69Código
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 por 1M de tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
Quando a Alibaba apresentou Qwen3.8-Max em Xangai em 19 de julho de 2026, a reação da comunidade foi imediata: este modelo de 2,4 trilhões de parâmetros estava "supostamente à frente do GPT-5.6 e apenas um pouco atrás do Fable 5." O GPT-5.6 da OpenAI em sua configuração principal Sol está em #2 no índice independente Artificial Analysis Intelligence Index, um ponto abaixo do Fable 5, então essa era uma afirmação ousada para se fazer sem números publicados por trás dela.
Duas coisas mudaram desde então. Qwen3.8-Max tornou-se geralmente disponível em 3 de agosto de 2026 com uma tabela de preços real e uma tabela de benchmarks real. E em 31 de julho, a OpenAI reduziu os preços em toda a família GPT-5.6 — Terra para US$ 2 / US$ 12, Luna para US$ 0,20 / US$ 1,20, com Sol inalterado no nível premium. Portanto, esse confronto não é mais uma afirmação contra um ranking; são dois modelos precificados e documentados que podem de fato ser comparados.
Uma nota para desenvolvedores — a maneira mais rápida de resolver uma disputa como essa é executar ambos nos seus próprios prompts. O OrcaRouter dá acesso a 200+ modelos por meio de um único endpoint compatível com OpenAI, permitindo que você compare o Qwen 3.8 Max com o GPT-5.6 na mesma tarefa sem precisar integrar dois SDKs.
Veredito TL;DR. Qwen3.8-Max no GA está com preço agressivo — $2 / $6 por 1M, tarifa fixa para 1M de tokens — o que o coloca no mesmo preço de entrada do GPT-5.6 Terra, mas metade do custo de saída do Terra, e muito abaixo do Sol. Seus números autorrelatados são fortes (GPQA Diamond 92.6, Terminal-Bench 2.1 86.6). Mas o GPT-5.6 Sol ainda vence nos dois aspectos que decidem o uso em produção: ele é o auditado nº 2 no Índice de Inteligência da Artificial Analysis (~59) e é rápido — com até 750 tokens/segundo em hardware Cerebras. O Qwen3.8-Max permanece sem pontuação de todos os avaliadores independentes. Então, o Qwen pode muito bem igualar o GPT-5.6 em qualidade one-shot e claramente vence o Terra no preço de saída; o GPT-5.6 vence em prova revisada por pares e em throughput, o que, muitas vezes, é o que mais importa.
Principais conclusões
• Qwen3.8-Max está em GA desde 3 de agosto de 2026 com preços publicados de $2 / $6 por 1M de tokens, fixos em todo o contexto de 1M de tokens.
• Em comparação com a GPT-5.6 Terra ($2 / $12 após o corte de 31 de julho da OpenAI), a Qwen iguala no input e reduz à metade a taxa de output. Em comparação com a Sol, a Qwen é dramaticamente mais barata.
• GPT-5.6 Sol é auditado como #2 no AA Intelligence Index (~59), e a Artificial Analysis nota que ele lidera nos problemas de STEM mais difíceis. O Qwen3.8-Max está ainda sem pontuação pela AA e pelo LMArena.
• A velocidade é o contraste mais acentuado. O GPT-5.6 alcança até 750 tokens/seg na Cerebras. O Qwen foi o modelo mais lento em testes práticos de prévia — uma constatação que precede o serviço GA e precisa ser retestada.
• A tabela do fornecedor da Qwen é credível, mas não revisada por pares: GPQA Diamond 92.6, PaperBench 93.0, Terminal-Bench 2.1 86.6, OSWorld-Verified 86.1, FrontierSWE 73.5 (acima dos 40.7 do antecessor).
• A abertura os divide permanentemente: Qwen promete pesos abertos dentro da semana, além de um Qwen3.8-27B com ~17GB de VRAM; o GPT-5.6 é fechado e somente via API.
Nota de precisão: todos os números de qualidade do Qwen3.8-Max são reportados pela Alibaba e não verificados por terceiros. Os números do GPT-5.6 vêm da Artificial Analysis e podem diferir dos relatórios da própria OpenAI. Os preços da família GPT-5.6 refletem a redução da OpenAI de 31 de julho de 2026. O preço do Qwen segue a tabela de preços GA e substitui o desconto de preview de julho.
Especificações e preço, lado a lado
Aqui estão os dados concretos, cada número atribuído à sua fonte.
• Fabricante / status — Qwen3.8-Max: Alibaba; GA (3 de agosto de 2026); GPT-5.6 Sol: OpenAI; carro-chefe fechado (variantes Sol / Terra / Luna)
• Arquitetura — Qwen3.8-Max: ~2,4T total, MoE esparso (parâmetros ativos ainda não divulgados); GPT-5.6 Sol: Fechado; arquitetura não divulgada
• Janela de contexto — Qwen3.8-Max: 1M tokens (983.616 com raciocínio; saída máxima 131.072); GPT-5.6 Sol: carro-chefe de contexto longo
• AA Intelligence Index — Qwen3.8-Max: Ainda sem pontuação; GPT-5.6 Sol: ~59 — #2 (Artificial Analysis)
• Pontos fortes auditados — Qwen3.8-Max: Nenhum de terceiros; GPT-5.6 Sol: Lidera os problemas de STEM mais difíceis (Artificial Analysis)
• Pontos fortes relatados pelo fornecedor — Qwen3.8-Max: GPQA Diamond 92.6, Terminal-Bench 2.1 86.6, OSWorld-Verified 86.1 (relatado pela Alibaba); GPT-5.6 Sol: n/d
• Velocidade — Qwen3.8-Max: p50 TTFT 1.64s (telemetria de 7 dias do OrcaRouter); modelo mais lento nos testes práticos de pré-visualização; GPT-5.6 Sol: Até 750 tok/s em Cerebras (Artificial Analysis)
• Preços (entrada / saída) — Qwen3.8-Max: $2,00 / $6,00 por 1M, fixo; entrada em cache $0,25; GPT-5.6: Terra $2 / $12, Luna $0,20 / $1,20, Sol premium (~1/3 do custo da Fable por AA)
• Pesos abertos — Qwen3.8-Max: Prometido para esta semana (sem licença ainda); GPT-5.6: Não — fechado / somente API
Dois fatores enquadram esta comparação, e ambos são novos desde julho.
Primeiro, a história dos preços ficou genuinamente interessante, e não apenas barata. Em julho, a vantagem da Qwen era um desconto imprevisível. Agora a comparação é concreta e se divide por faixa. Contra Terra a $2 / $12, a Qwen iguala exatamente a taxa de entrada e reduz pela metade a taxa de saída — uma vantagem real para trabalhos com alto uso de raciocínio, onde a saída domina o gasto. Contra Luna a $0.20 / $1.20, a Qwen é 10× mais cara, e a Luna é a melhor escolha para tarefas simples de alto volume. Contra Sol, a Qwen é muito mais barata. Então "qual é mais barata" agora tem três respostas diferentes, dependendo de qual GPT-5.6 você quer dizer — e a leitura honesta é que o corte da OpenAI em 31 de julho reduziu consideravelmente a diferença.
Em segundo lugar, a linha da velocidade ainda é onde esses dois mais divergem, e ela ainda favorece a OpenAI. A Artificial Analysis mede o GPT-5.6 Sol em até 750 tokens/seg no silício da Cerebras. Nada nos materiais de GA da Alibaba sugere que o Qwen3.8-Max seja projetado para esse tipo de throughput, e o revisor da era de preview que disse que era o modelo mais lento que já havia usado estava medindo exatamente as execuções longas de agentes em que o throughput se acumula. Se a sua carga de trabalho é interativa, baseada em agentes ou de alto volume, essa diferença pode decidir o confronto antes que a qualidade entre em pauta.

Prova: o que a tabela de benchmark GA resolve e não resolve
A decisão da Alibaba de publicar números no GA é uma melhoria real em relação à prévia, onde a frase da comunidade "à frente do GPT-5.6" não se baseava em nada publicado. A tabela é sólida: GPQA Diamond 92.6 em ciência de nível de pós-graduação, PaperBench 93.0 em reprodução de resultados de pesquisa, Terminal-Bench 2.1 86.6 em operar um shell real, OSWorld-Verified 86.1 em operar uma GUI de desktop. O salto geracional em codificação é o destaque — FrontierSWE 73.5 contra os 40.7 do antecessor, e DeepSWE 1.1 56.6 contra 21.6.
O que a tabela não faz é resolver a comparação GPT-5.6, por duas razões.
A primeira é a proveniência. Cada número foi produzido pela Alibaba em sua própria plataforma de testes. As tabelas dos fornecedores são escolhidas, não amostradas — um laboratório publica os benchmarks em que se sai bem e omite o restante. O ranking #2 do Intelligence Index da OpenAI, por outro lado, foi atribuído por um avaliador sem interesse no resultado. Notavelmente, a Artificial Analysis credita especificamente ao GPT-5.6 Sol a liderança nos mais difíceis problemas de STEM, que é exatamente o território que o GPQA Diamond 92.6 da Qwen pretende reivindicar. Uma dessas afirmações foi verificada.
O segundo é que o número mais fraco da própria Alibaba é revelador. IFBench 82.8 — seguir instruções sob restrição — é a pontuação mais baixa da sua tabela, e isso se alinha exatamente com a crítica mais consistente do período de prévia: o modelo entrega demais, excede o escopo e acrescenta coisas que ninguém pediu. Isso é charmoso em uma demo e caro quando a saída é cobrada a US$ 6 por milhão de tokens e você precisa de um formato exato. Para pipelines de agentes onde as etapas posteriores analisam a saída, a disciplina de seguir instruções importa mais do que um ponto no GPQA.
Para ancoragem: o predecessor Qwen3.7-Max obteve 46 no AA Intelligence Index contra o ~59 do GPT-5.6 Sol. Fechar treze pontos em uma geração seria um salto extraordinário. Possível — o próprio FrontierSWE da Alibaba, que quase dobrou, sugere progresso real — mas até que um árbitro publique um número, "à frente do GPT-5.6" continua uma alegação não comprovada, e não um resultado.

Custo na prática: um exemplo resolvido entre os níveis
Considere um agente de raciocínio enviando 100.000 tokens de contexto e gerando 10.000 tokens de saída por chamada — uma configuração típica de análise de documentos ou planejamento em múltiplas etapas.
• Qwen3.8-Max: 0,1M × $2 = $0,20, mais 0,01M × $6 = $0,06. ≈ $0,26 por chamada.
• GPT-5.6 Terra: 0.1M × $2 = $0.20, mais 0.01M × $12 = $0.12. ≈ $0.32 por chamada.
• GPT-5.6 Luna: 0.1M × $0.20 = $0.02, mais 0.01M × $1.20 = $0.012. ≈ $0.03 por chamada.
• A 5.000 chamadas/dia: Qwen ≈ $1.300, Terra ≈ $1.600, Luna ≈ $160.
Duas lições emergem. Contra a Terra, a economia da Qwen é real, mas modesta — cerca de 19% neste formato — e está longe da vantagem de ordem de magnitude que a Qwen tem sobre modelos premium como Fable 5 ou Sol. Quem assumiu que a OpenAI era estruturalmente cara deve atualizar: o corte de 31 de julho fez a maior parte do trabalho de neutralizar a narrativa de preços da Qwen no nível intermediário.
Onde a Qwen se destaca nitidamente é no contexto longo e no cache. Como a taxa de $2/$6 é plana em toda a janela de 1M de tokens, um prompt de 900.000 tokens custa o mesmo por token que um curto, enquanto muitos concorrentes cobram sobretaxa por entradas longas. E a entrada em cache a $0,25 por 1M reduz o lado da entrada em 8× em cargas de trabalho com contexto repetido: a chamada acima cai de $0,26 para cerca de $0,09 depois que o contexto é armazenado em cache. Se o seu agente relê um contexto majoritariamente estável a cada turno, é aí que está a vantagem duradoura — não na taxa anunciada.
Abertura e o irmão de 27B
GPT-5.6 nunca será auto-hospedável. Qwen3.8-Max talvez seja — a Alibaba agora diz que os pesos chegam dentro da semana — mas o carro-chefe não é um alvo prático: cerca de 1,2 TB em 4-bit contra aproximadamente 141 GB por H200 significa oito ou mais aceleradores de ponta, e com a contagem de parâmetros ativos ainda não divulgada, você não consegue nem modelar o throughput que isso proporciona. Também ainda não há texto de licença, o que significa que a usabilidade comercial está formalmente indeterminada.
Anunciado simultaneamente, o Qwen3.8-27B é o lançamento mais relevante para quem se interessa pela Qwen em termos de controle, e não de capacidade bruta. Também com pesos abertos, ele roda, segundo relatos, em cerca de 17GB de VRAM — uma única placa de consumo de alto desempenho — o que o torna uma opção genuinamente on-premise, de uma forma que o carro-chefe de 2.4T nunca será. Se você está comparando Qwen com GPT-5.6 porque precisa de residência de dados, o 27B é o modelo a avaliar.
Perguntas Frequentes
O Qwen 3.8 é melhor que o GPT-5.6?
Não com base nas evidências que existem. A tabela GA da Alibaba é forte (GPQA Diamond 92.6, Terminal-Bench 2.1 86.6), mas totalmente autorrelatada, e nenhum avaliador independente pontuou o modelo. O GPT-5.6 Sol detém o 2º lugar auditado no Índice de Inteligência (~59), lidera os problemas de STEM mais difíceis segundo a Artificial Analysis e atinge até 750 tokens/seg. O GPT-5.6 vence em prova e velocidade.
A afirmação "Qwen 3.8 está à frente do GPT-5.6" é verdadeira?
Começou como um sentimento da comunidade e ainda não foi verificado. A GA trouxe a própria tabela de benchmarks da Alibaba, mas nenhuma pontuação de terceiros — Artificial Analysis e LMArena continuam sem pontuação. O predecessor Qwen3.7-Max marcou 46 contra ~59 do Sol, então a alegação precisa de um salto muito grande de uma única geração para se sustentar literalmente.
Qual é mais barato, Qwen 3.8 ou GPT-5.6?
Depende do nível, e a resposta mudou em 31 de julho quando a OpenAI reduziu os preços. Qwen3.8-Max custa $2 / $6 por 1M. GPT-5.6 Terra é $2 / $12 — mesma entrada, dobro da saída, então Qwen vence nesse quesito. Luna é $0.20 / $1.20, tornando-a cerca de 10× mais barata que a Qwen. Sol é premium, então Qwen é muito mais barata que a Sol.
Qual é mais rápido?
GPT-5.6, decisivamente em throughput. A Artificial Analysis relata até 750 tokens/segundo em hardware Cerebras. Qwen3.8-Max mostra um p50 de tempo-para-primeiro-token de 1,64 segundos na telemetria de 7 dias do OrcaRouter, mas revisores da era de prévia o acharam muito lento em builds agênticas longas — essa descoberta precede o serviço GA e merece um novo teste.
O Qwen 3.8 Max saiu do preview?
Sim, em 3 de agosto de 2026. Agora possui uma tabela de preços publicada e um endpoint compatível com OpenAI e DashScope, portanto a abordagem de julho de uma campanha de créditos Qoder com 90% de desconto não descreve mais como é vendido.
Posso hospedar o Qwen 3.8 por conta própria para evitar os preços da OpenAI?
Não é o carro-chefe, realisticamente. Os pesos são prometidos dentro da semana, mas nenhuma licença foi publicada, e com ~1,2 TB em 4 bits você precisaria de oito ou mais GPUs da classe H200. O Qwen3.8-27B, anunciado simultaneamente, com cerca de 17 GB de VRAM, é a opção prática.
Qual devo usar hoje?
GPT-5.6 Sol para qualquer coisa sensível à latência, interativa ou crítica em termos de raciocínio, onde a qualidade auditada importa. Luna para tarefas simples de alto volume, onde é a mais barata por ampla margem. Qwen3.8-Max onde contexto longo e cache de prompts dominam sua fatura — sua tarifa fixa de 1M de tokens e entrada em cache de US$ 0,25 são os pontos mais fortes de sua oferta.
Conclusão
Qwen 3.8 vs GPT-5.6é uma disputa mais equilibrada do que era em julho e um pouco menos unilateral no preço do que os fãs da Qwen esperavam. Qwen3.8-Max chegou ao GA com preços reais, uma tabela de benchmarks autorrelatados confiável e uma tarifa fixa de 1M de tokens, além de cache barato, o que o torna genuinamente atraente para trabalhos de contexto longo. Essas são vantagens estruturais, não promocionais.
Mas o corte de preços da OpenAI em 31 de julho enfraqueceu o argumento de custo no nível intermediário — a Terra agora iguala a Qwen na entrada — e a GPT-5.6 ainda detém as duas propriedades decisivas: uma classificação nº 2 auditada por um avaliador sem interesse no resultado, e throughput de até 750 tokens/seg que a Qwen não mostrou evidência de alcançar. Observe dois eventos: a primeira pontuação independente do Intelligence Index para a Qwen3.8-Max, e a chegada dos pesos com uma licença. Até lá, roteie pela forma — GPT-5.6 quando velocidade e comprovação importarem, Qwen quando comprimento de contexto e cache hits dominarem a conta — e verifique com seus próprios prompts.

Comparados neste artigo3
Detectado a partir deste artigo · Benchmarks: Artificial Analysis · atualizado diariamente
