
Grok 4.7 vs Qwen 3.8 Max: Preço Idêntico, Separados por Um Ponto, Formatos Opostos
- OrcaNOVOOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 por 1M de tokens
- orcaNOVOOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 por 1M de tokens
- deepseekNOVODeepSeek: DeepSeek V4.1 Flash2026-09-1040Inteligência
- openaiOpenAI: GPT-6 Astra2026-09-0453Inteligência77Código
- googleGoogle: Gemini 3.8 Flash2026-09-0241Inteligência76Código
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Inteligência76Código
- anthropicAnthropic: Claude Fable 5.12026-09-0153Inteligência82Código
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 por 1M de tokens
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Inteligência72Código
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 por 1M de tokens
- z-aiZ.ai: GLM 5.32026-08-1845Inteligência75Código
- obsidianQwen3.8 27B2026-08-1534Inteligência68Código
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Inteligência69Código
- grokSpaceXAI: Grok 4.62026-08-1244Inteligência77Código
- metaMeta: Muse Spark 1.22026-08-0540Inteligência72Código
- qwenQwen: Qwen3.8 Max2026-08-0345Inteligência76Código
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3134Inteligência69Código
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 por 1M de tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
Dois modelos de ponta fechados, ambos a US$ 2 por milhão de tokens de entrada e US$ 6 por milhão de tokens de saída, ambos com pontuação dentro de um único ponto um do outro no mesmo benchmark independente, lançados com dezenove dias de diferença. Grok 4.7 chegou em 21 de setembro de 2026, da SpaceXAI; Qwen 3.8 Max foi lançado pelo fornecedor em 3 de agosto de 2026 e atualizado em 2 de setembro de 2026. No atual Artificial Analysis Intelligence Index, versão v4.3.2, Grok 4.7 obtém 46 pontos e Qwen 3.8 Max obtém 45. Em preço e em capacidade medida, esses dois modelos são a mesma compra. Em todo o resto — contexto, modalidade, velocidade de serviço, abertura e o que cada fornecedor escolheu otimizar — eles não poderiam ser mais diferentes, e é isso que torna esta comparação digna de ser feita em vez de ignorada.
Primeiro, a linha do tempo, porque o Qwen 3.8 Max tem duas datas
Isso causa confusão em muita cobertura, então vale esclarecer logo de início. O Qwen 3.8 Max foi lançado em 3 de agosto de 2026 como o maior e mais capaz modelo da Alibaba, construído a partir da arquitetura de visão e linguagem do Qwen 3.5 em um design esparso de mistura de especialistas, relatado com 2,4 trilhões de parâmetros totais e 95 bilhões ativos por token. Em 2 de setembro de 2026, a Alibaba lançou uma compilação atualizada — a revisão 0902, que é a versão que carrega os IDs de modelo atuais e a versão à qual o Artificial Analysis atribui a data de sua página. Se você viu tanto uma data de agosto quanto uma de setembro para o Qwen 3.8 Max, é por isso: uma é o lançamento, a outra é a revisão à qual a maioria das pessoas realmente se refere hoje.
O Grok 4.7 tem um histórico mais limpo e um mais bagunçado por trás dele. A SpaceXAI o lançou em 21 de setembro de 2026, após um lançamento que sofreu repetidos adiamentos — Musk havia apontado janelas no fim de agosto, no início de setembro e em meados de setembro antes de o modelo finalmente ser disponibilizado. O lançamento em si foi restrito: um modelo base maior que o do Grok 4.6, uma corrida de aprendizado por reforço mais longa voltada para tarefas de várias horas, e nenhuma mudança na tabela de tarifas de US$ 2/US$ 6 que o Grok 4.6 mantinha desde 12 de agosto.
O que cada fornecedor otimizou
Leia os dois anúncios de lançamento como um par e as apostas de design estão quase perfeitamente opostas.
A SpaceXAI otimizou para execução agêntica. Os números do Grok 4.7 relatados pelo fornecedor concentram-se em trabalho de terminal e repositório: Terminal-Bench 4.0 em 38,0% contra 20,3% do Grok 4.6, CursorBench 4.0 em 46,3%, DeepSWE v1.1 em 71,0% com alto esforço de raciocínio, EEBench em 64,0%. A própria descrição do lançamento feita pela empresa nomeia a autoverificação e o tratamento de contexto longo dentro do ambiente Grok Bot como os alvos. O Grok 4.7 atende a uma janela de 500.000 tokens, aceita texto e imagens na entrada, retorna texto e expõe esforço de raciocínio de low a xhigh. É um modelo criado para concluir tarefas.
A Alibaba otimizou para alcance. O Qwen 3.8 Max oferece uma janela de contexto de aproximadamente 984.000 tokens — efetivamente um milhão — e seus pontos fortes publicados são a amplitude, e não a profundidade em uma única área: uma pontuação de 86,6 no Terminal Bench 2.1, SWE-bench Pro com 67,7, PaperBench com 93,0, GPQA Diamond com 92,6, MMMU-Pro com 82,3, OSWorld-Verified com 86,1. Ele aceita entrada de texto, imagem e vídeo e retorna texto, oferece suporte a níveis de esforço de raciocínio, com xhigh como padrão, e seu ponto mais fraco publicado é o Humanity's Last Exam, com 43,6. É um modelo criado para lidar com qualquer coisa que você lhe entregue.
Todos os números desse parágrafo são informados pelos próprios fornecedores. Nenhum dos conjuntos foi reproduzido de forma independente, e os dois conjuntos tampouco são diretamente comparáveis — Terminal-Bench 2.1 e Terminal-Bench 4.0 são benchmarks diferentes, portanto o 86,6 do Qwen e o 38,0 do Grok nunca devem ser colocados lado a lado.
• Composto independente — Grok 4.7 46 no AA Intelligence Index v4.3.2 vs. Qwen 3.8 Max 45 na mesma versão. Um empate estatístico.
• Preço por milhão de tokens — US$ 2,00 de entrada / US$ 6,00 de saída em ambos. O desconto de cache do Qwen está listado em 88%, resultando em uma tarifa combinada de US$ 1,18 por milhão; os termos de cache do Grok 4.7 não são publicados na mesma base.
• Janela de contexto — Grok 4.7 com 500.000 tokens vs. Qwen 3.8 Max com aproximadamente 984.000. Qwen vence por quase o dobro, e esta é a maior diferença de especificação entre os dois.
• Modalidades de entrada — Grok 4.7 texto e imagem vs Qwen 3.8 Max texto, imagem e vídeo.
• Pesos — ambos proprietários. Nenhum dos dois modelos pode ser baixado, o que elimina completamente deste comparativo o argumento habitual dos pesos abertos.
• Parâmetros — Grok 4.7 não divulgado em nenhuma ficha técnica da SpaceXAI (o número de ~2,1T é uma alegação de Musk) vs. Qwen 3.8 Max, reportado com 2,4T no total e 95B ativos, que a Alibaba também não confirmou em uma ficha técnica.
• Velocidade de serviço — Qwen 3.8 Max a 38,8 tokens de saída por segundo, com 3,08 segundos até o primeiro token, segundo a Artificial Analysis; Grok 4.7 posicionado pela SpaceXAI como aproximadamente duas vezes mais rápido que modelos comparáveis, segundo o fornecedor, sem nenhum valor independente de throughput publicado até o momento.

A diferença de contexto é a verdadeira decisão.
Quando o preço e a capacidade são idênticos, a decisão recai sobre tudo o que mais difere e, neste caso, é o contexto. Duplicar a janela de 500.000 para cerca de 984.000 tokens não é um detalhe de ficha técnica — é a diferença entre fragmentar um repositório e mantê-lo por inteiro.
A janela mais longa do Qwen 3.8 Max vem acompanhada de uma ressalva documentada que é importante para compradores: a versão de pesos abertos que a Alibaba anunciou para a semana de 10 de agosto de 2026 era somente texto e não incluía o contexto completo de um milhão de tokens. Isso não afeta o endpoint hospedado do qual esta comparação trata, mas vale a pena saber caso você estivesse planejando com base no lançamento aberto.
Há uma segunda consideração do lado do Grok. A linha Grok tem aplicado historicamente um salto de preço em 200.000 tokens de entrada, em que uma solicitação que ultrapassa o limite reprecifica a solicitação inteira pelo dobro da tarifa — US$ 4 na entrada e US$ 12 na saída. Com uma janela de 500.000 tokens, esse limite fica bem dentro da faixa de operação do modelo. Antes de encaminhar trabalho de contexto longo para o Grok 4.7, confirme a tabela de tarifas atual do modelo implantado, porque a interação entre uma janela grande e um salto de reprecificação é aí que as faturas de contexto longo saem erradas.
Quanto custa um mês de trabalho em cada
Como as tarifas anunciadas são idênticas, a comparação de custos tem de ser construída a partir do comportamento dos tokens e não da tabela de preços, e é aí que os dois modelos divergem de forma mensurável.
A Artificial Analysis mediu o Grok 4.7 gerando 240 milhões de tokens de saída durante a execução do seu Intelligence Index, contra uma mediana de 92 milhões entre os modelos do ranking — é um raciocinador prolixo. O Qwen 3.8 Max gerou 190 milhões de tokens de saída no mesmo índice, com um custo total de avaliação de US$ 4.934,79 e 38,8 tokens por segundo medidos. Ambos estão bem acima da verbosidade mediana, e o Grok 4.7 é o mais verboso dos dois.
Então, com uma saída idêntica de $6 por milhão, o modelo que emite mais tokens por tarefa custa mais por tarefa. Os números publicados de verbosidade sugerem que o Grok 4.7 consumirá mais tokens de saída para trabalho de índice equivalente, o que significa que o empate no preço é na verdade uma pequena vantagem para o Qwen 3.8 Max no custo por tarefa — compensada pela alegada vantagem de velocidade do Grok 4.7, que encurta o tempo de relógio e, portanto, o custo humano de esperar por uma execução de agente. Nenhuma dessas compensações é visível numa tabela de preços, e ambas merecem ser medidas no seu próprio tráfego em vez de presumir.
A única assimetria que não está em disputa é o cache. O Qwen 3.8 Max divulga um desconto de cache de 88% e uma tarifa combinada de US$ 1,18 em uma proporção de 7:2:1 de acertos de cache/entrada/saída. Para cargas de trabalho com um prefixo estável grande — um prompt de sistema, um cabeçalho de base de código, um conjunto de documentos —, é nesse desconto que estão as economias reais, e vale a pena verificar como os termos de cache do Grok 4.7 se comparam antes de você comprometer volume.

Escolher, quando os números se recusam a escolher por você
Um 46 e um 45 no mesmo índice, ao mesmo preço, é o mais próximo de um empate genuíno que este blog provavelmente publicará. Isso significa que a decisão deve ser tomada nos eixos em que os dois modelos realmente diferem, e há quatro deles.
Escolha o Grok 4.7 se o seu trabalho for codificação agêntica e execução em terminal, se a velocidade em tempo real em execuções longas importar mais do que a folga de contexto, e se você quiser um ajuste de raciocínio por requisição para manter o tráfego simples barato. Escolha o Qwen 3.8 Max se você lida rotineiramente com entradas maiores que meio milhão de tokens, se a entrada de vídeo está no seu roadmap, se você quer o desconto de cache de 88% para cargas de trabalho com muitos prefixos, ou se você quer um modelo cujo fornecedor publica uma matriz de avaliação ampla em vez de uma concentrada em um único segmento.
Se a resposta honesta for "um pouco de cada", essa é a resposta normal, e é para esse caso que este par foi criado. O Qwen 3.8 Max está no OrcaRouter pelo preço de tabela da Alibaba, e o OrcaRouter repassa o preço de tabela do provedor com 0% de margem, então o $2/$6 acima é o que você realmente paga, e uma mudança de tarifa do fornecedor entra em vigor aqui no mesmo dia, e não na renovação. Uma chave de API cobre o Qwen 3.8 Max mais mais de 200 outros modelos, o que significa que a decisão de contexto se torna uma regra de roteamento por requisição em vez de um compromisso de plataforma: envie as entradas de tamanho excessivo para a janela de 984k e mantenha todo o resto no endpoint que for mais rápido e barato para essa tarefa, com failover automático se um provedor apresentar degradação. Quando uma tarefa realmente precisa das duas formas — uma leitura de contexto longo seguida por uma etapa de execução agêntica — o DSL de roteamento compõe modelos em uma única chamada, em vez de forçar você a escolher um lado.
Um esclarecimento que vale a pena mencionar, já que nenhum dos modelos é aberto: nada nesta comparação envolve pesos para download. Ambos são endpoints hospedados, e a auto-hospedagem não é uma opção para nenhum deles.
O único número a manter
Quarenta e seis contra quarenta e cinco não é razão para escolher um modelo, e não deveria ser. O que decide essa comparação é a janela de contexto — 500.000 tokens contra cerca de 984.000 — e a forma que cada fornecedor escolheu: o Grok 4.7 otimizado para concluir tarefas agênticas difíceis com rapidez, o Qwen 3.8 Max otimizado para lidar com o que quer que você lhe entregue. Mesmo preço, mesma capacidade medida, trabalhos diferentes. Essa é uma decisão de roteamento, e é o tipo de decisão que deveria levar uma tarde para testar, em vez de um trimestre para adquirir.

Comparados neste artigo3
Detectado a partir deste artigo · Benchmarks: Artificial Analysis · atualizado diariamente
