Um cartão de título de destaque gerado para um artigo intitulado "Grok 4.7 vs Qwen 3.8 Max — um cara ou coroa no papel", com o subtítulo "Preço idêntico, um ponto de índice de diferença, formas opostas" e chips de estatísticas mostrando AA Index 46 vs 45, preço $2/$6 em ambos, e contexto 500K vs 984K.
Guides & Insights

Grok 4.7 vs Qwen 3.8 Max: Preço Idêntico, Separados por Um Ponto, Formatos Opostos

Autor

Elias Hawthorne

Data de publicação

Modelos mais recentes · 20Ver todos os modelos
Benchmarks: Artificial Analysis · atualizado diariamente
Voltar para todas as publicações

Dois modelos de ponta fechados, ambos a US$ 2 por milhão de tokens de entrada e US$ 6 por milhão de tokens de saída, ambos com pontuação dentro de um único ponto um do outro no mesmo benchmark independente, lançados com dezenove dias de diferença. Grok 4.7 chegou em 21 de setembro de 2026, da SpaceXAI; Qwen 3.8 Max foi lançado pelo fornecedor em 3 de agosto de 2026 e atualizado em 2 de setembro de 2026. No atual Artificial Analysis Intelligence Index, versão v4.3.2, Grok 4.7 obtém 46 pontos e Qwen 3.8 Max obtém 45. Em preço e em capacidade medida, esses dois modelos são a mesma compra. Em todo o resto — contexto, modalidade, velocidade de serviço, abertura e o que cada fornecedor escolheu otimizar — eles não poderiam ser mais diferentes, e é isso que torna esta comparação digna de ser feita em vez de ignorada.

Primeiro, a linha do tempo, porque o Qwen 3.8 Max tem duas datas

Isso causa confusão em muita cobertura, então vale esclarecer logo de início. O Qwen 3.8 Max foi lançado em 3 de agosto de 2026 como o maior e mais capaz modelo da Alibaba, construído a partir da arquitetura de visão e linguagem do Qwen 3.5 em um design esparso de mistura de especialistas, relatado com 2,4 trilhões de parâmetros totais e 95 bilhões ativos por token. Em 2 de setembro de 2026, a Alibaba lançou uma compilação atualizada — a revisão 0902, que é a versão que carrega os IDs de modelo atuais e a versão à qual o Artificial Analysis atribui a data de sua página. Se você viu tanto uma data de agosto quanto uma de setembro para o Qwen 3.8 Max, é por isso: uma é o lançamento, a outra é a revisão à qual a maioria das pessoas realmente se refere hoje.

O Grok 4.7 tem um histórico mais limpo e um mais bagunçado por trás dele. A SpaceXAI o lançou em 21 de setembro de 2026, após um lançamento que sofreu repetidos adiamentos — Musk havia apontado janelas no fim de agosto, no início de setembro e em meados de setembro antes de o modelo finalmente ser disponibilizado. O lançamento em si foi restrito: um modelo base maior que o do Grok 4.6, uma corrida de aprendizado por reforço mais longa voltada para tarefas de várias horas, e nenhuma mudança na tabela de tarifas de US$ 2/US$ 6 que o Grok 4.6 mantinha desde 12 de agosto.

O que cada fornecedor otimizou

Leia os dois anúncios de lançamento como um par e as apostas de design estão quase perfeitamente opostas.

A SpaceXAI otimizou para execução agêntica. Os números do Grok 4.7 relatados pelo fornecedor concentram-se em trabalho de terminal e repositório: Terminal-Bench 4.0 em 38,0% contra 20,3% do Grok 4.6, CursorBench 4.0 em 46,3%, DeepSWE v1.1 em 71,0% com alto esforço de raciocínio, EEBench em 64,0%. A própria descrição do lançamento feita pela empresa nomeia a autoverificação e o tratamento de contexto longo dentro do ambiente Grok Bot como os alvos. O Grok 4.7 atende a uma janela de 500.000 tokens, aceita texto e imagens na entrada, retorna texto e expõe esforço de raciocínio de low a xhigh. É um modelo criado para concluir tarefas.

A Alibaba otimizou para alcance. O Qwen 3.8 Max oferece uma janela de contexto de aproximadamente 984.000 tokens — efetivamente um milhão — e seus pontos fortes publicados são a amplitude, e não a profundidade em uma única área: uma pontuação de 86,6 no Terminal Bench 2.1, SWE-bench Pro com 67,7, PaperBench com 93,0, GPQA Diamond com 92,6, MMMU-Pro com 82,3, OSWorld-Verified com 86,1. Ele aceita entrada de texto, imagem e vídeo e retorna texto, oferece suporte a níveis de esforço de raciocínio, com xhigh como padrão, e seu ponto mais fraco publicado é o Humanity's Last Exam, com 43,6. É um modelo criado para lidar com qualquer coisa que você lhe entregue.

Todos os números desse parágrafo são informados pelos próprios fornecedores. Nenhum dos conjuntos foi reproduzido de forma independente, e os dois conjuntos tampouco são diretamente comparáveis — Terminal-Bench 2.1 e Terminal-Bench 4.0 são benchmarks diferentes, portanto o 86,6 do Qwen e o 38,0 do Grok nunca devem ser colocados lado a lado.

• Composto independente — Grok 4.7 46 no AA Intelligence Index v4.3.2 vs. Qwen 3.8 Max 45 na mesma versão. Um empate estatístico.

• Preço por milhão de tokens — US$ 2,00 de entrada / US$ 6,00 de saída em ambos. O desconto de cache do Qwen está listado em 88%, resultando em uma tarifa combinada de US$ 1,18 por milhão; os termos de cache do Grok 4.7 não são publicados na mesma base.

• Janela de contexto — Grok 4.7 com 500.000 tokens vs. Qwen 3.8 Max com aproximadamente 984.000. Qwen vence por quase o dobro, e esta é a maior diferença de especificação entre os dois.

• Modalidades de entrada — Grok 4.7 texto e imagem vs Qwen 3.8 Max texto, imagem e vídeo.

• Pesos — ambos proprietários. Nenhum dos dois modelos pode ser baixado, o que elimina completamente deste comparativo o argumento habitual dos pesos abertos.

• Parâmetros — Grok 4.7 não divulgado em nenhuma ficha técnica da SpaceXAI (o número de ~2,1T é uma alegação de Musk) vs. Qwen 3.8 Max, reportado com 2,4T no total e 95B ativos, que a Alibaba também não confirmou em uma ficha técnica.

• Velocidade de serviço — Qwen 3.8 Max a 38,8 tokens de saída por segundo, com 3,08 segundos até o primeiro token, segundo a Artificial Analysis; Grok 4.7 posicionado pela SpaceXAI como aproximadamente duas vezes mais rápido que modelos comparáveis, segundo o fornecedor, sem nenhum valor independente de throughput publicado até o momento.

A generated two-column comparison scoreboard for Grok 4.7 and Qwen 3.8 Max with six rows: AA Intelligence Index 46 vs 45, price $2.00/$6.00 on both, context 500K vs 984K tokens, modalities text and image vs text, image and video, weights proprietary on both, and speed vendor-claimed twice as fast vs 38.8 tokens per second measured, with a footer noting index scores are per Artificial Analysis v4.3.2 and all benchmark figures are vendor-reported.

A diferença de contexto é a verdadeira decisão.

Quando o preço e a capacidade são idênticos, a decisão recai sobre tudo o que mais difere e, neste caso, é o contexto. Duplicar a janela de 500.000 para cerca de 984.000 tokens não é um detalhe de ficha técnica — é a diferença entre fragmentar um repositório e mantê-lo por inteiro.

A janela mais longa do Qwen 3.8 Max vem acompanhada de uma ressalva documentada que é importante para compradores: a versão de pesos abertos que a Alibaba anunciou para a semana de 10 de agosto de 2026 era somente texto e não incluía o contexto completo de um milhão de tokens. Isso não afeta o endpoint hospedado do qual esta comparação trata, mas vale a pena saber caso você estivesse planejando com base no lançamento aberto.

Há uma segunda consideração do lado do Grok. A linha Grok tem aplicado historicamente um salto de preço em 200.000 tokens de entrada, em que uma solicitação que ultrapassa o limite reprecifica a solicitação inteira pelo dobro da tarifa — US$ 4 na entrada e US$ 12 na saída. Com uma janela de 500.000 tokens, esse limite fica bem dentro da faixa de operação do modelo. Antes de encaminhar trabalho de contexto longo para o Grok 4.7, confirme a tabela de tarifas atual do modelo implantado, porque a interação entre uma janela grande e um salto de reprecificação é aí que as faturas de contexto longo saem erradas.

Quanto custa um mês de trabalho em cada

Como as tarifas anunciadas são idênticas, a comparação de custos tem de ser construída a partir do comportamento dos tokens e não da tabela de preços, e é aí que os dois modelos divergem de forma mensurável.

A Artificial Analysis mediu o Grok 4.7 gerando 240 milhões de tokens de saída durante a execução do seu Intelligence Index, contra uma mediana de 92 milhões entre os modelos do ranking — é um raciocinador prolixo. O Qwen 3.8 Max gerou 190 milhões de tokens de saída no mesmo índice, com um custo total de avaliação de US$ 4.934,79 e 38,8 tokens por segundo medidos. Ambos estão bem acima da verbosidade mediana, e o Grok 4.7 é o mais verboso dos dois.

Então, com uma saída idêntica de $6 por milhão, o modelo que emite mais tokens por tarefa custa mais por tarefa. Os números publicados de verbosidade sugerem que o Grok 4.7 consumirá mais tokens de saída para trabalho de índice equivalente, o que significa que o empate no preço é na verdade uma pequena vantagem para o Qwen 3.8 Max no custo por tarefa — compensada pela alegada vantagem de velocidade do Grok 4.7, que encurta o tempo de relógio e, portanto, o custo humano de esperar por uma execução de agente. Nenhuma dessas compensações é visível numa tabela de preços, e ambas merecem ser medidas no seu próprio tráfego em vez de presumir.

A única assimetria que não está em disputa é o cache. O Qwen 3.8 Max divulga um desconto de cache de 88% e uma tarifa combinada de US$ 1,18 em uma proporção de 7:2:1 de acertos de cache/entrada/saída. Para cargas de trabalho com um prefixo estável grande — um prompt de sistema, um cabeçalho de base de código, um conjunto de documentos —, é nesse desconto que estão as economias reais, e vale a pena verificar como os termos de cache do Grok 4.7 se comparam antes de você comprometer volume.

Screenshot of the Artificial Analysis model page for Qwen3.8 Max showing an Intelligence Index of 45 on index version v4.3.2, a context window of approximately 984k tokens, text and image input, listed pricing of $2.00 input and $6.00 output per million tokens, and an output speed of 38.8 tokens per second.

Escolher, quando os números se recusam a escolher por você

Um 46 e um 45 no mesmo índice, ao mesmo preço, é o mais próximo de um empate genuíno que este blog provavelmente publicará. Isso significa que a decisão deve ser tomada nos eixos em que os dois modelos realmente diferem, e há quatro deles.

Escolha o Grok 4.7 se o seu trabalho for codificação agêntica e execução em terminal, se a velocidade em tempo real em execuções longas importar mais do que a folga de contexto, e se você quiser um ajuste de raciocínio por requisição para manter o tráfego simples barato. Escolha o Qwen 3.8 Max se você lida rotineiramente com entradas maiores que meio milhão de tokens, se a entrada de vídeo está no seu roadmap, se você quer o desconto de cache de 88% para cargas de trabalho com muitos prefixos, ou se você quer um modelo cujo fornecedor publica uma matriz de avaliação ampla em vez de uma concentrada em um único segmento.

Se a resposta honesta for "um pouco de cada", essa é a resposta normal, e é para esse caso que este par foi criado. O Qwen 3.8 Max está no OrcaRouter pelo preço de tabela da Alibaba, e o OrcaRouter repassa o preço de tabela do provedor com 0% de margem, então o $2/$6 acima é o que você realmente paga, e uma mudança de tarifa do fornecedor entra em vigor aqui no mesmo dia, e não na renovação. Uma chave de API cobre o Qwen 3.8 Max mais mais de 200 outros modelos, o que significa que a decisão de contexto se torna uma regra de roteamento por requisição em vez de um compromisso de plataforma: envie as entradas de tamanho excessivo para a janela de 984k e mantenha todo o resto no endpoint que for mais rápido e barato para essa tarefa, com failover automático se um provedor apresentar degradação. Quando uma tarefa realmente precisa das duas formas — uma leitura de contexto longo seguida por uma etapa de execução agêntica — o DSL de roteamento compõe modelos em uma única chamada, em vez de forçar você a escolher um lado.

Um esclarecimento que vale a pena mencionar, já que nenhum dos modelos é aberto: nada nesta comparação envolve pesos para download. Ambos são endpoints hospedados, e a auto-hospedagem não é uma opção para nenhum deles.

O único número a manter

Quarenta e seis contra quarenta e cinco não é razão para escolher um modelo, e não deveria ser. O que decide essa comparação é a janela de contexto — 500.000 tokens contra cerca de 984.000 — e a forma que cada fornecedor escolheu: o Grok 4.7 otimizado para concluir tarefas agênticas difíceis com rapidez, o Qwen 3.8 Max otimizado para lidar com o que quer que você lhe entregue. Mesmo preço, mesma capacidade medida, trabalhos diferentes. Essa é uma decisão de roteamento, e é o tipo de decisão que deveria levar uma tarde para testar, em vez de um trimestre para adquirir.

Screenshot of the OrcaRouter model page for Qwen3.8 Max (model ID qwen/qwen3.8-max), showing Alibaba's list pricing of $2.00 per million input tokens and $6.00 per million output tokens, a 1M token context window, and the vision, tools, JSON and reasoning capability tags.

Comparados neste artigo3

Detectado a partir deste artigo · Benchmarks: Artificial Analysis · atualizado diariamente