Cartão de título principal para uma comparação entre o GPT-6 e o Grok 4.7. A manchete diz 'GPT-6 vs Grok 4.7'. Um chip diz 'GPT-6 Sol: contexto de 1,05M, saída de 128K, US$ 2,00 / US$ 10,00'. Um chip diz 'Grok 4.7: contexto de 500K, saída de 450K, US$ 2,00 / US$ 6,00'. Um rodapé diz 'O preço de entrada está empatado; o preço de saída e o teto de saída, não.'
Guides & Insights

GPT-6 vs Grok 4.7: A Coluna de Saída Decide

Autor

Rowan Sterling

Data de publicação

Modelos mais recentes · 20Ver todos os modelos →
Benchmarks: Artificial Analysis · atualizado diariamente
Voltar para todas as publicações

GPT-6 Sol e Grok 4.7 cobram o mesmo valor pelos tokens de entrada — US$ 2,00 por milhão, ambos —, o que torna a coluna de entrada inútil para escolher entre eles. A decisão está uma coluna à direita. O GPT-6 Sol cobra US$ 10,00 por milhão de tokens de saída; o Grok 4.7 cobra US$ 6,00. E os dois modelos divergem sobre quanto de saída você tem permissão de gerar em uma única chamada por um fator de três e meio: o GPT-6 Sol tem limite de 128.000 tokens, enquanto o Grok 4.7 — carro-chefe da SpaceXAI, lançado em 21 de setembro de 2026 como sucessor do Grok 4.6 — chega a 450.000.

Todo o resto neste confronto decorre desses dois fatos, mais um: o GPT-6 Sol possui a janela de contexto maior, 1.050.000 tokens contra os 500.000 do Grok 4.7. Portanto, esta não é uma história sobre um modelo ser melhor. É uma história sobre dois modelos com formatos diferentes e sobre qual é o formato da sua carga de trabalho.

Primeiro, acerte o formato do seu pedido.

A maneira útil de resolver uma decisão entre o GPT-6 e o Grok 4.7 é pelo recurso que a sua tarefa realmente consome. Três casos cobrem a maior parte do tráfego de produção.

Entrada longa, saída curta. Você alimenta um documento grande, uma base de código ou um longo histórico de agente e recebe de volta um resumo, um diff ou uma decisão. Aqui a janela de contexto é a restrição limitante, e os 1.050.000 tokens do GPT-6 Sol são aproximadamente o dobro dos 500.000 do Grok 4.7. Mas observe a linha de faixas em ambos os cartões: a tarifa de US$ 2,00 do Grok 4.7 se aplica até 200.000 tokens de entrada e sobe para US$ 4,00 além disso, enquanto a tarifa de US$ 2,00 do GPT-6 Sol vai até 272.000 e sobe para US$ 4,00 depois. Com 200.001 tokens, o Grok já teve o preço reajustado e o GPT-6 Sol não, então um documento de 250.000 tokens custa US$ 4,00 por milhão no Grok 4.7 e US$ 2,00 por milhão no GPT-6 Sol — o dobro, antes de contar a saída.

Entrada curta, saída longa. Você está gerando: um documento longo, um arquivo de código grande, um artefato estruturado ou uma cadeia de chamadas de ferramentas cujos resultados o modelo precisa escrever. É para isso que o Grok 4.7 foi feito. Um teto de saída de 450.000 tokens está mais de uma ordem de magnitude além do que a maioria dos modelos permite e, a US$ 6,00 por milhão de saída em vez de US$ 10,00, você paga 40% menos por cada um desses tokens. Se sua geração rotineiramente ultrapassa 128.000 tokens de saída, o GPT-6 Sol não consegue atender à solicitação de forma alguma em uma única chamada, e o Grok 4.7 consegue.

Equilibrado e pesado em ambos. Entrada longa e saída longa em conjunto é o caso em que os dois cartões interagem. Uma entrada de 400.000 tokens com uma saída de 200.000 tokens custa $4,00 de entrada e $12,00 de saída no Grok 4.7 (ambos acima do seu limite) e $4,00 de entrada e $15,00 de saída no GPT-6 Sol. Essa é a única configuração em que o GPT-6 Sol é o modelo mais caro por token, e vale a pena comparar as suas próprias médias com isso antes de assumir que o padrão da era ChatGPT é mais barato.

O que a OpenAI mudou, e por que isso importa aqui

O GPT-6 é uma família de três modelos e, em 7 de outubro de 2026, a OpenAI colocou o modelo intermediário diante do público. O GPT-6 no ChatGPT — o lançamento da Intelligent UI — é alimentado pelo GPT-6 Sol para Plus, Pro, Business e Enterprise, e pelo GPT-6 Luna para Free e Go, alcançando mais de 1,2 bilhão de pessoas que usam o ChatGPT semanalmente. Isso é um fato de distribuição, não um fato de capacidade, e muda o que “GPT-6” significa em uma comparação: quando alguém diz que o GPT-6 venceu ou perdeu para outro modelo em algum benchmark, geralmente quer dizer especificamente o GPT-6 Sol, ou o GPT-6 Astra, o modelo principal, a $10.00 / $50.00.

Para este confronto, o lançamento do ChatGPT importa de uma forma concreta. O Grok 4.7 foi lançado em 21 de setembro de 2026, quatro dias antes do GPT-6 Sol, e é um modelo exclusivamente de API e aplicativo, sem um equivalente padrão de consumo para bilhões de usuários. A descrição que a própria SpaceXAI faz dele é restrita e específica: um carro-chefe para engenharia de software de longa duração, fluxos de trabalho agênticos com uso de ferramentas e autoverificação, e trabalho de conhecimento. Isso é uma afirmação sobre trabalho com grande volume de output, que é exatamente o formato em que a carta do Grok é mais forte.

O placar, honestamente rotulado

A avaliação independente desses dois é da Artificial Analysis, e o resumo é que eles estão próximos no índice composto e divergem nos testes individuais de uma forma que corresponde aos produtos.

• AA Intelligence Index: Grok 4.7 46,4 (16º entre os modelos que avalia), GPT-6 Sol 47,6 — GPT-6 Sol à frente por cerca de um ponto
• Humanity's Last Exam: Grok 4.7 43,1%, GPT-6 Sol 47,9%
• SciCode: Grok 4.7 57,4%, GPT-6 Sol 57,6% — efetivamente empatados
• Long-Context Recall: Grok 4.7 76,7%, GPT-6 Sol 83,7% — GPT-6 Sol à frente, consistente com a janela maior
• Terminal-Bench (v4.0 na ficha do Grok): Grok 4.7 25,8%, GPT-6 Sol 43,9% na mesma família de harness
• Programação: Grok 4.7 fica no decil superior do índice de programação, na companhia dos modelos mais fortes do ranking

Duas ressalvas, e elas não são decorativas. Os valores de índice dos dois modelos foram avaliados em datas diferentes, portanto isto não é um confronto direto no mesmo dia, e um ponto de diferença está dentro da variação que uma revisão produz. E cada número do Grok 4.7 acima é o número publicado pelo próprio fornecedor conforme consta no catálogo, não uma pontuação que nós rodamos novamente — a leitura honesta é que o Grok 4.7 é um modelo de codificação entre os 10% melhores que fica cerca de um ponto atrás do GPT-6 Sol em um composto de raciocínio geral, e que a diferença no terminal-bench é o maior sinal individual do conjunto.

Screenshot of the OrcaRouter model page for Grok 4.7, showing the SpaceXAI Grok 4.7 card with a 500,000-token context window, up to 450,000-token output, text/image/file input and text output, and a tiered rate of $2.00 per million input and $6.00 per million output up to 200,000 tokens, stepping to $4.00 and $12.00 above.

Latência e confiabilidade, que a ficha técnica esconde

Tanto as tabelas de tarifas publicadas quanto as tabelas de benchmark omitem aquilo que determina a qualidade do serviço em produção, por isso vale a pena olhar para os números medidos e não para os de marketing.

Nas próprias medições do playground da OrcaRouter durante a primeira semana de outubro de 2026, o Grok 4.7 apresentou uma latência mediana de primeiro token de 3.825 ms e gerou saída a cerca de 147 tokens por segundo, com uma taxa de erro em torno de 8%. A latência mediana medida do GPT-6 Sol na mesma janela foi maior — 6.363 ms — com uma taxa de erro muito mais alta. Estas são observações de playground numa rota compartilhada, não um SLA do fornecedor, e uma taxa de erro de 39% na rota de um modelo é um problema de roteamento, e não um problema do modelo; é exatamente o tipo de lacuna que o failover existe para cobrir. O ponto para uma comparação é que uma rota do Grok 4.7 pareceu substancialmente mais responsiva e mais confiável do que uma rota do GPT-6 Sol naquela janela específica, e que o card publicado de nenhum dos fornecedores lhe teria dito isso.

Rodando ambos sem se comprometer com nenhum

A tentação, num confronto tão equilibrado, é escolher um antecipadamente com base no preço e depois descobrir, três meses mais tarde, que o perfil do seu tráfego mudou. É esse o problema que o roteamento resolve. No OrcaRouter, tanto o grok/grok-4.7 quanto o GPT-6 Sol são rotas ativas no mesmo catálogo por trás de uma única API, ao preço de tabela do fornecedor com 0% de markup — portanto, quando a SpaceXAI ou a OpenAI altera uma tarifa, a alteração fica ativa no mesmo dia, em vez de na sua próxima reconciliação de faturas. O failover automático entre fornecedores cobre o caso em que uma rota se degrada, o que é diretamente relevante, dada a variação das taxas de erro acima. E a DSL de roteamento permite dividir o tráfego pelo formato do pedido em vez de pela preferência de modelo: envie trabalho de entrada longa e saída curta para o modelo com a janela maior, envie geração de saída longa para o que tem o teto de 450K e a tarifa de saída mais barata, e deixe um predicado de tamanho do pedido fazer a escolha em vez de um humano.

Escolhendo

Se o seu trabalho é análise de documentos longos, raciocínio com grande contexto ou qualquer coisa que fique acima de 200.000 tokens de entrada, GPT-6 Sol é a melhor opção: o dobro do contexto, um índice independente mais alto e um limite que fica 72.000 tokens mais adiante. Se o seu trabalho é geração — artefatos de código longos, escrita de textos longos, cadeias longas de chamadas de ferramentas em que o modelo precisa escrever o que encontrou — Grok 4.7 é a melhor opção: um teto de saída de 450.000 tokens que o GPT-6 Sol não consegue alcançar, tokens de saída 40% mais baratos e um perfil de codificação no decil superior à altura. Se você realmente faz as duas coisas, a resposta não é um modelo. É uma rota.

A comparison card titled 'The shape of the request decides'. Left column 'Grok 4.7': rows 'Context: 500K', 'Output: up to 450K', 'Input: $2.00 to 200K, then $4.00', 'Output: $6.00, then $12.00', 'AA Index: 46.4'. Right column 'GPT-6 Sol': rows 'Context: 1,050,000', 'Output: 128K', 'Input: $2.00 to 272K, then $4.00', 'Output: $10.00, then $15.00', 'AA Index: 47.6'. A footer reads 'Figures per each vendor's published card and Artificial Analysis; evaluation dates differ between models.'Screenshot of the OrcaRouter model page for GPT-6 Sol, showing the OpenAI GPT-6 Sol card with a 1,050,000-token context window, 128,000 maximum output, text/image/file input, and the tiered rate card of $2.00 per million input and $10.00 per million output up to 272,000 tokens, stepping to $4.00 and $15.00 above that.

Comparados neste artigo2

Detectado a partir deste artigo · Benchmarks: Artificial Analysis · atualizado diariamente