
GPT-6 vs Grok 4.7: A Coluna de Saída Decide
- openaiNOVOOpenAI: GPT-6.1 Sol2026-09-2952Inteligência
- anthropicNOVOAnthropic: Claude Sonnet 5.52026-09-2856Inteligência
- typesafeNOVOTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 por 1M de tokens · 127 tok/s
- OpenAIOpenAI: GPT-6 Luna2026-09-2238Inteligência
- OpenAIOpenAI: GPT-6 Sol2026-09-2248Inteligência
- AnthropicAnthropic: Claude Opus 5.52026-09-2258Inteligência
- xAIGrok 4.72026-09-2146Inteligência
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 por 1M de tokens · 68 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 por 1M de tokens · 320 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Inteligência
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Inteligência77Código
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Inteligência76Código
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Inteligência76Código
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Inteligência82Código
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 por 1M de tokens · 54 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 por 1M de tokens · 361 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Inteligência72Código
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 por 1M de tokens · 233 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Inteligência75Código
- obsidianQwen3.8 27B2026-08-1534Inteligência68Código
GPT-6 Sol e Grok 4.7 cobram o mesmo valor pelos tokens de entrada — US$ 2,00 por milhão, ambos —, o que torna a coluna de entrada inútil para escolher entre eles. A decisão está uma coluna à direita. O GPT-6 Sol cobra US$ 10,00 por milhão de tokens de saída; o Grok 4.7 cobra US$ 6,00. E os dois modelos divergem sobre quanto de saída você tem permissão de gerar em uma única chamada por um fator de três e meio: o GPT-6 Sol tem limite de 128.000 tokens, enquanto o Grok 4.7 — carro-chefe da SpaceXAI, lançado em 21 de setembro de 2026 como sucessor do Grok 4.6 — chega a 450.000.
Todo o resto neste confronto decorre desses dois fatos, mais um: o GPT-6 Sol possui a janela de contexto maior, 1.050.000 tokens contra os 500.000 do Grok 4.7. Portanto, esta não é uma história sobre um modelo ser melhor. É uma história sobre dois modelos com formatos diferentes e sobre qual é o formato da sua carga de trabalho.
Primeiro, acerte o formato do seu pedido.
A maneira útil de resolver uma decisão entre o GPT-6 e o Grok 4.7 é pelo recurso que a sua tarefa realmente consome. Três casos cobrem a maior parte do tráfego de produção.
Entrada longa, saída curta. Você alimenta um documento grande, uma base de código ou um longo histórico de agente e recebe de volta um resumo, um diff ou uma decisão. Aqui a janela de contexto é a restrição limitante, e os 1.050.000 tokens do GPT-6 Sol são aproximadamente o dobro dos 500.000 do Grok 4.7. Mas observe a linha de faixas em ambos os cartões: a tarifa de US$ 2,00 do Grok 4.7 se aplica até 200.000 tokens de entrada e sobe para US$ 4,00 além disso, enquanto a tarifa de US$ 2,00 do GPT-6 Sol vai até 272.000 e sobe para US$ 4,00 depois. Com 200.001 tokens, o Grok já teve o preço reajustado e o GPT-6 Sol não, então um documento de 250.000 tokens custa US$ 4,00 por milhão no Grok 4.7 e US$ 2,00 por milhão no GPT-6 Sol — o dobro, antes de contar a saída.
Entrada curta, saída longa. Você está gerando: um documento longo, um arquivo de código grande, um artefato estruturado ou uma cadeia de chamadas de ferramentas cujos resultados o modelo precisa escrever. É para isso que o Grok 4.7 foi feito. Um teto de saída de 450.000 tokens está mais de uma ordem de magnitude além do que a maioria dos modelos permite e, a US$ 6,00 por milhão de saída em vez de US$ 10,00, você paga 40% menos por cada um desses tokens. Se sua geração rotineiramente ultrapassa 128.000 tokens de saída, o GPT-6 Sol não consegue atender à solicitação de forma alguma em uma única chamada, e o Grok 4.7 consegue.
Equilibrado e pesado em ambos. Entrada longa e saída longa em conjunto é o caso em que os dois cartões interagem. Uma entrada de 400.000 tokens com uma saída de 200.000 tokens custa $4,00 de entrada e $12,00 de saída no Grok 4.7 (ambos acima do seu limite) e $4,00 de entrada e $15,00 de saída no GPT-6 Sol. Essa é a única configuração em que o GPT-6 Sol é o modelo mais caro por token, e vale a pena comparar as suas próprias médias com isso antes de assumir que o padrão da era ChatGPT é mais barato.
O que a OpenAI mudou, e por que isso importa aqui
O GPT-6 é uma família de três modelos e, em 7 de outubro de 2026, a OpenAI colocou o modelo intermediário diante do público. O GPT-6 no ChatGPT — o lançamento da Intelligent UI — é alimentado pelo GPT-6 Sol para Plus, Pro, Business e Enterprise, e pelo GPT-6 Luna para Free e Go, alcançando mais de 1,2 bilhão de pessoas que usam o ChatGPT semanalmente. Isso é um fato de distribuição, não um fato de capacidade, e muda o que “GPT-6” significa em uma comparação: quando alguém diz que o GPT-6 venceu ou perdeu para outro modelo em algum benchmark, geralmente quer dizer especificamente o GPT-6 Sol, ou o GPT-6 Astra, o modelo principal, a $10.00 / $50.00.
Para este confronto, o lançamento do ChatGPT importa de uma forma concreta. O Grok 4.7 foi lançado em 21 de setembro de 2026, quatro dias antes do GPT-6 Sol, e é um modelo exclusivamente de API e aplicativo, sem um equivalente padrão de consumo para bilhões de usuários. A descrição que a própria SpaceXAI faz dele é restrita e específica: um carro-chefe para engenharia de software de longa duração, fluxos de trabalho agênticos com uso de ferramentas e autoverificação, e trabalho de conhecimento. Isso é uma afirmação sobre trabalho com grande volume de output, que é exatamente o formato em que a carta do Grok é mais forte.
O placar, honestamente rotulado
A avaliação independente desses dois é da Artificial Analysis, e o resumo é que eles estão próximos no índice composto e divergem nos testes individuais de uma forma que corresponde aos produtos.
• AA Intelligence Index: Grok 4.7 46,4 (16º entre os modelos que avalia), GPT-6 Sol 47,6 — GPT-6 Sol à frente por cerca de um ponto
• Humanity's Last Exam: Grok 4.7 43,1%, GPT-6 Sol 47,9%
• SciCode: Grok 4.7 57,4%, GPT-6 Sol 57,6% — efetivamente empatados
• Long-Context Recall: Grok 4.7 76,7%, GPT-6 Sol 83,7% — GPT-6 Sol à frente, consistente com a janela maior
• Terminal-Bench (v4.0 na ficha do Grok): Grok 4.7 25,8%, GPT-6 Sol 43,9% na mesma família de harness
• Programação: Grok 4.7 fica no decil superior do índice de programação, na companhia dos modelos mais fortes do ranking
Duas ressalvas, e elas não são decorativas. Os valores de índice dos dois modelos foram avaliados em datas diferentes, portanto isto não é um confronto direto no mesmo dia, e um ponto de diferença está dentro da variação que uma revisão produz. E cada número do Grok 4.7 acima é o número publicado pelo próprio fornecedor conforme consta no catálogo, não uma pontuação que nós rodamos novamente — a leitura honesta é que o Grok 4.7 é um modelo de codificação entre os 10% melhores que fica cerca de um ponto atrás do GPT-6 Sol em um composto de raciocínio geral, e que a diferença no terminal-bench é o maior sinal individual do conjunto.

Latência e confiabilidade, que a ficha técnica esconde
Tanto as tabelas de tarifas publicadas quanto as tabelas de benchmark omitem aquilo que determina a qualidade do serviço em produção, por isso vale a pena olhar para os números medidos e não para os de marketing.
Nas próprias medições do playground da OrcaRouter durante a primeira semana de outubro de 2026, o Grok 4.7 apresentou uma latência mediana de primeiro token de 3.825 ms e gerou saída a cerca de 147 tokens por segundo, com uma taxa de erro em torno de 8%. A latência mediana medida do GPT-6 Sol na mesma janela foi maior — 6.363 ms — com uma taxa de erro muito mais alta. Estas são observações de playground numa rota compartilhada, não um SLA do fornecedor, e uma taxa de erro de 39% na rota de um modelo é um problema de roteamento, e não um problema do modelo; é exatamente o tipo de lacuna que o failover existe para cobrir. O ponto para uma comparação é que uma rota do Grok 4.7 pareceu substancialmente mais responsiva e mais confiável do que uma rota do GPT-6 Sol naquela janela específica, e que o card publicado de nenhum dos fornecedores lhe teria dito isso.
Rodando ambos sem se comprometer com nenhum
A tentação, num confronto tão equilibrado, é escolher um antecipadamente com base no preço e depois descobrir, três meses mais tarde, que o perfil do seu tráfego mudou. É esse o problema que o roteamento resolve. No OrcaRouter, tanto o grok/grok-4.7 quanto o GPT-6 Sol são rotas ativas no mesmo catálogo por trás de uma única API, ao preço de tabela do fornecedor com 0% de markup — portanto, quando a SpaceXAI ou a OpenAI altera uma tarifa, a alteração fica ativa no mesmo dia, em vez de na sua próxima reconciliação de faturas. O failover automático entre fornecedores cobre o caso em que uma rota se degrada, o que é diretamente relevante, dada a variação das taxas de erro acima. E a DSL de roteamento permite dividir o tráfego pelo formato do pedido em vez de pela preferência de modelo: envie trabalho de entrada longa e saída curta para o modelo com a janela maior, envie geração de saída longa para o que tem o teto de 450K e a tarifa de saída mais barata, e deixe um predicado de tamanho do pedido fazer a escolha em vez de um humano.
Escolhendo
Se o seu trabalho é análise de documentos longos, raciocínio com grande contexto ou qualquer coisa que fique acima de 200.000 tokens de entrada, GPT-6 Sol é a melhor opção: o dobro do contexto, um índice independente mais alto e um limite que fica 72.000 tokens mais adiante. Se o seu trabalho é geração — artefatos de código longos, escrita de textos longos, cadeias longas de chamadas de ferramentas em que o modelo precisa escrever o que encontrou — Grok 4.7 é a melhor opção: um teto de saída de 450.000 tokens que o GPT-6 Sol não consegue alcançar, tokens de saída 40% mais baratos e um perfil de codificação no decil superior à altura. Se você realmente faz as duas coisas, a resposta não é um modelo. É uma rota.


Comparados neste artigo2
Detectado a partir deste artigo · Benchmarks: Artificial Analysis · atualizado diariamente
