Um cartão de título principal para um artigo que compara o GPT-6 Sol Pro com o Grok 4.7, com o texto 'GPT-6 Sol Pro vs Grok 4.7' e o subtítulo 'Duas vezes a verbosidade, um terço do preço'.
Guides & Insights

GPT-6 Sol Pro vs Grok 4.7: o dobro da verbosidade, um terço do preço

Autor

Rowan Sterling

Data de publicação

Modelos mais recentes · 20Ver todos os modelos →
Benchmarks: Artificial Analysis · atualizado diariamente
Voltar para todas as publicações

Os dois modelos mais baratos adjacentes à fronteira de setembro de 2026 chegaram com um dia de diferença, e o interessante neles não é qual é mais inteligente. GPT-6 Sol — o modelo que as pessoas procuram quando pesquisam GPT-6 Sol Pro, que é aquele modelo com seu reasoning.mode definido como pro em vez de um produto separado — foi lançado em 22 de setembro de 2026 a US$ 2,00 por milhão de tokens de entrada e US$ 10,00 por milhão de tokens de saída. Grok 4.7 do fornecedor foi lançado em 21 de setembro com a mesma entrada de US$ 2,00 e saída de US$ 6,00. No harness neutro da Artificial Analysis, os dois ficam separados por dois pontos no índice e por cerca de dois dólares por tarefa concluída, e o motivo dessa diferença não é a capacidade. É quantos tokens cada um queima para chegar lá.

O Sol gerou 77 milhões de tokens de saída executando o Intelligence Index. O Grok 4.7 gerou 240 milhões. Essa proporção — um pouco mais de três para um — é toda a comparação, e inverte a conclusão que uma tabela de preços por token lhe dá.

As duas tabelas de tarifas, e onde a barata não é barata

Ambos os fornecedores publicam eles próprios esses números; nenhum foi reprecificado de forma independente.

• Entrada — GPT-6 Sol $2,00 por milhão de tokens vs. Grok 4.7 $2,00 por milhão de tokens

• Saída — GPT-6 Sol $10,00 por milhão de tokens vs Grok 4.7 $6,00 por milhão de tokens

• Entrada em cache — GPT-6 Sol $0,20 por milhão de tokens vs Grok 4.7 $0,50 por milhão de tokens; a leitura de cache do Sol é duas vezes e meia mais barata, o que é o oposto do que a taxa de saída da manchete sugere

• Janela de contexto — GPT-6 Sol 1.050.000 tokens vs Grok 4.7 500.000 tokens

• Sobretaxa de contexto longo — O GPT-6 Sol repreficica uma solicitação acima de 272.000 tokens de entrada cobrando 2× as tarifas de entrada e de cache e 1,5× a tarifa de saída para toda a solicitação, em comparação com o Grok 4.7, que dobra todas as tarifas a 200.000 tokens de entrada, também para toda a solicitação

• Data de corte de conhecimento — GPT-6 Sol, 20 de abril de 2026 vs. Grok 4.7, um corte de pré-treinamento relatado como junho de 2026, com treinamento suplementar até agosto

• Esforço de raciocínio — GPT-6 Sol nenhum, baixo, médio (padrão), alto, xhigh, máx vs Grok 4.7 baixo, médio (padrão), alto, xhigh

• Modalidade — ambos aceitam entrada de texto e imagem e retornam texto

A linha de leitura de cache é aquela com que um comprador deveria sentar-se para analisar. A taxa de saída do Grok 4.7 é 40% menor, mas seu input em cache é 150% maior, e é no input em cache que vivem históricos longos de agentes e prompts de sistema repetidos. Uma carga de trabalho que consiste sobretudo em reler um contexto grande e estável verá os dois modelos muito mais próximos do que US$ 6 contra US$ 10 sugere.

A six-row scoreboard card titled 'GPT-6 Sol Pro vs Grok 4.7 - the scoreboard', comparing output price, cached input, context window, index tokens, AA Intelligence Index and cost per task. GPT-6 Sol Pro is listed at $10.00 output and $0.20 cached input per million tokens, a 1,050,000-token context, 77M index tokens, an AA Index of 48 and $1.06 per task; Grok 4.7 at $6.00 output and $0.50 cached input, a 500,000-token context, 240M index tokens, an AA Index of 46 and $3.74 per task. A footer reads 'Vendor list prices; index and cost figures per Artificial Analysis.'

O registro independente, e o único número que o decide.

O Artificial Analysis é a única estrutura de avaliação que mediu ambos os modelos, e vale a pena colocar seus números lado a lado, porque a divergência é instrutiva.

• Índice de Inteligência — GPT-6 Sol 48 no esforço máximo vs Grok 4.7 46 no xhigh; ambos bem acima da mediana de 25 dos modelos comparáveis

• Custo por tarefa de índice — GPT-6 Sol $1,06 vs Grok 4.7 $3,74

• Tokens de saída para a execução do índice — GPT-6 Sol 77M vs Grok 4.7 240M, contra uma mediana de 88M

• Velocidade de saída — o Grok 4.7 mediu 39 tokens por segundo, o que o próprio harness classifica como notavelmente lento; o número do Sol no mesmo placar não é publicado na mesma linha de resumo

• Índice de Agentes de Codificação — GPT-6 Sol 57 a US$ 2,99 por tarefa vs. Grok 4.7 56 com seu próprio harness Grok Build, nove pontos acima do Grok 4.6

Dois pontos de diferença no índice, três vezes e meia o custo por tarefa. Isso não é uma anomalia de precificação — é a aritmética da verbosidade. O Grok 4.7 é um modelo que pensa em voz alta de forma prolongada; o harness o sinaliza como “muito verboso” em comparação com uma mediana de 88 milhões de tokens, e o custo acompanha os tokens, não a tabela de preços.

A comparação de agentes de codificação traz uma ressalva que o placar esconde. O 56 do Grok 4.7 é medido dentro do próprio harness Grok Build da xAI, que é a configuração que a xAI distribui e toma como referência em benchmarks. O 57 do Sol é medido em um harness neutro. Uma vantagem de um ou dois pontos por ser um harness próprio está bem dentro da faixa que a escolha do harness explica, o que significa que a leitura honesta é que esses dois estão empatados em codificação agêntica — e não que o Sol está um ponto à frente.

Screenshot of the Artificial Analysis model page for Grok 4.7 (xhigh), captured 23 September 2026, showing list pricing of $2.00 per million input tokens and $6.00 per million output tokens with a 75% cache discount, an Intelligence Index score of 46, a cost per Intelligence Index task of $3.74, 240 million output tokens generated during the index run, a 500,000-token context window, and a measured output speed of 39 tokens per second that the page labels notably slow.

O que cada fornecedor alega, e o que nenhum dos dois demonstrou

O material de lançamento da xAI é específico e conta uma história de longo horizonte: o Grok 4.7 é construído sobre um modelo base maior que o do Grok 4.6 e recebeu uma execução de aprendizado por reforço mais longa, voltada para tarefas que "podem levar horas para serem concluídas", aprimorando a autoverificação, o processamento de contexto longo e o comportamento dentro do ambiente Grok Bot. Os números relatados pelo fornecedor incluem Terminal-Bench 4.0 em 38,0%, contra 20,3% do Grok 4.6, CursorBench 4.0 em 46,3% e DeepSWE v1.1 em 71,0%. Cada um deles é medição da própria xAI e nenhum foi reproduzido de forma independente; o número independente do Terminal-Bench 4.0 que circula é substancialmente menor que o do fornecedor, que é o formato habitual dessa diferença.

As alegações da OpenAI para o GPT-6 Sol são as já abordadas acima, e carregam o mesmo rótulo. Os números relatados pelo fornecedor são 33,2% no AutomationBench com esforço xhigh, contra 26,9% do Claude Opus 5 no max, a cerca de 9% do custo por tarefa, e 68,8% no DeepSWE v1.1 com esforço max — dentro de 1,1 ponto do Claude Fable 5 no xhigh, com cerca de 80% menos custo por tarefa. Observe o alvo da comparação: os próprios gráficos da OpenAI colocam o Sol contra os modelos da Anthropic, não contra o Grok 4.7. Nenhum dos fornecedores publicou um confronto direto contra o outro.

Screenshot of OpenAI's developer model page for GPT-6 Sol, captured 23 September 2026, showing the model id gpt-6-sol as the default snapshot, a 1,050,000-token context window with 128,000 maximum output tokens, an April 20, 2026 knowledge cutoff, text and image input with text output, and Standard pricing of $2.00 input, $0.20 cached input, $2.50 cache writes and $10.00 output per million tokens. No pro model id appears on the page.

Onde a camada de roteamento justifica seu lugar

O OrcaRouter não disponibiliza nenhum dos dois modelos neste confronto — nem o Grok 4.7 nem o GPT-6 Sol constam do nosso catálogo, pelo que nada aqui constitui uma afirmação sobre o preço deles através de nós. O que uma camada de encaminhamento vale neste emparelhamento em particular é o modo de falha, e não a tabela de preços. A razão para recorrer ao Grok 4.7 é o seu comportamento agêntico de longo horizonte; a razão para não recorrer a ele é que uma velocidade de saída de 39 tokens por segundo torna uma execução longa de agente lenta o suficiente para ser relevante, e uma execução lenta é uma execução que pode expirar. Failover automático entre fornecedores significa que uma tarefa longa pode ser encaminhada para o modelo que estiver realmente disponível, sem que essa velocidade se torne um ponto único de falha, e a DSL de encaminhamento expressa a escolha do modelo como uma regra dentro da chamada e não como uma migração — o que importa aqui, porque a resposta correta para este par depende de a tarefa ser ávida por tokens ou sensível à latência, e isso é uma propriedade do pedido, não do trimestre.

A regra de decisão

• Programação agêntica com orçamento fixo — capacidade ao nível do GPT-6 Sol no índice neutro de programação, por cerca de um terço do custo por tarefa, porque chega lá com um terço dos tokens.

• Tarefas de longo horizonte, em que a duração da execução é o ponto central — Grok 4.7. O lançamento foi treinado especificamente para trabalho de várias horas, e os números do fornecedor no SWE-Marathon e no CursorBench apontam exatamente nessa direção.

• Volume sensível à latência — nenhum dos dois, com base no registro atual. O custo por tarefa do Sol é o número melhor, mas os 39 tokens por segundo medidos do {{1}}Grok 4.7{{/1}} são uma restrição real para qualquer coisa interativa.

• Cargas de trabalho de contexto longo majoritariamente em cache — GPT-6 Sol, na linha de leitura de cache em vez da linha de saída. A US$ 0,20 contra US$ 0,50 por milhão de tokens em cache, e com uma janela duas vezes maior, o argumento fica mais forte quanto mais estável for o seu prompt.

• Se a sua comparação foi construída a partir da tabela de preços por token — reconstrua-a a partir do custo por tarefa. US$ 6,00 contra US$ 10,00 de saída é o par de números menos informativo deste artigo, e é o par com que todas as páginas existentes abrem.

Comparados neste artigo2

Detectado a partir deste artigo · Benchmarks: Artificial Analysis · atualizado diariamente