
GPT-6 Sol Pro vs Grok 4.7: o dobro da verbosidade, um terço do preço
- typesafeNOVOTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 por 1M de tokens · 986 tok/s
- openaiNOVOOpenAI: GPT-6 Luna2026-09-2237Inteligência
- openaiNOVOOpenAI: GPT-6 Sol2026-09-2248Inteligência
- anthropicNOVOAnthropic: Claude Opus 5.52026-09-2258Inteligência
- grokNOVOGrok 4.72026-09-2146Inteligência
- OrcaNOVOOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 por 1M de tokens · 196 tok/s
- orcaNOVOOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 por 1M de tokens · 1327 tok/s
- deepseekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Inteligência
- openaiOpenAI: GPT-6 Astra2026-09-0453Inteligência77Código
- googleGoogle: Gemini 3.8 Flash2026-09-0241Inteligência76Código
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Inteligência76Código
- anthropicAnthropic: Claude Fable 5.12026-09-0153Inteligência82Código
- tencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 por 1M de tokens
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 por 1M de tokens · 112 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Inteligência72Código
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 por 1M de tokens · 221 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Inteligência75Código
- obsidianQwen3.8 27B2026-08-1534Inteligência68Código
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Inteligência69Código
- grokSpaceXAI: Grok 4.62026-08-1244Inteligência77Código
Os dois modelos mais baratos adjacentes à fronteira de setembro de 2026 chegaram com um dia de diferença, e o interessante neles não é qual é mais inteligente. GPT-6 Sol — o modelo que as pessoas procuram quando pesquisam GPT-6 Sol Pro, que é aquele modelo com seu reasoning.mode definido como pro em vez de um produto separado — foi lançado em 22 de setembro de 2026 a US$ 2,00 por milhão de tokens de entrada e US$ 10,00 por milhão de tokens de saída. Grok 4.7 do fornecedor foi lançado em 21 de setembro com a mesma entrada de US$ 2,00 e saída de US$ 6,00. No harness neutro da Artificial Analysis, os dois ficam separados por dois pontos no índice e por cerca de dois dólares por tarefa concluída, e o motivo dessa diferença não é a capacidade. É quantos tokens cada um queima para chegar lá.
O Sol gerou 77 milhões de tokens de saída executando o Intelligence Index. O Grok 4.7 gerou 240 milhões. Essa proporção — um pouco mais de três para um — é toda a comparação, e inverte a conclusão que uma tabela de preços por token lhe dá.
As duas tabelas de tarifas, e onde a barata não é barata
Ambos os fornecedores publicam eles próprios esses números; nenhum foi reprecificado de forma independente.
• Entrada — GPT-6 Sol $2,00 por milhão de tokens vs. Grok 4.7 $2,00 por milhão de tokens
• Saída — GPT-6 Sol $10,00 por milhão de tokens vs Grok 4.7 $6,00 por milhão de tokens
• Entrada em cache — GPT-6 Sol $0,20 por milhão de tokens vs Grok 4.7 $0,50 por milhão de tokens; a leitura de cache do Sol é duas vezes e meia mais barata, o que é o oposto do que a taxa de saída da manchete sugere
• Janela de contexto — GPT-6 Sol 1.050.000 tokens vs Grok 4.7 500.000 tokens
• Sobretaxa de contexto longo — O GPT-6 Sol repreficica uma solicitação acima de 272.000 tokens de entrada cobrando 2× as tarifas de entrada e de cache e 1,5× a tarifa de saída para toda a solicitação, em comparação com o Grok 4.7, que dobra todas as tarifas a 200.000 tokens de entrada, também para toda a solicitação
• Data de corte de conhecimento — GPT-6 Sol, 20 de abril de 2026 vs. Grok 4.7, um corte de pré-treinamento relatado como junho de 2026, com treinamento suplementar até agosto
• Esforço de raciocínio — GPT-6 Sol nenhum, baixo, médio (padrão), alto, xhigh, máx vs Grok 4.7 baixo, médio (padrão), alto, xhigh
• Modalidade — ambos aceitam entrada de texto e imagem e retornam texto
A linha de leitura de cache é aquela com que um comprador deveria sentar-se para analisar. A taxa de saída do Grok 4.7 é 40% menor, mas seu input em cache é 150% maior, e é no input em cache que vivem históricos longos de agentes e prompts de sistema repetidos. Uma carga de trabalho que consiste sobretudo em reler um contexto grande e estável verá os dois modelos muito mais próximos do que US$ 6 contra US$ 10 sugere.

O registro independente, e o único número que o decide.
O Artificial Analysis é a única estrutura de avaliação que mediu ambos os modelos, e vale a pena colocar seus números lado a lado, porque a divergência é instrutiva.
• Índice de Inteligência — GPT-6 Sol 48 no esforço máximo vs Grok 4.7 46 no xhigh; ambos bem acima da mediana de 25 dos modelos comparáveis
• Custo por tarefa de índice — GPT-6 Sol $1,06 vs Grok 4.7 $3,74
• Tokens de saída para a execução do índice — GPT-6 Sol 77M vs Grok 4.7 240M, contra uma mediana de 88M
• Velocidade de saída — o Grok 4.7 mediu 39 tokens por segundo, o que o próprio harness classifica como notavelmente lento; o número do Sol no mesmo placar não é publicado na mesma linha de resumo
• Índice de Agentes de Codificação — GPT-6 Sol 57 a US$ 2,99 por tarefa vs. Grok 4.7 56 com seu próprio harness Grok Build, nove pontos acima do Grok 4.6
Dois pontos de diferença no índice, três vezes e meia o custo por tarefa. Isso não é uma anomalia de precificação — é a aritmética da verbosidade. O Grok 4.7 é um modelo que pensa em voz alta de forma prolongada; o harness o sinaliza como “muito verboso” em comparação com uma mediana de 88 milhões de tokens, e o custo acompanha os tokens, não a tabela de preços.
A comparação de agentes de codificação traz uma ressalva que o placar esconde. O 56 do Grok 4.7 é medido dentro do próprio harness Grok Build da xAI, que é a configuração que a xAI distribui e toma como referência em benchmarks. O 57 do Sol é medido em um harness neutro. Uma vantagem de um ou dois pontos por ser um harness próprio está bem dentro da faixa que a escolha do harness explica, o que significa que a leitura honesta é que esses dois estão empatados em codificação agêntica — e não que o Sol está um ponto à frente.

O que cada fornecedor alega, e o que nenhum dos dois demonstrou
O material de lançamento da xAI é específico e conta uma história de longo horizonte: o Grok 4.7 é construído sobre um modelo base maior que o do Grok 4.6 e recebeu uma execução de aprendizado por reforço mais longa, voltada para tarefas que "podem levar horas para serem concluídas", aprimorando a autoverificação, o processamento de contexto longo e o comportamento dentro do ambiente Grok Bot. Os números relatados pelo fornecedor incluem Terminal-Bench 4.0 em 38,0%, contra 20,3% do Grok 4.6, CursorBench 4.0 em 46,3% e DeepSWE v1.1 em 71,0%. Cada um deles é medição da própria xAI e nenhum foi reproduzido de forma independente; o número independente do Terminal-Bench 4.0 que circula é substancialmente menor que o do fornecedor, que é o formato habitual dessa diferença.
As alegações da OpenAI para o GPT-6 Sol são as já abordadas acima, e carregam o mesmo rótulo. Os números relatados pelo fornecedor são 33,2% no AutomationBench com esforço xhigh, contra 26,9% do Claude Opus 5 no max, a cerca de 9% do custo por tarefa, e 68,8% no DeepSWE v1.1 com esforço max — dentro de 1,1 ponto do Claude Fable 5 no xhigh, com cerca de 80% menos custo por tarefa. Observe o alvo da comparação: os próprios gráficos da OpenAI colocam o Sol contra os modelos da Anthropic, não contra o Grok 4.7. Nenhum dos fornecedores publicou um confronto direto contra o outro.

Onde a camada de roteamento justifica seu lugar
O OrcaRouter não disponibiliza nenhum dos dois modelos neste confronto — nem o Grok 4.7 nem o GPT-6 Sol constam do nosso catálogo, pelo que nada aqui constitui uma afirmação sobre o preço deles através de nós. O que uma camada de encaminhamento vale neste emparelhamento em particular é o modo de falha, e não a tabela de preços. A razão para recorrer ao Grok 4.7 é o seu comportamento agêntico de longo horizonte; a razão para não recorrer a ele é que uma velocidade de saída de 39 tokens por segundo torna uma execução longa de agente lenta o suficiente para ser relevante, e uma execução lenta é uma execução que pode expirar. Failover automático entre fornecedores significa que uma tarefa longa pode ser encaminhada para o modelo que estiver realmente disponível, sem que essa velocidade se torne um ponto único de falha, e a DSL de encaminhamento expressa a escolha do modelo como uma regra dentro da chamada e não como uma migração — o que importa aqui, porque a resposta correta para este par depende de a tarefa ser ávida por tokens ou sensível à latência, e isso é uma propriedade do pedido, não do trimestre.
A regra de decisão
• Programação agêntica com orçamento fixo — capacidade ao nível do GPT-6 Sol no índice neutro de programação, por cerca de um terço do custo por tarefa, porque chega lá com um terço dos tokens.
• Tarefas de longo horizonte, em que a duração da execução é o ponto central — Grok 4.7. O lançamento foi treinado especificamente para trabalho de várias horas, e os números do fornecedor no SWE-Marathon e no CursorBench apontam exatamente nessa direção.
• Volume sensível à latência — nenhum dos dois, com base no registro atual. O custo por tarefa do Sol é o número melhor, mas os 39 tokens por segundo medidos do {{1}}Grok 4.7{{/1}} são uma restrição real para qualquer coisa interativa.
• Cargas de trabalho de contexto longo majoritariamente em cache — GPT-6 Sol, na linha de leitura de cache em vez da linha de saída. A US$ 0,20 contra US$ 0,50 por milhão de tokens em cache, e com uma janela duas vezes maior, o argumento fica mais forte quanto mais estável for o seu prompt.
• Se a sua comparação foi construída a partir da tabela de preços por token — reconstrua-a a partir do custo por tarefa. US$ 6,00 contra US$ 10,00 de saída é o par de números menos informativo deste artigo, e é o par com que todas as páginas existentes abrem.
Comparados neste artigo2
Detectado a partir deste artigo · Benchmarks: Artificial Analysis · atualizado diariamente
