Um cartão hero gerado para uma comparação entre GPT-6.1 Sol e Grok 4.7, com o título '40% mais barato por token, 5,2 vezes a fatura', com três badges com os textos 'Saída do Grok 4.7: US$ 6,00 por 1M', 'Saída do GPT-6.1 Sol: US$ 10,00 por 1M' e 'Tokens de saída na execução do índice: 67M vs 240M', e o logotipo OrcaRouter no canto inferior direito.
Guides & Insights

GPT-6.1 Sol vs Grok 4.7: A Taxa de Saída Mais Barata da Sala, e a Conversa Mais Cara

Autor

Elias Hawthorne

Data de publicação

Modelos mais recentes · 20Ver todos os modelos →
Benchmarks: Artificial Analysis · atualizado diariamente
Voltar para todas as publicações

Grok 4.7, o sucessor do Grok 4.6 da xAI, foi lançado em 21 de setembro de 2026 a US$ 2,00 por milhão de tokens de entrada e US$ 6,00 por milhão de tokens de saída. GPT-6.1 Sol, a atualização de faixa intermediária da OpenAI, foi lançado oito dias depois, em 29 de setembro, a US$ 2,00 de entrada e US$ 10,00 de saída. As tarifas de entrada são idênticas, a tarifa de saída é 40% mais barata no Grok 4.7, e é aí que a maioria das comparações para. É o lugar errado para parar, porque o mesmo painel independente agora mediu os dois modelos de ponta a ponta: o Grok 4.7 consumiu cerca de 240 milhões de tokens de saída para concluir o Artificial Analysis Intelligence Index; o GPT-6.1 Sol consumiu 67 milhões. Multiplique a tarifa mais barata por três vezes e meia o volume e o modelo com o menor preço por token custa US$ 3,74 por tarefa concluída, contra US$ 0,72.

Dois modelos, com oito dias de diferença, e uma tabela de preços idêntica

O Grok 4.7 é o modelo mais forte da xAI para codificação e trabalho do conhecimento: uma janela de contexto de 500.000 tokens, até 450.000 tokens de saída em uma única resposta segundo a listagem do fornecedor, entrada de texto, imagem e arquivo, e esforço de raciocínio configurável entre baixo, médio (padrão), alto e xhigh. A xAI não divulgou o número de parâmetros, e sua data de corte de pré-treinamento é relatada como junho de 2026, com treinamento complementar até agosto.

O GPT-6.1 Sol é a atualização de um único incremento da OpenAI para o nível GPT-6 Sol, posicionado abaixo do GPT-6 Astra e acima do GPT-6 Luna: 1.050.000 tokens de contexto — aproximadamente o dobro do Grok — com um teto de saída de 128.000 tokens, que é cerca de um terço do teto do Grok, uma data de corte de conhecimento de 30 de abril de 2026, e a mesma entrada de texto, imagem e arquivo. Sua escala de raciocínio vai de baixo até máximo com padrão médio, e não aceita mais nenhum de forma alguma.

Uma linha por dimensão, ambos os lados em cada:

• Entrada — GPT-6.1 Sol $2,00 por 1M vs. Grok 4.7 $2,00 por 1M; idênticos
• Saída — GPT-6.1 Sol $10,00 por 1M vs. Grok 4.7 $6,00 por 1M; Grok é 40% mais barato
• Entrada em cache — GPT-6.1 Sol $0,10 por 1M vs. Grok 4.7 $0,50 por 1M; Sol é cinco vezes mais barato, o oposto do que a linha de saída implica
• Janela de contexto — 1.050.000 tokens vs. 500.000
• Saída máxima em uma resposta — 128.000 tokens vs. 450.000 declarados
• Faixa de contexto longo — preço reajustado para a requisição inteira acima de 272.000 tokens de entrada, com 2× na entrada e no cache e 1,5× na saída vs. todas as tarifas dobradas acima de 200.000 tokens de entrada, também para a requisição inteira
• Esforço de raciocínio — baixo, médio (padrão), alto, xhigh, máximo vs. baixo, médio (padrão), alto, xhigh
• Pesos e parâmetros — fechados, não divulgados vs. fechados, não divulgados; nenhum dos dois oferece um checkpoint
• Intelligence Index no esforço máximo publicado — GPT-6.1 Sol 51,8 no máximo vs. Grok 4.7 46,4 no xhigh
• Custo por tarefa do índice, independente — $0,72 vs. $3,74
• Tokens de saída na execução do índice — 67 milhões vs. 240 milhões, contra uma mediana do ranking perto de 81 milhões

Duas linhas dessa lista são a comparação inteira. A taxa de saída do Grok 4.7 é genuinamente mais baixa, e sua linha de cache é genuinamente cinco vezes mais alta; e ele gerou três vezes e meia a quantidade de tokens a serem medidos. A tabela de preços, lida isoladamente, aponta em uma direção. A medição aponta na outra, por um fator de cinco.

A generated hero card for a GPT-6.1 Sol versus Grok 4.7 comparison, headed '40% cheaper per token, 5.2 times the bill', with two badges reading 'Grok 4.7 output: $6.00 per 1M' and 'GPT-6.1 Sol output: $10.00 per 1M', a footer reading 'Independent figures per Artificial Analysis v4.3.2; Grok at xhigh, Sol at max; AI-generated card', and the OrcaRouter logo in the bottom-right corner.

Onde o Grok 4.7 está de fato à frente

Seria desonesto publicar este artigo como uma goleada, porque o Grok 4.7 vence em avaliações reais. Pontuados lado a lado no esforço máximo publicado no Artificial Analysis v4.3.2 — Grok em xhigh, Sol em max, uma diferença de configuração que vale a pena ter em mente durante todo o texto:

• GDPval-AA v2.1 — Grok 4.7 Elo 1715,4 vs GPT-6.1 Sol Elo 1575,1. Uma vantagem de 140 pontos de Elo em trabalho de conhecimento economicamente valioso, e a maior vitória independente isolada para o modelo com a tabela de preços mais barata.
• AutomationBench-AA — Grok 4.7 0,6556 vs GPT-6.1 Sol 0,6487. Efetivamente um empate, nominalmente de Grok.
• SciCode — Grok 4.7 0,5741 vs GPT-6.1 Sol 0,5417. Uma vantagem de 3,2 pontos em codificação científica.
• Terminal-Bench 4.0 — Grok 4.7 0,2576 vs GPT-6.1 Sol 0,5606. Um déficit de 30 pontos, e a maior diferença do confronto.
• Humanity's Last Exam — Grok 4.7 0,4314 vs GPT-6.1 Sol 0,5292.
• AA-LCR v1.1, raciocínio de contexto longo — Grok 4.7 0,7667 vs GPT-6.1 Sol 0,83.
• AA-Omniscience — Grok 4.7 32,0 vs GPT-6.1 Sol 41,5.
• GDP.pdf — Grok 4.7 0,20 vs GPT-6.1 Sol 0,31.
• CritPt — Grok 4.7 0,1771 vs GPT-6.1 Sol 0,3171.

Três de nove avaliações vão para o Grok 4.7 ou empatam, incluindo aquela com a qual é mais difícil contestar: o GDPval-AA foi concebido para precificar trabalho profissional economicamente valioso, e uma vantagem de 140 pontos de Elo não é ruído. Se a sua carga de trabalho é do tipo que o GDPval foi criado para representar — análise com muito documento, entregas profissionais, decisões de julgamento com uma resposta correta —, o modelo com a tabela de preços mais barata também é o melhor modelo no placar neutro, e a penalidade de custo por tarefa é o que você paga por isso.

Os próprios números de lançamento da xAI são grandes e, como todos os números de lançamento de fornecedores, não reproduzidos. CursorBench 4.0 a 46,3% em xhigh contra os 40,4% do Grok 4.6; Terminal-Bench 4.0 a 38,0% contra 20,3%, o maior ganho único alegado no lançamento; DeepSWE v1.1 a 71,0% em high contra 65,2%; EEBench a 64,0% contra 53,0%. Esses são o harness da xAI, as configurações da xAI, os relatórios da xAI — e observe que a alegação de 38,0% no Terminal-Bench 4.0 contrasta com o 0,2576 do ranking independente para o mesmo modelo no mesmo benchmark, que é o tipo de discrepância que você deve esperar entre uma configuração ajustada de um fornecedor e uma execução neutra de esforço máximo.

Os números da OpenAI para o GPT-6.1 Sol merecem o mesmo desconto e têm a mesma fraqueza. O único número nesta comparação que nenhum dos fornecedores produziu é o custo por tarefa concluída, porque é calculado a partir do consumo medido de tokens, e não de uma tabela de pontuação. É esse o número que sobrevive.

Por que 240 milhões de tokens decidem isso

A Artificial Analysis descreve a verbosidade do Grok 4.7 em seu próprio resumo, e a contagem de tokens por trás da execução do índice é a evidência: 240 milhões de tokens de saída contra uma mediana do placar perto de 81 milhões, aproximadamente três vezes o que um modelo típico no mesmo conjunto produz. Os 67 milhões do GPT-6.1 Sol ficam bem abaixo da mediana. Junte as duas proporções — 3,6× o volume a 0,6× o preço — e a taxa de saída mais barata está comprando mais tokens em vez de uma conta menor, que é exatamente a aparência de uma diferença de custo por tarefa de US$ 3,74 contra US$ 0,72.

O cache altera o tamanho do efeito, mas não a sua direção, e é este o detalhe que confunde as pessoas. A entrada em cache do Grok 4.7 é de $0.50 por milhão contra $0.10 do Sol — cinco vezes mais cara na linha onde vivem históricos longos de agentes e prompts de sistema repetidos. Uma carga de trabalho dominada pela releitura de um grande prefixo estável, portanto, encontra os dois modelos mais próximos do que $6 contra $10 sugere, e, uma vez aplicada a verbosidade do Grok por cima, mais distantes do que as taxas de entrada sugerem. A linha de cache e a linha de tokens apontam na mesma direção aqui, o que é incomum e torna este emparelhamento mais limpo do que as tabelas de tarifas implicam.

Vale a pena precificar as cláusulas de contexto longo separadamente, porque elas são acionadas em pontos diferentes. O GPT-6.1 Sol reprecifica uma requisição inteira acima de 272.000 tokens; o Grok 4.7 faz o mesmo acima de 200.000. Em uma chamada de 250.000 tokens, o Grok já dobrou — US$ 4,00 e US$ 12,00 com uma leitura de cache de US$ 1,00 — enquanto o Sol ainda está em seus valores padrão de US$ 2,00 e US$ 10,00. Entre 200.000 e 272.000 tokens, o modelo com a tabela de preços mais barata é o mais caro por uma margem ampla, e essa faixa é comum em documentos.

Onde o Grok realmente vence na estrutura, e não na pontuação, é no teto de saída. Uma resposta máxima de 450.000 tokens contra os 128.000 do Sol é uma categoria diferente de artefato: uma base de código inteira gerada, uma transcrição longa, uma síntese do tamanho de um livro em uma única chamada. Se você está atingindo os limites de saída hoje, essa linha decide a comparação e nada da aritmética de custos acima se aplica — você não pode comprar a nenhum preço uma capacidade que o outro modelo não tem.

Ambos estão em uma única tecla, o que é a parte útil

O Grok 4.7 está no OrcaRouter pelo preço de tabela da própria xAI — $2,00 e $6,00 por milhão de tokens, com leitura de cache a $0,50, e o escalão de 200.000 tokens para $4,00 e $12,00 repassado exatamente como a xAI o lista — e o GPT-6.1 Sol chegou às nossas rotas no dia do lançamento pelo preço da OpenAI, $2,00 e $10,00, com entrada em cache a $0,10, e o escalão de 272.000 tokens inalterado. Nada é acrescentado a nenhum dos dois: a plataforma repassa o preço de tabela do provedor em vez de aplicar uma margem, o que significa que um corte de preço do fornecedor de qualquer lado entra em vigor aqui no mesmo dia em que entra em vigor lá, sem segunda fatura e sem revendedor no meio.

A screenshot of the OrcaRouter model page for grok/grok-4.7, showing the listing dated 2026-09-21, the model described as SpaceXAI's flagship for coding, agentic tasks and knowledge work, a 500K-token context with up to 450K output tokens, text, image and file input, and the list price of $2.00 input and $6.00 output per million tokens with a 4.03 s median time to first token.

Para este par em particular, isso vale mais do que a conveniência. Os dois modelos divergem quanto àquilo em que são bons — Grok 4.7 lidera no Elo de trabalho profissional e em codificação científica, GPT-6.1 Sol lidera na execução em terminal, na confiabilidade factual e na recuperação de contexto longo — e a fronteira entre essas cargas de trabalho é visível no seu próprio tráfego antes de ser visível em um benchmark. Enviar requisições no formato GDPval para um lado e execuções de agente de horizonte longo para o outro, atrás de um único endpoint, com failover automático entre ambos e uma regra de roteamento que você altera na configuração em vez de numa implantação, é uma forma mais barata de encontrar essa fronteira do que um projeto de avaliação. A fusão de modelos, em que um painel de modelos responde em conjunto, é a outra opção que a plataforma oferece se você preferir não escolher a cada requisição.

A screenshot of xAI's Grok 4.7 developer documentation, showing the model ID grok-4.7, the description 'SpaceXAI's frontier model for coding, agentic tasks, and knowledge work', text and image to text modalities, a 500,000-token context window, and pricing of $2.00 per 1M input tokens and $6.00 per 1M output tokens.

A chamada

• Trabalho agêntico e de terminal com saída longa, loops de prefixo em cache — GPT-6.1 Sol. Trinta pontos no Terminal-Bench 4.0, uma linha de cache cinco vezes mais barata e um quinto do custo por tarefa.
• Trabalho profissional de conhecimento, análise de documentos, tarefas de julgamento — Grok 4.7 com base em uma vantagem de 140 pontos no GDPval-El o, com a conta de tokens orçada em vez de presumida.
• Codificação científica — Grok 4.7, por pouco, na divisão SciCode do quadro. Verifique na sua própria suíte; 3,2 pontos está dentro do intervalo que um conjunto de prompts diferente pode mover.
• Respostas únicas acima de 128.000 tokens de saída — Grok 4.7, e não há aritmética que substitua isso.
• Requisições entre 200.000 e 272.000 tokens de entrada — GPT-6.1 Sol, porque Grok 4.7 já dobrou sua requisição e o Sol também.
• Conversa mais barata possível — nenhum desses dois. Ambos são modelos com preços de fronteira e apetites de tokens de fronteira; a comparação é sobre qual deles termina sua tarefa, não sobre qual é barato em abstrato.
• Se uma comparação termina com "Grok é mais barato por token" — ela terminou um passo cedo demais. O próximo passo é a contagem de tokens, e é 240 milhões contra 67.

Comparados neste artigo1

Detectado a partir deste artigo · Benchmarks: Artificial Analysis · atualizado diariamente