
GPT-5.6 vs Grok 4.6: Empate no Índice, Divergência em Contexto e Preço
- openaiNOVOOpenAI: GPT-6 Astra2026-09-0453Inteligência77Código
- googleNOVOGoogle: Gemini 3.8 Flash2026-09-0241Inteligência76Código
- qwenNOVOQwen: Qwen3.8 Max (0902)2026-09-0240Inteligência72Código
- anthropicNOVOAnthropic: Claude Fable 5.12026-09-0153Inteligência82Código
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 por 1M de tokens
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Inteligência72Código
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.24 / $0.73 por 1M de tokens
- z-aiZ.ai: GLM 5.32026-08-1845Inteligência75Código
- obsidianQwen3.8 27B2026-08-1534Inteligência68Código
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Inteligência69Código
- grokSpaceXAI: Grok 4.62026-08-1244Inteligência77Código
- metaMeta: Muse Spark 1.22026-08-0540Inteligência72Código
- qwenQwen: Qwen3.8 Max2026-08-0340Inteligência72Código
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135Inteligência69Código
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 por 1M de tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2451Inteligência78Código
- googleGoogle: Gemini 3.6 Flash2026-07-2134Inteligência69Código
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2123Inteligência49Código
Na escala do Artificial Analysis Intelligence Index, contra a qual ambos foram medidos até o início de setembro de 2026, o GPT-5.6 da OpenAI — cujo nível principal, GPT-5.6 Sol, é para onde o nome da API gpt-5.6 aponta — e o Grok 4.6 da SpaceXAI obtiveram o mesmo número: 61. Um índice independente colocando dois carros-chefe rivais em empate é o tipo de resultado mais raro numa comparação de fronteira, e é aí que este confronto fica interessante, e não onde termina. Os modelos que empataram são vendidos de maneiras bem diferentes. O GPT-5.6 Sol, o principal lançado pela OpenAI em 9 de julho e reposicionado como seu nível de valor quando o GPT-6 Astra foi lançado em 3 de setembro, custa US$ 4,00 por milhão de tokens de entrada e US$ 20,00 por milhão de tokens de saída após um corte de preço em 24 de agosto, e lê até cerca de 1,05 milhão de tokens de contexto. O Grok 4.6, que a xAI lançou em 12 de agosto, custa US$ 2,00 / US$ 6,00 e chega a 500.000 tokens. Mesma nota no quadro independente, e então os dois modelos divergem em quão longe você pode levar uma única solicitação — e quanto custa levá-la.
Esta página existe agora por um motivo concreto: as duas tabelas de preços e os dois tetos mudaram com poucas semanas de diferença. O Grok 4.6 foi lançado em 12 de agosto e, em 28 de agosto, ficou disponível nos chats normais do Grok na web e no celular, após duas semanas iniciais restritas ao Grok Build e à API. O corte promocional do GPT-5.6 Sol chegou em 24 de agosto e, dez dias depois, o lançamento do GPT-6 Astra rebaixou silenciosamente o Sol de carro-chefe a carro-chefe de valor. Os dois modelos abaixo são agora o que você procura quando quer raciocínio próximo da fronteira sem pagar preços da classe Astra — exatamente por isso o empate de 61 a 61 se tornou o ponto de decisão real, e não uma questão de trivia.
O que "empatado em 61" significa, e o que não significa
A pontuação precisa de uma data e de uma régua. A Artificial Analysis mediu o GPT-5.6 Sol em ~61 e o Grok 4.6 em 61 na escala de índice em uso até o início de setembro — a escala que as outras comparações de GPT-5.6 deste blog citam — com o Grok classificado em 11º entre os 202 modelos que a AA acompanha e a Sol a alguns postos dele, com a mesma pontuação. Em seguida, a AA recalibrou o índice em 7 de setembro (v4.3), uma versão que comprime as pontuações: o GPT-5.6 Sol marca 47 nela, o GPT-6 Astra e o Claude Fable 5.1 marcam 53, e nenhuma pontuação geral do Grok 4.6 foi publicada na nova escala até agora. O empate abaixo é, portanto, uma afirmação sobre a escala de setembro anterior à recalibração, e é melhor lê-lo como posição relativa: no índice mais recente que pontuou ambos, os dois estavam empatados, e ambos ficaram logo atrás da classe do Claude Opus 5.
Mais uma ressalva sobre o empate, e isso importa para como você o utiliza. As duas pontuações foram produzidas em configurações de esforço diferentes — GPT-5.6 Sol com raciocínio máximo, a configuração mais alta do dial da OpenAI (que executa quatro subagentes paralelos em solicitações difíceis), e Grok 4.6 em alto, o padrão da xAI em seu dial de baixo a muito alto. Ambas são configurações de "dar tudo de si", mas não são a mesma configuração, e o empate é entre essas duas configurações específicas, e não entre todas as configurações que os modelos oferecem. O que a pontuação igual estabelece é que nenhum dos modelos tem uma vantagem de inteligência geral que o outro lado possa apontar em um composto independente — portanto, um comprador que escolhe entre eles precisa olhar além do índice, para o contexto, o preço e as evidências que cada lado pode realmente apresentar.
Duas tabelas de preços, dois precipícios
Ambos os fornecedores cobram um prompt longo como evento premium, e ambos cobram a solicitação inteira na camada superior quando um limite é ultrapassado — esse é o mecanismo comum que torna esta comparação de preços compreensível. A tarifa da OpenAI para GPT-5.6 Sol é de US$ 4,00 / US$ 20,00 por milhão, com leituras em cache a US$ 0,40, e quando uma solicitação ultrapassa cerca de 272 mil tokens de entrada, a solicitação inteira é reprecificada para US$ 8,00 / US$ 30,00 — a estrutura de contexto longo que a Epoch AI documentou em 8 de setembro. A tarifa da xAI para Grok 4.6 é de US$ 2,00 / US$ 6,00, com leituras em cache a US$ 0,50, e quando um prompt ultrapassa 200 mil tokens, a solicitação inteira passa para US$ 4,00 / US$ 12,00.
• Lançado — GPT-5.6: 9 de julho de 2026 (API pública; o alias gpt-5.6 atinge o nível Sol). Grok 4.6: 12 de agosto de 2026.
• Preço de tabela por 1M (entrada/saída) — GPT-5.6 Sol: $4.00 / $20.00, leituras em cache $0.40 (promoção até pelo menos 21 de novembro de 2026). Grok 4.6: $2.00 / $6.00, leituras em cache $0.50.
• Nível de prompt longo — GPT-5.6 Sol: solicitação inteira por $8,00 / $30,00 além de ~272K de entrada. Grok 4.6: solicitação inteira por $4,00 / $12,00 a 200K de entrada.
• Contexto / teto de saída — GPT-5.6 Sol: ~1.05M de entrada, 128K de saída. Grok 4.6: 500K de entrada, sem teto de saída publicado.
• Índice (independente) — GPT-5.6 Sol (max) ~61 vs Grok 4.6 (high) 61, escala de setembro pré-recalibração.
• Modalidade — ambas aceitam entrada de texto e imagem e produzem texto.
Rode os números calculados e o padrão é inequívoco: em cada comprimento de prompt que o Grok 4.6 pode atender, é a opção mais barata, porque seu teto reprecificado ainda se situa em ou abaixo da tarifa padrão do GPT-5.6 Sol.
• 100K de entrada / 8K de saída — GPT-5.6 Solução: 0.10 × $4 + 0.008 × $20 = $0.56. Grok 4.6: 0.10 × $2 + 0.008 × $6 = $0.25. Grok é aproximadamente 55% mais barato na requisição.
• 400K in / 30K out (ambos reajustados) — GPT-5.6 Sol: 0.40 × $8 + 0.03 × $30 = $4.10. Grok 4.6: 0.40 × $4 + 0.03 × $12 = $1.96. O Grok ainda custa aproximadamente metade do preço, mesmo após seu próprio aumento abrupto.
• 600K in / 30K out — GPT-5.6 Sol: 0,60 × US$ 8 + 0,03 × US$ 30 = US$ 5,70. Grok 4.6: não pode — 600K excede sua janela de contexto de 500K. Esta é a faixa em que Sol é a única opção e em que seu preço deixa de parecer premium.

A geometria do precipício difere de uma maneira que favorece o GPT-5.6 Sol: seu limiar (272K) fica mais alto que o do Grok (200K), então há uma faixa — aproximadamente de 200K a 272K de entrada — em que o Grok já aplicou o novo preço e o Sol ainda não. Mesmo nessa faixa, o Grok tende a ganhar em dólares, porque sua taxa de saída com o novo preço, de US$ 12, ainda é 40% menor que os US$ 20 padrão do Sol. A vantagem de custo só se inverte a favor do Sol acima de 500K tokens, que é exatamente a região que a janela de contexto do Grok não alcança. Se o comprimento dos seus prompts permanecer abaixo de 200K — o que vale para a maior parte do tráfego de chat, RAG e assistência de código — o Grok 4.6 é mais barato em escala por quase um fator de dois no custo combinado, e o efeito de precipício sobre a solicitação inteira significa que você deve tratar 200K como um limite de planejamento, e não como uma sugestão flexível.
Para que realmente servem os meio milhão de tokens extras do Sol.
A janela de 500K do Grok 4.6 comporta mais cargas de trabalho reais do que a ficha técnica sugere — leitura de bases de código inteiras, transcrições longas de agentes, grandes contextos de recuperação — {{1}}e a falta de um teto de saída publicado ajuda no lado da geração: para uma única chamada que precisa emitir um artefato muito longo, o Grok não tem teto documentado, enquanto o GPT-5.6 Sol se limita a 128K tokens de saída.{{/1}} {{2}}A vantagem do GPT-5.6 Sol está na faixa de 500K a 1,05M, e as cargas de trabalho que de fato precisam dessa faixa são mais restritas do que o marketing sugere: agentes que mantêm um repositório inteiro mais um longo histórico de tarefas no contexto; transcrições muito longas de reuniões ou de pesquisas analisadas em uma única passada; e tarefas de recuperação sobre corpora grandes demais para serem divididos em blocos que caibam nas janelas do tamanho do Grok.{{/2}} {{3}}Se nenhum dos seus pipelines tocar nessa faixa, o contexto extra do Sol é uma folga que você paga à taxa de entrada de US$ 4,00 para não usar.{{/3}}
Os dois modelos também direcionam o raciocínio de maneira diferente. O GPT-5.6 Sol expõe um dial de esforço baixo / médio / alto / máximo, onde o máximo executa quatro subagentes paralelos que se coordenam em tarefas difíceis — efetivamente um pequeno enxame de agentes por solicitação difícil, poderoso, porém caro em tokens de saída, e a configuração por trás da pontuação de índice ~61. O Grok 4.6 executa um único modelo com um dial de baixo a extra alto (padrão alto) e ferramentas do lado do servidor para busca e execução de código, o que torna seu comportamento mais previsível para orçamento: uma solicitação, um modelo, um custo que você pode estimar a partir da tabela de preços. Para um desenvolvedor que deseja gastos determinísticos, o design de modelo único do Grok é operacionalmente mais simples; para as tarefas mais difíceis de longo horizonte, o enxame de esforço máximo do Sol é a configuração mais capaz — e a razão pela qual sua melhor pontuação e suas piores contas vêm da mesma configuração.
As provas que cada lado pode realmente apresentar
Nenhum dos modelos tem uma vantagem independente no placar de codificação, então a evidência citável se divide por fornecedor. A OpenAI relata que o GPT-5.6 Sol obtém cerca de 96% no SWE-bench Verified — a citação de codificação mais forte que qualquer um dos modelos pode apresentar, mas uma avaliação relatada sem auditoria independente publicada até agora — e a vantagem do Sol no mundo real inclui estar integrado às ferramentas Codex e ChatGPT. A xAI relata que o Grok 4.6 obteve 94,9% no GPQA Diamond, que a empresa apresenta como a maior pontuação testada nesse benchmark, e cita avaliações de agentes com média de aproximadamente US$ 0,84 de custo de API por tarefa abrangente; ambos são números do fornecedor. Em velocidade, os dois estão mais próximos do que a diferença de preço sugere: a AA mediu o Grok 4.6 em 64,9 tokens de saída por segundo e o GPT-5.6 Sol na mesma faixa de meados dos 60 no serviço padrão, com a prévia separada "Ultrafast" da OpenAI, alimentada pela Cerebras, (até cerca de 750 tokens por segundo) ainda limitada e sem preço. Leia toda a tabela de evidências assim: empate no índice, comprovantes de codificação dos dois lados sem auditoria independente em nenhum deles, e nenhuma diferença de velocidade que mude a decisão.
Qual default é racional em setembro de 2026
Escolha o Grok 4.6 quando seu tráfego couber em menos de 200 mil tokens de entrada — o preço é quase a metade em cada tamanho que ele atende, o índice independente afirma que os modelos estão no mesmo nível, e um dial de modelo único com ferramentas no servidor mantém a conta previsível. Escolha o GPT-5.6 Sol quando você realmente precisar da faixa de contexto de 500 mil a 1,05 milhão, quando sua stack já for nativa em Codex ou ChatGPT e o valor relatado de ~96% no SWE-bench der ao procurement um comprovante de codificação, ou quando quiser a opção da configuração de máximo esforço com quatro subagentes para as tarefas mais difíceis de longo horizonte. E fique de olho em duas datas: a promoção de US$ 4/US$ 20 do GPT-5.6 Sol só é garantida até pelo menos 21 de novembro de 2026, após o que esta comparação muda, e a xAI já provocou um Grok 4.7 — qualquer um desses eventos pode repreificar o confronto que você está prestes a adotar como padrão.
Executar ambos sem rearquitetar
Como o empate no índice significa que esta é uma decisão de teto e preço, e não de qualidade, o padrão prático para a maioria das equipes é rotear em vez de escolher. GPT-5.6 Sol e Grok 4.6 estão ambos no OrcaRouter pelos preços de tabela de seus provedores, repassados sem margem — os US$ 4/US$ 20 da OpenAI e os US$ 2/US$ 6 da xAI são os números na listagem, e quando qualquer um dos fornecedores altera uma tarifa, o novo preço fica ativo na mesma chave no mesmo dia. Com um único endpoint compatível com OpenAI, você pode enviar tráfego sub-200K para Grok 4.6, escalar prompts que precisam do contexto mais longo da Sol ou de sua configuração de máximo esforço, e usar failover automático para que um limite de taxa em um caminho de provedor seja um evento de roteamento em vez de uma indisponibilidade.

A metade do preço desta comparação é a parte que muda — a promoção Sol da OpenAI só é garantida até 21 de novembro e a xAI tem um 4.7 no roadmap — então a referência que este blog mantém atualizada é sua página de preços do GPT-5.6 Sol, com data e reverificada sempre que a tabela de preços muda.

A resposta de duas linhas
Se seus prompts cabem em menos de 500 mil tokens — e a maioria cabe — o Grok 4.6 entrega a mesma pontuação de índice independente que o GPT-5.6 Sol por cerca de metade do preço em todos os comprimentos que ele consegue atender, sem limite de saída publicado e com um dial previsível de modelo único. O GPT-5.6 Sol justifica seu preço premium na faixa que o Grok não alcança: além de 500 mil tokens de contexto, e dentro das ferramentas da OpenAI, onde seus relatados ~96% no SWE-bench Verified e os níveis Terra e Luna abaixo dele oferecem uma família em vez de um modelo único. O empate no índice significa que essa decisão é sobre tetos e dólares, não sobre capacidade — então meça seus prompts reais mais longos antes de se comprometer, porque esse único número escolhe o vencedor.
Comparados neste artigo1
Detectado a partir deste artigo · Benchmarks: Artificial Analysis · atualizado diariamente
