
GPT-6 vs Grok 4.6: dois níveis intermediários, uma fatura que diverge acima de 200 mil tokens
- openaiNOVOOpenAI: GPT-6.1 Sol2026-09-2952Inteligência
- anthropicNOVOAnthropic: Claude Sonnet 5.52026-09-2856Inteligência
- typesafeNOVOTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 por 1M de tokens · 128 tok/s
- OpenAIOpenAI: GPT-6 Luna2026-09-2238Inteligência
- OpenAIOpenAI: GPT-6 Sol2026-09-2248Inteligência
- AnthropicAnthropic: Claude Opus 5.52026-09-2258Inteligência
- xAIGrok 4.72026-09-2146Inteligência
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 por 1M de tokens · 60 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 por 1M de tokens · 320 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Inteligência
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Inteligência77Código
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Inteligência76Código
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Inteligência76Código
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Inteligência82Código
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 por 1M de tokens · 54 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 por 1M de tokens · 356 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Inteligência72Código
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 por 1M de tokens · 232 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Inteligência75Código
- obsidianQwen3.8 27B2026-08-1534Inteligência68Código
GPT-6 Sol e Grok 4.6 custam os mesmos US$ 2,00 por milhão de tokens de entrada e US$ 6,00 por milhão de tokens de saída no topo das duas colunas. O que quase ninguém publica ao lado disso é que as colunas deixam de coincidir em pontos diferentes da requisição. O Grok 4.6 começa a cobrar sua tarifa de contexto longo assim que um prompt ultrapassa 200.000 tokens de entrada; o GPT-6 Sol só começa em 272.000. Acima dessas linhas, a requisição inteira é reprecificada — não apenas o excedente — e os dois fornecedores a reprecificam em direções opostas, que é justamente a parte que decide a fatura de uma longa execução de agente. O GPT-6 Sol e seus irmãos GPT-6 Astra e GPT-6 Luna foram lançados em 22 de setembro de 2026; o Grok 4.6, o nível intermediário da linha da SpaceXAI, foi lançado em 12 de agosto de 2026 e já foi acompanhado pelo Grok 4.7, de modo que esta é uma comparação entre dois modelos já lançados, e não o lançamento de nenhum deles.
Uma segunda coisa mudou em 7 de outubro de 2026 que é relevante para a forma como você lê o GPT-6 de modo geral: a OpenAI começou a implementar o GPT-6 na aba Chat principal do ChatGPT, chegando aos planos gratuitos em 8 de outubro, com os planos Plus, Pro, Business e Enterprise executando o GPT-6 Sol e os planos Free e Go executando o GPT-6 Luna. Isso é uma mudança de superfície — os mesmos modelos, um público muito maior e uma nova camada de interface que a OpenAI chama de Intelligent UI. Isso não altera nenhuma taxa de API. Mas significa que, se você está fazendo benchmark do "GPT-6" contra qualquer coisa, agora está fazendo benchmark contra um modelo com o qual um número muito grande de pessoas também está conversando em uma aba do navegador.
Em que os dois cartões realmente diferem
• Entrada de contexto curto — GPT-6 Sol US$ 2,00 por milhão vs Grok 4.6 US$ 2,00 por milhão
• Saída de contexto curto — GPT-6 Sol US$ 10,00 por milhão vs Grok 4.6 US$ 6,00 por milhão
• Limite de solicitação longa — GPT-6 Sol altera o preço acima de 272.000 tokens de entrada vs Grok 4.6 acima de 200.000
• Entrada de solicitação longa — GPT-6 Sol US$ 4,00 por milhão vs Grok 4.6 US$ 4,00 por milhão
• Saída de solicitação longa — GPT-6 Sol US$ 15,00 por milhão vs Grok 4.6 US$ 12,00 por milhão
• Entrada em cache — GPT-6 Sol US$ 0,20 por milhão vs Grok 4.6 US$ 0,50 por milhão
• Janela de contexto — GPT-6 Sol 1.050.000 tokens vs Grok 4.6 500.000 tokens
• Modalidades de entrada — ambos aceitam texto, imagem e arquivo
• Pontuação de trabalho de conhecimento — GPT-6 Sol 47,6 vs Grok 4.6 44,3 no Artificial Analysis Intelligence Index
• Terminal-Bench 2.1 — GPT-6 Sol não publicado na mesma revisão vs Grok 4.6 88,4
Leia as duas linhas de saída em conjunto e a forma da decisão se revela. O Grok 4.6 é US$ 4,00 mais barato por milhão de tokens de saída em qualquer requisição abaixo de 200 mil, e apenas US$ 3,00 mais barato acima disso. Essa é uma diferença muito menor do que os 40% sugeridos pela manchete, porque ambos os modelos recalculam o preço da requisição inteira, e não apenas da parte que ultrapassa o limite — um detalhe que vale a pena ponderar, já que um prompt com 200.001 tokens não é cobrado como um token à tarifa cara mais 200.000 à tarifa barata.
Então o próprio limiar segue na direção oposta. O Grok 4.6 começa a aplicar novos preços 72.000 tokens antes do que o GPT-6 Sol. Para uma carga de trabalho que fica consistentemente entre 200 e 272K, o Grok 4.6 é o modelo mais caro, apesar do seu preço anunciado por token mais barato, e é o único dos dois que apresentou qualquer mudança. Em qual lado dessa janela seus prompts caem é uma pergunta mais útil do que qual preço anunciado é menor.

A lacuna do benchmark é menor e mais estreita do que a lacuna de preço.
No Índice de Inteligência da Artificial Analysis, que é uma medição de terceiros, e não uma tabela de fornecedor, o GPT-6 Sol está em 47,6 e o Grok 4.6 em 44,3. Uma diferença de 3,3 pontos numa escala de 0 a 100 é real, mas não é o tipo de distância que torna um modelo errado para uma tarefa e o outro certo. Além disso, ela é medida com uma configuração específica de raciocínio por modelo, e o GPT-6 Sol expõe esforço de raciocínio configurável, enquanto o Grok 4.6 expõe o seu próprio — portanto, quem cita um único número de confronto direto está citando um ponto numa grade bidimensional.
Onde os dois estão realmente mais distantes é no trabalho agêntico ao estilo de terminal. No Terminal-Bench 2.1, o Grok 4.6 apresenta 88,4. O GPT-6 Sol não tem nenhum valor publicado comparável para a revisão que o nosso catálogo inclui, e a leitura honesta de uma célula vazia é que o número não foi publicado — e não que o modelo teve um mau desempenho. Se a carga de trabalho for um agente de longa duração orientado por shell, as evidências publicadas favorecem o Grok 4.6, e a evidência em falta não conta como evidência para nenhum dos lados.
O inverso vale para a recuperação de conhecimento em contextos longos. O GPT-6 Sol registra 83,7 em recordação de contexto longo, contra os 80,3 do Grok 4.6, e os fornecedores de ambos os modelos relatam seus próprios números em outros lugares — a SpaceXAI destaca o GPQA Diamond em 94,9 para o Grok 4.6, e o material do GPT-6 da OpenAI é em grande parte relatado pelo fornecedor e não reproduzido. Duas regras mantêm isso claro: um número de fornecedor é uma alegação, e um número de índice é uma medição de uma revisão nomeada. Eles não são intercambiáveis e nunca devem ser calculados em média para uma única pontuação "melhor".
O problema do sucessor
Nenhum desses é o modelo mais recente de seu próprio laboratório, e fingir o contrário seria a coisa mais enganosa que esta comparação poderia fazer. A SpaceXAI lançou o Grok 4.7 em 21 de setembro de 2026, com o mesmo preço base de US$ 2,00 / US$ 6,00, com o Índice de Inteligência passando de 44,3 para 46,4. A OpenAI lançou o GPT-6.1 Sol em 29 de setembro de 2026, também a US$ 2,00 / US$ 10,00, com o Índice de Inteligência em 51,8 e uma tarifa que na verdade melhorou: a entrada em cache caiu de US$ 0,20 para US$ 0,10 por milhão. A Artificial Analysis agora sinaliza sua página do GPT-6 Sol como obsoleta, direcionando os leitores para o GPT-6.1 Sol.
Então, o enquadramento justo não é "qual destes dois você deve adotar", mas "qual destes dois, e você tem certeza de que não é uma geração mais nova de qualquer um dos lados". A razão para permanecer no GPT-6 Sol costuma ser uma integração específica de oito dias, e não uma alegação de capacidade; a razão para permanecer no Grok 4.6 é um número publicado de agente de terminal que seu sucessor ainda não igualou em público. Ambas são legítimas, e ambas têm prazo definido.

Executando ambos a partir de uma tecla.
Os dois modelos são roteados pelo OrcaRouter, então a parte mecânica de manter dois candidatos vivos não custa nada: uma única API na frente de mais de 200 modelos, a mesma chave, nenhum segundo contrato e nenhuma alteração de código entre eles. Isso importa mais aqui do que de costume, porque o argumento a favor de um segundo modelo neste confronto específico não é uma proteção de capacidade, mas uma decisão de roteamento — mande a janela de 200K a 272K para o GPT-6 Sol e tudo o que for mais curto para o Grok 4.6, e a mesma aplicação fica com a conta mais barata dos dois lados de um limite que nenhum dos fornecedores deixa você escolher.
O failover automático é a metade entediante da mesma configuração. Execuções de agentes com contexto longo são longas justamente porque algo está mantendo uma sessão aberta, e um soluço de um provedor no minuto quarenta é o tipo caro de falha. Uma segunda rota configurada com antecedência transforma isso em uma nova tentativa, em vez de uma nova execução.
Nosso catálogo lista ambos ao preço de tabela do próprio provedor, sem nenhum acréscimo de margem, então uma alteração de tarifa em qualquer um dos cartões chega ao nosso lado no mesmo dia em que chega ao lado deles. Vale a pena dizer isso claramente, e não como um slogan: o motivo para se importar é que a diferença de entrada em cache de US$ 0,20 versus US$ 0,50 acima é exatamente o tipo de linha que os fornecedores alteram silenciosamente, e um repasse significa que você nunca precisa esperar que um revendedor se atualize.

O que realmente decide isso
Se seus prompts forem curtos, o Grok 4.6 vence no preço de saída por uma margem que nenhum delta de índice fecha, e sua pontuação de agente terminal é o número publicado mais alto em qualquer uma das colunas. Se seus prompts forem longos, o limiar de reajuste de preço mais tardio do GPT-6 Sol e sua janela mais longa valem mais do que sua taxa de saída mais alta, e a linha de entrada em cache custa um quarto do valor. Se seus prompts ficarem entre 200K e 272K, você está com a única carga de trabalho em que o modelo aparentemente mais barato é o mais caro, e a solução é a seleção de rota, não a seleção de modelo.
O que deve ser observado não é nenhum dos dois modelos, mas os dois sucessores que já estão disponíveis. Tanto o Grok 4.7 quanto o GPT-6.1 Sol enfraquecem o argumento para esperar por uma decisão aqui, e uma comparação que precisa ser refeita a cada três semanas é uma comparação que deve ficar atrás de um roteador, e não em um documento de arquitetura.
Comparados neste artigo3
Detectado a partir deste artigo · Benchmarks: Artificial Analysis · atualizado diariamente
