
Gemini 4 Argon vs GPT-6 Sol: Um Quinto do Preço, Quatro Vezes a Fatura
- openaiNOVOOpenAI: GPT-6.1 Sol2026-09-2952Inteligência
- anthropicNOVOAnthropic: Claude Sonnet 5.52026-09-2856Inteligência
- typesafeNOVOTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 por 1M de tokens · 219 tok/s
- OpenAINOVOOpenAI: GPT-6 Luna2026-09-2238Inteligência
- OpenAINOVOOpenAI: GPT-6 Sol2026-09-2248Inteligência
- AnthropicNOVOAnthropic: Claude Opus 5.52026-09-2258Inteligência
- xAINOVOGrok 4.72026-09-2146Inteligência
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 por 1M de tokens · 118 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 por 1M de tokens · 1064 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Inteligência
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Inteligência77Código
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Inteligência76Código
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Inteligência76Código
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Inteligência82Código
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 por 1M de tokens · 47 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 por 1M de tokens · 104 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Inteligência72Código
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 por 1M de tokens · 213 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Inteligência75Código
- obsidianQwen3.8 27B2026-08-1534Inteligência68Código
Executar a suíte de índices Artificial Analysis no Gemini 4 Argon custa US$ 2.407. Executar a mesma suíte no GPT-6 Sol custa US$ 1.546. Mesmo índice, mesmas tarefas, mesma semana. Os dois modelos têm preços de tabela idênticos — US$ 2,00 por milhão de tokens de entrada e US$ 10,00 por milhão de tokens de saída, com o Argon como uma tarifa introdutória declarada do Google e o Sol como a tarifa vigente da OpenAI — e, ainda assim, o custo final de executar um trabalho idêntico difere em 56%, a favor do modelo que pontua cinco pontos a menos. Essa diferença é exatamente o motivo pelo qual vale a pena escrever esta comparação, e não tem nada a ver com a tabela de preços.
Google anunciou o Gemini 4 Argon em 2026-09-30, chamando-o de a próxima era da inteligência de fronteira, com preço de US$ 2 de entrada e US$ 10 de saída, com entrada em cache com 95% de desconto, sendo disponibilizado a defensores cibernéticos de confiança por meio do Programa Fairwind. O GPT-6 Sol está disponível em geral desde 2026-09-22, quando a OpenAI lançou o nível intermediário da linha GPT-6 a US$ 2 de entrada e US$ 10 de saída, com 90% de desconto no cache. Um pode ser comprado hoje em um endpoint compatível com OpenAI, e o outro não pode ser comprado por ninguém fora de um grupo nomeado, que é a bifurcação prática deste artigo. Mas a inversão de custos acima sobrevive mesmo que você deixe a disponibilidade completamente de lado, e entender por que é a parte útil.
A inversão, dita sem rodeios
A Artificial Analysis publica tanto um Intelligence Index quanto uma contabilização de quanto custou executar esse índice. Lidos em conjunto, eles dizem isto:
• Índice de Inteligência — Gemini 4 Argon 52,6 contra GPT-6 Sol 47,5. Uma diferença de cinco pontos, medida com o Argon registrado em seu nível de esforço alto e o Sol no máximo, de modo que a comparação é generosa com o Sol, e não com o Argon.
• Preço de tabela por milhão de tokens — idêntico. $2,00 de entrada / $10,00 de saída nos dois. As leituras de cache são a única diferença: $0,10 no Argon, $0,20 no Sol.
• Custo por tarefa de indexação — Gemini 4 Argon $1.99 contra GPT-6 Sol $1.05. O Argon custa aproximadamente o dobro por tarefa, apesar de custar o mesmo por token.
• Custo para executar a suíte completa — Gemini 4 Argon $2,407 contra GPT-6 Sol $1,546.
• Velocidade de saída medida — GPT-6 Sol 77,0 tokens por segundo contra Gemini 4 Argon 48,9, uma diferença de 1,6× que se manifesta tanto na latência quanto no gasto.
Há uma linha nessa lista que explica todas as outras, e não é o preço. É a contagem de tokens. Nas próprias tarefas do índice, o Gemini 4 Argon gerou aproximadamente 561.000 tokens de saída por tarefa; o GPT-6 Sol gerou aproximadamente 282.000. O Argon pensa por duas vezes mais tempo para responder à mesma pergunta e, a uma taxa idêntica por token, isso é exatamente o dobro da conta.

Por que os tokens são o preço
Esta é a correção que vale a pena interiorizar antes de alguém orçar uma migração, porque a intuição aponta na direção errada. Quando um modelo tem o mesmo preço que o seu concorrente e consome o dobro dos tokens de saída para concluir, o preço por token não é o preço. O preço é o preço por token multiplicado pela quantidade de tokens que o modelo decide gastar, e esse segundo fator é uma propriedade do modelo, não da tabela de preços.
A margem por tarefa varia enormemente, o que torna tudo pior — não dá para aplicar um multiplicador fixo e simplesmente seguir em frente:
• Terminal-Bench 4.0 — Argon 165.330 tokens de saída por tarefa, contra os 97.372 do Sol. Argon custa US$ 6,78 por tarefa aqui, contra US$ 4,00 do Sol, embora o Argon pontue 57,1% contra 43,9% do Sol.
• CritPt — Argon 109 533 tokens contra os 31 848 do Sol. Uma proporção de tokens de 3,4× numa tarefa em que o Sol, na verdade, obtém pontuação mais alta, 30,9% contra 27,1%.
• GDPval — Argon 74.571 tokens contra 41.567 do Sol, por US$ 1,82 por tarefa contra US$ 1,32.
• Onisciência — uma proporção de 938 contra 2.662 tokens a favorda Argon, a $0,010 por tarefa contra $0,027 do Sol. A única família de tarefas em que a direção se inverte.
• Raciocínio de contexto longo — Argon com 2.197 tokens contra os 954 do Sol, e a única tarefa da suíte em que Sol vence claramente na pontuação, 83,7% a 79,7%.
CritPt é o instrutivo. Um modelo que consome três vezes e meia os tokens para produzir uma resposta um pouco pior à mesma pergunta não é uma história de capacidade; é uma história de hábito de gastos. O raciocínio do Argon se prolonga, e em alguns formatos de tarefa esse comprimento se converte em pontuação e, em outros, simplesmente se converte em dólares. O 52,6 do índice e o 47,5 do Sol são o agregado, e agregados escondem exatamente isso.
De onde os cinco pontos realmente vêm
Como o intervalo de indexação e o intervalo de custo apontam em direções opostas, vale a pena saber quais tarefas determinam cada um.
• Terminal-Bench 4.0 — Gemini 4 Argon 57,1% contra GPT-6 Sol 43,9%. A maior vitória individual do Argon, e a família de tarefas mais próxima de codificação agêntica de longo horizonte.
• Onisciência — Gemini 4 Argon 42.4 versus GPT-6 Sol 27.1. Uma diferença de quinze pontos na cobertura factual, a maior lacuna proporcional da suíte.
• AutomationBench-AA — Gemini 4 Argon 77,5% versus GPT-6 Sol 61,6%.
SciCode — Gemini 4 Argon 61% versus Gemini-6 Sol 57%.
• Último Exame da Humanidade — Gemini 4 Argon 57,1% versus GPT-6 Sol 47,9%.
• GDPval — Gemini 4 Argon 1.611 versus GPT-6 Sol 1.487.
• ApexAgents / AA-Briefcase — GPT-6 Sol com 1.482,78 de Elo, contra os 1.493,84 do Argon, uma diferença de 11 pontos que está dentro dos intervalos de confiança publicados e deveria ser considerada um empate.
• Raciocínio de contexto longo — GPT-6 Sol 83,7% versus Gemini 4 Argon 79,7%. A única vitória clara do Sol.
• CritPt — GPT-6 Sol 30,9% versus Gemini 4 Argon 27,1%. Sol vence novamente, por pouco.
Então, o cenário não é "Argon é melhor". É que Argon é melhor nas duas coisas que seus materiais de lançamento destacaram — execução de tarefas empresariais de ponta a ponta e engenharia de software de longo horizonte — e Sol está no mesmo nível ou à frente na escala de raciocínio de teor acadêmico e em manter coerência ao longo de um contexto extenso. Para um leitor cuja carga de trabalho é um pipeline de recuperação com um prompt de 400K tokens, Sol é simultaneamente o modelo superior e o mais barato, o que é uma posição incomum e confortável.
As diferenças de especificação que sobrevivem à discussão do benchmark
• Saída máxima — Gemini 4 Argon 1.000.000 de tokens em uma única trajetória, que o Google descreve como a maior do setor e um aumento em relação ao limite de 64K da geração anterior. GPT-6 Sol 128.000 tokens.
• Janela de contexto — a ficha do fornecedor do GPT-6 Sol declara aproximadamente 1.050.000 tokens; a do Argon, 1.000.000. A Artificial Analysis mediu o Sol em 872.000 tokens por meio de seu harness, o que é uma medição do harness e não um número da ficha — trate a ficha como a especificação e o número do harness como aquilo que o avaliador realmente exercitou.
• Modalidades de entrada — ambos aceitam texto, imagens e arquivos. O material de lançamento do Argon também se apoia na compreensão de vídeos longos, na qual o Google afirma 91,7% no LVBench e a descreve como estado da arte; esse é um número informado pelo fornecedor e nenhum painel independente o reproduz até o momento.
• Entrada de vídeo — Fraca. O Artificial Analysis mapeia o Argon com a entrada de vídeo desativada e nomeia vídeo explicitamente no lançamento, enquanto a ficha do Sol não lista vídeo de forma alguma. Se vídeo é essencial no seu pipeline, nenhuma das fichas resolve isso e você deve testar antes de arquitetar.
• Esforço de raciocínio — Sol expõe esforço configurável (de nenhum a máximo, médio por padrão) na API e foi plotado em máximo. Argon foi plotado em alto; ninguém publicou a mesma suíte na sua configuração máxima.
O teto de saída de 1M de tokens é o que poderia genuinamente mudar uma arquitetura, e não um orçamento. Qualquer coisa que você atualmente divide em uma dúzia de chamadas encadeadas para ficar abaixo de um limite de 128K — um conjunto de patches de vários arquivos, um relatório de auditoria completo, um documento longo em uma única passagem — passa a ser uma única chamada, com menos pontos em que um loop de agente pode perder estado. Se isso vale o dobro do custo por tarefa depende inteiramente de você ter essa carga de trabalho. Se tiver, provavelmente vale a pena. Se suas chamadas são de classificar e retornar, é dinheiro gasto em folga que ninguém vai ocupar.
A configuração de esforço que ninguém igualou, e por que isso importa
Uma ressalva merece um parágrafo próprio, porque vai contra a leitura da diferença de cinco pontos no índice como uma diferença pura de capacidade. A Artificial Analysis apresenta o Gemini 4 Argon em seu high ajuste de esforço de raciocínio e o GPT-6 Sol em max. Esses não são o mesmo degrau nas duas escadas, e a direção da discrepância é interessante: o Sol foi executado em seu ajuste mais caro e o Argon em um intermediário.
Seguem-se duas leituras e os dados não conseguem distingui-las. Ou o Argon no modo máximo obteria uma pontuação superior a 52,6 — mas também consumiria mais de 561.000 tokens por tarefa e custaria mais de US$ 1,99 — ou obteria mais ou menos a mesma pontuação, o que significaria que o ajuste de esforço não está fazendo muita diferença nesta suíte. Não há nenhuma execução publicada que resolva isso. Quem cita 52,6 como o teto do Argon está citando uma configuração, não um modelo, e a configuração é a que o fornecedor do Argon escolheu publicar primeiro.
A mesma lógica se aplica ao 47,5 do Sol, exceto na direção oposta: O max é o topo da sua escala, então o número está mais próximo de um teto do que de um piso. Uma disputa justa com esforço equiparado poderia reduzir a diferença e também poderia inverter a comparação de custos, já que os tokens que o max consome são os tokens que custam US$ 10 por milhão.
A bifurcação de disponibilidade, que decide a resposta real
O Gemini 4 Argon não está disponível de forma geral. O anúncio do Google diz que está a ser disponibilizado a um conjunto de defensores cibernéticos de confiança através do Programa Fairwind, que a empresa está envolvida no processo voluntário de acesso ao modelo antes do lançamento do governo dos EUA, e que o acesso geral para programadores, empresas e consumidores chega "o mais rapidamente possível", começando pelos clientes de API pagos e pelos subscritores do Google AI Ultra. Não há identificador de modelo, nem endpoint, nem quota e nem data. Não está em nenhuma API pública, incluindo a nossa — verifique o catálogo e dá 404, porque ainda não existe lá.
GPT-6 Sol é um produto chamável. No OrcaRouter, ele é openai/gpt-6-sol, no mesmo endpoint compatível com OpenAI que os outros mais de 200 modelos do catálogo, pelo preço de tabela da OpenAI repassado com margem zero, então os $2/$10 acima e o passo de contexto longo de 272.000 tokens para $4/$15 são o que você realmente paga, e não o que uma tabela de tarifas alega. O failover automático entre provedores cobre o caso em que a rota se degrada durante a execução, e a DSL de roteamento permite que um único aplicativo envie seu tráfego barato de classificação para um modelo menor e seu tráfego de raciocínio difícil para o Sol sem um segundo SDK.

Essa última configuração é a resposta honesta para esta comparação para a maioria das equipes. O argumento de custo a favor do Argon é real, mas condicional a uma carga de trabalho em que o trabalho de agente de horizonte longo domina; o argumento de custo contra ele é real em todas as outras cargas de trabalho; e você não pode comprá-lo este mês de qualquer forma. A jogada barata é construir o harness de avaliação agora — seus próprios prompts, sua própria pontuação, executados contra o Sol em algumas configurações de esforço — para que, quando o Argon chegar aos clientes pagantes da API, você tenha uma resposta medida para uma pergunta que todos os outros responderão a partir de um leaderboard.
O que resolveria isso
Três coisas, em ordem de quanto elas moveriam o veredito. Disponibilidade geral do Argon a um preço real, não introdutório — a palavra “introdutório” significa que os US$ 2/US$ 10 podem mudar, e a própria sequência do Google coloca clientes pagos da API em primeiro lugar, então a primeira tarifa publicada após o lançamento é a que deve ser observada. Uma execução publicada do Artificial Analysis do Argon na sua configuração de esforço máximo, que diria se 52,6 é um teto ou está a um fio de distância dele. E uma reprodução independente do número do DeepSWE v1.1 — o Google alega 77,9% e o chama de novo estado da arte; é informado pelo fornecedor e não foi reproduzido fora do Google até o momento.
Até lá, a divisão é nítida e levemente irônica. GPT-6 Sol é o modelo mais bem verificado, o mais rápido, o mais barato por tarefa concluída e aquele que você pode chamar hoje à tarde. Gemini 4 Argon é o modelo com maior pontuação no ranking que seu fornecedor escolheu publicar, aproximadamente duas vezes mais caro para realmente usar e ainda não está à venda. Escolher entre eles não é um julgamento sobre capacidade. É um julgamento sobre qual dessas duas frases descreve o seu mês.

Comparados neste artigo1
Detectado a partir deste artigo · Benchmarks: Artificial Analysis · atualizado diariamente
