Cartão de título principal com o texto "Gemini 4 Argon vs GPT-6 Sol — um quinto do preço, quatro vezes a conta", com chips com os textos "Argon $2 / $10", "Sol $2 / $10" e "Custo por tarefa de índice $1,99 vs $1,05", e uma linha de rodapé com o texto "Valores do Argon informados pelo fornecedor; valores do índice conforme a Artificial Analysis, consultado em 2026-10-01." O logotipo da OrcaRouter está composto no canto inferior direito.
Guides & Insights

Gemini 4 Argon vs GPT-6 Sol: Um Quinto do Preço, Quatro Vezes a Fatura

Autor

Magnus Corvin

Data de publicação

Modelos mais recentes · 20Ver todos os modelos →
Benchmarks: Artificial Analysis · atualizado diariamente
Voltar para todas as publicações

Executar a suíte de índices Artificial Analysis no Gemini 4 Argon custa US$ 2.407. Executar a mesma suíte no GPT-6 Sol custa US$ 1.546. Mesmo índice, mesmas tarefas, mesma semana. Os dois modelos têm preços de tabela idênticos — US$ 2,00 por milhão de tokens de entrada e US$ 10,00 por milhão de tokens de saída, com o Argon como uma tarifa introdutória declarada do Google e o Sol como a tarifa vigente da OpenAI — e, ainda assim, o custo final de executar um trabalho idêntico difere em 56%, a favor do modelo que pontua cinco pontos a menos. Essa diferença é exatamente o motivo pelo qual vale a pena escrever esta comparação, e não tem nada a ver com a tabela de preços.

Google anunciou o Gemini 4 Argon em 2026-09-30, chamando-o de a próxima era da inteligência de fronteira, com preço de US$ 2 de entrada e US$ 10 de saída, com entrada em cache com 95% de desconto, sendo disponibilizado a defensores cibernéticos de confiança por meio do Programa Fairwind. O GPT-6 Sol está disponível em geral desde 2026-09-22, quando a OpenAI lançou o nível intermediário da linha GPT-6 a US$ 2 de entrada e US$ 10 de saída, com 90% de desconto no cache. Um pode ser comprado hoje em um endpoint compatível com OpenAI, e o outro não pode ser comprado por ninguém fora de um grupo nomeado, que é a bifurcação prática deste artigo. Mas a inversão de custos acima sobrevive mesmo que você deixe a disponibilidade completamente de lado, e entender por que é a parte útil.

A inversão, dita sem rodeios

A Artificial Analysis publica tanto um Intelligence Index quanto uma contabilização de quanto custou executar esse índice. Lidos em conjunto, eles dizem isto:

• Índice de Inteligência — Gemini 4 Argon 52,6 contra GPT-6 Sol 47,5. Uma diferença de cinco pontos, medida com o Argon registrado em seu nível de esforço alto e o Sol no máximo, de modo que a comparação é generosa com o Sol, e não com o Argon.

• Preço de tabela por milhão de tokens — idêntico. $2,00 de entrada / $10,00 de saída nos dois. As leituras de cache são a única diferença: $0,10 no Argon, $0,20 no Sol.

• Custo por tarefa de indexação — Gemini 4 Argon $1.99 contra GPT-6 Sol $1.05. O Argon custa aproximadamente o dobro por tarefa, apesar de custar o mesmo por token.

• Custo para executar a suíte completa — Gemini 4 Argon $2,407 contra GPT-6 Sol $1,546.

• Velocidade de saída medida — GPT-6 Sol 77,0 tokens por segundo contra Gemini 4 Argon 48,9, uma diferença de 1,6× que se manifesta tanto na latência quanto no gasto.

Há uma linha nessa lista que explica todas as outras, e não é o preço. É a contagem de tokens. Nas próprias tarefas do índice, o Gemini 4 Argon gerou aproximadamente 561.000 tokens de saída por tarefa; o GPT-6 Sol gerou aproximadamente 282.000. O Argon pensa por duas vezes mais tempo para responder à mesma pergunta e, a uma taxa idêntica por token, isso é exatamente o dobro da conta.

A two-column scoreboard comparing Gemini 4 Argon and GPT-6 Sol. The Gemini 4 Argon column reads: AA Intelligence Index 52.6, price $2 in / $10 out per million tokens, cost per index task $1.99, output tokens per task 561K, output speed 48.9 tok/s, max output 1M tokens. The GPT-6 Sol column reads: AA Intelligence Index 47.5, price $2 in / $10 out, cost per index task $1.05, output tokens per task 282K, output speed 77.0 tok/s, max output 128K tokens. A footer line reads that the prices are vendor list prices and the index figures are per Artificial Analysis, read 2026-10-01.

Por que os tokens são o preço

Esta é a correção que vale a pena interiorizar antes de alguém orçar uma migração, porque a intuição aponta na direção errada. Quando um modelo tem o mesmo preço que o seu concorrente e consome o dobro dos tokens de saída para concluir, o preço por token não é o preço. O preço é o preço por token multiplicado pela quantidade de tokens que o modelo decide gastar, e esse segundo fator é uma propriedade do modelo, não da tabela de preços.

A margem por tarefa varia enormemente, o que torna tudo pior — não dá para aplicar um multiplicador fixo e simplesmente seguir em frente:

• Terminal-Bench 4.0 — Argon 165.330 tokens de saída por tarefa, contra os 97.372 do Sol. Argon custa US$ 6,78 por tarefa aqui, contra US$ 4,00 do Sol, embora o Argon pontue 57,1% contra 43,9% do Sol.

• CritPt — Argon 109 533 tokens contra os 31 848 do Sol. Uma proporção de tokens de 3,4× numa tarefa em que o Sol, na verdade, obtém pontuação mais alta, 30,9% contra 27,1%.

• GDPval — Argon 74.571 tokens contra 41.567 do Sol, por US$ 1,82 por tarefa contra US$ 1,32.

• Onisciência — uma proporção de 938 contra 2.662 tokens a favorda Argon, a $0,010 por tarefa contra $0,027 do Sol. A única família de tarefas em que a direção se inverte.

• Raciocínio de contexto longo — Argon com 2.197 tokens contra os 954 do Sol, e a única tarefa da suíte em que Sol vence claramente na pontuação, 83,7% a 79,7%.

CritPt é o instrutivo. Um modelo que consome três vezes e meia os tokens para produzir uma resposta um pouco pior à mesma pergunta não é uma história de capacidade; é uma história de hábito de gastos. O raciocínio do Argon se prolonga, e em alguns formatos de tarefa esse comprimento se converte em pontuação e, em outros, simplesmente se converte em dólares. O 52,6 do índice e o 47,5 do Sol são o agregado, e agregados escondem exatamente isso.

De onde os cinco pontos realmente vêm

Como o intervalo de indexação e o intervalo de custo apontam em direções opostas, vale a pena saber quais tarefas determinam cada um.

• Terminal-Bench 4.0 — Gemini 4 Argon 57,1% contra GPT-6 Sol 43,9%. A maior vitória individual do Argon, e a família de tarefas mais próxima de codificação agêntica de longo horizonte.

• Onisciência — Gemini 4 Argon 42.4 versus GPT-6 Sol 27.1. Uma diferença de quinze pontos na cobertura factual, a maior lacuna proporcional da suíte.

• AutomationBench-AA — Gemini 4 Argon 77,5% versus GPT-6 Sol 61,6%.

SciCode — Gemini 4 Argon 61% versus Gemini-6 Sol 57%.

• Último Exame da Humanidade — Gemini 4 Argon 57,1% versus GPT-6 Sol 47,9%.

• GDPval — Gemini 4 Argon 1.611 versus GPT-6 Sol 1.487.

• ApexAgents / AA-Briefcase — GPT-6 Sol com 1.482,78 de Elo, contra os 1.493,84 do Argon, uma diferença de 11 pontos que está dentro dos intervalos de confiança publicados e deveria ser considerada um empate.

• Raciocínio de contexto longo — GPT-6 Sol 83,7% versus Gemini 4 Argon 79,7%. A única vitória clara do Sol.

• CritPt — GPT-6 Sol 30,9% versus Gemini 4 Argon 27,1%. Sol vence novamente, por pouco.

Então, o cenário não é "Argon é melhor". É que Argon é melhor nas duas coisas que seus materiais de lançamento destacaram — execução de tarefas empresariais de ponta a ponta e engenharia de software de longo horizonte — e Sol está no mesmo nível ou à frente na escala de raciocínio de teor acadêmico e em manter coerência ao longo de um contexto extenso. Para um leitor cuja carga de trabalho é um pipeline de recuperação com um prompt de 400K tokens, Sol é simultaneamente o modelo superior e o mais barato, o que é uma posição incomum e confortável.

As diferenças de especificação que sobrevivem à discussão do benchmark

• Saída máxima — Gemini 4 Argon 1.000.000 de tokens em uma única trajetória, que o Google descreve como a maior do setor e um aumento em relação ao limite de 64K da geração anterior. GPT-6 Sol 128.000 tokens.

• Janela de contexto — a ficha do fornecedor do GPT-6 Sol declara aproximadamente 1.050.000 tokens; a do Argon, 1.000.000. A Artificial Analysis mediu o Sol em 872.000 tokens por meio de seu harness, o que é uma medição do harness e não um número da ficha — trate a ficha como a especificação e o número do harness como aquilo que o avaliador realmente exercitou.

• Modalidades de entrada — ambos aceitam texto, imagens e arquivos. O material de lançamento do Argon também se apoia na compreensão de vídeos longos, na qual o Google afirma 91,7% no LVBench e a descreve como estado da arte; esse é um número informado pelo fornecedor e nenhum painel independente o reproduz até o momento.

• Entrada de vídeo — Fraca. O Artificial Analysis mapeia o Argon com a entrada de vídeo desativada e nomeia vídeo explicitamente no lançamento, enquanto a ficha do Sol não lista vídeo de forma alguma. Se vídeo é essencial no seu pipeline, nenhuma das fichas resolve isso e você deve testar antes de arquitetar.

• Esforço de raciocínio — Sol expõe esforço configurável (de nenhum a máximo, médio por padrão) na API e foi plotado em máximo. Argon foi plotado em alto; ninguém publicou a mesma suíte na sua configuração máxima.

O teto de saída de 1M de tokens é o que poderia genuinamente mudar uma arquitetura, e não um orçamento. Qualquer coisa que você atualmente divide em uma dúzia de chamadas encadeadas para ficar abaixo de um limite de 128K — um conjunto de patches de vários arquivos, um relatório de auditoria completo, um documento longo em uma única passagem — passa a ser uma única chamada, com menos pontos em que um loop de agente pode perder estado. Se isso vale o dobro do custo por tarefa depende inteiramente de você ter essa carga de trabalho. Se tiver, provavelmente vale a pena. Se suas chamadas são de classificar e retornar, é dinheiro gasto em folga que ninguém vai ocupar.

A configuração de esforço que ninguém igualou, e por que isso importa

Uma ressalva merece um parágrafo próprio, porque vai contra a leitura da diferença de cinco pontos no índice como uma diferença pura de capacidade. A Artificial Analysis apresenta o Gemini 4 Argon em seu high ajuste de esforço de raciocínio e o GPT-6 Sol em max. Esses não são o mesmo degrau nas duas escadas, e a direção da discrepância é interessante: o Sol foi executado em seu ajuste mais caro e o Argon em um intermediário.

Seguem-se duas leituras e os dados não conseguem distingui-las. Ou o Argon no modo máximo obteria uma pontuação superior a 52,6 — mas também consumiria mais de 561.000 tokens por tarefa e custaria mais de US$ 1,99 — ou obteria mais ou menos a mesma pontuação, o que significaria que o ajuste de esforço não está fazendo muita diferença nesta suíte. Não há nenhuma execução publicada que resolva isso. Quem cita 52,6 como o teto do Argon está citando uma configuração, não um modelo, e a configuração é a que o fornecedor do Argon escolheu publicar primeiro.

A mesma lógica se aplica ao 47,5 do Sol, exceto na direção oposta: O max é o topo da sua escala, então o número está mais próximo de um teto do que de um piso. Uma disputa justa com esforço equiparado poderia reduzir a diferença e também poderia inverter a comparação de custos, já que os tokens que o max consome são os tokens que custam US$ 10 por milhão.

A bifurcação de disponibilidade, que decide a resposta real

O Gemini 4 Argon não está disponível de forma geral. O anúncio do Google diz que está a ser disponibilizado a um conjunto de defensores cibernéticos de confiança através do Programa Fairwind, que a empresa está envolvida no processo voluntário de acesso ao modelo antes do lançamento do governo dos EUA, e que o acesso geral para programadores, empresas e consumidores chega "o mais rapidamente possível", começando pelos clientes de API pagos e pelos subscritores do Google AI Ultra. Não há identificador de modelo, nem endpoint, nem quota e nem data. Não está em nenhuma API pública, incluindo a nossa — verifique o catálogo e dá 404, porque ainda não existe lá.

GPT-6 Sol é um produto chamável. No OrcaRouter, ele é openai/gpt-6-sol, no mesmo endpoint compatível com OpenAI que os outros mais de 200 modelos do catálogo, pelo preço de tabela da OpenAI repassado com margem zero, então os $2/$10 acima e o passo de contexto longo de 272.000 tokens para $4/$15 são o que você realmente paga, e não o que uma tabela de tarifas alega. O failover automático entre provedores cobre o caso em que a rota se degrada durante a execução, e a DSL de roteamento permite que um único aplicativo envie seu tráfego barato de classificação para um modelo menor e seu tráfego de raciocínio difícil para o Sol sem um segundo SDK.

A capture of the OrcaRouter model page for openai/gpt-6-sol, listed by OpenAI with a 2026-09-22 date, a 1M-token context window, a 128K-token maximum output, text, image and file input, and pricing of $2.00 per million input tokens and $10.00 per million output tokens.

Essa última configuração é a resposta honesta para esta comparação para a maioria das equipes. O argumento de custo a favor do Argon é real, mas condicional a uma carga de trabalho em que o trabalho de agente de horizonte longo domina; o argumento de custo contra ele é real em todas as outras cargas de trabalho; e você não pode comprá-lo este mês de qualquer forma. A jogada barata é construir o harness de avaliação agora — seus próprios prompts, sua própria pontuação, executados contra o Sol em algumas configurações de esforço — para que, quando o Argon chegar aos clientes pagantes da API, você tenha uma resposta medida para uma pergunta que todos os outros responderão a partir de um leaderboard.

O que resolveria isso

Três coisas, em ordem de quanto elas moveriam o veredito. Disponibilidade geral do Argon a um preço real, não introdutório — a palavra “introdutório” significa que os US$ 2/US$ 10 podem mudar, e a própria sequência do Google coloca clientes pagos da API em primeiro lugar, então a primeira tarifa publicada após o lançamento é a que deve ser observada. Uma execução publicada do Artificial Analysis do Argon na sua configuração de esforço máximo, que diria se 52,6 é um teto ou está a um fio de distância dele. E uma reprodução independente do número do DeepSWE v1.1 — o Google alega 77,9% e o chama de novo estado da arte; é informado pelo fornecedor e não foi reproduzido fora do Google até o momento.

Até lá, a divisão é nítida e levemente irônica. GPT-6 Sol é o modelo mais bem verificado, o mais rápido, o mais barato por tarefa concluída e aquele que você pode chamar hoje à tarde. Gemini 4 Argon é o modelo com maior pontuação no ranking que seu fornecedor escolheu publicar, aproximadamente duas vezes mais caro para realmente usar e ainda não está à venda. Escolher entre eles não é um julgamento sobre capacidade. É um julgamento sobre qual dessas duas frases descreve o seu mês.

A capture of the Artificial Analysis model page for Gemini 4 Argon (High), dated September 2026 and credited to Google, marked a proprietary model. It reports an Artificial Analysis Intelligence Index score of 53, pricing of $2.00 per million input tokens and $10.00 per million output tokens with a 95% cache discount, an average cost of $1.99 per task on the Intelligence Index, a 1M-token context window, and text and image input.

Comparados neste artigo1

Detectado a partir deste artigo · Benchmarks: Artificial Analysis · atualizado diariamente