
GPT-6 vs Gemini 4 Argon: Um quase empate entre um modelo em uma lista de preços e outro em uma lista de espera
- openaiNOVOOpenAI: GPT-6.1 Sol2026-09-2952Inteligência
- anthropicNOVOAnthropic: Claude Sonnet 5.52026-09-2856Inteligência
- typesafeNOVOTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 por 1M de tokens · 128 tok/s
- OpenAIOpenAI: GPT-6 Luna2026-09-2238Inteligência
- OpenAIOpenAI: GPT-6 Sol2026-09-2248Inteligência
- AnthropicAnthropic: Claude Opus 5.52026-09-2258Inteligência
- xAIGrok 4.72026-09-2146Inteligência
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 por 1M de tokens · 67 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 por 1M de tokens · 320 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Inteligência
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Inteligência77Código
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Inteligência76Código
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Inteligência76Código
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Inteligência82Código
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 por 1M de tokens · 54 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 por 1M de tokens · 360 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Inteligência72Código
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 por 1M de tokens · 232 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Inteligência75Código
- obsidianQwen3.8 27B2026-08-1534Inteligência68Código
O par de modelos mais próximos no atual quadro de fronteira não é um par que se possa comprar. O Gemini 4 Argon pontua 52,6 no Intelligence Index v4.3.2 da Artificial Analysis. O GPT-6 Astra, principal modelo da OpenAI, pontua 52,7. Essa é uma diferença de um décimo de ponto em dez avaliações, e ambos os números vêm da mesma revisão do mesmo conjunto de testes. É o emparelhamento mais apertado no topo da tabela do conjunto.
Há uma simetria nesse número, e nenhuma em absoluto na disponibilidade. O Google anunciou o Gemini 4 Argon em 30 de setembro de 2026, com um preço introdutório declarado de US$ 2,00 por milhão de tokens de entrada e US$ 10,00 por milhão de tokens de saída, sendo disponibilizado primeiro para um grupo nomeado de defensores cibernéticos por meio de um programa que o Google chama de Fairwind. Ele não tem identificador de modelo de API publicado, nem data de disponibilidade geral, nem um endpoint que um cliente possa chamar hoje. O GPT-6 Astra está à venda desde 3 de setembro de 2026 e, em 7 de outubro de 2026, também é para a família GPT-6 que o ChatGPT direciona mais de 1,2 bilhão de usuários semanais — com o GPT-6 Sol, e não o Astra, alimentando os níveis pagos dessa implementação.
Portanto, a comparação é real, mas assimétrica de uma forma que muda a maneira como ela deve ser lida. Os números da Argon descrevem um modelo em uma implantação controlada. Os da GPT-6 descrevem um produto com uma tabela de preços. Tudo abaixo vale sob a ressalva “se você pudesse comprá-lo”, e nada abaixo responde “você deveria trocar”, porque ainda não há nada para o qual trocar.
O que se sabe realmente sobre a contraparte que existe
Comece pelo lado que existe, porque a comparação só tem uma metade acionável. O GPT-6 é lançado em três níveis, e apenas dois deles importam aqui:
• GPT-6 Astra — o carro-chefe, id do modelo gpt-6-astra, lançado em 3 de setembro de 2026, contexto de 1.050.000 tokens, saída de 128.000 tokens, entrada de texto/imagem/arquivo, esforço de baixo a máximo, US$ 10,00 por milhão de entrada e US$ 50,00 de saída, com reprecificação para US$ 20,00/US$ 75,00 para toda a solicitação acima de 272.000 tokens de entrada
• GPT-6 Sol — o nível intermediário, lançado em 22 de setembro de 2026, mesmos limites de contexto e de saída, US$ 2,00/US$ 10,00 com o degrau de contexto longo de US$ 4,00/US$ 15,00, e o modelo que a OpenAI colocou no ChatGPT Plus, Pro, Business e Enterprise em 7 de outubro de 2026
• GPT-6 Luna — o nível econômico a US$ 0,10/US$ 0,50, atendendo ao ChatGPT Free e Go
O lado da Argon nessa lista tem uma linha só. O anúncio da Google trouxe um preço introdutório, um enquadramento de capacidades — codificação no mundo real, trabalho de conhecimento empresarial e defesa cibernética — e um plano de lançamento. Não trouxe uma string de modelo, uma janela de contexto, uma saída máxima, uma tarifa de entrada em cache, um cronograma de descontinuação nem uma data para acesso mais amplo. A ausência de um identificador de modelo é a mais prática: qualquer exemplo de código que você veja online citando uma string de modelo Gemini 4 Argon é chute, porque não há string para citar.
A única medição totalmente comparável, e o que ela esconde
Uma métrica permite comparar o Argon com um modelo GPT-6 sem qualquer "se" associado, porque a Artificial Analysis testou ambos: o custo de produzir uma resposta finalizada na suíte de avaliação.
• Custo por tarefa de índice concluída — Gemini 4 Argon $1,99 vs GPT-6 Astra $3,26, uma diferença de 1,6× em favor do Argon
• Tokens de saída gerados em toda a suíte — Gemini 4 Argon 112,8M vs GPT-6 Astra 108,8M, efetivamente nivelados
• Intelligence Index, v4.3.2 — Gemini 4 Argon 52,6 vs GPT-6 Astra 52,7, um empate absoluto
• Preço declarado — $2,00 de entrada e $10,00 de saída por 1M no Argon, como tarifa introdutória vs. a tarifa padrão de $10,00/$50,00 do Astra
• Janela de contexto — GPT-6 Astra 1.050.000 tokens vs. a do Argon, não publicada
Leia essa primeira linha de novo, porque é a única surpresa nesta página. Os preços anunciados da Argon são um quinto dos da Astra, e seu custo por tarefa na mesma suíte é 39% menor. Um modelo que obtém a mesma pontuação que o carro-chefe, com um quinto do preço de entrada, seria o assunto do trimestre, se é que se pode chamar assim.

A segunda linha é a razão pela qual a primeira linha é menos dramática do que parece, e vai na direção contrária ao argumento habitual de verbosidade. Argon e Astra escreveram quase exatamente o mesmo número de tokens para produzir quase exatamente a mesma pontuação. Não há lacuna de verbosidade para explicar a diferença de custos — a diferença de US$ 1,27 vem da tabela de preços, não de um modelo divagando. Isso torna a comparação mais limpa do que a maioria neste lote e faz com que a falta de disponibilidade seja a única coisa entre Argon e uma recomendação direta.
A própria tabela do Google não é a independente
Google publicou uma tabela de lançamento para o Argon comparando-o com o GPT-6 Astra em dezenove benchmarks. Se você ler apenas essa tabela, o Argon vence quatorze, o Astra vence quatro e um é empate. Esse é um resultado impressionante e deve ser tratado com cuidado: todos os números nela vêm do Google, selecionados e ordenados pelo Google, e nada disso foi reproduzido de forma independente. É o argumento do Google em favor do Argon, que é justamente para o que serve uma tabela de lançamento, e pertence a uma comparação como uma alegação de fornecedor rotulada, e não como evidência.
Compare-o com a execução independente e o quadro muda de caráter. Na suíte da Artificial Analysis, os dois estão empatados em 52,6 e 52,7 — uma vantagem muito menor do que a que um placar de 14 a 4 sugere, em uma suíte que nenhum dos fornecedores montou. O resumo honesto é que Argon é plausivelmente igual à Astra e possivelmente melhor que ela em engenharia de software, que a própria tabela do fornecedor imagina uma diferença maior do que a que a independente encontra, e que, até que alguém fora do Google o execute em algo que não sejam tarefas do Google, nada disso se resolve.

Por que um modelo não lançado merece uma seção de qualquer forma
Porque o padrão de lançamento do Google é, ele mesmo, informação, e aponta para onde vai o próximo lançamento da linha Pro. O Google passou 2026 lançando modelos da linha Flash — a linha Flash 3.5, 3.6 e 3.8, as variantes Lite, um 3.8 Flash ajustado para cibersegurança — enquanto a linha Pro ficou em Gemini 3.1 Pro Preview, um modelo que está em pré-visualização desde fevereiro de 2026, sem compromisso de disponibilidade geral e sem data de encerramento. Argon é o primeiro movimento no topo da linha em sete meses, e saiu primeiro para defensores, e não para desenvolvedores.
Essa sequência é uma escolha coerente — a cibersegurança é a carga de trabalho em que um modelo de fronteira com uso de ferramentas agênticas e autonomia de longo horizonte tem o valor mais claro e mais mensurável, e é também a carga de trabalho em que um fornecedor quer uma coorte controlada antes do lançamento geral. Não é evidência de que o modelo não esteja pronto. É evidência de que o Google está tratando a disponibilidade geral como uma decisão posterior, em vez de uma decisão para o dia do lançamento, o que é exatamente o que o identificador de modelo ausente e a data ausente dizem de uma forma diferente.
Para quem constrói, a consequência é simples: você não pode planejar contando com o Argon. Você pode planejar contando com o GPT-6 Astra ou com o GPT-6 Sol, porque ambos têm identificadores, endpoints, tabelas de preços e um fornecedor que já publicou uma política de descontinuação para a linha. Um modelo sem identificador é um modelo para o qual você não pode escrever um adaptador.
O que mudaria esta comparação
Três coisas, e qualquer uma delas transforma o artigo acima em uma questão resolvida. A primeira é um identificador de modelo — uma string real servida pela API do Google, porque é nesse ponto que um adaptador se torna gravável e uma estimativa de integração passa a ter significado. A segunda é uma data de disponibilidade geral, que é o que distingue uma prévia de um produto e é a única data que o anúncio da Argon omitiu completamente. A terceira é a avaliação comparativa independente em tarefas que o Google não escolheu; uma suíte montada pelo fornecedor é uma alegação, e uma suíte montada por outra pessoa é uma medição.
Até que todos os três existam, o papel do Argon numa comparação é o de um teto, e não o de uma opção. Os seus números indicam para onde o nível Gemini Pro está a caminhar e dão-lhe uma ideia de quanto espaço de manobra de preço o Google tem no topo da gama. Não lhe dizem em que se basear.
O que fazer enquanto Argon espera
Se a razão pela qual você está aqui é que os números da Argon parecem bons, o movimento útil é testar a mesma classe de carga de trabalho com o modelo que você pode realmente chamar hoje e, para engenharia de software e trabalho agêntico de longo horizonte, isso significa GPT-6 Astra. Ele está no catálogo da OrcaRouter com o próprio padrão do Google de preços de repasse — os $10,00/$50,00 do fornecedor, com o nível de contexto longo de $20,00/$75,00, a 0% de margem, então uma mudança de tarifa do fornecedor chega até você no mesmo dia, em vez de no próximo ciclo de faturamento. O GPT-6 Sol a $2,00/$10,00 também está lá, e para a maioria das cargas de trabalho é a melhor compra: ele pontua 47,6 contra 52,7 do Astra, e custa cerca de um terço por tarefa concluída.
A camada de roteamento é o que torna o cronograma de lançamento de um fornecedor algo sobrevivível. Quando o Argon finalmente receber um identificador, ele não precisa se tornar um projeto de migração: uma regra de roteamento pode enviar uma parte do seu tráfego para ele, ou usar a configuração de fusão de modelos para executar um painel e comparar respostas, enquanto o GPT-6 Astra ou o Sol continua sendo o padrão por trás dele. O failover automático cobre o caso que mais importa aqui — um modelo em lançamento controlado é exatamente o tipo de rota que pode sofrer limitação de taxa ou ser retirado sem aviso, e um caminho de fallback significa que isso se torna uma requisição lenta em vez de uma indisponibilidade.

O que não se deve fazer é iniciar um plano de migração em torno de uma tabela de lançamento de um modelo sem endpoint. A diferença em relação ao GPT-6 Astra é de um décimo de ponto e a diferença de preço é real, mas nenhuma das duas justifica reconstruir uma integração para algo para o qual você não consegue enviar uma requisição.
Comparados neste artigo1
Detectado a partir deste artigo · Benchmarks: Artificial Analysis · atualizado diariamente
