Cartão de título principal com o texto "Gemini 4 Argon vs GPT-6 Astra", com um chip que exibe "Índice 52,6 vs 52,7" e um chip que exibe "Custo por tarefa de índice US$ 1,99 vs US$ 3,26", e uma linha de rodapé com o texto "Números do Argon informados pelo fornecedor; dados de índice e custo conforme a Artificial Analysis, 2026-09-30."
Guides & Insights

Gemini 4 Argon vs. GPT-6 Astra: Um empate técnico no índice e uma redução de preço de dois terços

Autor

Gideon Frost

Data de publicação

Modelos mais recentes · 20Ver todos os modelos →
Benchmarks: Artificial Analysis · atualizado diariamente
Voltar para todas as publicações

Dois modelos de fronteira, separados por 0,11 ponto no Índice de Inteligência da Artificial Analysis. O Gemini 4 Argon marca 52,56. O GPT-6 Astra marca 52,67. Se você tivesse que escolher entre eles com base na capacidade geral medida, poderia jogar uma moeda para o alto, e a diferença entre as duas pontuações é menor que o intervalo de confiança de qualquer uma delas. Essa é uma situação genuinamente rara em um mercado no qual os dez melhores modelos abrangem cerca de quinze pontos no total, e isso faz deste o mais fácil dos confrontos do Gemini 4 Argon para se analisar, porque o argumento de capacidade termina antes mesmo de começar e tudo o que resta é economia e acesso.

Os dois não são gêmeos, porém. O Argon foi anunciado em 30/09/2026 pelo Google DeepMind e está sendo lançado em fases, começando com defensores cibernéticos confiáveis no Fairwind Program. O GPT-6 Astra foi lançado no início de setembro — nossa ficha de catálogo o data de 04/09/2026, e a Artificial Analysis o lista em 03/09/2026 — e é uma rota ativa que você pode chamar hoje à tarde a US$10 de entrada e US$50 de saída por milhão de tokens, com uma janela de contexto de 1.050.000 tokens e um teto de saída de 128.000 tokens. Um desses modelos tem um preço pelo qual você pode ser cobrado hoje.

Onde um intervalo de 0,11 ponto é real e onde é apenas ruído

Um índice é um composto, portanto dois modelos que empatam no composto podem diferir significativamente em suas partes. Aqui, as partes concordam em grande parte, com três exceções que vale a pena mencionar.

• Terminal-Bench 4.0 — GPT-6 Astra 59,1% contra Gemini 4 Argon 57,1%. Astra lidera, por pouco.

• Raciocínio de contexto longo — GPT-6 Astra 80,7% versus Gemini 4 Argon 79,7%.

• GPQA Diamond — GPT-6 Astra 96,1%. A Argon não publica nenhum número neste ranking.

• CritPt — GPT-6 Astra 31,7% contra Gemini 4 Argon 27,1%.

• SciCode — Gemini 4 Argon 61,8% versus GPT-6 Astra 56,5%.

• Humanity's Last Exam — Gemini 4 Argon 57,1% versus GPT-6 Astra 54,7%.

• AutomationBench-AA — Gemini 4 Argon 77,5% versus GPT-6 Astra 68,5%.

• GDPval — Gemini 4 Argon 1.611 versus GPT-6 Astra 1.542.

• Onisciência — GPT-6 Astra 43,4 versus Gemini 4 Argon 42,4.

• ITBench-SRE — GPT-6 Astra 48,6%, contra nenhum número publicado do Argon.

• Velocidade de saída — GPT-6 Astra 51,2 tokens por segundo versus Gemini 4 Argon 48,9. Efetivamente equivalentes.

• Latência do primeiro token no harness de índice — Gemini 4 Argon 2,8 segundos versus GPT-6 Astra 320,2 segundos.

Astra apresenta vantagens em raciocínio científico de múltipla escolha, em problemas de física de ponto crítico e no benchmark SRE. Argon apresenta vantagens em programação científica, no conjunto de tarefas ponta a ponta mais difíceis e em trabalho com valor de PIB. Nenhuma das vantagens é grande o suficiente para, por si só, ser a base de uma migração.

A two-column scoreboard comparing Gemini 4 Argon and GPT-6 Astra on six dimensions. Gemini 4 Argon reads: AA Intelligence Index 52.6, price $2 / $10 per million tokens, cost per index task $1.99, output ceiling 1M tokens, first token 2.8 s, input modalities text, image, video and files. GPT-6 Astra reads: AA Intelligence Index 52.7, price $10 / $50, cost per index task $3.26, output ceiling 128K tokens, first token 320.2 s, input modalities text, image and files, with a note that its standard rate steps to $20 input and $75 output above 272K input tokens. A footer line reads that Argon figures are vendor-reported and both models' index and cost figures are per Artificial Analysis.

A linha de latência é outra questão. 320 segundos até o primeiro token são cinco minutos e meio de silêncio antes que qualquer coisa seja emitida, contra menos de três segundos para o Argon. Ambos estão medindo a mesma coisa — o tempo até o primeiro chunk nas execuções do índice da Artificial Analysis —, então isso é comparável. O raciocínio do Astra está sempre ativado e é configurável de esforço baixo até máximo; uma execução com esforço máximo numa tarefa difícil realmente pensa durante minutos antes de falar. Se isso é um defeito depende inteiramente da sua interface. Para um trabalho em lote, não custa nada. Para qualquer coisa com um usuário observando um indicador de carregamento, é a diferença mais visível para o usuário entre estes dois modelos, maior do que qualquer lacuna de benchmark na página.

O passo de preço, que é o verdadeiro assunto

É aqui que o desempate acontece, e acontece de uma forma que é fácil modelar incorretamente, porque a tabela de preços da Astra tem três níveis que se parecem entre si.

• Padrão, até 272.000 tokens de entrada — GPT-6 Astra $10,00 entrada / $50,00 saída, leituras em cache a $1,00, gravações em cache a $12,50.

• Contexto longo, acima de 272.000 tokens de entrada — GPT-6 Astra $20,00 de entrada / $75,00 de saída, leituras em cache a $2,00. A solicitação inteira é reprecificada no nível superior, não apenas o excedente: 2× entrada e 1,5× saída.

• Modo rápido — 2× a tarifa padrão aplicável, ou seja, $20,00 de entrada / $100,00 de saída. É esse o valor de $100 que é citado como se fosse a tarifa de contexto longo; mas não é.

• Gemini 4 Argon — $2,00 de entrada / $10,00 de saída fixos no regime introdutório, entrada em cache a $0,10, sem escalão publicado e sem nível rápido publicado.

Então, o Argon é cinco vezes mais barato na entrada e cinco vezes mais barato na saída do que o nível padrão do Astra, e dez vezes mais barato na entrada acima de 272K. Duas medições independentes de custo apontam para a mesma conclusão por um caminho diferente: a Artificial Analysis coloca o Argon em US$ 1,99 por tarefa do índice, contra US$ 3,26 do Astra, e US$ 2.407 para executar o índice inteiro, contra US$ 5.324 do Astra. A razão por tarefa é menor que a razão por token pelo mesmo motivo que era em relação ao DeepSeek — o Argon executa menos tokens para terminar —, mas ainda é de 1,6×.

O ranking ponderado pelo PIB da Vals conta uma terceira versão da mesma história: Argon em primeiro, com 68,90% e US$ 15,68 por execução; Astra em sexto, com 63,13% e US$ 18,46. A Astra é mais cara e pontua menos ali. O material do Google deixa explícito que o preço é uma tarifa introdutória, palavra que significa que pode mudar, e a leitura honesta é que a vantagem de preço da Argon é real e sua permanência não é garantida.

Dois fatos de arquitetura que decidem mais do que benchmarks

A capture of the Google DeepMind blog post announcing Gemini 4 Argon, dated Sep 30 2026, credited to Koray Kavukcuoglu, SVP Google DeepMind and Chief AI Architect, with the standfirst describing frontier performance across real-world software engineering, enterprise knowledge work like legal and finance, and cybersecurity defense.

Teto de saída primeiro. Gemini 4 Argon gera até 1.000.000 de tokens em uma única trajetória — o anúncio do Google destaca isso como uma expansão de 64K na geração anterior. GPT-6 Astra tem limite de 128.000. Ambos mantêm uma janela de contexto em torno de um milhão de tokens, então isso é puramente sobre quanto o modelo pode escrever de uma só vez. Para geração de texto longo, alterações de código de patch completo ou redação de documentos em uma única passagem, essa é uma diferença de oito vezes no que uma única chamada pode produzir. Para chat, extração e etapas curtas de agente, ambos os tetos são efetivamente infinitos e a diferença não custa nada.

Modalidade em segundo lugar, e aqui a vantagem se inverte em um aspecto. O GPT-6 Astra aceita texto, imagens e arquivos. O Gemini 4 Argon aceita texto, imagens, vídeo e arquivos, e o material de lançamento do Google enfatiza especificamente a compreensão de vídeos longos — um número do LVBench de 91,7% que é relatado pelo fornecedor. Se o seu pipeline ingere vídeo, o Astra não é um substituto. Áudio também não é mencionado na lista publicada de modalidades do Argon, então não presuma que a atualização o inclua.

O que realmente fazer

A Astra está disponível e o Argon não está, e isso resolve a maioria das decisões para o próximo mês. O caminho concreto que não desperdiça trabalho: construa sobre o GPT-6 Astra se sua carga de trabalho precisar de um modelo de raciocínio sempre ativo, com forte precisão científica e um histórico agêntico comprovado, mantenha o nome do seu modelo na configuração e defina os timeouts do seu cliente a partir do comportamento medido da Astra, em vez de otimismo — uma execução de cinco minutos até o primeiro token acionará um timeout padrão de 60 segundos, e um stream que morre aos 300 segundos parece uma indisponibilidade. Se você for sensível a custos acima de 272K tokens de entrada, modele explicitamente a nova precificação antes de se comprometer, porque o degrau dobra a entrada e aumenta a saída em 50% em um único limite.

A capture of the OrcaRouter model page for OpenAI: GPT-6 Astra, showing the OpenAI provider, a release date of 2026-09-04, a 1,050,000-token context window, a 128,000-token maximum output, text, image and file input, and pricing of $10.00 input / $50.00 output per million tokens.

O caminho intermediário interessante é que você não precisa escolher um único padrão. Astra e Argon — quando o Argon for lançado — são o mesmo formato de modelo voltado para a mesma classe de trabalho, o que os torna parceiros naturais de failover em vez de concorrentes pela mesma vaga. No OrcaRouter, openai/gpt-6-astra está disponível pelo preço de tabela do provedor, sem margem, no mesmo endpoint compatível com OpenAI que mais de 200 outros modelos, com failover automático entre provedores e uma DSL de roteamento para expressar um arranjo de primário e backup em uma única chave. Quando o Argon entrar no catálogo sob qualquer id que o Google publicar, a troca é uma string — sem segundo contrato, sem trabalho de integração e sem reconstruir o que você construiu em torno do Astra nesse meio-tempo.

O que desempataria permanentemente?

Um preço do Argon publicado após o período introdutório e uma reprodução independente das alegações agênticas do Google — o número de 77,9% do DeepSWE v1.1 e o resultado de 68% do CWE-bench v1 são ambos relatados pelo fornecedor e nenhum deles tem uma execução externa por trás. Qualquer um dos dois poderia mover o Argon para cima ou para baixo de forma significativa, porque uma vantagem de 0,11 ponto no índice não é uma proteção contra uma desvantagem de custo de 1,6× se a vantagem de custo se revelar temporária, e não é um déficit se o Google mantiver a tarifa introdutória e o nível de contexto longo da Astra tiver um impacto maior do que o esperado em produção.

Por enquanto: em termos de capacidade geral medida, estes dois são o mesmo modelo em duas embalagens. Astra é o que tem uma rota ativa, um degrau de preço conhecido e uma pausa de cinco minutos para pensar. Argon é o que tem um cartão mais barato e nenhum endpoint. O empate é real, e um dos lados dele é comprável.