
Gemini 4 Argon vs. GPT-6 Astra: Um empate técnico no índice e uma redução de preço de dois terços
- openaiNOVOOpenAI: GPT-6.1 Sol2026-09-2952Inteligência
- anthropicNOVOAnthropic: Claude Sonnet 5.52026-09-2856Inteligência
- typesafeNOVOTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 por 1M de tokens · 144 tok/s
- OpenAINOVOOpenAI: GPT-6 Luna2026-09-2238Inteligência
- OpenAINOVOOpenAI: GPT-6 Sol2026-09-2248Inteligência
- AnthropicNOVOAnthropic: Claude Opus 5.52026-09-2258Inteligência
- xAINOVOGrok 4.72026-09-2146Inteligência
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 por 1M de tokens · 125 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 por 1M de tokens · 933 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Inteligência
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Inteligência77Código
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Inteligência76Código
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Inteligência76Código
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Inteligência82Código
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 por 1M de tokens · 50 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 por 1M de tokens · 106 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Inteligência72Código
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 por 1M de tokens · 217 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Inteligência75Código
- obsidianQwen3.8 27B2026-08-1534Inteligência68Código
Dois modelos de fronteira, separados por 0,11 ponto no Índice de Inteligência da Artificial Analysis. O Gemini 4 Argon marca 52,56. O GPT-6 Astra marca 52,67. Se você tivesse que escolher entre eles com base na capacidade geral medida, poderia jogar uma moeda para o alto, e a diferença entre as duas pontuações é menor que o intervalo de confiança de qualquer uma delas. Essa é uma situação genuinamente rara em um mercado no qual os dez melhores modelos abrangem cerca de quinze pontos no total, e isso faz deste o mais fácil dos confrontos do Gemini 4 Argon para se analisar, porque o argumento de capacidade termina antes mesmo de começar e tudo o que resta é economia e acesso.
Os dois não são gêmeos, porém. O Argon foi anunciado em 30/09/2026 pelo Google DeepMind e está sendo lançado em fases, começando com defensores cibernéticos confiáveis no Fairwind Program. O GPT-6 Astra foi lançado no início de setembro — nossa ficha de catálogo o data de 04/09/2026, e a Artificial Analysis o lista em 03/09/2026 — e é uma rota ativa que você pode chamar hoje à tarde a US$10 de entrada e US$50 de saída por milhão de tokens, com uma janela de contexto de 1.050.000 tokens e um teto de saída de 128.000 tokens. Um desses modelos tem um preço pelo qual você pode ser cobrado hoje.
Onde um intervalo de 0,11 ponto é real e onde é apenas ruído
Um índice é um composto, portanto dois modelos que empatam no composto podem diferir significativamente em suas partes. Aqui, as partes concordam em grande parte, com três exceções que vale a pena mencionar.
• Terminal-Bench 4.0 — GPT-6 Astra 59,1% contra Gemini 4 Argon 57,1%. Astra lidera, por pouco.
• Raciocínio de contexto longo — GPT-6 Astra 80,7% versus Gemini 4 Argon 79,7%.
• GPQA Diamond — GPT-6 Astra 96,1%. A Argon não publica nenhum número neste ranking.
• CritPt — GPT-6 Astra 31,7% contra Gemini 4 Argon 27,1%.
• SciCode — Gemini 4 Argon 61,8% versus GPT-6 Astra 56,5%.
• Humanity's Last Exam — Gemini 4 Argon 57,1% versus GPT-6 Astra 54,7%.
• AutomationBench-AA — Gemini 4 Argon 77,5% versus GPT-6 Astra 68,5%.
• GDPval — Gemini 4 Argon 1.611 versus GPT-6 Astra 1.542.
• Onisciência — GPT-6 Astra 43,4 versus Gemini 4 Argon 42,4.
• ITBench-SRE — GPT-6 Astra 48,6%, contra nenhum número publicado do Argon.
• Velocidade de saída — GPT-6 Astra 51,2 tokens por segundo versus Gemini 4 Argon 48,9. Efetivamente equivalentes.
• Latência do primeiro token no harness de índice — Gemini 4 Argon 2,8 segundos versus GPT-6 Astra 320,2 segundos.
Astra apresenta vantagens em raciocínio científico de múltipla escolha, em problemas de física de ponto crítico e no benchmark SRE. Argon apresenta vantagens em programação científica, no conjunto de tarefas ponta a ponta mais difíceis e em trabalho com valor de PIB. Nenhuma das vantagens é grande o suficiente para, por si só, ser a base de uma migração.

A linha de latência é outra questão. 320 segundos até o primeiro token são cinco minutos e meio de silêncio antes que qualquer coisa seja emitida, contra menos de três segundos para o Argon. Ambos estão medindo a mesma coisa — o tempo até o primeiro chunk nas execuções do índice da Artificial Analysis —, então isso é comparável. O raciocínio do Astra está sempre ativado e é configurável de esforço baixo até máximo; uma execução com esforço máximo numa tarefa difícil realmente pensa durante minutos antes de falar. Se isso é um defeito depende inteiramente da sua interface. Para um trabalho em lote, não custa nada. Para qualquer coisa com um usuário observando um indicador de carregamento, é a diferença mais visível para o usuário entre estes dois modelos, maior do que qualquer lacuna de benchmark na página.
O passo de preço, que é o verdadeiro assunto
É aqui que o desempate acontece, e acontece de uma forma que é fácil modelar incorretamente, porque a tabela de preços da Astra tem três níveis que se parecem entre si.
• Padrão, até 272.000 tokens de entrada — GPT-6 Astra $10,00 entrada / $50,00 saída, leituras em cache a $1,00, gravações em cache a $12,50.
• Contexto longo, acima de 272.000 tokens de entrada — GPT-6 Astra $20,00 de entrada / $75,00 de saída, leituras em cache a $2,00. A solicitação inteira é reprecificada no nível superior, não apenas o excedente: 2× entrada e 1,5× saída.
• Modo rápido — 2× a tarifa padrão aplicável, ou seja, $20,00 de entrada / $100,00 de saída. É esse o valor de $100 que é citado como se fosse a tarifa de contexto longo; mas não é.
• Gemini 4 Argon — $2,00 de entrada / $10,00 de saída fixos no regime introdutório, entrada em cache a $0,10, sem escalão publicado e sem nível rápido publicado.
Então, o Argon é cinco vezes mais barato na entrada e cinco vezes mais barato na saída do que o nível padrão do Astra, e dez vezes mais barato na entrada acima de 272K. Duas medições independentes de custo apontam para a mesma conclusão por um caminho diferente: a Artificial Analysis coloca o Argon em US$ 1,99 por tarefa do índice, contra US$ 3,26 do Astra, e US$ 2.407 para executar o índice inteiro, contra US$ 5.324 do Astra. A razão por tarefa é menor que a razão por token pelo mesmo motivo que era em relação ao DeepSeek — o Argon executa menos tokens para terminar —, mas ainda é de 1,6×.
O ranking ponderado pelo PIB da Vals conta uma terceira versão da mesma história: Argon em primeiro, com 68,90% e US$ 15,68 por execução; Astra em sexto, com 63,13% e US$ 18,46. A Astra é mais cara e pontua menos ali. O material do Google deixa explícito que o preço é uma tarifa introdutória, palavra que significa que pode mudar, e a leitura honesta é que a vantagem de preço da Argon é real e sua permanência não é garantida.
Dois fatos de arquitetura que decidem mais do que benchmarks

Teto de saída primeiro. Gemini 4 Argon gera até 1.000.000 de tokens em uma única trajetória — o anúncio do Google destaca isso como uma expansão de 64K na geração anterior. GPT-6 Astra tem limite de 128.000. Ambos mantêm uma janela de contexto em torno de um milhão de tokens, então isso é puramente sobre quanto o modelo pode escrever de uma só vez. Para geração de texto longo, alterações de código de patch completo ou redação de documentos em uma única passagem, essa é uma diferença de oito vezes no que uma única chamada pode produzir. Para chat, extração e etapas curtas de agente, ambos os tetos são efetivamente infinitos e a diferença não custa nada.
Modalidade em segundo lugar, e aqui a vantagem se inverte em um aspecto. O GPT-6 Astra aceita texto, imagens e arquivos. O Gemini 4 Argon aceita texto, imagens, vídeo e arquivos, e o material de lançamento do Google enfatiza especificamente a compreensão de vídeos longos — um número do LVBench de 91,7% que é relatado pelo fornecedor. Se o seu pipeline ingere vídeo, o Astra não é um substituto. Áudio também não é mencionado na lista publicada de modalidades do Argon, então não presuma que a atualização o inclua.
O que realmente fazer
A Astra está disponível e o Argon não está, e isso resolve a maioria das decisões para o próximo mês. O caminho concreto que não desperdiça trabalho: construa sobre o GPT-6 Astra se sua carga de trabalho precisar de um modelo de raciocínio sempre ativo, com forte precisão científica e um histórico agêntico comprovado, mantenha o nome do seu modelo na configuração e defina os timeouts do seu cliente a partir do comportamento medido da Astra, em vez de otimismo — uma execução de cinco minutos até o primeiro token acionará um timeout padrão de 60 segundos, e um stream que morre aos 300 segundos parece uma indisponibilidade. Se você for sensível a custos acima de 272K tokens de entrada, modele explicitamente a nova precificação antes de se comprometer, porque o degrau dobra a entrada e aumenta a saída em 50% em um único limite.

O caminho intermediário interessante é que você não precisa escolher um único padrão. Astra e Argon — quando o Argon for lançado — são o mesmo formato de modelo voltado para a mesma classe de trabalho, o que os torna parceiros naturais de failover em vez de concorrentes pela mesma vaga. No OrcaRouter, openai/gpt-6-astra está disponível pelo preço de tabela do provedor, sem margem, no mesmo endpoint compatível com OpenAI que mais de 200 outros modelos, com failover automático entre provedores e uma DSL de roteamento para expressar um arranjo de primário e backup em uma única chave. Quando o Argon entrar no catálogo sob qualquer id que o Google publicar, a troca é uma string — sem segundo contrato, sem trabalho de integração e sem reconstruir o que você construiu em torno do Astra nesse meio-tempo.
O que desempataria permanentemente?
Um preço do Argon publicado após o período introdutório e uma reprodução independente das alegações agênticas do Google — o número de 77,9% do DeepSWE v1.1 e o resultado de 68% do CWE-bench v1 são ambos relatados pelo fornecedor e nenhum deles tem uma execução externa por trás. Qualquer um dos dois poderia mover o Argon para cima ou para baixo de forma significativa, porque uma vantagem de 0,11 ponto no índice não é uma proteção contra uma desvantagem de custo de 1,6× se a vantagem de custo se revelar temporária, e não é um déficit se o Google mantiver a tarifa introdutória e o nível de contexto longo da Astra tiver um impacto maior do que o esperado em produção.
Por enquanto: em termos de capacidade geral medida, estes dois são o mesmo modelo em duas embalagens. Astra é o que tem uma rota ativa, um degrau de preço conhecido e uma pausa de cinco minutos para pensar. Argon é o que tem um cartão mais barato e nenhum endpoint. O empate é real, e um dos lados dele é comprável.
