Cartão de título principal com o texto "Gemini 4 Argon — qual degrau da escada do Gemini 4?", com uma escada vertical de cinco degraus classificados listando Claude Opus 5.5 em 57,6, Gemini 4 Argon em 52,6, GPT-6 Astra em 52,7, Gemini 3.8 Flash em 40,9 e Gemini 3.1 Pro Preview em 29,7, um selo com o texto "Não há Gemini 4 Ultra — a página do Ultra redireciona para um plano de assinatura", e uma linha de rodapé com o texto "Valores do índice conforme a Artificial Analysis, revisão v4.3.2; Argon não pode ser chamado em nenhuma API pública."
Guides & Insights

O degrau do Argon na escada do Gemini 4 — e por que não existe um G4 Ultra

Autor

Alistair Wren

Data de publicação

Modelos mais recentes · 20Ver todos os modelos →
Benchmarks: Artificial Analysis · atualizado diariamente
Voltar para todas as publicações

A resposta curta para a pergunta que deu origem a este artigo é que o Gemini 4 Argon é o principal modelo do Google, e não o seu nível mais alto, porque o nível acima dele ainda não existe — e possivelmente não na forma que alguém espera. O Google publicou exatamente um modelo Gemini 4, o Argon, e a única página própria em seu próprio domínio sob o caminho /models/gemini/ultra/ não é uma página de modelo de forma alguma: ela redireciona para os planos de assinatura do Google AI. Esse redirecionamento é o fato mais útil deste artigo, e pode ser verificado em uma linha a partir de um terminal. Todo o resto aqui é sobre onde o Argon realmente se posiciona quando você para de ler o preço dele como um rótulo de nível e começa a lê-lo como um número.

Duas coisas são verdadeiras ao mesmo tempo, e é fácil confundi-las. Argon é o G​emini mais capaz que existe, e Argon não é um modelo de nível de fronteira. Ele está à frente de todos os modelos do G​oogle já lançados, por uma margem ampla o bastante para que a comparação não seja realmente uma comparação, e fica no Intelligence Index da Artificial Analysis a uma fração de ponto de dois modelos concorrentes de ponta que, por sua vez, estão cinco pontos inteiros atrás do líder atual. O G​oogle o precificou como se ele estivesse um degrau abaixo da fronteira, e a medição independente concorda. Portanto, o preço não é uma decisão de marketing que subestima o modelo. É uma declaração precisa sobre o modelo.

Este é um texto do tipo “o que sabemos até agora”. O Gemini 4 Argon foi anunciado em 2026-09-30 em uma publicação do Google DeepMind atribuída a Koray Kavukcuoglu, e está sendo disponibilizado primeiro para uma coorte nomeada de defensores cibernéticos por meio do Programa Fairwind do Google — não para desenvolvedores, não para empresas, não para consumidores e não para qualquer pessoa com cartão de crédito. Ele não tem ID de modelo na Gemini API, nem endpoint, nem preço publicado por token pelo qual você possa ser cobrado. Identificadores de modelo, throughput e confiabilidade medidos em tráfego real não existem para ele, o que significa que a medição abaixo é a execução de benchmark de um laboratório e nada mais. Quando um número vem do Google, ele é rotulado como do Google; quando vem da Artificial Analysis, é rotulado como deles. Nada aqui deve ser lido como uma afirmação de que o Argon é um produto comprável.

A escada que o Google de fato lançou, lida em suas próprias páginas

A maneira mais rápida de responder “onde o Argon se encaixa no lineup do Gemini 4” é parar de perguntar sobre o lineup e começar a listar os modelos para os quais o Google publica páginas. Um lineup é um conceito de marketing; uma página é um fato. Eis para onde os caminhos de primeira parte apontam em 1º de outubro de 2026.

• deepmind.google/models/gemini/pro/ retorna 200 e seu título é “Gemini 3.1 Pro — Google DeepMind”. O espaço Pro no site do próprio Google ainda é um modelo da geração 3.1.

• deepmind.google/models/gemini/flash/ retorna 200 e seu título é "Gemini 3.8 Flash — Google DeepMind". O slot Flash já mudou três vezes — 3.5, 3.6, 3.7, 3.8 — enquanto o slot Pro não mudou nada.

• deepmind.google/models/gemini/argon/ retorna 404. Argon não recebe um caminho por modelo. Sua página inicial é a página da família em deepmind.google/models/gemini/, que é onde o Google coloca o modelo que está liderando atualmente.

• deepmind.google/models/gemini/ultra/ retorna 302 e leva a one.google.com/about/google-ai-plans/, a página de assinatura do consumidor. O mesmo vale para o caminho mais antigo deepmind.google/technologies/gemini/ultra/. Um “Ultra” no caminho de modelos do Google é um nível de cobrança, não um checkpoint.

• deepmind.google/models/gemini/nano/ retorna 301 para a página da família Gemini. Também não há um slot Nano como página de modelo independente.

• deepmind.google/models/gemini/model-cards/ — o índice que o Google mantém de todos os cards de modelo que publicou — não contém nenhuma entrada para Argon nem nenhuma entrada com “Gemini 4” no nome. Suas linhas mais recentes do Gemini são 3.8 Flash, 3.8 Audio, 3.7 Flash, 3.6 Flash, 3.5 Flash, 3.5 Flash-Lite e 3.1 Pro. O índice de cards é o documento que muda mais lentamente neste conjunto, portanto o seu silêncio não é prova de que Argon nunca terá um card; é prova de que a papelada ainda não acompanhou o anúncio.

• deepmind.google/models/, o índice de modelos, lista "Gemini 4 Argon" como o cartão principal, com o slogan "Nossa próxima era de inteligência de fronteira", logo acima de "Gemini 3.8 Flash — Melhor para lidar com tarefas agênticas complexas em escala". Dois cartões Gemini, com uma geração de diferença, nessa ordem.

Junte tudo isso e a forma da escada não é ambígua. A gama pública de modelos da Google tem atualmente uma entrada no degrau Gemini 4, uma entrada no degrau Gemini 3.8, um degrau Pro desatualizado três gerações e meia atrás, e nada acima de qualquer um deles. A palavra “Ultra” no domínio da Google remete a uma assinatura. Não há página do Gemini 4 Pro, nem página do Gemini 4 Flash, nem página do Gemini 4 Ultra, nem cartão de modelo do Gemini 4. A Google anunciou um modelo, não uma família.

Existe um Gemini 4 Ultra? As evidências, e o que o falsificaria

Isto merece uma secção própria porque é a parte da questão com maior probabilidade de ser respondida de forma diferente dentro de uma semana, e porque a resposta honesta tem prazo de validade.

A evidência negativa é específica, e não vaga. Um 302 no caminho Ultra para a página de planos de subscrição não é um sinal subtil; é um redirecionamento que a própria equipa web da Google configurou. Vários padrões de URL do blog.google para uma publicação sobre o Gemini 4 Ultra retornam 404 — o caminho de produtos, o caminho innovation-and-ai models-and-research e o caminho de anúncio simples. A nomenclatura Ultra tem precedentes aqui, e os precedentes jogam contra um Gemini 4 Ultra. O anúncio original do Gemini da Google apresentou o Gemini 1.0 “otimizado para três tamanhos diferentes: Ultra, Pro e Nano”, com o Gemini Ultra descrito como “o nosso maior e mais capaz modelo”. Uma publicação de lançamento que nomeia três tamanhos é o aspeto de um anúncio de uma família. A publicação da Argon nomeia um único modelo e nenhum modelo irmão. Mais tarde, a Google retirou o nome de modelo Ultra em favor de níveis numéricos e transferiu a palavra para o lado da subscrição do negócio, onde agora designa o principal plano para consumidores. Uma página de modelo que redireciona para uma página de planos é o aspeto de um nome de modelo retirado quando o site de marketing à sua volta foi limpo.

Também não há nada no anúncio que prometa um irmão maior. O post de lançamento do Argon descreve o Argon como “o nosso novo modelo de fronteira” e descreve a implementação faseada, o trabalho de salvaguardas e as implementações internas, e fica por aí. Não diz “o primeiro da família Gemini 4”, não faz uma antevisão de um Pro ou de um Ultra, e não nomeia um sucessor. O enquadramento da própria Google trata o Argon como o produto principal, e não como o modelo pequeno.

O que refutaria a conclusão é fácil de enunciar e vale a pena ficar atento, porque qualquer um destes a inverteria num dia.

• Um 200 em deepmind.google/models/gemini/ultra/ que renderiza uma página de modelo em vez da página de planos, ou um novo models/gemini/ caminho filho aparecendo ao lado de pro e flash.

• Uma linha do Gemini 4 Ultra aparecendo no índice de cartões de modelo, que é como o Google historicamente confirma que um modelo existe como um artefato documentado.

• Um segundo ID de modelo na API Gemini no namespace gemini-4-*. O Argon atualmente não tem nenhum, então um Pro ou ID seria a primeira evidência de que a família é real.

• Uma entrada na lista de modelos da Artificial Analysis, ou uma tabela de benchmarks na página da família com uma quarta coluna. Ambos acompanham os lançamentos do Google de perto o suficiente para serem dos primeiros.

• Um post de anúncio do Google I/O, Cloud Next ou DeepMind usando a palavra “família” sobre o Gemini 4. O post da Argon não.

Até que pelo menos uma dessas coisas aconteça, um texto que afirma que um Gemini 4 Ultra está chegando é uma previsão vestida de reportagem. Trate-o como tal, inclusive quando vier de nós.

A two-column comparison scoreboard titled "Gemini 4 Argon vs Gemini 3.8 Flash — the scoreboard", with the left column showing Gemini 4 Argon at AA Intelligence Index 52.6, 1M context window, $2 input per million tokens, $10 output per million tokens, $1.99 cost per Index task and 142,374 output tokens per Index task, and the right column showing Gemini 3.8 Flash at AA Intelligence Index 40.9, 1M context window, $0.75 input, $3.75 output, $1.24 cost per Index task and 154,230 output tokens per Index task, with a footer reading "Both columns' Index, price, context, cost-per-task and token-use figures per Artificial Analysis, v4.3.2 revision."

Lendo a escada de preços como uma declaração de escalão

O preço é a única parte disto que o Google publicou de propósito, com uma nota de rodapé, e é a declaração mais clara da intenção de níveis em todo o lançamento. O preço introdutório do Argon é de US$ 2 por milhão de tokens de entrada e US$ 10 por milhão de tokens de saída, com entrada em cache com 95% de desconto, e a nota de rodapé número um do Google diz que, após um período introdutório que o Google não conseguiu definir, “o preço de US$ 4 por 1 milhão de tokens de entrada e US$ 20 por 1 milhão de tokens de saída será aplicado.”

Leia esses dois pares frente ao campo e a alegação de nível se escreve por si só.

• $4 / $20 é o preço de tabela do Claude Opus 5.5. O preço pós-introdutório do Google para o Argon coincide exatamente com a tabela de preços do atual líder da fronteira, para um modelo que fica cinco pontos atrás dele.

• $2 / $10 é a faixa promocional que GPT-6 Sol e Claude Sonnet 5.5 ocupam. A tarifa introdutória do Argon é a mesma: $2 / $10, o que coloca o preço de lançamento do Argon na mesma faixa que um Sol de nível intermediário, em vez da faixa de ponta.

• $10 / $50 é onde tanto Claude Fable 5.1 quanto GPT-6 Astra se situam. Argon custa um quinto do preço de entrada do Fable 5.1 e um quinto do seu preço de saída, e sua pontuação fica dentro de 0,8 dele.

• $0.75 / $3.75 é o Gemini 3.8 Flash. O Argon é 2,7× isso na entrada e 2,7× na saída — um aumento claro, não um precipício.

Então o Google precificou o Argon como um modelo que fica abaixo de $10/$50 e acima de $0.75/$3.75, com um eventual ponto de estabilização em $4/$20. Nada nessa escada diz “fronteira”. Ela diz “topo da faixa intermediária, com um número de destaque que vai se estabilizar na mesma tarifa que o líder cobra hoje, por menos capacidade”. Essa é uma escolha comercial defensável. Não é a precificação de um modelo posicionado dois patamares à frente de qualquer coisa.

Um ponto estrutural que vale a pena reter: o patamar de preço do Argon é um patamar genuíno, definido em nota de rodapé, e sem data. As famílias Sonnet 5.5 e GPT-6 fazem algo semelhante com níveis de contexto longo, e o Sol passa para $4/$15 depois de 272K. O patamar do Argon é por tempo, não por comprimento de contexto — o mesmo $2/$10 se aplica em toda a janela de 1M e apenas o calendário altera a tarifa. Esse é um formato incomum e faz com que qualquer comparação de custo com o Argon seja um exercício de duas colunas: qual período, e qual uso.

Onde o Argon se posiciona em relação aos rivais, com base nos números existentes

Artificial Analysis publicou uma medição do Gemini 4 Argon rápido o suficiente para ser a única leitura independente disponível. Na revisão vigente em 1º de outubro — v4.3.2 —, o Argon pontua 52,56 no Intelligence Index, configurado com alto esforço de raciocínio. Os modelos ao redor dele não são uma amostra aleatória do campo.

• Claude Opus 5.5 está em 57,62, medido no esforço máximo com fallback. Isso é pouco mais de cinco pontos acima do Argon, e é o topo atual do ranking.

• O Claude Fable 5.1 está em 53,35, medido com esforço máximo e fallback. O Argon está 0,79 atrás.

• GPT-6 Astra está em 52,67, medido no máximo. O Argon está 0,11 atrás.

• O Claude Sonnet 5.5 fica em 55,98, também no máximo com fallback. Esse é um modelo de nível intermediário que supera o Argon em 3,4 pontos, e é o número que deveria preocupar qualquer pessoa que recorra a “O Gemini 4 Argon é o segundo melhor modelo do mundo”.

• O GPT-6 Sol está em 47,63, medido no máximo, em uma janela de contexto de 872K. O Argon está 4,9 à frente dele.

• O Gemini 3.8 Flash está em 40,93 com esforço alto. O Argon está 11,6 à frente dele.

• O Gemini 3.1 Pro Preview está em 29,72. O Argon está 22,8 à frente dele, o que é a declaração mais clara possível de até que ponto o nível Pro que o Google está lançando ficou atrás de sua própria pesquisa.

Três coisas decorrem dessa lista. Primeiro, o Argon está no mesmo nível dos dois desafiantes, Fable 5.1 e Astra, e claramente atrás de dois modelos da Anthropic — Opus 5.5 e, de forma mais incômoda, Sonnet 5.5. Segundo, a diferença entre o Argon e o melhor modelo lançado da própria Google é o maior salto geracional da linha atual, de longe. Terceiro, o enquadramento do sinal de que “a fronteira está pelo menos dois níveis à frente” está certo em substância, mas ligeiramente equivocado na geometria: há um nível de modelo claramente à frente do Argon (Opus 5.5 com 57,6) e um segundo modelo num nível mais barato que também está à frente dele (Sonnet 5.5 com 56,0), o que é um problema mais agudo do que estar dois degraus abaixo numa escada na qual o Argon realmente está.

O enquadramento de comparação de preços na pergunta original — “os preços sugerem que este é o equivalente a Sol/Sonnet deles” — acaba se revelando aproximadamente certo quanto ao preço de lançamento e errado quanto ao preço final. O Argon abre no preço do Sol e do Sonnet 5.5 e se estabiliza no do Opus 5.5. Ele é precificado como um modelo de nível intermediário que pretende se tornar um de preço de fronteira, embora não se situe em nenhum dos dois.

O panorama de custo por tarefa é onde Argon é mais forte e onde a história dos níveis ganha uma segunda dimensão. Na tarefa Index, Argon custa $1,99 e emite 142.374 tokens de saída. Opus 5.5 custa $5,98 e emite 338.099. Sonnet 5.5 custa $7,62 por 599.849. Fable 5.1 custa $7,63 por 187.455. Astra custa $3,26 por 68.691. Gemini 3.8 Flash custa $1,24 por 154.230. Argon é a forma mais barata de comprar uma pontuação próxima da fronteira, e é mais barato que o modelo Flash acima dele em pontuação por menos de um dólar por tarefa.

As configurações de esforço são o asterisco em todos os itens acima, e o campo não as reporta de forma uniforme. O Argon é medido no nível alto; Opus 5.5, Fable 5.1 e Sonnet 5.5 no máximo com fallback; Astra e Sol no máximo. Uma rodada de esforço alto e uma rodada de esforço máximo não são a mesma medição, e o próprio esforço da Anthropic desloca um modelo vários pontos entre configurações. O Argon medido com esforço máximo pontua significativamente acima de 52,6. O argumento de nível muda. Ninguém reportou essa rodada ainda.

O que a própria tabela do Google afirma, e como ela difere da independente

A página da família Gemini traz uma tabela de desempenho de autoria do Google com quatro colunas — Gemini 4 Argon, GPT-6 Astra, Claude Fable 5.1, Claude Opus 5.5 — e dezenove linhas de benchmark. É o conjunto de alegações mais detalhado que o Google publicou para este modelo, e é reportado pelo fornecedor em sua totalidade. Compará-la com o Index independente é instrutivo justamente porque os dois não concordam quanto ao formato do campo.

• Na tabela do Google, Argon vence treze das dezenove linhas de forma isolada ou empata em primeiro lugar, incluindo Vals Index Knowledge work com 68,9, AutomationBench com 51,3, Harvey’s Legal Agent Benchmark com 19,6, DeepSWE v1.1 com 77,9, LABBench 2 com 88,8, GraphWalks com 99,7 para a faixa ≤128K e 84,2 para a faixa 256K–1M, Agent’s Last Exam com 39,5, LVBench com 91,7 e Chartography com 71,6.

• Claude Opus 5.5 vence as linhas que soam como engenharia contínua: FrontierSWE v2 com 62,3 contra 55,0 do Argon, Terminal-bench 4.0 com 66,4 contra 57,4, Terminal-Bench Science 0.1 com 63,3 contra 57,6, e PostTrainBench com 49,3 contra 45,3.

• GPT-6 Astra atinge 68,1 no Terminal-Bench Science 0.1 e 72,6 no subconjunto offline do OSWorld-2.0, e empata com Argon no CWE-bench v1 em 68,0. Claude Fable 5.1 perde todas as linhas, exceto um empate compartilhado no Vibe Code Bench.

• No Índice independente, a ordem é Opus 5.5 em primeiro, depois Sonnet 5.5, depois Fable 5.1, e então Argon e Astra praticamente empatados. A tabela do Google não tem coluna alguma para o Sonnet 5.5, o que é a omissão mais significativa dela: as quatro colunas da tabela são escolhidas, e o modelo que supera o Argon no Índice a um preço mais baixo não está entre elas.

Nada disso torna a tabela do Google desonesta. Tabelas de benchmark de fornecedores são selecionadas, não amostradas, e as de todos os laboratórios também são. Isso a torna uma alegação, e não uma medição, e significa que a questão do nível não pode ser resolvida a partir dela. O único ponto em que a tabela é realmente essencial para este artigo é o negativo: dezenove linhas, quatro colunas e nenhuma quinta coluna para um Ultra.

A screenshot of Google DeepMind's Gemini 4 Argon page scrolled to its Performance section, showing the Performance heading and the line “Frontier performance in complex workflows” above the vendor-reported benchmark table, whose four model columns are Gemini 4 Argon, GPT-6 Astra, Claude Fable 5.1 and Claude Opus 5.5, with rows running from Vals Index and AutomationBench down through FrontierSWE v2 and Terminal-bench 4.0 to GraphWalks and Agent's Last Exam.

A única coisa sobre o Argon que não é de forma alguma uma questão de tier

Todo argumento de nível acima pressupõe que o Argon é um modelo que você poderá eventualmente chamar. Vale a pena separar isso da questão de posicionamento, porque as duas têm respostas diferentes e apenas uma delas diz respeito à capacidade.

O limite de tokens de saída do Argon é de 1 milhão de tokens, acima dos 64K, e o Google afirma isso diretamente. Esse é um teto de saída, não uma janela de contexto. A distinção importa porque os dois são constantemente confundidos na cobertura deste lançamento, e porque um limite de saída de 1M é uma alegação de engenharia diferente de uma janela de contexto de 1M — o primeiro diz respeito a por quanto tempo uma única trajetória pode ser executada, o segundo a quanto você pode entregar ao modelo de uma só vez. O Google tem sido explícito sobre o limite de saída e silencioso sobre a janela de contexto. O Artificial Analysis registra 1.000.000 de tokens também para o contexto do Argon, mas esse é o campo do rastreador e não uma declaração do Google, então trate os dois números como vindos de salas diferentes, ainda que a leitura seja a mesma.

O que não está inequivocamente disponível é o acesso. O Argon não está disponível de forma geral, não está na Gemini API sob nenhum identificador e não está em nenhum catálogo de terceiros. Ele está disponível para defensores cibernéticos verificados por meio do Fairwind Program e para os próprios engenheiros do Google, e a próxima etapa que o Google menciona — “começando com clientes pagos da API e assinantes do Google AI Ultra” — não tem data associada. Você não pode avaliá-lo com sua própria carga de trabalho. Cada número neste artigo é, portanto, a medição de outra pessoa sobre um modelo que você não pode usar.

O que faria o Argon subir um degrau

Uma avaliação de nível é um instantâneo, e há cerca de cinco coisas que mudariam esta, em ordem aproximada do quanto elas importariam.

• Uma execução de esforço máximo medida de forma independente. Atualmente, o Argon é uma medição de alto esforço em 52,56. As próprias escadas de esforço da Anthropic movem um modelo vários pontos entre configurações, e se o modelo do Google se comportar de forma semelhante no máximo, a posição real do Argon em relação ao Fable 5.1 e ao Astra é melhor do que este artigo diz. Esta é a mudança mais provável.

• Uma segunda fonte de medição. Um rastreador é uma medição. Um segundo laboratório independente pontuando o Argon em seu próprio harness faria mais pela alegação de tier do que qualquer linha adicional de benchmark do Google.

• Um Gemini 4 Pro. Se a Google abrir o patamar Pro da geração 4 abaixo do Argon, a gama passa a ser uma família com forma, a posição do Argon deixa de ser “a única” e passa a ser “o topo de três”, e todos os argumentos deste artigo sobre uma família em falta precisam de ser reescritos. Vale a pena ficar atento, e está mais próximo do que a questão do Ultra.

• Um preço que não sobe por degraus. Se o período introdutório simplesmente nunca expirar — o Google não definiu quando ele termina —, o preço efetivo estável do Argon é US$ 2/US$ 10, e não US$ 4/US$ 20, e sua vantagem de custo por tarefa sobre o Opus 5.5 aumenta de cerca de 3× para cerca de 6×. Trata-se de um evento comercial, não de capacidade, mas muda a forma como uma decisão de compras se configura.

• Um cartão de modelo, cartão de sistema ou página de metodologia de avaliação do Argon. A tabela de desempenho remete para uma página de metodologia no domínio do Google; um cartão de modelo completo tornaria públicos a janela de contexto, a configuração de implantação e o envelope de segurança, e seria o primeiro artefato que permitiria a alguém fora da coorte Fairwind verificar os números do Google, em vez de apenas lê-los.

Por outro lado, o que mais provavelmente faria Argon descer não é um benchmark de forma alguma. É a reportagem da Bloomberg de 30 de setembro, que citou funcionários do Google com acesso ao modelo dizendo que ele tem um desempenho pior em trabalho real do que suas pontuações sugerem. Essa alegação não foi verificada por ninguém fora do Google e não é uma medição, mas é o tipo de alegação que um segundo benchmark independente confirmaria ou derrubaria. Até lá, ela fica no registro como uma alegação com um veículo identificado e fontes anônimas, e pertence à discussão de categoria, porque um modelo cuja lacuna entre benchmark e aplicação real é contestada não pode ser promovido apenas com base em benchmarks.

O que isso significa se você está escolhendo um modelo este mês

Despido do argumento de posicionamento, o panorama prático é direto o bastante para caber em um parágrafo. O Gemini 4 Argon é o melhor Gemini que o Google já criou, e ele não está disponível para você; portanto, os modelos do Google entre os quais você pode realmente escolher hoje são os que já foram lançados: Gemini 3.8 Flash, que mede 40,93 no Index a US$ 0,75/US$ 3,75, e Gemini 3.1 Pro Preview, que mede 29,72 a US$ 2/US$ 12. Se você precisa de um Gemini agora, essa é a escolha real, e o Argon não está entre elas.

Se você está escolhendo entre fornecedores em vez de dentro do Google, nada no anúncio do Argon muda a decisão de hoje. O topo do Índice é o Claude Opus 5.5, com 57,62, e o Claude Sonnet 5.5, com 55,98, logo atrás, a um quinto da tarifa de entrada e metade da de saída. O Gemini 4 Argon, com 52,56, não tem rota para a sua aplicação, então não é um candidato, por melhor que a pontuação venha a ser.

A screenshot of Google's own Google AI plans page, showing the three consumer Google AI plans side by side — Google AI Plus at $4.99/mo with 400 GB storage, Google AI Pro at $19.99/mo with 5 TB storage, and Google AI Ultra from $99.99/mo starting at 20 TB of storage — each with a “View plan benefits” link, illustrating that “Ultra” on Google's domain names a subscription plan rather than a Gemini model.

O OrcaRouter é uma única API em mais de 200 modelos com os preços de tabela dos provedores repassados sem nenhum markup e failover automático entre provedores, o que significa que a decisão de trocar de modelo não exige nenhuma reestruturação: o id na requisição é o modelo. Os modelos do Google no nosso catálogo hoje são os que o Google realmente lançou — google/gemini-3.8-flash, google/gemini-3.6-flash, google/gemini-3.5-flash e google/gemini-3.1-pro-preview. O Gemini 3 Argon não é um deles e não será enquanto não tiver um identificador público de modelo e uma tabela de preços publicada, então ninguém deve enxergar nisso uma questão de roteamento. Quando o Google colocar o Argon em uma API com um ID, aí sim passa a ser uma questão de roteamento. Até lá, a versão honesta do OrcaRouter é que ele ainda não se aplica, e a coisa útil que o OrcaRouter faz para essa decisão em particular é permitir que você compare os preços dos modelos que podem ser chamados lado a lado sem precisar abrir quatro contas para descobrir.

A conclusão

O Gemini 4 Argon é o carro-chefe do Google, e não seu modelo de fronteira. Ele obtém 52,56 no Índice v4.3.2 da Artificial Analysis em esforço alto — no mesmo nível de Claude Fable 5.1 e GPT-6 Astra, cinco pontos atrás do Claude Opus 5.5 e atrás do Claude Sonnet 5.5, um modelo mais barato de um laboratório rival. O Google o precificou em US$ 2/US$ 10 como preço introdutório, passando para US$ 4/US$ 20, o que faz seu preço final coincidir exatamente com o do Claude Opus 5.5, com capacidade mensuravelmente menor. Sua vantagem de 11,6 pontos sobre o Gemini 3.8 Flash é a maior diferença geracional no próprio portfólio do Google, e é a evidência mais forte de que a geração Gemini 4 representa um avanço real, e não uma mera troca de etiqueta.

Sobre a questão que deu origem a tudo isto: não existe Gemini 4 Ultra. O caminho Ultra do Google em seu próprio domínio redireciona para uma página de planos de assinatura, o índice de cartões de modelo não contém nenhuma entrada do Gemini 4, todos os padrões de URL de anúncio para uma publicação do Gemini 4 Ultra retornam 404, e o post de lançamento anuncia um modelo sem prometer uma família. Isso é um achado real e é evidência primária, e não inferência, mas também é um fato com meia-vida curta — um único 200 em um caminho o reverte, e o nível Pro da geração Gemini 4 é o que tem mais chance de aparecer primeiro.

Duas ressalvas a tirar desta peça. Todo número do Argon aqui é a medição de outra pessoa para um modelo que ninguém fora de uma coorte verificada de ciberdefensores pode chamar, e a própria tabela de dezenove linhas do Google é uma alegação, não uma medição — útil pelo que é, e não um substituto para o Index independente. E o veredito justo sobre a questão de nível é provisório: o Argon é medido em esforço alto, não máximo, e uma execução com esforço máximo é a forma mais barata possível de este artigo estar errado.

Comparados neste artigo4

Detectado a partir deste artigo · Benchmarks: Artificial Analysis · atualizado diariamente