Cartão de título principal com o texto "Gemini 4 Argon vs Claude Opus 5.5 — a divisão do benchmark", com uma faixa de data com o texto "Argon anunciado em 2026-09-30" e "Opus 5.5 lançado em 2026-09-22", um selo com o texto "Argon: piloto definido, não disponibilidade geral", e uma linha de rodapé com o texto "Números do Argon informados pelo fornecedor; valores de índice de ambos os modelos conforme a Artificial Analysis."
Guides & Insights

Gemini 4 Argon vs Claude Opus 5.5: A Divergência nos Benchmarks Que Ninguém Esperava

Autor

Magnus Corvin

Data de publicação

Modelos mais recentes · 20Ver todos os modelos →
Benchmarks: Artificial Analysis · atualizado diariamente
Voltar para todas as publicações

Gemini 4 Argon e Claude Opus 5.5 discordam sobre quem é melhor, e a discordância não é ruído. No Intelligence Index da Artificial Analysis, os dois estão a cinco pontos de distância a favor do Opus 5.5. No Vals Index — o ranking de impacto econômico ponderado pelo PIB — Gemini 4 Argon ocupa o primeiro lugar e Claude Opus 5.5 ocupa o terceiro lugar, atrás tanto do Argon quanto do Claude Sonnet 5.5. Os dois rankings mediram os mesmos dois modelos na mesma semana. É esse o artigo inteiro: qual deles você deve escolher depende de se o seu trabalho se parece mais com uma questão de prova ou com uma terça-feira num escritório de advocacia, e de você ter sequer acesso à API do Argon, o que, até hoje, quase ninguém tem.

O Google anunciou o Gemini 4 Argon em 2026-09-30 em uma publicação do DeepMind atribuída a Koray Kavukcuoglu, SVP do Google DeepMind e Arquiteto-Chefe de IA. A Anthropic lançou o Claude Opus 5.5 oito dias antes, em 2026-09-22. Um deles é um lançamento GA que você pode chamar esta tarde. O outro é uma distribuição faseada para um grupo nomeado de defensores cibernéticos, além dos próprios engenheiros do Google, com a intenção declarada de alcançar "clientes pagos da API e assinantes do Google AI Ultra" assim que as salvaguardas estiverem prontas e sem data vinculada a isso.

A resposta em uma linha, antes do detalhe.

Se você precisa do melhor raciocínio geral medido hoje e precisa dele em uma chave de produção, o Claude Opus 5.5 está disponível no OrcaRouter agora, e o Gemini 4 Argon não está em nenhuma API pública. Se você está desenvolvendo para agentes de finanças, jurídico, tributos ou programação que são avaliados por produção econômica por dólar, os números do Argon são melhores, e seu preço é um quinto do de Opus 5.5 por tarefa no único ranking que mede exatamente isso. Se você atua em defesa de cibersegurança para infraestrutura crítica, o Argon tem um programa ao qual você pode se candidatar, e a resposta pode ser sim.

De onde cada número realmente vem

Dois conselhos de índices, duas metodologias, e vale a pena ser preciso sobre qual é qual, porque os dois lados vão se citar mutuamente por meses.

• Artificial Analysis Intelligence Index v4.3 — Claude Opus 5.5 com 57,6 e Gemini 4 Argon com 52,6, ambos consultados no Artificial Analysis em 30/09/2026. Trata-se de um composto de dez avaliações, deliberadamente generalista em termos de tarefas, e é o quadro que a maioria das pessoas cita como "o" ranking.

• Vals Index, atualizado em 2026-09-29 — Gemini 4 Argon em primeiro lugar com 68,90% (±0,97), Claude Sonnet 5.5 em segundo com 67,04% (±0,92), Claude Opus 5.5 em terceiro com 66,97% (±0,89). O Vals pondera tarefas de finanças, programação, jurídicas e tributárias conforme a participação de cada setor no PIB dos EUA, de modo que um modelo medíocre em quebra-cabeças, mas excelente em revisão de contratos e trabalho com planilhas, obtém uma boa pontuação aqui.

Uma diferença de cinco pontos no AA é real e não é pequena. Uma diferença de dois pontos no Vals também é real, e, com os intervalos de confiança impressos no placar, os 68,90 ±0,97 do Argon contra os 66,97 ±0,89 do Opus 5.5 representam uma separação de cerca de 1,5 erro-padrão — melhor que um cara ou coroa, mas longe de ser esmagadora. Nenhum dos placares está errado. Eles estão medindo tarefas diferentes.

A two-column scoreboard comparing Gemini 4 Argon and Claude Opus 5.5 on six dimensions. Gemini 4 Argon reads: AA Intelligence Index 52.6, Vals Index 68.90% (rank 1), price $2 / $10 per million tokens, cost per index task $1.99, output ceiling 1M tokens, throughput 48.9 tok/s. Claude Opus 5.5 reads: AA Intelligence Index 57.6, Vals Index 66.97% (rank 3), price $4 / $20, cost per index task $5.98, output ceiling 128K tokens, throughput 92.2 tok/s. A footer line reads that Argon figures are vendor-reported and both models' index and cost figures are per Artificial Analysis on 2026-09-30.

Uma ressalva de configuração, e ela vai contra interpretar a diferença do AA como uma comparação puramente entre modelos. O Artificial Analysis apresenta o Gemini 4 Argon em sua configuração de alto esforço e o Claude Opus 5.5 em "Adaptive Reasoning, Max Effort, Default Fallback". Esses não são o mesmo ponto nas duas escadas de esforço, então o número de destaque 57,6 contra 52,6 não é uma comparação equivalente com orçamentos de raciocínio equiparados. É o número que ambas as páginas publicam, e é o número a citar se você estiver sendo justo com a Anthropic, mas não é um experimento controlado.

É no custo por tarefa que a diferença fica desconfortável.

A Artificial Analysis também publica uma prestação de contas do custo de executar seu conjunto de índices, e aqui os dois modelos não estão nem perto.

• Custo por tarefa de indexação — Gemini 4 Argon $1,99 versus Claude Opus 5.5 $5,98.

• Custo para executar toda a suíte de índices — Gemini 4 Argon $2.407 versus Claude Opus 5.5 $8.708.

• Preço de tabela por milhão de tokens — Gemini 4 Argon $2 de entrada / $10 de saída (tarifa introdutória informada pelo Google, com entrada em cache com 95% de desconto, ou seja, $0.10) versus Claude Opus 5.5 $4 de entrada / $20 de saída.

• Vazão — Gemini 4 Argon: 48,9 tokens de saída por segundo, primeiro token após 2,79 segundos; Claude Opus 5.5: 92,2 tokens de saída por segundo, mas uma latência de primeiro token de 702 segundos no mesmo ambiente de testes, o que é o custo do raciocínio estendido aparecendo às claras.

• Custo do Vals por execução — Gemini 4 Argon $15,68 contra Claude Opus 5.5 $32,14 no mesmo conjunto de tarefas ponderado pelo PIB.

Há um detalhe que vale a pena sinalizar em vez de suavizar: o ranking da Vals lista as tarifas do Argon como US$ 4 de entrada / US$ 20 de saída, enquanto o anúncio do Google informa US$ 2 de entrada / US$ 10 de saída para o período introdutório. A leitura mais provável é que a Vals esteja mostrando uma tarifa de tabela padrão e o Google esteja mostrando uma promocional, mas isso é uma inferência e não uma declaração publicada por nenhum dos lados. Se o seu orçamento depende desse número, pergunte ao Google.

O que a Argon alega e o que foi verificado

A capture of the Google DeepMind blog post announcing Gemini 4 Argon, dated Sep 30 2026, credited to Koray Kavukcuoglu, SVP Google DeepMind and Chief AI Architect, with the standfirst reading that Gemini 4 Argon delivers frontier performance in complex workflows across real-world software engineering, enterprise knowledge work like legal and finance, and cybersecurity defense.

O post do Google está repleto de números, e todos eles são relatados pelo fornecedor. Até onde consigo encontrar, nenhum foi reproduzido de forma independente, e os painéis independentes acima medem coisas diferentes das que o Google escolheu destacar. Declarado como as próprias alegações do Google:

• DeepSWE v1.1 — 77,9%, descrito como um novo estado da arte em engenharia de software de longo horizonte do mundo real.

• Compreensão de vídeos longos do LVBench — 91,7%, descrito como o estado da arte.

• AutomationBench (o benchmark da Zapier para tarefas empresariais de ponta a ponta) — 1.º lugar, com 51,3%.

• Remediação de vulnerabilidades do CWE-bench v1 — empatado em primeiro lugar, com 68%, partindo do resultado do Gemini 3.8 Flash Cyber no quadro v0.

• Gray Swan Indirect Prompt Injection — descrito como líder, sem números publicados no post.

• Vals Finance Agent v2 e Harvey's Legal Agent Benchmark — descritos como líderes, igualmente sem um número impresso no anúncio.

As duas famílias de alegações que realmente têm apoio independente são as que mais merecem confiança: Vals confirma a posição no índice com um número e um intervalo, e Artificial Analysis confirma um índice de 52,6 e o preço. As anedotas de produtividade interna — uma melhoria de 40% em relação a uma linha de base publicada numa sub-rotina quântica, mais de 300 TiB de memória liberados em toda a frota do Google por agentes Argon — são resultados internos da empresa sem teste externo, e devem ser interpretadas como tal.

O que é o Opus 5.5, caso você esteja vivendo debaixo de uma pedra

O Claude Opus 5.5 é o carro-chefe da Anthropic: contexto de 1M de tokens, saída máxima de 128K, entrada multimodal em texto, imagem e arquivo, pensamento estendido, uso de ferramentas e saídas estruturadas. Ele sucedeu o Claude Opus 5 em 22 de setembro de 2026 e a manchete do seu lançamento foi possivelmente o corte de preço — a faixa caiu em vez de subir, para US$ 4/US$ 20, com leituras em cache a US$ 0,20. Hoje ele é roteável no OrcaRouter exatamente a essa tarifa, com o preço de tabela do provedor repassado com margem zero, e uma mudança de preço do fornecedor chega do nosso lado no mesmo dia em que chega do lado deles.

Nas pontuações por tarefa que ambos os modelos têm, o quadro é uma verdadeira gangorra, e não uma varredura:

• Terminal-Bench 4.0 — Claude Opus 5.5 59,6% contra Gemini 4 Argon 57,1%.

• SciCode — Claude Opus 5.5 66,9% versus Gemini 4 Argon 61,8%.

• Humanity's Last Exam — Claude Opus 5.5 61,4% versus Gemini 4 Argon 57,1%.

• Raciocínio de contexto longo — Claude Opus 5.5 84,7% versus Gemini 4 Argon 79,7%.

CritPt — Claude Opus 5.5 31,7% versus Gemini 4 Aron 27,1%.

• Onisciência — Claude Opus 5.5 46,4 versus Gemini 4 Argon 42,4.

• GDPval — Claude Opus 5.5 1.846 versus Gemini 4 Argon 1.611.

• AutomationBench-AA — Gemini 4 Argon 77,5% contra Claude Opus 5.5 69,5%. Esta é a única pontuação de tarefa em confronto direto na qual o Argon vence com clareza, e é também a família de tarefas mais próxima do que o Vals Index recompensa.

Portanto, o padrão é consistente: o Opus 5.5 está à frente na escala de raciocínio de cunho acadêmico, e o Argon está à frente na execução de tarefas ponta a ponta. Isso já não é uma contradição entre os dois rankings. É a mesma constatação expressa duas vezes.

A capacidade que ninguém está usando como critério de comparação

O teto de saída do Gemini 4 Argon é de 1.000.000 de tokens em uma única trajetória, ante 64K da geração anterior. O Claude Opus 5.5 limita a saída a 128K. Ambos mantêm uma janela de contexto de 1M de tokens, mas contexto e saída são orçamentos diferentes, e este é o maior salto de uma única especificação no anúncio.

Se isso importa depende inteiramente do que você executa. Um teto de saída de 128K é generoso para chat, revisão de código, extração estruturada e etapas de agente. É uma barreira intransponível para gerar um conjunto completo de patches de migração, um relatório de auditoria completo ou um documento longo em uma única passagem — os fluxos de trabalho que o Google escolheu para ilustrar o lançamento. Se o seu pipeline encadeia vinte chamadas para se manter abaixo de um limite, o teto do Argon vai economizar latência e código de orquestração para você. Se não encadear, você está pagando por capacidade extra que não vai usar.

A disponibilidade é a variável decisiva, não a qualidade.

Esta é a parte da comparação à qual não está associado nenhum benchmark e que importa mais do que todos eles.

O Gemini 4 Argon não está em disponibilidade geral. A publicação do Google diz que ele está sendo disponibilizado gradualmente a defensores cibernéticos de confiança por meio do Fairwind Program, que a empresa está envolvida no processo voluntário de acesso a modelos antes do lançamento do governo dos EUA e que o acesso mais amplo para desenvolvedores, empresas e consumidores virá "o mais rápido possível", começando por clientes pagos da API e assinantes do Google AI Ultra. Não há identificador de modelo, nem endpoint, nem cota publicada, nem data. Ele não está no nosso catálogo e também não está na API pública de mais ninguém, portanto ainda não existe uma página de preços para o Argon.

O Claude Opus 5.5 chega hoje. No OrcaRouter, ele é anthropic/claude-opus-5.5, acessado pelo mesmo endpoint compatível com OpenAI que os outros mais de 200 modelos do catálogo, com failover automático entre provedores quando uma rota degrada, e uma DSL de roteamento para casos em que você quer enviar parte do tráfego para o Opus 5.5 e o restante para outro lugar na mesma chave. Sem segundo contrato, sem segundo SDK.

A capture of the OrcaRouter model page for Anthropic: Claude Opus 5.5, showing the Anthropic provider, a release date of 2026-09-22, a 1,000,000-token context window, a 128,000-token maximum output, text, image and file input, and pricing of $4.00 input / $20.00 output per million tokens with cache reads at $0.20 and cache writes at $5.00.

A recomendação prática para o próximo mês é pouco glamourosa: construa sobre o Opus 5.5, mantenha o nome do seu modelo em um valor de configuração em vez de um literal de string e coloque um modelo barato por trás do seu caminho de retentativa para que um pico de latência em uma execução de primeiro token de 702 segundos não derrube seu produto junto com ele. Esse último ponto não é teórico — a latência de primeiro token do Opus 5.5 no harness da AA é de onze minutos, e, quer isso seja um artefato do harness, quer o modelo esteja genuinamente pensando por mais tempo do que qualquer coisa anterior, seu orçamento de timeout deve ser definido pelo número, não pelo marketing.

O que mudaria este veredito?

Três coisas, em ordem de probabilidade. A disponibilidade geral do Argon com um preço publicado, o que tornaria o argumento de custo imediatamente acionável e testaria se $2/$10 sobrevive ao contato com tráfego real. Uma execução independente e reproduzível do DeepSWE v1.1 e do CWE-bench v1 fora do Google, que ou confirmaria as alegações do fornecedor ou as desmentiria. Ou uma configuração do Argon no Artificial Analysis em seu nível máximo de esforço, o que resolveria se a diferença de cinco pontos no índice é uma diferença de capacidade ou um artefato das configurações de esforço.

Até que um deles se concretize, o resumo honesto é que o Opus 5.5 é o modelo mais bem verificado e o Argon é a alegação com melhor preço. Qual deles você consegue realmente usar hoje não é uma decisão difícil.

O Claude Opus 5.5 já está disponível no OrcaRouter à tarifa de tabela do fornecedor, sem margem adicional, a par do resto do catálogo — se quiser avaliá-lo com a sua própria carga de trabalho em vez de com um ranking, anthropic/claude-opus-5.5é o id a chamar, e trocar mais tarde por um modelo diferente é uma alteração de uma linha na mesma chave.

Comparados neste artigo2

Detectado a partir deste artigo · Benchmarks: Artificial Analysis · atualizado diariamente