
Gemini 4 Argon no FrontierSWE: Ele grita "Eureka!" e depois corrige o próprio dever de casa
- typesafeNOVOTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 por 1M de tokens · 261 tok/s
- OpenAINOVOOpenAI: GPT-6 Luna2026-09-2237Inteligência
- OpenAINOVOOpenAI: GPT-6 Sol2026-09-2248Inteligência
- AnthropicNOVOAnthropic: Claude Opus 5.52026-09-2258Inteligência
- xAINOVOGrok 4.72026-09-2146Inteligência
- OrcaNOVOOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 por 1M de tokens · 114 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 por 1M de tokens · 1148 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Inteligência
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Inteligência77Código
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Inteligência76Código
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Inteligência76Código
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Inteligência82Código
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 por 1M de tokens · 48 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 por 1M de tokens · 102 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Inteligência72Código
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 por 1M de tokens · 216 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Inteligência75Código
- obsidianQwen3.8 27B2026-08-1534Inteligência68Código
- DeepSeekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Inteligência69Código
- xAISpaceXAI: Grok 4.62026-08-1244Inteligência77Código
O Gemini 4 Argon tem um problema de personalidade, e essa é a coisa mais interessante que alguém disse sobre o modelo desde que o Google o anunciou em 30 de setembro de 2026. No benchmark FrontierSWE de horizonte ultralongo, o modelo que terminou em terceiro lugar — atrás do GPT-6 Astra e do Claude Opus 5.5 — deixou em seus avaliadores uma impressão memorável: sua palavra favorita é "Eureka!", e ele passa boa parte do orçamento de tarefa de vinte horas sendo extremamente duro consigo mesmo. Essa é uma observação adjacente a vazamentos, de fonte única, feita por um operador de benchmark — não é uma alegação de fornecedor nem uma nota de lançamento —, e vale a pena ser preciso sobre o que ela diz e o que não diz. Nenhum dos três modelos acima tem uma data de GA para o Argon atrelada a si; a observação é sobre comportamento dentro de um harness, e os números que a acompanham são a primeira medição independente do Argon em um benchmark que o próprio Google não executa.
O que a exclamação "Eureka!" realmente é
A fonte é uma postagem de @nrehiew_, um engenheiro que trabalha com avaliação de modelos, publicada em 2026-09-30, citando o anúncio do Gemini 4 Argon de Sundar Pichai. A essência são três afirmações: Argon é o modelo mais divertido que eles avaliaram no FrontierSWE; sua palavra favorita é "Eureka!"; e ele é extremamente autocrítico. O autor da postagem o descreve como uma grande melhoria em relação aos Geminis anteriores, mantendo ainda essa personalidade, e o considera impressionante.
Leia isso com atenção, porque é fácil interpretar demais. É a impressão de um avaliador ao observar traços de agentes, não um resultado com pontuação, nem uma métrica publicada, nem algo que a Proximal Labs — que constrói e opera o FrontierSWE — tenha assinado como constatação. Não existe uma coluna de "autocrítica" no leaderboard. O que faz valer a pena escrever sobre o comentário não é ele ser autoritativo; é que é a única leitura qualitativa que alguém fora do Google ofereceu sobre o Argon e, como o modelo não está disponível para o público em geral, traços como estes são atualmente a única forma de ver o modelo se comportar.
Isso também toca numa questão real para quem planeia executar o Argon como agente. Execuções de programação de longo horizonte são, sobretudo, um problema de gestão de orçamento: um modelo que se interrompe para reconsiderar, que avalia o seu próprio trabalho intermédio e que anuncia avanços é um modelo que gasta tokens com processo. Se isso é uma vantagem ou um custo depende inteiramente de a autocrítica convergir ou entrar em loop. Um único avaliador a dizer "impressionante" é um dado, não uma resposta.
FrontierSWE v2, e por que o terceiro lugar é a verdadeira história
O FrontierSWE não é o tipo de benchmark do qual se possa extrair um número de manchete. Ele é criado pela Proximal Labs e descrito em seu repositório como um benchmark de agente de codificação de horizonte ultra longo que testa implementação, engenharia de desempenho e pesquisa em ML. A versão 2 foi lançada em setembro de 2026 com 21 novas tarefas somadas ao conjunto original, totalizando 34, e espera que um agente continue trabalhando por até vinte horas. Tudo é executado pelo próprio harness da Proximal, proximus, que é construído sobre o mini-swe-agent e acrescenta compactação de contexto, visão e uma ferramenta explícita de submissão. A pontuação é mean@5 — a média de cinco tentativas por tarefa — com a faixa de incerteza reportada indo da média da pior execução de cada tarefa até a média de sua melhor execução.
Essa metodologia é importante para ler a linha de Argon honestamente:
• Pontuação — Gemini 4 Argon 55,0% média@5, ±9,9, contra GPT-6 Astra 65,5% e Claude Opus 5.5 62,3%
• Dispersão — a faixa das execuções do Argon vai de 44,5% (pior@5) a 64,3% (melhor@5), um intervalo que se sobrepõe à faixa de 52,0%–71,5% do Opus 5.5 na parte superior e não se sobrepõe, em nenhum ponto, à faixa de 55,1%–73,0% do Astra
• Custo por ensaio — Argon $129,36, Opus 5.5 $98,87, Astra $1.029,65
• Tempo real por ensaio — Argon 10,6 horas, Opus 5.5 14,2 horas, Astra 12,1 horas
A primeira coisa que você nota é que o Argon está em terceiro e não está perto do segundo em pontuação. A segunda — a que deveria decidir se você se importa — é que, nesse benchmark, o Argon é estritamente dominado pelo Claude Opus 5.5. O Opus 5.5 marcou mais (62,3% vs 55,0%) e custou menos por tentativa (US$ 98,87 vs US$ 129,36). Não há eixo algum aqui em que o Argon vença. Sua única vantagem é o tempo: 10,6 horas contra as 14,2 do Opus 5.5, o que é relevante se você paga por tempo de relógio e não por tokens, e irrelevante se você paga por um orçamento por tentativa.
O leaderboard do próprio Proximal traz uma nota de rodapé na linha do Argon que todos que citam esse número deveriam repetir: "Gemini 4 Argon: a taxa de acerto de cache é muito menor devido a uma configuração que não é de produção." Isso significa que os avaliadores estão sinalizando que executaram o Argon fora da configuração que uma implantação em produção usaria, o que infla seu custo e, plausivelmente, sua latência. É uma ressalva especificamente sobre o valor de custo, e é o motivo pelo qual os $129.36 devem ser lidos como um limite superior, e não como uma tabela de preços.
O número que o próprio gráfico do Google não mostra
É aqui que a apuração fica genuinamente interessante, e é aí que a maioria dos textos sobre esse resultado vai errar. O post de anúncio da Google inclui um gráfico de benchmark com uma linha do FrontierSWE v2. Essa linha mostra GPT-6 Astra 65,5%, Claude Fable 5.1 56,3%, Claude Opus 5.5 62,3%. O Gemini 4 Argon não está nela. O ranking ao vivo da Proximal traz o Astra com 65,5% e o Opus 5.5 com 62,3% — os mesmos números —, mas coloca o Claude Fable 5.1 em 56,5%, não 56,3%, e lista o Gemini 4 Argon com 55,0%.
A razão para a omissão não é misteriosa, e a própria Google o diz: as notas metodológicas que acompanham o seu conjunto de avaliação afirmam que os resultados do FrontierSWE são reportados a partir do ranking público oficial da Proximal. A Google não calculou este benchmark por si própria. Estão a citar a mesma terceira parte que nós, e o único valor do Argon que essa terceira parte publica é 55,0%. Portanto, a leitura honesta é que a pontuação do Argon no FrontierSWE é uma medição genuinamente independente — a Proximal realizou-a, no seu ambiente de avaliação, nas suas tarefas — e que coloca o Argon atrás de dois concorrentes.
Todo o resto no gráfico do Google é informado pelo fornecedor e você deve rotulá-lo assim na sua cabeça: Argon 63,1% no Vals Index contra 67,0% do Opus 5.5, 41,4% no AutomationBench contra 42,5% do Opus 5.5, 89,6% no Vibe Code Bench contra 90,3% tanto para Astra quanto para Opus 5.5, 87,5% no LVBench contra 83,7%, 68,0% no CWE-bench v1 contra 67,0% do Opus 5.5. Essas são execuções do Google de avaliações escolhidas pelo Google. A linha do FrontierSWE é a única nesse quadro que um leitor pode verificar de forma independente, e é exatamente por isso que o resultado em terceiro lugar tem mais peso do que o padrão de empate ou leve vitória ao seu redor.
O que a Artificial Analysis diz, de forma independente
O FrontierSWE é uma lente. O Artificial Analysis é a outra, e concorda com o formato da história. Em seu Intelligence Index v4.3.2, o Gemini 4 Argon, em sua configuração de raciocínio alto, obtém 52,56 — medidos de forma independente em seu próprio hardware, não reportados pelo Google — a um preço de tabela de US$ 2,00 por milhão de tokens de entrada e US$ 10,00 por milhão de tokens de saída, com 95% de desconto para entrada em cache. Sua instrumentação estima o custo de uma única tarefa do índice em US$ 1,99.
A comparação que importa é a mesma que a FrontierSWE produziu. O Claude Opus 5.5 em sua configuração alta obtém uma pontuação mais alta no índice, 53,58, a um custo por tarefa menor, US$ 1,82. Dois avaliadores independentes, usando tarefas diferentes e estruturas de avaliação diferentes, colocam o Argon atrás do Opus 5.5 tanto em qualidade quanto em custo. Isso é um sinal consistente, e não um único artefato de benchmarking, e é a afirmação mais forte que se pode fazer atualmente sobre a economia do Gemini 4 Argon.

Anunciado, não lançado — e por que esse enquadramento não é pedantismo
Não existe um ID de modelo Gemini 4 Argon. O acesso está sendo disponibilizado por meio do Fairwind Program a defensores cibernéticos verificados, em paralelo a uma abertura faseada para clientes pagos da API e assinantes do Google AI Ultra, sem data de disponibilidade geral publicada. A publicação do Google é um anúncio de um modelo e de um conjunto de avaliações, não o lançamento de um endpoint que você possa chamar. Se você leu reportagens que descreveram isso como um lançamento, essas reportagens estão à frente dos fatos.
Essa distinção tem consequências práticas para qualquer pessoa que leia o número do FrontierSWE. A avaliação foi executada com um modelo ao qual a Proximal tinha acesso sob algum tipo de acordo; ela informa o que o modelo consegue fazer, não o que você pode ter. Também significa que os números de desempenho têm uma meia-vida mais curta do que o habitual. Um modelo que ainda não está em GA ainda pode mudar — configurações de decodificação, prompts de sistema, padrões predefinidos de uso de ferramentas e arcabouços de segurança ainda estão todos sendo ajustados, e o motivo declarado de a taxa de acerto de cache do Argon ter sido baixa é precisamente que os avaliadores não estavam usando uma configuração de produção. Espere que os 55,0% e os US$ 129,36 mudem.
O que mudaria esse quadro: um ID de modelo publicado com uma tabela de preços, uma data de GA, uma nova execução do FrontierSWE em configurações de produção e um segundo avaliador independente reproduzindo o resultado de terceiro lugar. Até que pelo menos os dois primeiros existam, trate todo número do Argon — incluindo os bons no próprio gráfico do Google — como provisório.

A leitura de personalidade é a parte que vai envelhecer melhor.
Pontuações de benchmark para um modelo pré-GA têm uma validade medida em semanas. A observação comportamental, não. É no trabalho de agentes de horizonte longo que o caráter do modelo realmente se manifesta, porque um orçamento de vinte horas com 34 tarefas é corda suficiente para as tendências de um modelo se acumularem: como ele se recupera de uma abordagem fracassada, se para para replanejar, se consegue distinguir entre um problema difícil e um caminho errado. Um avaliador que assiste a muitas dessas traces e descreve um modelo como autocrítico e propenso a exclamar quando algo funciona está descrevendo um modelo que externaliza seu raciocínio sobre o próprio progresso. Essa é uma hipótese sobre por que as execuções do Argon se distribuem de 44,5% a 64,3% — uma faixa mais ampla que a do Opus 5.5 — e é testável assim que o modelo for chamável.
A outra metade do comentário é a que deve ser encarada com ceticismo. "Uma grande melhoria em relação aos Geminis anteriores" é uma comparação com modelos que nunca foram pontuados neste benchmark sob este harness, portanto não pode ser verificada em relação à tabela de classificação de forma alguma. É uma impressão, e deve ser tratada como tal, por mais credível que seja a pessoa que a apresenta.

Onde isso deixa você se você realmente precisa de um agente de longo horizonte hoje
Não dá para chamar o Gemini 4 de Argon, então a questão prática não é Argon versus qualquer outra coisa — é qual modelo você deveria estar rodando para o trabalho no qual o Argon foi avaliado em benchmark. A própria ordenação da FrontierSWE responde a isso: o GPT-6 Astra lidera o ranking com 65,5%, mas a US$ 1.029,65 por teste, cerca de dez vezes o custo dos dois modelos abaixo dele, enquanto o Claude Opus 5.5 entrega 62,3% por US$ 98,87. A escolha de melhor custo-benefício neste benchmark é o Opus 5.5, e também é o modelo que superou o Argon na Artificial Analysis com um custo por tarefa menor.
Ambos esses modelos, e a maioria dos dez primeiros do ranking — GLM-5.3, Grok 4.7, Kimi K3, Qwen3.8-Max, DeepSeek V4 Flash Vision Exp e Muse Spark 1.2 entre eles — são roteáveis através da API única da OrcaRouter ao lado de mais de 200 outros — uma chave, 0% de markup, então o preço de tabela do provedor é o que você paga e um corte de preço do fornecedor chega ao nosso lado no mesmo dia. Essa última propriedade vale mais do que o habitual em um modelo pré-GA: se o preço da Argon mudar entre agora e a GA, o que a nota de rodapé do cache de não produção sugere que pode acontecer, nada na sua integração muda quando isso ocorrer. O failover automático é a outra peça que se encaixa neste caso específico — um modelo pouco familiar cujos modos de falha ninguém mapeou ainda é exatamente o que você não quer em um único caminho de produção codificado de forma fixa.
Para ser explícito sobre uma coisa: o Gemini 4 Argon não está no nosso catálogo. Uma consulta à nossa API pública de modelos para google/gemini-4-argon retorna "model not found", e nenhum outro serviço o hospeda também — ele está restrito ao Fairwind Program do Google, sem ID de modelo publicado. Quando ele puder ser chamado, vamos roteá-lo, e os números do FrontierSWE acima são o motivo para ficarmos atentos a esse dia, em vez de esperarmos por ele. Os modelos para os quais ele perdeu já estão lá.
O que assistir
Os sinais que transformariam isto de um "o que sabemos até agora" em uma decisão são específicos. Um ID de modelo publicado e sua tabela de preços. Uma data de disponibilidade geral. Uma nova execução do FrontierSWE sob configurações de produção, o que resolveria se o custo de $129,36 por tentativa é uma taxa real ou um artefato da configuração de cache que a Proximal sinalizou. E, idealmente, um segundo avaliador publicando traços do Argon para que a observação "Eureka!" deixe de ser uma amostra de um.
Até então, o resumo honesto é limitado e vale a pena nos atermos a ele: o Gemini 4 Argon foi anunciado, é excepcionalmente expressivo em traços de agente de horizonte longo segundo um avaliador, e no único benchmark independente que podemos verificar, terminou em terceiro atrás de dois modelos — um dos quais o superou em pontuação e custo ao mesmo tempo.
Comparados neste artigo1
Detectado a partir deste artigo · Benchmarks: Artificial Analysis · atualizado diariamente
