Um cartão de destaque intitulado 'Claude Haiku 5.5 vs Gemini 3.7 Flash', mostrando Claude Haiku 5.5, lançado a 7 de outubro de 2026, à esquerda, contra Gemini 3.7 Flash, marcado como obsoleto, à direita, uma linha do Intelligence Index v4.3.2 com 43,40 contra 39,06, e uma linha do Terminal Bench 4.0 com 0,3283 contra 0,1364.
Guides & Insights

Claude Haiku 5.5 vs Gemini 3.7 Flash: Um destes dois já foi descontinuado

Autor

Gideon Frost

Data de publicação

Modelos mais recentes · 20Ver todos os modelos →
Benchmarks: Artificial Analysis · atualizado diariamente
Voltar para todas as publicações

Há um fato incômodo por trás de qualquer Claude Haiku 5.5 versus Gemini 3.7 Flash, comparação escrita hoje: o Gemini 3.7 Flash está obsoleto. O fornecedor o lançou em 13 de agosto de 2026, substituiu-o pelo Gemini 3.8 Flash em 2 de setembro, e a Artificial Analysis agora mantém a página do 3.7 com um sinalizador de obsolescência. O Claude Haiku 5.5, em contraste, foi lançado em 7 de outubro de 2026 e tem um compromisso de descontinuação não antes de outubro de 2027.

Isso não torna a comparação inútil. Isso muda a pergunta. Já não se trata de “qual destes dois devo chamar” — para a maioria das equipes, a resposta é nenhum dos dois, porque a linha 3.7 foi superada dentro da própria família. Para o que ela serve é algo mais sutil e possivelmente mais útil: uma leitura clara de quão rápido o nível flash do Google avançou em três semanas, e de quais partes da ficha técnica de um modelo de nível flash realmente determinam se ele será usado.

O que você ainda pode medir

Ambos os modelos foram executados no mesmo painel independente, que é o único lugar onde os dois podem sequer ser comparados. No Artificial Analysis Intelligence Index v4.3.2, o Claude Haiku 5.5 obtém 43,40 em sua configuração Max, contra 39,06 do Gemini 3.7 Flash em sua configuração High — uma diferença de 4,33 pontos.

Ambos os fornecedores também publicam seus próprios conjuntos de avaliação, e eles não se sobrepõem de uma forma que permita uma comparação direta. As linhas independentes compartilhadas são as quatro que a Artificial Analysis executou em ambos:

• Terminal Bench 4.0 — 0,3283 para Claude Haiku 5.5 contra 0,1364 para Gemini 3.7 Flash. Uma diferença absoluta de 19 pontos, e a maior assimetria do conjunto.

• SciCode — 0,5498 contra 0,5718. Gemini 3.7 Flash supera por 2,2 pontos.

• Humanity's Last Exam — 0,4439 contra 0,4787. Gemini 3.7 Flash por 3,5 pontos.

• AutomationBench, pontuação parcial — 0,3541 contra 0,6203. Gemini 3.7 Flash por 27 pontos.

Leia esse conjunto com atenção, porque ele contém o resultado interessante. Gemini 3.7 Flash vence três dos quatro benchmarks compartilhados e ainda assim perde o índice composto por 4,3 pontos. Um índice é uma combinação ponderada, e a ponderação coloca as linhas de terminal e de código — onde a diferença segue no sentido oposto por uma margem muito maior — à frente do agregado das demais. Isso não é tanto um artefato de pontuação quanto uma afirmação sobre para que serve o índice: ele tenta prever se um modelo consegue concluir um trabalho, e, nessa questão, a linha 3.7 era fraca de uma forma que suas pontuações respeitáveis em benchmarks científicos não escondiam.

A two-column scoreboard titled 'Claude Haiku 5.5 vs Gemini 3.7 Flash - the scoreboard' with rows Index v4.3.2 43.40 against 39.06, Terminal Bench 4.0 0.3283 against 0.1364, SciCode 0.5498 against 0.5718, Humanity's Last Exam 0.4439 against 0.4787, cost per task $0.21 against $0.93 and input price $0.10 against $0.75, footed 'Gemini 3.7 Flash is listed as deprecated; all figures per Artificial Analysis v4.3.2.'

Em que a linha 3.7 era realmente ruim

Duas linhas contam a história melhor do que o índice.

O Terminal Bench 4.0 com 0,1364 é um número baixo, e ele fica ao lado de um 0,8577 na geração anterior do Terminal Bench do mesmo modelo. Isso não é um modelo que piorou; é um benchmark que mudou o que mede, e o Gemini 3.7 Flash não fez a transição. O Claude Haiku 5.5, no mesmo benchmark revisado, pontua 0,3283 — não espetacular em termos absolutos, mas quase duas vezes e meia o valor do 3.7 Flash, na linha que mais diretamente prevê o desempenho em codificação agêntica.

A segunda linha é Tau-Bench Banking, onde o Gemini 3.7 Flash obtém 0.3278. A confiabilidade no uso de ferramentas em um domínio estruturado é exatamente para o que um modelo barato é implantado, e uma pontuação abaixo de 0.33 é o tipo de número que mata silenciosamente um projeto-piloto. O Claude Haiku 5.5 não tem uma pontuação publicada do Tau-Bench na mesma tabela, então não há comparação disponível ali — o honesto é dizer isso em vez de inferir uma.

Onde o Gemini 3.7 Flash se saiu bem é onde ele sempre se saiu bem: GPQA em 0,9455 e MMMU-Pro em 0,8549 são ambos pontos fortes genuínos, e sua entrada multimodal nunca esteve em questão. A falha estava na parte da ficha técnica que decide se um loop de agente funciona, não na parte que conquista posições no ranking.

O que mudou nas três semanas depois disso?

O Gemini 3.8 Flash chegou em 2 de setembro de 2026, e a movimentação dentro do próprio nível flash do Google é a comparação mais útil para quem planeja um pipeline para 2027.

No mesmo índice, o Gemini 3.8 Flash registra 40,93 contra 39,06 da linha 3.7 — um ganho de 1,87 ponto em três semanas. O Terminal Bench 4.0 passou de 0,1364 para 0,1970. O Tau-Bench Banking passou de 0,3278 para 0,4495. Essas são exatamente as linhas em que o modelo 3.7 teve o pior desempenho, o que sugere que o sucessor foi direcionado precisamente para essa fraqueza, em vez de para um aumento geral de capacidade.

O preço não se moveu absolutamente nada. O Gemini 3.7 Flash foi listado a US$ 0,75 de entrada e US$ 3,75 de saída por milhão de tokens, e o Gemini 3.8 Flash foi lançado com os mesmos US$ 0,75 e US$ 3,75 — a mesma tabela de preços, associada a um modelo dois pontos de índice melhor nas linhas que importam para agentes.

A capture of Google's Gemini API pricing documentation page, headed 'Gemini Developer API pricing', with the banner 'Gemini 3.8 Flash is now available. Try it out.' and the documentation's left-hand model list showing Gemini 3.8 Flash, Gemini 3.7 Flash, Gemini 3.6 Flash and Gemini 3.5 Flash.

A tabela de tarifas é onde essa comparação realmente muda de rumo.

Frente ao Claude Haiku 5.5, o preço do Google é toda a história, e não está nem perto.

• Entrada — Claude Haiku 5.5 US$ 0,10 por milhão de tokens até 100.000, US$ 0,50 acima; Gemini 3.7 Flash US$ 0,75 fixo, ou sete vezes e meia a tarifa da Anthropic dentro da primeira faixa.

• Saída — US$ 0,50 para Claude Haiku 5.5 na primeira faixa, US$ 2,50 acima dela; US$ 3,75 para Gemini 3.7 Flash.

• Entrada em cache — $0.01 e $0.125 para o Claude Haiku 5.5; $0.075 de leitura e $0.75 de gravação para o Gemini 3.7 Flash.

• Contexto — um milhão de tokens para ambos. Saída máxima — 128.000 tokens para o Claude Haiku 5.5 contra 65.536 para o Gemini 3.7 Flash.

• Modalidade de entrada — texto e imagens para Claude Haiku 5.5; texto, imagens, fala e vídeo para Gemini 3.7 Flash. Esta continua sendo a única linha em que a especificação do Google é estritamente mais longa, e sobreviveu inalterada à sucessão para a 3.8.

• Custo independente por tarefa Index concluída — US$ 0,21 para o Claude Haiku 5.5, contra US$ 0,93 para o Gemini 3.7 Flash. Uma diferença de 4,4×, maior do que sugeriria a proporção de entrada de sete e meio para um, porque o modelo da Anthropic é o verboso aqui: 162.164 tokens de saída por tarefa Index, contra 58.387 do Gemini 3.7 Flash. A Anthropic também documenta um tokenizador compartilhado com o Claude 4.7 e versões posteriores que contabiliza cerca de 30% mais tokens para o mesmo texto, o que empurra na mesma direção.

• Velocidade — 212,3 segundos por tarefa do Index para o Gemini 3.7 Flash contra 424,6 para o Claude Haiku 5.5. O modelo do Google é o mais rápido dos dois por um fator de dois, que é a única linha nesta seção em que o modelo mais barato não é também o melhor.

O que isso significa se você estiver escolhendo hoje

A leitura prática é que nenhum desses dois é a resposta certa, por motivos diferentes.

O Gemini 3.7 Flash está obsoleto, tem o mesmo preço do seu sucessor e é pior que esse sucessor exatamente nas linhas de que um modelo de produção barato precisa. Recomendá-lo seria recomendar uma tabela de preços atrelada a um modelo superado — o sucessor custa o mesmo e faz mais. Ninguém que estiver escolhendo entre esses dois em outubro de 2026 deveria optar pela linha 3.7, e o fato de sua tabela de preços permanecer inalterada é o que decide a questão.

Claude Haiku 5.5 é o modelo ativo e, em trabalho de texto para texto, é mais barato em todos os aspectos, mais alto no índice composto e muito melhor nas duas linhas que preveem sucesso agêntico. Ele também é o mais lento e não aceita áudio ou vídeo. Se isso importa é uma questão do seu pipeline, não dos modelos.

A terceira opção, que a diferença de pontos do índice entre 3.8 e 3.7 torna visível, é que o nível flash do Google está avançando rápido o suficiente para que uma comparação de três semanas já seja histórica. Trate qualquer confronto direto no nível flash como algo com uma vida útil medida em semanas, não em trimestres.

Executando qualquer lado em que você cair

O Gemini 3.8 Flash — o sucessor, e não o 3.7 obsoleto — está no catálogo do OrcaRouter pelo preço de tabela do Google, com 0% de margem, pelo que a tarifa que a Google publica é a tarifa que chega à sua fatura e qualquer alteração do lado deles fica ativa no nosso no mesmo dia. O Claude Sonnet 5.5 e o Claude Opus 5.5 também estão no catálogo, o que faz de um teste de encaminhamento entre dois fornecedores uma configuração e não um projeto: uma API para mais de 200 modelos, uma chave, failover automático por baixo, e a DSL de encaminhamento quando prefere manter a escalada na rota em vez de no código.

O próprio Gemini 3.7 Flash não está no nosso catálogo, e o Claude Haiku 5.5 também não. Ambos continuam acessíveis por meio das APIs de seus próprios fornecedores e, no caso do Google, de várias plataformas de terceiros. Vale a pena afirmar isso claramente, em vez de deixar que o leitor descubra por conta própria.

A capture of the OrcaRouter model page for Gemini 3.8 Flash under google/gemini-3.8-flash, showing a 65K maximum output, text, image, video, file and audio input, benchmarks published by Google on 2026-09-02, a p50 time to first token of 3.838 seconds, and the rates $0.75 input and $3.75 output per million tokens.

O número a subtrair

Não é a diferença de 4,33 pontos no índice. É que o Gemini 3.7 Flash venceu três dos quatro benchmarks compartilhados e ainda assim perdeu no composto por quatro pontos, porque o benchmark com maior peso no índice foi aquele em que ele marcou 0,1364. As pontuações em ciências de um modelo de nível flash podem parecer boas, enquanto ele falha naquilo para que modelos baratos são comprados.

O corolário é que o sucessor corrigiu precisamente aquelas linhas em três semanas, a um preço inalterado. Diante dessas evidências, a pressão competitiva nesse segmento não é o preço. É se o modelo consegue concluir uma tarefa de várias etapas, e isso agora está avançando mais rápido do que as tabelas de preços.