Um cartão de destaque gerado com o título 'Claude Haiku 5.5 vs Gemini 3.6 Flash' e a chamada '7.5x O CUSTO POR RESPOSTA', mostrando Claude Haiku 5.5 com Entrada $0.10, Saída $0.50 e Índice 43.40 contra Gemini 3.6 Flash com Entrada $0.75, Saída $3.75 e Índice 33.98, sobre uma barra que exibe 'Custo por tarefa concluída $0.21 vs $1.60'.
Engineering & Research

Claude Haiku 5.5 vs Gemini 3.6 Flash: 7,5x o Custo por Resposta, Modelo com Nove Pontos a Menos

Autor

Rowan Sterling

Data de publicação

Modelos mais recentes · 20Ver todos os modelos →
Benchmarks: Artificial Analysis · atualizado diariamente
Voltar para todas as publicações

Claude Haiku 5.5 e Gemini 3.6 Flash ocupam o mesmo nível em suas respectivas linhas — o pequeno, rápido e barato — e é aí que a semelhança termina. No Artificial Analysis Intelligence Index v4.3.2, o Claude Haiku 5.5 pontua 43,40 na configuração Max, contra 33,98 do Gemini 3.6 Flash na configuração High. Na mesma execução, uma tarefa do Index concluída custa $0,21 no Claude Haiku 5.5 e $1,60 no Gemini 3.6 Flash.

Leia esse par em conjunto, porque cada um isoladamente engana. O modelo mais barato não é marginalmente mais barato; ele é 7,5 vezes mais barato por tarefa concluída. E o modelo que ele está superando não é marginalmente mais fraco; ele é 9,42 pontos de índice mais fraco, o que, em um ranking de 182 modelos, é a distância entre o quartil superior e o meio.

Ambos os fatos vêm da mesma execução independente, o que importa porque os cartões dos fornecedores aqui não informam nenhum dos dois. A Anthropic lançou o Claude Haiku 5.5 em 7 de outubro de 2026; o Google lançou o Gemini 3.6 Flash em 21 de julho de 2026. Os três meses entre eles são a parte interessante.

Os dois cartões, lado a lado

Por milhão de tokens em dólares americanos. As tarifas da Anthropic e do Google vêm da documentação de preços das próprias empresas; as linhas compartilhadas são do Artificial Analysis Intelligence Index v4.3.2. Armazenado em cache em 2026-10-08.

A generated two-column scoreboard titled 'Claude Haiku 5.5 vs Gemini 3.6 Flash — the scoreboard' with rows Index v4.3.2 43.40 against 33.98, cost per task $0.21 against $1.60, input price $0.10 against $0.75, output tokens per task 162,164 against 41,606, Terminal Bench 4.0 0.3283 against 0.0707 and input modality 'text, image' against 'text, image, video, audio', footed 'All figures per Artificial Analysis Intelligence Index v4.3.2; Gemini 3.6 Flash is flagged deprecated on the board.'

• Entrada — Claude Haiku 5.5: US$ 0,10 até 100.000 tokens e US$ 0,50 acima; Gemini 3.6 Flash: US$ 0,75 fixo hoje, subindo para US$ 1,50 em 1º de janeiro de 2027.

• Saída — Claude Haiku 5.5 US$ 0,50 até 100.000 tokens e US$ 2,50 acima; Gemini 3.6 Flash US$ 3,75 fixo hoje, subindo para US$ 7,50 na mesma data.

• Entrada em cache — Claude Haiku 5.5 $0.01 e $0.05; Gemini 3.6 Flash $0.075, além de uma cobrança de armazenamento de $0.50 por milhão de tokens por hora.

• Contexto e limite de saída — 1M de tokens para ambos. Claude Haiku 5.5 limita uma resposta a 128.000 tokens; Gemini 3.6 Flash a 65.536.

• Modalidade — Claude Haiku 5.5 aceita texto e imagens. Gemini 3.6 Flash aceita texto, imagens, vídeo, áudio e arquivos. Esta é a única linha em que o lado do Google está inequivocamente à frente e, para um pipeline de compreensão de mídia, pode decidir a questão inteira.

• Pontuação independente — 43,40 para o Claude Haiku 5.5 (Max) contra 33,98 para o Gemini 3.6 Flash (High).

• Custo por tarefa — $0,21 contra $1,60, na mesma execução de avaliação.

A capture of Anthropic's Claude Platform models documentation showing the Claude model comparison table — Claude Fable 5.1, Claude Opus 5.5, Claude Sonnet 5.5 and Claude Haiku 5.5 'This model', the latter reading 1M context, 128K max output, 'From $0.10/$0.50', latency 'Fastest', default effort medium — above the Claude Haiku 5.5 specifications block with model ids claude-haiku-5-5, the pricing lines $0.10/$0.50 up to 100,000 tokens and $0.50/$2.50 over it, and the release line 'Released October 7, 2026'.

Por que por tarefa, e não por token, é o número a usar

O múltiplo da tabela de preços já parece 7,5 na entrada e 7,5 na saída, portanto o valor por tarefa não é surpresa aqui — mas vale a pena mostrar por que os dois modelos ficam no mesmo ponto em uma métrica e tão distantes na outra, porque a mesma aritmética corta no sentido oposto nas outras comparações deste lote.

O Gemini 3.6 Flash é o menos verboso dos dois. Ele emite 41.606 tokens de saída por tarefa do Intelligence Index — 20.061 de raciocínio e 21.545 de resposta — contra os 162.164 do Claude Haiku 5.5, divididos em 129.047 de raciocínio e 33.118 de resposta. O modelo da Anthropic gasta quase quatro vezes mais tokens para realizar o mesmo trabalho, e é aquele cuja taxa de saída é um sétimo da do Google, de modo que a diferença de tokens e a diferença de taxa se multiplicam em vez de se anularem.

Essa combinação — tarifa baixa multiplicada por uso intenso — é a descrição honesta da economia do Claude Haiku 5.5, e o próprio post de lançamento da Anthropic reconhece o outro lado disso: o modelo tem "especialmente boa relação custo-benefício quando usado para tarefas com prompts de até 100.000 tokens, que representam cerca de 90% das solicitações ao nosso modelo Haiku anterior". Acima de 100.000 tokens, o medidor de entrada passa para US$ 0,50 e o de saída para US$ 2,50, momento em que o múltiplo em relação ao Gemini 3.6 Flash se estreita para aproximadamente 1,5x.

O que o próprio nível do Google fez enquanto esta comparação ficou parada

É aqui que o artigo deixa de ser uma comparação entre dois modelos e se torna um alerta sobre com qual Gemini você está realmente comparando.

O Google manteve o preço do Flash fixo ao longo de três gerações. O Gemini 3.6 Flash, o Gemini 3.7 Flash e o Gemini 3.8 Flash aparecem todos com US$ 0,75 de entrada e US$ 3,75 de saída na própria documentação de preços do Google, com a mesma taxa de cache de US$ 0,075 e o mesmo aumento em 1º de janeiro de 2027 para US$ 1,50 e US$ 7,50. O cartão do Google referente à linha 3.6 descreve-o como "nosso modelo Flash da geração anterior", que são as próprias palavras do fornecedor para ele.

O que mudou foi a pontuação, não o preço. No painel independente, o Gemini 3.6 Flash pontua 33,98, o Gemini 3.7 Flash 39,06 e o Gemini 3.8 Flash 40,93 — todos em sua configuração publicada de maior intensidade. Nove pontos no índice surgiram dentro do tier flash do Google em seis semanas, sem qualquer alteração na tarifa.

A consequência para quem está no meio de uma avaliação é concreta: se você fez o benchmark desta comparação há três semanas contra o Gemini 3.7 Flash, seu resultado está desatualizado; e se você fizer o benchmark contra o Gemini 3.8 Flash, a diferença para o Claude Haiku 5.5 diminui para 2,47 pontos. O Gemini 3.6 Flash é a versão desta comparação que mais favorece a Anthropic, e também é a versão que o Google está mais longe de vender.

A Artificial Analysis sinaliza a entrada 3.6 como obsoleta. A documentação de preços do Google ainda publica a tarifa, e sua lista de modelos ainda direciona para uma seção 3.6, então a leitura honesta não é "sumiu", mas "superada duas vezes dentro da própria família em dez semanas" — e isso é um fato sobre a velocidade com que este nível se move, não um motivo para pular a comparação.

Para quem isso realmente decide

Há um argumento a favor do Gemini 3.6 Flash, e não é a pontuação.

Se você precisar de áudio ou vídeo no prompt, o Claude Haiku 5.5 não consegue fazer isso de jeito nenhum — ele lê texto e imagens e nada mais. O Gemini 3.6 Flash lê texto, imagens, vídeo, áudio e arquivos, e nosso próprio catálogo o registra em 582 tokens de saída por segundo medidos, com um tempo mediano de 4,1 segundos até o primeiro token na última semana, o que é um modelo rápido mesmo para os padrões do Flash. Para um pipeline de compreensão de mídia, a lista de modalidades é a decisão inteira, e a diferença de índice é uma nota de rodapé.

Se o seu trabalho é texto e imagens, a aritmética não é próxima o suficiente para dar margem a discussão. Numa mistura 7:2:1 com peso na entrada — o formato que a maior parte do tráfego de produção tem — o Claude Haiku 5.5 chega a US$ 0,077 por milhão de tokens, contra US$ 0,63 do Gemini 3.6 Flash. Ao longo de um milhão de tokens combinados por dia, isso é 77 centavos contra US$ 6,30, e o segundo número piora em 1º de janeiro de 2027, enquanto o primeiro não se move.

O penhasco de 100.000 tokens é a condição que inverte o resultado. Um pipeline de recuperação ou de documentos longos que monta rotineiramente prompts de 150.000 tokens paga a faixa de $0.50/$2.50 da Anthropic pela requisição inteira, e nesse ponto os dois modelos ficam dentro de 1,5x um do outro em preço, enquanto o Gemini 3.6 Flash ainda vence em modalidade e na cifra de 91,8% que o Google publica para recuperação de múltiplas agulhas com média de 128k. Isso é reportado pelo fornecedor e não reproduzido, e pertence exatamente a esse enquadramento.

A capture of the OrcaRouter model page for Gemini 3.6 Flash under google/gemini-3.6-flash, showing a 65K maximum output, text, image, video, file and audio input, public benchmarks published by Google dated 2026-07-21, a p50 time to first token of 4.1 seconds, and the page's own description of the model as Google's fast, cost-efficient multimodal model in the Gemini 3 family with a 1M-token context window.

Chamando ambos, ou chamando um

O Gemini 3.6 Flash está hoje no catálogo da OrcaRouter em google/gemini-3.6-flash, pelo preço de tabela do Google com 0% de markup — US$ 0,75 e US$ 3,75, com leitura de cache de US$ 0,075, repassados exatamente como o provedor cobra. Isso importa para este modelo em particular porque o aumento de 1º de janeiro do Google é uma mudança de tarifa, e um catálogo de repasse a aplica no dia em que acontece, em vez de na próxima renovação de contrato. Uma única chave de API e uma única chamada de SDK acessam tanto este modelo quanto qualquer um dos mais de 200 outros do catálogo, então um A/B entre uma perna Google e uma perna Anthropic é uma mudança na string do modelo, com failover automático subjacente, em vez de uma segunda integração.

O Claude Haiku 5.5 não está no catálogo. O modelo da Anthropic é acessível através da própria API da Anthropic e através da AWS, Google Cloud e Microsoft Azure, e essa é toda a resposta honesta. O que nós temos dessa linha é Claude Sonnet 5.5 e Claude Opus 5.5 — o que faz com que o caminho de escalonamento de uma chamada de classificação barata até uma chamada agêntica de nível médio seja uma decisão de roteamento e não um projeto.

O que torna o veredito simples o bastante para declarar sem rodeios. Para trabalho com texto e imagem em prompts curtos, o Claude Haiku 5.5 vence em todos os eixos, exceto no teto de resposta. Para qualquer coisa com áudio ou vídeo, o Gemini 3.6 Flash é o único dos dois que consegue responder, de modo geral — e, se você vai pagar a tarifa do Google por essa capacidade, pergunte por qual Gemini está pagando por isso, porque, nesse nível, você pode obter nove pontos de índice a mais pelo mesmo dinheiro com um irmão mais novo.

Uma API para mais de 200 modelos, uma chave, failover automáticonos bastidores, de modo que um teste A/B entre um braço do Google e um braço da Anthropic seja uma alteração na string do modelo, e não uma segunda integração.

Comparados neste artigo2

Detectado a partir deste artigo · Benchmarks: Artificial Analysis · atualizado diariamente