
Claude Haiku 5.5 vs Gemini 3.6 Flash: 7,5x o Custo por Resposta, Modelo com Nove Pontos a Menos
- openaiNOVOOpenAI: GPT-6.1 Sol2026-09-2952Inteligência
- anthropicNOVOAnthropic: Claude Sonnet 5.52026-09-2856Inteligência
- typesafeNOVOTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 por 1M de tokens · 127 tok/s
- OpenAIOpenAI: GPT-6 Luna2026-09-2238Inteligência
- OpenAIOpenAI: GPT-6 Sol2026-09-2248Inteligência
- AnthropicAnthropic: Claude Opus 5.52026-09-2258Inteligência
- xAIGrok 4.72026-09-2146Inteligência
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 por 1M de tokens · 58 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 por 1M de tokens · 320 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Inteligência
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Inteligência77Código
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Inteligência76Código
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Inteligência76Código
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Inteligência82Código
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 por 1M de tokens · 54 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 por 1M de tokens · 350 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Inteligência72Código
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 por 1M de tokens · 232 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Inteligência75Código
- obsidianQwen3.8 27B2026-08-1534Inteligência68Código
Claude Haiku 5.5 e Gemini 3.6 Flash ocupam o mesmo nível em suas respectivas linhas — o pequeno, rápido e barato — e é aí que a semelhança termina. No Artificial Analysis Intelligence Index v4.3.2, o Claude Haiku 5.5 pontua 43,40 na configuração Max, contra 33,98 do Gemini 3.6 Flash na configuração High. Na mesma execução, uma tarefa do Index concluída custa $0,21 no Claude Haiku 5.5 e $1,60 no Gemini 3.6 Flash.
Leia esse par em conjunto, porque cada um isoladamente engana. O modelo mais barato não é marginalmente mais barato; ele é 7,5 vezes mais barato por tarefa concluída. E o modelo que ele está superando não é marginalmente mais fraco; ele é 9,42 pontos de índice mais fraco, o que, em um ranking de 182 modelos, é a distância entre o quartil superior e o meio.
Ambos os fatos vêm da mesma execução independente, o que importa porque os cartões dos fornecedores aqui não informam nenhum dos dois. A Anthropic lançou o Claude Haiku 5.5 em 7 de outubro de 2026; o Google lançou o Gemini 3.6 Flash em 21 de julho de 2026. Os três meses entre eles são a parte interessante.
Os dois cartões, lado a lado
Por milhão de tokens em dólares americanos. As tarifas da Anthropic e do Google vêm da documentação de preços das próprias empresas; as linhas compartilhadas são do Artificial Analysis Intelligence Index v4.3.2. Armazenado em cache em 2026-10-08.

• Entrada — Claude Haiku 5.5: US$ 0,10 até 100.000 tokens e US$ 0,50 acima; Gemini 3.6 Flash: US$ 0,75 fixo hoje, subindo para US$ 1,50 em 1º de janeiro de 2027.
• Saída — Claude Haiku 5.5 US$ 0,50 até 100.000 tokens e US$ 2,50 acima; Gemini 3.6 Flash US$ 3,75 fixo hoje, subindo para US$ 7,50 na mesma data.
• Entrada em cache — Claude Haiku 5.5 $0.01 e $0.05; Gemini 3.6 Flash $0.075, além de uma cobrança de armazenamento de $0.50 por milhão de tokens por hora.
• Contexto e limite de saída — 1M de tokens para ambos. Claude Haiku 5.5 limita uma resposta a 128.000 tokens; Gemini 3.6 Flash a 65.536.
• Modalidade — Claude Haiku 5.5 aceita texto e imagens. Gemini 3.6 Flash aceita texto, imagens, vídeo, áudio e arquivos. Esta é a única linha em que o lado do Google está inequivocamente à frente e, para um pipeline de compreensão de mídia, pode decidir a questão inteira.
• Pontuação independente — 43,40 para o Claude Haiku 5.5 (Max) contra 33,98 para o Gemini 3.6 Flash (High).
• Custo por tarefa — $0,21 contra $1,60, na mesma execução de avaliação.

Por que por tarefa, e não por token, é o número a usar
O múltiplo da tabela de preços já parece 7,5 na entrada e 7,5 na saída, portanto o valor por tarefa não é surpresa aqui — mas vale a pena mostrar por que os dois modelos ficam no mesmo ponto em uma métrica e tão distantes na outra, porque a mesma aritmética corta no sentido oposto nas outras comparações deste lote.
O Gemini 3.6 Flash é o menos verboso dos dois. Ele emite 41.606 tokens de saída por tarefa do Intelligence Index — 20.061 de raciocínio e 21.545 de resposta — contra os 162.164 do Claude Haiku 5.5, divididos em 129.047 de raciocínio e 33.118 de resposta. O modelo da Anthropic gasta quase quatro vezes mais tokens para realizar o mesmo trabalho, e é aquele cuja taxa de saída é um sétimo da do Google, de modo que a diferença de tokens e a diferença de taxa se multiplicam em vez de se anularem.
Essa combinação — tarifa baixa multiplicada por uso intenso — é a descrição honesta da economia do Claude Haiku 5.5, e o próprio post de lançamento da Anthropic reconhece o outro lado disso: o modelo tem "especialmente boa relação custo-benefício quando usado para tarefas com prompts de até 100.000 tokens, que representam cerca de 90% das solicitações ao nosso modelo Haiku anterior". Acima de 100.000 tokens, o medidor de entrada passa para US$ 0,50 e o de saída para US$ 2,50, momento em que o múltiplo em relação ao Gemini 3.6 Flash se estreita para aproximadamente 1,5x.
O que o próprio nível do Google fez enquanto esta comparação ficou parada
É aqui que o artigo deixa de ser uma comparação entre dois modelos e se torna um alerta sobre com qual Gemini você está realmente comparando.
O Google manteve o preço do Flash fixo ao longo de três gerações. O Gemini 3.6 Flash, o Gemini 3.7 Flash e o Gemini 3.8 Flash aparecem todos com US$ 0,75 de entrada e US$ 3,75 de saída na própria documentação de preços do Google, com a mesma taxa de cache de US$ 0,075 e o mesmo aumento em 1º de janeiro de 2027 para US$ 1,50 e US$ 7,50. O cartão do Google referente à linha 3.6 descreve-o como "nosso modelo Flash da geração anterior", que são as próprias palavras do fornecedor para ele.
O que mudou foi a pontuação, não o preço. No painel independente, o Gemini 3.6 Flash pontua 33,98, o Gemini 3.7 Flash 39,06 e o Gemini 3.8 Flash 40,93 — todos em sua configuração publicada de maior intensidade. Nove pontos no índice surgiram dentro do tier flash do Google em seis semanas, sem qualquer alteração na tarifa.
A consequência para quem está no meio de uma avaliação é concreta: se você fez o benchmark desta comparação há três semanas contra o Gemini 3.7 Flash, seu resultado está desatualizado; e se você fizer o benchmark contra o Gemini 3.8 Flash, a diferença para o Claude Haiku 5.5 diminui para 2,47 pontos. O Gemini 3.6 Flash é a versão desta comparação que mais favorece a Anthropic, e também é a versão que o Google está mais longe de vender.
A Artificial Analysis sinaliza a entrada 3.6 como obsoleta. A documentação de preços do Google ainda publica a tarifa, e sua lista de modelos ainda direciona para uma seção 3.6, então a leitura honesta não é "sumiu", mas "superada duas vezes dentro da própria família em dez semanas" — e isso é um fato sobre a velocidade com que este nível se move, não um motivo para pular a comparação.
Para quem isso realmente decide
Há um argumento a favor do Gemini 3.6 Flash, e não é a pontuação.
Se você precisar de áudio ou vídeo no prompt, o Claude Haiku 5.5 não consegue fazer isso de jeito nenhum — ele lê texto e imagens e nada mais. O Gemini 3.6 Flash lê texto, imagens, vídeo, áudio e arquivos, e nosso próprio catálogo o registra em 582 tokens de saída por segundo medidos, com um tempo mediano de 4,1 segundos até o primeiro token na última semana, o que é um modelo rápido mesmo para os padrões do Flash. Para um pipeline de compreensão de mídia, a lista de modalidades é a decisão inteira, e a diferença de índice é uma nota de rodapé.
Se o seu trabalho é texto e imagens, a aritmética não é próxima o suficiente para dar margem a discussão. Numa mistura 7:2:1 com peso na entrada — o formato que a maior parte do tráfego de produção tem — o Claude Haiku 5.5 chega a US$ 0,077 por milhão de tokens, contra US$ 0,63 do Gemini 3.6 Flash. Ao longo de um milhão de tokens combinados por dia, isso é 77 centavos contra US$ 6,30, e o segundo número piora em 1º de janeiro de 2027, enquanto o primeiro não se move.
O penhasco de 100.000 tokens é a condição que inverte o resultado. Um pipeline de recuperação ou de documentos longos que monta rotineiramente prompts de 150.000 tokens paga a faixa de $0.50/$2.50 da Anthropic pela requisição inteira, e nesse ponto os dois modelos ficam dentro de 1,5x um do outro em preço, enquanto o Gemini 3.6 Flash ainda vence em modalidade e na cifra de 91,8% que o Google publica para recuperação de múltiplas agulhas com média de 128k. Isso é reportado pelo fornecedor e não reproduzido, e pertence exatamente a esse enquadramento.

Chamando ambos, ou chamando um
O Gemini 3.6 Flash está hoje no catálogo da OrcaRouter em google/gemini-3.6-flash, pelo preço de tabela do Google com 0% de markup — US$ 0,75 e US$ 3,75, com leitura de cache de US$ 0,075, repassados exatamente como o provedor cobra. Isso importa para este modelo em particular porque o aumento de 1º de janeiro do Google é uma mudança de tarifa, e um catálogo de repasse a aplica no dia em que acontece, em vez de na próxima renovação de contrato. Uma única chave de API e uma única chamada de SDK acessam tanto este modelo quanto qualquer um dos mais de 200 outros do catálogo, então um A/B entre uma perna Google e uma perna Anthropic é uma mudança na string do modelo, com failover automático subjacente, em vez de uma segunda integração.
O Claude Haiku 5.5 não está no catálogo. O modelo da Anthropic é acessível através da própria API da Anthropic e através da AWS, Google Cloud e Microsoft Azure, e essa é toda a resposta honesta. O que nós temos dessa linha é Claude Sonnet 5.5 e Claude Opus 5.5 — o que faz com que o caminho de escalonamento de uma chamada de classificação barata até uma chamada agêntica de nível médio seja uma decisão de roteamento e não um projeto.
O que torna o veredito simples o bastante para declarar sem rodeios. Para trabalho com texto e imagem em prompts curtos, o Claude Haiku 5.5 vence em todos os eixos, exceto no teto de resposta. Para qualquer coisa com áudio ou vídeo, o Gemini 3.6 Flash é o único dos dois que consegue responder, de modo geral — e, se você vai pagar a tarifa do Google por essa capacidade, pergunte por qual Gemini está pagando por isso, porque, nesse nível, você pode obter nove pontos de índice a mais pelo mesmo dinheiro com um irmão mais novo.
Uma API para mais de 200 modelos, uma chave, failover automáticonos bastidores, de modo que um teste A/B entre um braço do Google e um braço da Anthropic seja uma alteração na string do modelo, e não uma segunda integração.
Comparados neste artigo2
Detectado a partir deste artigo · Benchmarks: Artificial Analysis · atualizado diariamente
