Um cartão de destaque gerado para "Mais barato por token, mais caro por resposta", com o selo "CUSTO POR RESPOSTA", o antetítulo "DUAS CAMADAS BARATAS, UM PLACAR COMPARTILHADO" e o subtítulo "Claude Haiku 5.5 com 43,40 contra Gemini 3.5 Flash-Lite com 22,2 no Intelligence Index v4.3.2." Quatro chips mostram "43,40 vs 22,2", "$0,21 vs $0,12", "$0,10 vs $0,30" e "$0,50 vs $2,50". Dois cartões abaixo estão rotulados como "A VANTAGEM DA ANTHROPIC" ("vinte e um pontos a mais no placar compartilhado, e mais barata nos dois medidores") e "A VANTAGEM DO GOOGLE" ("mais barata para uma tarefa concluída, e aceita vídeo e áudio"). Um rodapé diz "Pontuações independentes e custo por tarefa da Artificial Analysis; preços de tabela consultados em 8 de outubro de 2026." O logotipo da OrcaRouter é composto no canto inferior direito.
Guides & Insights

Claude Haiku 5.5 vs. Gemini 3.5 Flash-Lite: Mais barato por token, mais caro por resposta

Autor

Gideon Frost

Data de publicação

Modelos mais recentes · 20Ver todos os modelos →
Benchmarks: Artificial Analysis · atualizado diariamente
Voltar para todas as publicações

Claude Haiku 5.5 custa US$ 0,10 por milhão de tokens de entrada e US$ 0,50 por milhão de tokens de saída.Gemini 3.5 Flash-Lite custa US$ 0,30 e US$ 2,50 nas mesmas duas métricas. O modelo Anthropic custa um terço do preço na entrada e um quinto do preço na saída, e marca 43,40 contra 22,2 no Artificial Analysis Intelligence Index v4.3.2 — uma diferença de mais de vinte pontos em um campo onde dez é um salto geracional. Na tabela de preços, esta não é uma comparação acirrada, e em capacidade também não é.

Na fatura, é uma comparação acirrada, e o resultado é o oposto. Coloque ambos os modelos no mesmo painel independente e cobre cada um deles por uma tarefa concluída em vez de por um token, e o Gemini 3.5 Flash-Lite sai mais barato por resposta. A Artificial Analysis coloca o Claude Haiku 5.5 a $0,21 por tarefa do Intelligence Index e o Gemini 3.5 Flash-Lite a $0,1235 — uma vantagem de 1,7 para 1 para o modelo que paga cinco vezes mais por cada token que emite.

Essa inversão é o cerne desta comparação. O Claude Haiku 5.5 substitui o nível mais barato que a Anthropic já lançou e supera tudo o que está perto dele no ranking compartilhado. O Gemini 3.5 Flash-Lite foi lançado em 21 de julho de 2026 e tem sido a escolha de melhor custo-benefício nessa faixa desde o verão. A pergunta que um comprador de fato tem não é qual dos dois é melhor, porque a resposta a isso já está definida. É qual deles colocar diante de uma solicitação que precisa retornar barata.

Tudo abaixo é por milhão de tokens em dólares americanos. Os preços de tabela são as tarifas publicadas pelos próprios fornecedores. As pontuações independentes, os valores de custo por tarefa e as medições de velocidade atribuídos à Artificial Analysis são desse avaliador. Os valores de latência do Gemini 3.5 Flash-Lite vêm do nosso próprio tráfego medido. Quando um número consta do registro do modelo que mantemos, em vez de ter sido lido na página do avaliador naquele dia, temos tratado esse avaliador como a fonte, e não a nós mesmos.

A etiqueta e a fatura não coincidem.

A diferença de custo por tarefa não é explicada pela tabela de preços, e a razão pela qual ela existe vale a pena conhecer antes que qualquer um dos modelos chegue perto da produção.

O Claude Haiku 5.5 é prolixo, e o avaliador diz isso literalmente. Ao executar o Intelligence Index, a Artificial Analysis registrou 440 milhões de tokens de saída do modelo contra uma mediana de 100 milhões em geral, e classificou-o como muito prolixo. O raciocínio é cobrado como saída, vem ativado por padrão com um ajuste de esforço que começa em médio, e uma tarifa de entrada barata não ajuda uma carga de trabalho cuja conta é majoritariamente de saída.

O Gemini 3.5 Flash-Lite também não é conciso, mas é mensuravelmente menos caro por tarefa. O mesmo placar registra 17.507 tokens de saída por tarefa de indexação concluída para ele — 10.405 deles de raciocínio e 7.102 de resposta. Compare isso com o volume de tokens do modelo da Anthropic e a aritmética se resolve: uma vantagem de cinco para um na taxa de saída é parcialmente consumida por um modelo que emite a resposta maior, e o que sobrevive no nível da tarefa é uma pequena desvantagem, e não uma grande vantagem.

Há um segundo efeito, mais discreto, atuando da mesma forma. A documentação da Anthropic diz que o Claude Haiku 5.5 usa o tokenizador compartilhado com o Claude 4.7 e posteriores, então o mesmo texto conta como aproximadamente 30% mais tokens do que contava no modelo que este substitui. A taxa caiu por um fator de três em relação ao nível do Google. A contagem de tokens não caiu e, no mesmo texto, aumentou.

Ambos os modelos, nos números que importam

Taxas em cache e preços de tabela da própria documentação da Anthropic e do Google; números independentes atribuídos à Artificial Analysis; latência em tempo real da nossa própria janela de tráfego de sete dias. Em cache em 2026-10-08.

A generated scoreboard titled 'Claude Haiku 5.5 vs Gemini 3.5 Flash-Lite - on the numbers that matter'. Claude Haiku 5.5 reads input $0.10 under 100K and $0.50 above, output $0.50 and $2.50, cached input $0.01 and $0.05, maximum output 128,000 tokens, input modality text and images, Intelligence Index v4.3.2 43.40, cost per task $0.21. Gemini 3.5 Flash-Lite reads input $0.30, output $2.50, cached input $0.03, maximum output 65,536 tokens, input modality text images video audio and files, Intelligence Index v4.3.2 22.2, cost per task $0.12. A footer reads 'Vendors' published list rates; independent scores and cost per task from Artificial Analysis.'

• Entrada — Claude Haiku 5.5: US$ 0,10 até 100.000 tokens e US$ 0,50 acima; Gemini 3.5 Flash-Lite: US$ 0,30 fixo em uma janela de 1.048.576 tokens.

• Saída — Claude Haiku 5.5 US$ 0,50 até 100.000 tokens e US$ 2,50 acima; Gemini 3.5 Flash-Lite US$ 2,50 fixo.

• Entrada em cache — Claude Haiku 5.5 $0,01 até 100.000 tokens e $0,05 acima; Gemini 3.5 Flash-Lite $0,03. Gravações em cache custam $0,125 e $0,625 por milhão de tokens para Claude Haiku 5.5.

• Contexto e saída — um milhão de tokens para cada. A saída máxima é de 128.000 tokens para Claude Haiku 5.5 contra 65.536 para Gemini 3.5 Flash-Lite, então o teto da Ant​hropic é aproximadamente o dobro.

• Modalidade de entrada — texto e imagens para o Claude Haiku 5.5; texto, imagens, vídeo, áudio e arquivos para o Gemini 3.5 Flash-Lite. Ambos retornam texto.

• Pontuação independente — 43,40 para Claude Haiku 5.5 (Max), segundo de 182 modelos no Intelligence Index v4.3.2, contra 22,2 para Gemini 3.5 Flash-Lite, nonagésimo sexto de 147 e no trigésimo quarto percentil desse ranking.

• Custo independente por tarefa — $0,21 contra $0,1235 na mesma placa.

• Vazão — 241,9 tokens de saída por segundo medidos para o Claude Haiku 5.5 pela Artificial Analysis, contra 280,0 para o Gemini 3.5 Flash-Lite medidos em nosso próprio playground nos últimos sete dias. Esses são dois harnesses diferentes, não um só, então leia-os como uma ordem de magnitude e não como uma corrida.

Vinte e um pontos, e do que são feitos

Uma diferença de vinte e um pontos num índice que chega à casa dos sessenta não é uma margem. É a diferença entre um modelo capaz de sustentar um loop agêntico e um modelo que deveria receber uma única chamada bem especificada.

Os dois fornecedores não medem os harnesses um do outro, então seus próprios conjuntos de testes não podem ser comparados diretamente. A Ant​hropic publica resultados do GDPval-AA v2.1, OSWorld 2.1, Terminal-Bench 4.0 e FrontierCode para o Claude Haiku 5.5; o Goo​gle publica seu próprio conjunto para o nível Flash-Lite; nenhum dos dois executou os do outro. A única comparação realmente justa disponível é o painel independente, e nele o modelo da Ant​hropic está à frente por uma margem que não é nada pequena.

As subpontuações do avaliador para o Gemini 3.5 Flash-Lite deixam registrado o perfil desse nível. Ele atinge 83,8% no GPQA Diamond e 54,2% no SWE-Bench Pro, 54% no Terminal-bench 2.1, 41,3% no SciCode e 39,2% no MLE-Bench, com 18,8% no Humanity's Last Exam. Esses são os números de um nível competente, barato e de propósito geral — forte em perguntas de conhecimento, visivelmente atrás nas avaliações mais difíceis de raciocínio e pesquisa. O Claude Haiku 5.5, com 43,40 no composto, está em uma faixa totalmente diferente, e a leitura prática é que trabalho que exige planejamento em várias etapas ao longo de um horizonte longo não é, de modo algum, tarefa para o nível do Google.

Um milhão de tokens de janela, e 65.536 de resposta

As duas janelas de contexto têm o mesmo tamanho e não são o mesmo produto.

O contexto longo no Gemini 3.5 Flash-Lite degrada-se com a distância de uma forma que vale a pena precificar antes de se confiar nele. No GDM-MRCR v2, a avaliação de recuperação de oito agulhas, ele tem média de 72,2% quando as agulhas estão dentro de 128.000 tokens e 21,3% na variante pontual de um milhão de tokens. Sua métrica Long-Context Recall é 76%, e o CharXiv Reasoning fica em 74,5% sem ferramentas e 76,5% com elas. Uma janela de um milhão de tokens é uma capacidade real; recuperar de forma confiável a partir da extremidade distante dela é uma capacidade menor, e os dois números acima são a distância entre elas. A janela do modelo Claude não foi medida da mesma forma no mesmo quadro, então não há número equivalente disponível para ele, e este texto não vai inventar um.

Os limites de saída são a diferença mais imediatamente útil. O Claude Haiku 5.5 emitirá 128.000 tokens em uma única resposta; o Gemini 3.5 Flash-Lite para em 65.536. Se o artefato que você deseja receber de volta for um arquivo longo, uma migração completa, uma suíte de testes gerada ou uma reescrita em escala de transcrição, um desses dois modelos consegue produzi-lo em uma única chamada e o outro não — e um trabalho dividido em duas chamadas custa mais que o dobro de uma única chamada, porque o prefixo compartilhado é enviado duas vezes.

A screenshot of the Artificial Analysis model page for Gemini 3.5 Flash-Lite, showing the model name over the provider Google, the release month July 2026, a one-million-token context window, the input modality list covering text, image, video, audio and PDF, an Intelligence Index v4.3.2 score of 22, the per-million-token input and output rates with the cached-input discount, and the measured output speed, total response time and cost per task.

Áudio e vídeo não é uma questão de preço

Gemini 3.5 Flash-Lite aceita vídeo, áudio e arquivos à mesma taxa que texto. Claude Haiku 5.5 aceita texto e imagens.

Para um pipeline que ingere chamadas gravadas, captura de tela ou filmagens de vigilância, a diferença de capacidade que importa não são os vinte e um pontos do índice. É que um desses modelos recebe a entrada diretamente, e o outro precisa de uma etapa de transcrição ou extração de quadros antes dele — um segundo modelo, uma segunda conta e um novo modo de falha entre a fonte e a resposta. Equipes nessa posição não estão escolhendo entre dois níveis baratos. Estão escolhendo entre um modelo e um pipeline.

O inverso vale para imagens e documentos. Ambos os modelos leem imagens nativamente, e o Claude Haiku 5.5 o faz com 43,40 no composto, de modo que uma carga de trabalho de extração de imagens de páginas ou de compreensão de diagramas, sem áudio envolvido, pertence ao lado da Ant​hropic com base nos números, e não em um argumento de modalidade.

Executando um dos dois a partir daqui

O Gemini 3.5 Flash-Lite está no catálogo da OrcaRouter pelo preço de tabela do Google, com 0% de markup, o que significa que a tarifa do provedor é repassada em vez de combinada, e uma alteração na tabela de preços do Google chega à sua fatura no mesmo dia em que chega à deles. Isso é uma única chave e um único SDK para o nível do Google, junto com Claude Sonnet 5.5 e Claude Opus 5.5, que também estão no catálogo — então um teste A/B entre uma perna Google Flash-Lite e uma perna Anthropic já é uma configuração, e não um projeto de integração. O failover automático fica por baixo, de modo que nenhuma das pernas é um ponto único de falha, e a DSL de roteamento expressará a escalada na rota se for aí que a lógica deve ficar.

O perfil de latência desse trecho baseia-se na nossa própria medição, e não na do fornecedor. Nos últimos sete dias de tráfego ao vivo, o Gemini 3.5 Flash-Lite manteve um p50 de 2.426 milissegundos e um p95 de 8.600 milissegundos a 280 tokens de saída por segundo, com uma taxa de erro de 0,313%. Leia isso como uma janela móvel, e não como uma promessa: ela muda conforme o tráfego e as condições do provedor mudam, e o número em que se deve confiar para um determinado pipeline é aquele que você mesmo mede depois de uma semana.

A screenshot of the Artificial Analysis model page for Claude Haiku 5.5 (Max), showing the Anthropic model name and an October 2026 release, Intelligence Index v4.3.2 of 43 ranking second of 182, speed ninth of 182 at 241.9 output tokens per second, a $0.21 cost per task, input $0.10 and output $0.50 per million tokens, and a one-million-token context window.

O Claude Haiku 5.5 não está no catálogo. Foi lançado em 7 de outubro de 2026 — um dia antes de isto ser escrito — e não é roteável a partir de nós hoje, então o lado Anthropic desta comparação atualmente só é acessível na Anthropic. Dizer isso claramente é melhor do que deixar implícito. Uma lacuna entre um modelo ser lançado e um modelo poder ser chamado através de nós é normal, não é uma promessa sobre quando ela será fechada, e um leitor que planeja uma migração deve planejar com base no calendário que consegue ver, e não naquele que preferiria.

Qual deles, e para quem?

Se o trabalho for texto de entrada e texto de saída, se os prompts couberem em menos de 100.000 tokens e se a tarefa exigir planejamento em várias etapas ou agentes de horizonte longo, o Claude Haiku 5.5 é o modelo mais forte, por vinte e um pontos, e o mais barato por token, por um fator de três a cinco. Faça o orçamento com base no custo por tarefa, e não na tabela de preços; espere cerca de US$ 0,21 para o tipo de trabalho que o conselho independente mede; e reconte seus prompts antes de fazer qualquer previsão, porque a mudança do tokenizador altera a contagem em cerca de trinta por cento por si só.

Se o trabalho é curto, de alto volume e com formato de resposta — uma etiqueta, uma categoria, uma extração, uma decisão de guardrail —, então a aritmética favorece o Gemini 3.5 Flash-Lite, e por um motivo pouco glamouroso. A conta de uma chamada que emite muito pouco é dominada pela entrada, as duas tarifas de entrada são US$ 0,30 contra US$ 0,10, e a pegada de tarefa muito menor do modelo Google faz com que a tarifa mais barata vença o trabalho final, mesmo que perca no preço de tabela. Adicione entrada de vídeo, áudio ou arquivo e a escolha deixa de ser sobre preço por completo.

O que o pareamento na verdade resolve é mais restrito do que "o novo Haiku é barato". Ele resolve que a tarifa anunciada de uma camada barata é um mau guia para o que essa camada custa a você, e que o modelo que parece três vezes mais caro na página de preços pode lhe enviar a fatura menor. Seja qual for o seu caso, meça os tokens que você emite e não os que você envia, porque, nesses dois modelos, é nesse medidor que a conta realmente se baseia.