Um cartão de título de destaque encabeçado por «O Nível Flash Chinês, Auditado», com uma etiqueta de verificação de afirmações «Outubro de 2026», três chips de preço com os valores Claude Haiku 5.5 $0.10 entrada / $0.50 saída por 1M de tokens, GLM 5.3 Flash $0.15 / $0.50 e DeepSeek V4.1 Flash $0.30 / $1.20, uma linha com «Terminal Bench 4.0 0.32828 - empate» e uma linha Index v4.3.2 com 43.40 - 41.81 - 39.46.
Guides & Insights

O Claude Haiku 5.5 Visava o Nível Flash da China. Apenas Metade Dessa Alegação Sobrevive ao Escrutínio.

Autor

Magnus Corvin

Data de publicação

Modelos mais recentes · 20Ver todos os modelos →
Benchmarks: Artificial Analysis · atualizado diariamente
Voltar para todas as publicações

Um leitor que escreveu em chinês apresentou esta semana um argumento incisivo: Claude Haiku 5.5parece ter sido criado para conquistar o segmento intermediário do mercado chinês, porque cobra menos que DeepSeek V4.1 Flash e GLM 5.3 Flashe obtém pontuação superior ao GLM 5.3 Flash no Terminal Bench 4.0 e no Artificial Analysis Intelligence Index. É uma análise mais perspicaz do que a maioria dos comentários de lançamento. Também são duas afirmações disfarçadas de uma só, e não têm o mesmo grau de verdade.

A Anthropic lançou o Claude Haiku 5.5 em 7 de outubro de 2026 — um lançamento público completo, com um anúncio datado, uma ficha do sistema e uma tabela de preços publicada. Isso dá à afirmação algo que comentários de mercado obtidos em segunda mão raramente têm: números que você pode verificar.

A auditoria abaixo constata que uma metade é mais forte do que o leitor afirmou e que a outra metade está errada quanto ao benchmark específico que cita. Vale a pena conhecer ambas as constatações; elas apontam em direções opostas.

A afirmação, formulada com precisão

Reduzido às suas partes, o argumento tem três peças.

• Preço — Claude Haiku 5.5 é mais barato que o DeepSeek V4.1 Flash e mais barato que o GLM 5.3 Flash.

• Pontuação independente — fica cerca de um ponto acima do GLM 5.3 Flash no Artificial Analysis Intelligence Index.

• Benchmark de programação — também pontua um ponto acima do GLM 5.3 Flash no Terminal Bench 4.0.

Dois deles podem ser verificados em tabelas publicadas e se sustentam, com ajustes. O terceiro pode ser verificado na mesma tabela e resulta diferente do que foi descrito.

A three-column scoreboard titled 'The claim, audited - Claude Haiku 5.5 against the flash tier' comparing Claude Haiku 5.5, GLM 5.3 Flash and DeepSeek V4.1 Flash across six rows: input price, output price, Intelligence Index v4.3.2 (43.40, 41.81 and 39.46), Terminal Bench 4.0 (0.32828, 0.32828 and 0.2677), cost per finished task ($0.21, $0.25 and $0.27) and weights (proprietary, MIT open, MIT open), footed 'Vendor list rates; Index and benchmark figures per Artificial Analysis v4.3.2.'

A metade do preço: verdadeira, e subestimada numa direção, superestimada em outra

A taxa publicada pela Anthropic para o Claude Haiku 5.5 é de $0,10 por milhão de tokens de entrada e $0,50 por milhão de tokens de saída para um prompt de até 100.000 tokens, subindo para $0,50 e $2,50 acima desse limite. Leituras de entrada em cache custam $0,01 e gravações custam $0,125. A janela de contexto é de um milhão de tokens; a saída máxima é de 128.000.

O GLM 5.3 Flash, da Z.ai, está listado a $0.15 e $0.50, com entrada em cache a $0.026. O DeepSeek V4.1 Flash está listado a $0.30 e $1.20, com entrada em cache a $0.006.

Na tarifa principal, o leitor está certo. Uma tarifa de entrada de US$ 0,10 é um terço abaixo do GLM 5.3 Flash e dois terços abaixo do DeepSeek V4.1 Flash, e uma tarifa de saída de US$ 0,50 iguala exatamente o GLM 5.3 Flash, ficando bem abaixo da metade da do DeepSeek. Esse é um posicionamento que parece deliberado: igualar a saída do rival mais barato, superá-lo na entrada e deixar a proporção falar por si.

O ponto em que a alegação fica mais forte é o custo medido por tarefa concluída. No Intelligence Index v4.3.2 da Artificial Analysis, o custo do trabalho completo fica em US$ 0,21 para Claude Haiku 5.5, US$ 0,25 para GLM 5.3 Flash e US$ 0,27 para DeepSeek V4.1 Flash. A tabela de tarifas diz que o Claude Haiku 5.5 é 1,5 vez mais barato que o GLM 5.3 Flash na entrada; a medição diz que o trabalho concluído é cerca de um sexto mais barato. Ainda é o mais barato dos três — só não pela margem que a etiqueta sugere.

A razão é a que a maioria das comparações de preço deixa de fora. O Claude Haiku 5.5 é prolixo. A Artificial Analysis registrou 162.164 tokens de saída para ele ao executar o Index, contra 68.673 para o GLM 5.3 Flash e 88.574 para o DeepSeek V4.1 Flash. A documentação da própria Anthropic acrescenta um segundo efeito: o modelo usa o tokenizador mais recente compartilhado com o Claude 4.7 e posteriores, então o mesmo texto conta como aproximadamente 30% mais tokens do que no modelo que ele substitui. Uma tarifa mais barata aplicada a mais tokens é uma tarifa mais barata aplicada a mais tokens.

Uma peculiaridade que só aparece em uma fatura roteada: nosso próprio catálogo lista o DeepSeek V4.1 Flash a US$ 0,15 de entrada e US$ 0,60 de saída, com um multiplicador de 2× aplicado durante duas janelas diárias, 01:00–04:00 e 06:00–10:00 UTC. Dezoito horas por dia essa é a tarifa base; seis horas por dia a tarifa de saída é US$ 1,20. O tráfego em lote que pode ser agendado para fora dessas janelas obtém um preço de DeepSeek substancialmente melhor do que a tarifa de tabela de destaque do fornecedor sugere, e o tráfego interativo não. Se você está modelando essa comparação de verdade, o calendário importa tanto quanto a tabela de tarifas.

A capture of the Artificial Analysis model page for Claude Haiku 5.5 (Max), showing its standing chips of Intelligence #21/182, Speed #91/182, Cost #46/182 and Verbosity #62/182, the rates $0.10 in and $0.50 out with a 90% cache discount, a cost of $0.21 per task, 440M generated tokens, and the summary line that Claude Haiku 5.5 scores 43 on the Intelligence Index against a median of 13.

A metade da pontuação: "cerca de um ponto" é 1,6

No Artificial Analysis Intelligence Index v4.3.2, o Claude Haiku 5.5 é medido em 43,40 na sua configuração Max. O GLM 5.3 Flash é medido em 41,81. O DeepSeek V4.1 Flash fica em 39,46.

Então, a metade da afirmação relativa ao índice está direcionalmente correta e arredonda para baixo: a diferença é de 1,59 pontos, não de um. Essa é uma vantagem real num índice que chega à casa dos sessenta, e é o número que é citado em todos os resumos deste confronto.

O que não é é uma afirmação sobre os benchmarks subjacentes. Ambos os fornecedores publicam seus próprios conjuntos de avaliação, e não são os mesmos conjuntos — a Anthropic relata GDPval-AA v2.1, OSWorld 2.1, Terminal-Bench 4.0 e FrontierCode para o Claude Haiku 5.5; a Z.ai relata sua própria suíte para o GLM 5.3 Flash. O quadro independente é a única linha de comparação direta disponível, que é exatamente por isso que a diferença no índice é tão usada e por que a próxima seção importa.

A metade da programação: esta é um empate absoluto, não uma vitória.

Terminal Bench 4.0, na medição independente compartilhada, registra 0,32828 para Claude Haiku 5.5 e 0,32828 para GLM 5.3 Flash. Idênticos até cinco casas decimais.

Esse é o número mais citável deste confronto, e a afirmação está errada a respeito dele. A provável fonte da confusão é a linha vizinha: o GLM-5.3 completo, o irmão não-Flash, obtém 0,4192 no mesmo benchmark. Se você viu "GLM" e "Terminal Bench" em uma mesma frase ao lado de um número um ponto acima do Claude Haiku 5.5, esse é o irmão, não o Flash.

As outras três linhas que a Artificial Analysis publica para ambos os modelos são mais interessantes do que o empate, e não apontam numa única direção:

• SciCode — 0,5498 para Claude Haiku 5.5 contra 0,5162 para GLM 5.3 Flash. Uma vantagem de 3,4 pontos para a Anthropic.

• Humanity's Last Exam — 0,4439 contra 0,3985. Uma vantagem de 4,5 pontos para a Anthropic.

• AutomationBench, pontuação parcial — 0,3541 contra 0,6037. Uma vantagem de 25 pontos para o GLM 5.3 Flash, e de longe a maior diferença do conjunto.

Essa última linha é a que mais interessará às equipes de compras, porque é na automação agêntica que os modelos de nível intermediário estão de fato sendo implantados. Em uma métrica que avalia se o modelo consegue levar uma tarefa de várias etapas até a conclusão, o modelo de pesos abertos mais barato de executar vence por uma margem que faz parecer minúscula a diferença de 1,6 ponto no índice na direção oposta.

A velocidade divide-se da mesma forma que o preço, só que de forma ainda mais acentuada. A Artificial Analysis mediu 424,6 segundos por tarefa do Index para o Claude Haiku 5.5, contra 1035,4 segundos para o GLM 5.3 Flash. O modelo da Anthropic chega lá em menos da metade do tempo real decorrido, o que, num loop de agente, é um número operacional maior do que a taxa de tokens.

O que a afirmação deixa completamente de fora

A comparação é enquadrada como uma narrativa de preço e pontuação, que ignora discretamente a dimensão em que os dois modelos são menos parecidos. O GLM 5.3 Flash tem pesos abertos, publicados sob a licença MIT, com 320 bilhões de parâmetros totais e 18 bilhões ativos. O DeepSeek V4.1 Flash também tem pesos abertos, com 552 bilhões no total e 16 bilhões ativos. O Claude Haiku 5.5 é proprietário, somente via API, sem contagem de parâmetros publicada e sem repositório.

Isso não é uma nota de rodapé para muitos compradores; é a primeira linha do documento de requisitos. Uma equipe que precisa executar inferência em seu próprio tenancy, fazer fine-tune ou manter uma versão de modelo fixa por anos não está escolhendo entre esses três com base em pontos de índice — dois dos três já estão desqualificados antes mesmo de se ler a coluna de preço. O enquadramento do leitor é uma observação de posicionamento de mercado, e é justa; acontece apenas que a diferença estrutural joga contra o modelo que o enquadramento defende.

Executando a comparação você mesmo

GLM 5.3 Flash e DeepSeek V4.1 Flash estão ambos no catálogo da OrcaRouter pelo preço de tabela do provedor com 0% de markup, o que torna o lado chinês desta comparação algo que você pode chamar hoje em vez de modelar em uma planilha. Como a tarifa é repassada em vez de combinada, uma mudança de preço do fornecedor chega ao nosso lado no mesmo dia em que chega ao lado deles — e a janela do DeepSeek baseada em calendário descrita acima está visível no mesmo bloco de preços contra o qual você faria o roteamento. Uma chave, um SDK, failover automático por baixo, e a DSL de roteamento se você preferir expressar um teto de custo na rota em vez de no código da aplicação.

O Claude Haiku 5.5 não está no nosso catálogo. É acessível através da própria API da Anthropic, e é melhor dizê-lo claramente do que deixá-lo subentendido.

A capture of the OrcaRouter models index, headed 'Models' with the subtitle '207 models, 16 providers - one API key, one bill' and an OpenAI-compatible cURL example showing a POST to the chat completions endpoint with the model field.

O que o leitor acertou, e o que fazer com isso

O instinto está certo. Se você quisesse que a onda de modelos chineses de gama média, baratos e capazes, parecesse cara, essa é mais ou menos a carta que você jogaria: igualar a taxa de saída do rival mais barato, reduzir pela metade a taxa de entrada dele, ficar 1,6 ponto de índice à frente e deixar o número de preço por tarefa concluída sustentar o argumento. O Claude Haiku 5.5 faz isso, e faz isso sendo mais de duas vezes mais rápido por tarefa do que o modelo que tem como alvo.

O que o leitor entendeu mal é mais restrito e mais interessante. O Terminal Bench 4.0 não é uma vitória; é um empate exato. A vantagem de preço, quando se cobra pelo trabalho completo em vez do token, é de cerca de um sexto, e não os 1,5× que a tabela de preços sugere. E o único benchmark em que os dois modelos estão mais distantes é o agêntico, em que o GLM 5.3 Flash lidera por 25 pontos.

Então, a versão honesta da alegação é esta: o Claude Haiku 5.5 é voltado para o segmento flash chinês, vence essa comparação no índice composto, no custo por tarefa concluída e na latência, não vence em automação agêntica nem em abertura, e a vantagem específica em benchmark de programação que fazia o argumento parecer decisivo não existe.

Comparados neste artigo2

Detectado a partir deste artigo · Benchmarks: Artificial Analysis · atualizado diariamente