
O Claude Haiku 5.5 Visava o Nível Flash da China. Apenas Metade Dessa Alegação Sobrevive ao Escrutínio.
- openaiNOVOOpenAI: GPT-6.1 Sol2026-09-2952Inteligência
- anthropicNOVOAnthropic: Claude Sonnet 5.52026-09-2856Inteligência
- typesafeNOVOTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 por 1M de tokens · 128 tok/s
- OpenAIOpenAI: GPT-6 Luna2026-09-2238Inteligência
- OpenAIOpenAI: GPT-6 Sol2026-09-2248Inteligência
- AnthropicAnthropic: Claude Opus 5.52026-09-2258Inteligência
- xAIGrok 4.72026-09-2146Inteligência
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 por 1M de tokens · 60 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 por 1M de tokens · 320 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Inteligência
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Inteligência77Código
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Inteligência76Código
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Inteligência76Código
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Inteligência82Código
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 por 1M de tokens · 54 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 por 1M de tokens · 356 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Inteligência72Código
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 por 1M de tokens · 232 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Inteligência75Código
- obsidianQwen3.8 27B2026-08-1534Inteligência68Código
Um leitor que escreveu em chinês apresentou esta semana um argumento incisivo: Claude Haiku 5.5parece ter sido criado para conquistar o segmento intermediário do mercado chinês, porque cobra menos que DeepSeek V4.1 Flash e GLM 5.3 Flashe obtém pontuação superior ao GLM 5.3 Flash no Terminal Bench 4.0 e no Artificial Analysis Intelligence Index. É uma análise mais perspicaz do que a maioria dos comentários de lançamento. Também são duas afirmações disfarçadas de uma só, e não têm o mesmo grau de verdade.
A Anthropic lançou o Claude Haiku 5.5 em 7 de outubro de 2026 — um lançamento público completo, com um anúncio datado, uma ficha do sistema e uma tabela de preços publicada. Isso dá à afirmação algo que comentários de mercado obtidos em segunda mão raramente têm: números que você pode verificar.
A auditoria abaixo constata que uma metade é mais forte do que o leitor afirmou e que a outra metade está errada quanto ao benchmark específico que cita. Vale a pena conhecer ambas as constatações; elas apontam em direções opostas.
A afirmação, formulada com precisão
Reduzido às suas partes, o argumento tem três peças.
• Preço — Claude Haiku 5.5 é mais barato que o DeepSeek V4.1 Flash e mais barato que o GLM 5.3 Flash.
• Pontuação independente — fica cerca de um ponto acima do GLM 5.3 Flash no Artificial Analysis Intelligence Index.
• Benchmark de programação — também pontua um ponto acima do GLM 5.3 Flash no Terminal Bench 4.0.
Dois deles podem ser verificados em tabelas publicadas e se sustentam, com ajustes. O terceiro pode ser verificado na mesma tabela e resulta diferente do que foi descrito.

A metade do preço: verdadeira, e subestimada numa direção, superestimada em outra
A taxa publicada pela Anthropic para o Claude Haiku 5.5 é de $0,10 por milhão de tokens de entrada e $0,50 por milhão de tokens de saída para um prompt de até 100.000 tokens, subindo para $0,50 e $2,50 acima desse limite. Leituras de entrada em cache custam $0,01 e gravações custam $0,125. A janela de contexto é de um milhão de tokens; a saída máxima é de 128.000.
O GLM 5.3 Flash, da Z.ai, está listado a $0.15 e $0.50, com entrada em cache a $0.026. O DeepSeek V4.1 Flash está listado a $0.30 e $1.20, com entrada em cache a $0.006.
Na tarifa principal, o leitor está certo. Uma tarifa de entrada de US$ 0,10 é um terço abaixo do GLM 5.3 Flash e dois terços abaixo do DeepSeek V4.1 Flash, e uma tarifa de saída de US$ 0,50 iguala exatamente o GLM 5.3 Flash, ficando bem abaixo da metade da do DeepSeek. Esse é um posicionamento que parece deliberado: igualar a saída do rival mais barato, superá-lo na entrada e deixar a proporção falar por si.
O ponto em que a alegação fica mais forte é o custo medido por tarefa concluída. No Intelligence Index v4.3.2 da Artificial Analysis, o custo do trabalho completo fica em US$ 0,21 para Claude Haiku 5.5, US$ 0,25 para GLM 5.3 Flash e US$ 0,27 para DeepSeek V4.1 Flash. A tabela de tarifas diz que o Claude Haiku 5.5 é 1,5 vez mais barato que o GLM 5.3 Flash na entrada; a medição diz que o trabalho concluído é cerca de um sexto mais barato. Ainda é o mais barato dos três — só não pela margem que a etiqueta sugere.
A razão é a que a maioria das comparações de preço deixa de fora. O Claude Haiku 5.5 é prolixo. A Artificial Analysis registrou 162.164 tokens de saída para ele ao executar o Index, contra 68.673 para o GLM 5.3 Flash e 88.574 para o DeepSeek V4.1 Flash. A documentação da própria Anthropic acrescenta um segundo efeito: o modelo usa o tokenizador mais recente compartilhado com o Claude 4.7 e posteriores, então o mesmo texto conta como aproximadamente 30% mais tokens do que no modelo que ele substitui. Uma tarifa mais barata aplicada a mais tokens é uma tarifa mais barata aplicada a mais tokens.
Uma peculiaridade que só aparece em uma fatura roteada: nosso próprio catálogo lista o DeepSeek V4.1 Flash a US$ 0,15 de entrada e US$ 0,60 de saída, com um multiplicador de 2× aplicado durante duas janelas diárias, 01:00–04:00 e 06:00–10:00 UTC. Dezoito horas por dia essa é a tarifa base; seis horas por dia a tarifa de saída é US$ 1,20. O tráfego em lote que pode ser agendado para fora dessas janelas obtém um preço de DeepSeek substancialmente melhor do que a tarifa de tabela de destaque do fornecedor sugere, e o tráfego interativo não. Se você está modelando essa comparação de verdade, o calendário importa tanto quanto a tabela de tarifas.

A metade da pontuação: "cerca de um ponto" é 1,6
No Artificial Analysis Intelligence Index v4.3.2, o Claude Haiku 5.5 é medido em 43,40 na sua configuração Max. O GLM 5.3 Flash é medido em 41,81. O DeepSeek V4.1 Flash fica em 39,46.
Então, a metade da afirmação relativa ao índice está direcionalmente correta e arredonda para baixo: a diferença é de 1,59 pontos, não de um. Essa é uma vantagem real num índice que chega à casa dos sessenta, e é o número que é citado em todos os resumos deste confronto.
O que não é é uma afirmação sobre os benchmarks subjacentes. Ambos os fornecedores publicam seus próprios conjuntos de avaliação, e não são os mesmos conjuntos — a Anthropic relata GDPval-AA v2.1, OSWorld 2.1, Terminal-Bench 4.0 e FrontierCode para o Claude Haiku 5.5; a Z.ai relata sua própria suíte para o GLM 5.3 Flash. O quadro independente é a única linha de comparação direta disponível, que é exatamente por isso que a diferença no índice é tão usada e por que a próxima seção importa.
A metade da programação: esta é um empate absoluto, não uma vitória.
Terminal Bench 4.0, na medição independente compartilhada, registra 0,32828 para Claude Haiku 5.5 e 0,32828 para GLM 5.3 Flash. Idênticos até cinco casas decimais.
Esse é o número mais citável deste confronto, e a afirmação está errada a respeito dele. A provável fonte da confusão é a linha vizinha: o GLM-5.3 completo, o irmão não-Flash, obtém 0,4192 no mesmo benchmark. Se você viu "GLM" e "Terminal Bench" em uma mesma frase ao lado de um número um ponto acima do Claude Haiku 5.5, esse é o irmão, não o Flash.
As outras três linhas que a Artificial Analysis publica para ambos os modelos são mais interessantes do que o empate, e não apontam numa única direção:
• SciCode — 0,5498 para Claude Haiku 5.5 contra 0,5162 para GLM 5.3 Flash. Uma vantagem de 3,4 pontos para a Anthropic.
• Humanity's Last Exam — 0,4439 contra 0,3985. Uma vantagem de 4,5 pontos para a Anthropic.
• AutomationBench, pontuação parcial — 0,3541 contra 0,6037. Uma vantagem de 25 pontos para o GLM 5.3 Flash, e de longe a maior diferença do conjunto.
Essa última linha é a que mais interessará às equipes de compras, porque é na automação agêntica que os modelos de nível intermediário estão de fato sendo implantados. Em uma métrica que avalia se o modelo consegue levar uma tarefa de várias etapas até a conclusão, o modelo de pesos abertos mais barato de executar vence por uma margem que faz parecer minúscula a diferença de 1,6 ponto no índice na direção oposta.
A velocidade divide-se da mesma forma que o preço, só que de forma ainda mais acentuada. A Artificial Analysis mediu 424,6 segundos por tarefa do Index para o Claude Haiku 5.5, contra 1035,4 segundos para o GLM 5.3 Flash. O modelo da Anthropic chega lá em menos da metade do tempo real decorrido, o que, num loop de agente, é um número operacional maior do que a taxa de tokens.
O que a afirmação deixa completamente de fora
A comparação é enquadrada como uma narrativa de preço e pontuação, que ignora discretamente a dimensão em que os dois modelos são menos parecidos. O GLM 5.3 Flash tem pesos abertos, publicados sob a licença MIT, com 320 bilhões de parâmetros totais e 18 bilhões ativos. O DeepSeek V4.1 Flash também tem pesos abertos, com 552 bilhões no total e 16 bilhões ativos. O Claude Haiku 5.5 é proprietário, somente via API, sem contagem de parâmetros publicada e sem repositório.
Isso não é uma nota de rodapé para muitos compradores; é a primeira linha do documento de requisitos. Uma equipe que precisa executar inferência em seu próprio tenancy, fazer fine-tune ou manter uma versão de modelo fixa por anos não está escolhendo entre esses três com base em pontos de índice — dois dos três já estão desqualificados antes mesmo de se ler a coluna de preço. O enquadramento do leitor é uma observação de posicionamento de mercado, e é justa; acontece apenas que a diferença estrutural joga contra o modelo que o enquadramento defende.
Executando a comparação você mesmo
GLM 5.3 Flash e DeepSeek V4.1 Flash estão ambos no catálogo da OrcaRouter pelo preço de tabela do provedor com 0% de markup, o que torna o lado chinês desta comparação algo que você pode chamar hoje em vez de modelar em uma planilha. Como a tarifa é repassada em vez de combinada, uma mudança de preço do fornecedor chega ao nosso lado no mesmo dia em que chega ao lado deles — e a janela do DeepSeek baseada em calendário descrita acima está visível no mesmo bloco de preços contra o qual você faria o roteamento. Uma chave, um SDK, failover automático por baixo, e a DSL de roteamento se você preferir expressar um teto de custo na rota em vez de no código da aplicação.
O Claude Haiku 5.5 não está no nosso catálogo. É acessível através da própria API da Anthropic, e é melhor dizê-lo claramente do que deixá-lo subentendido.

O que o leitor acertou, e o que fazer com isso
O instinto está certo. Se você quisesse que a onda de modelos chineses de gama média, baratos e capazes, parecesse cara, essa é mais ou menos a carta que você jogaria: igualar a taxa de saída do rival mais barato, reduzir pela metade a taxa de entrada dele, ficar 1,6 ponto de índice à frente e deixar o número de preço por tarefa concluída sustentar o argumento. O Claude Haiku 5.5 faz isso, e faz isso sendo mais de duas vezes mais rápido por tarefa do que o modelo que tem como alvo.
O que o leitor entendeu mal é mais restrito e mais interessante. O Terminal Bench 4.0 não é uma vitória; é um empate exato. A vantagem de preço, quando se cobra pelo trabalho completo em vez do token, é de cerca de um sexto, e não os 1,5× que a tabela de preços sugere. E o único benchmark em que os dois modelos estão mais distantes é o agêntico, em que o GLM 5.3 Flash lidera por 25 pontos.
Então, a versão honesta da alegação é esta: o Claude Haiku 5.5 é voltado para o segmento flash chinês, vence essa comparação no índice composto, no custo por tarefa concluída e na latência, não vence em automação agêntica nem em abertura, e a vantagem específica em benchmark de programação que fazia o argumento parecer decisivo não existe.
Comparados neste artigo2
Detectado a partir deste artigo · Benchmarks: Artificial Analysis · atualizado diariamente
