Um cartão de destaque com o título 'Empate total em 0.32828', com Claude Haiku 5.5 e GLM 5.3 Flash de cada lado do número, uma linha exibindo Terminal Bench 4.0 0.32828, uma linha de Índice exibindo 43.40 contra 41.81, e o subtítulo 'Mesmo número, máquinas diferentes'.
Guides & Insights

Claude Haiku 5.5 vs GLM 5.3 Flash: Empate absoluto no benchmark citado por ambos os fornecedores

Autor

Rowan Sterling

Data de publicação

Modelos mais recentes · 20Ver todos os modelos →
Benchmarks: Artificial Analysis · atualizado diariamente
Voltar para todas as publicações

Run Claude Haiku 5.5 and GLM 5.3 Flash through Terminal Bench 4.0 and you get the same number: 0.32828 for both. Not close — identical, to five decimal places, on the benchmark that the vendor leads with in its own launch materials and that Z.ai's launch materials lead with too. For two models built on entirely different stacks, by vendors in different countries, released six weeks apart, that is a coincidence worth stopping on.

Também é o número errado para se decidir com base nele. Os dois modelos separam-se nitidamente em todos os outros aspectos, e o padrão dessa separação é incomum o bastante para que deva mudar a forma como você lê as alegações de destaque de qualquer um dos fornecedores. Um deles vence o índice composto e a métrica de custo por tarefa. O outro vence em quase tudo o que se parece com uma implantação real.

Eles não são separados por capacidade. Eles são separados por forma.

Comece pelo único número que diz "estes são da mesma classe de modelo."

• SciCode — 0,5498 para Claude Haiku 5.5 contra 0,5162 para GLM 5.3 Flash. Dois pontos para a Anthropic, num benchmark onde dois pontos são ruído.

• Terminal Bench 4.0 — 0,32828 contra 0,32828. Um empate, exatamente.

• Janela de contexto — um milhão de tokens para ambos.

• Preço de saída, primeiro nível — US$ 0,50 por milhão de tokens para ambos.

Quatro linhas, quatro quase correspondências. Se você parasse aqui, concluiria que esses modelos são intercambiáveis e escolheria pelo preço. Essa conclusão estaria errada, e o próximo conjunto de linhas explica por quê.

Onde divergem, a direção é consistente.

As linhas que de fato os separam não estão espalhadas. Elas se agrupam em dois grupos, e cada modelo domina um grupo por completo.

O grupo agêntico pertence ao GLM 5.3 Flash.A pontuação parcial do AutomationBench registra 0,6037 para o GLM 5.3 Flash, contra 0,3541 para o Claude Haiku 5.5 — uma diferença de 25 pontos, a maior diferença isolada entre esses dois modelos em qualquer medição compartilhada. O Tau-Bench Banking registra 0,4722 para o GLM 5.3 Flash; o Claude Haiku 5.5 não tem número publicado nessa linha. O GPQA registra 0,9121 para o GLM 5.3 Flash; novamente, não há valor da Anthropic para comparar. Nas medidas de se um modelo consegue manter uma tarefa de várias etapas coesa e usar ferramentas de forma confiável dentro de um domínio estruturado, o modelo da Z.ai está à frente por uma margem que ofusca a diferença do índice composto que corre no sentido oposto.

O grupo de composto e custo pertence ao Claude Haiku 5.5.O Artificial Analysis Intelligence Index v4.3.2 registra 43,40 contra 41,81 — 1,59 ponto, e o número que todo resumo deste confronto cita. O custo por tarefa concluída do Index é de US$ 0,21 contra US$ 0,25. O tempo real por tarefa do Index é de 424,6 segundos contra 1.035,4 segundos: o modelo da Anthropic conclui em menos da metade do tempo.

É esse o formato da escolha. Claude Haiku 5.5 é mais rápido, mais barato por trabalho concluído e tem melhor desempenho no agregado. GLM 5.3 Flash é mais confiável na classe específica de trabalho para a qual modelos baratos são comprados.

A two-column scoreboard titled 'Claude Haiku 5.5 vs GLM 5.3 Flash - the scoreboard' with rows Terminal Bench 4.0 0.32828 against 0.32828, SciCode 0.5498 against 0.5162, Humanity's Last Exam 0.4439 against 0.3985, AutomationBench 0.3541 against 0.6037, Index v4.3.2 43.40 against 41.81 and cost per task $0.21 against $0.25, footed 'Both figures per Artificial Analysis v4.3.2; Terminal Bench 4.0 is an exact tie.'

Qual é o que se deve acreditar?

Nenhum dos dois, por si só — e a própria divergência é a informação.

Um Intelligence Index é uma combinação ponderada de categorias de raciocínio, ciência, programação e agênticas. Ele foi projetado para responder “aproximadamente quão capaz é este modelo” em um único número, e faz esse trabalho. O que ele não consegue fazer é dizer se uma vantagem de 1,59 pontos vem das categorias em que sua carga de trabalho se insere ou daquelas que ela nunca toca. Aqui, a vantagem vem substancialmente de linhas como SciCode e Humanity's Last Exam — 0,5498 contra 0,5162, e 0,4439 contra 0,3985 — enquanto um déficit de 25 pontos está em AutomationBench com o sinal oposto.

Uma equipe que desenvolve um assistente de programação em um loop de terminal notará a vantagem do SciCode. Uma equipe que desenvolve um agente que precisa concluir um fluxo de trabalho bancário de ponta a ponta notará a lacuna do AutomationBench, e notará isso todos os dias. As duas equipes estão olhando para o mesmo índice e deveriam chegar a conclusões opostas.

A medida prática é ler o composto como um filtro, em vez de um ranking. Se dois modelos estiverem a cerca de dois pontos de índice um do outro, o composto lhe disse que eles estão na mesma faixa e não lhe disse nada sobre qual deles escolher. Nesse ponto, as únicas linhas que vale a pena ler são as que correspondem à sua carga de trabalho — e, se um fornecedor não publicou uma linha de que você precisa, a ausência é em si um dado, não uma lacuna a ser preenchida por suposição.

A linha do tokenizador que ninguém coloca na tabela de comparação

A própria documentação da Anthropic contém uma frase que muda toda comparação de preços envolvendo o Claude Haiku 5.5, e é fácil deixá-la passar. O modelo usa o tokenizador mais recente compartilhado com o Claude 4.7 e versões posteriores, que conta o mesmo texto como aproximadamente 30% mais tokens do que o modelo que ele substitui.

Compare isso com a tabela de preços e a aritmética fica menos favorável do que o preço de etiqueta sugere. A tarifa de entrada do Claude Haiku 5.5 é de US$ 0,10 por milhão de tokens, contra US$ 0,15 do GLM 5.3 Flash — uma vantagem de 1,5×. Considere 30% mais tokens para o mesmo prompt e a vantagem efetiva em texto idêntico reduz-se consideravelmente, embora não desapareça. As tarifas de saída são idênticas, a US$ 0,50 na primeira faixa, por isso o efeito do tokenizador aplica-se aí sem nada que o compense.

O resultado medido é a versão honesta da afirmação: nos próprios números da Artificial Analysis, o Claude Haiku 5.5 gerou 162.164 tokens de saída por tarefa do Index, contra 68.673 do GLM 5.3 Flash — 2,4 vezes mais — e ainda assim ficou em US$ 0,21 por tarefa concluída, contra US$ 0,25. A vantagem de tarifa sobrevive à verbosidade, e o que resta dela é menor do que a tabela de tarifas indica.

Apenas um destes dois tem suas tarifas declaradas como fixas. O preço do Claude Haiku 5.5 aumenta após 100.000 tokens de prompt para US$ 0,50 de entrada e US$ 2,50 de saída; o GLM 5.3 Flash não tem um limite equivalente publicado. Para a maior parte do tráfego de chat e assistência de código, esse degrau nunca se aplica. Para trabalhos com documentos longos ou de grande contexto com agentes, ele se aplica constantemente, e nesse ponto a comparação se inverte muito além do que os números do primeiro nível sugerem.

A capture of Anthropic's models-overview documentation table headed 'Lifecycle and reference', listing Claude Fable 5.1, Claude Opus 5.5, Claude Sonnet 5.5 and Claude Haiku 5.5 with context windows, maximum outputs, prices per million tokens, latency and default effort, and showing Claude Haiku 5.5 as 'This model' at 1M context, 128K maximum output and 'From $0.10/$0.50'.

A linha que decide isso antes que qualquer um dos números o faça

Tudo o que está acima pressupõe que você pode escolher livremente entre esses dois modelos. Uma grande fração das equipes não pode, e o motivo é uma única linha da ficha técnica que a discussão sobre benchmarks tende a soterrar.

O GLM 5.3 Flash tem pesos abertos, lançado sob a licença MIT, com 320 bilhões de parâmetros totais e 18 bilhões ativos. Ele pode ser baixado, auto-hospedado, ajustado, quantizado, fixado a uma versão e executado dentro de uma tenancy que você controla. O Claude Haiku 5.5 é proprietário e somente via API, sem contagem de parâmetros publicada, sem licença e sem repositório.

Se o seu documento de requisitos diz que o modelo precisa ser executado no seu próprio hardware, ou que um checkpoint específico precisa continuar podendo ser chamado pelos próximos três anos, essa comparação acaba antes mesmo de a coluna de preços ser lida. Isso não é um detalhe técnico. É o motivo mais comum pelo qual equipes acabam em um modelo de pesos abertos de nível intermediário, e é o motivo pelo qual uma vantagem de 25 pontos no AutomationBench não é a única coisa puxando na direção da Z.ai.

Isso também corta para o outro lado, e a mesma honestidade se aplica. A Anthropic publica um compromisso de descontinuação para o Claude Haiku 5.5 de não antes de outubro de 2027, e mantém o modelo em uma API própria com um cartão de sistema e um conjunto de avaliação documentado. Um lançamento com pesos abertos não é automaticamente mais durável — você herda o ônus operacional junto com os pesos, e um arquivo de licença não é um contrato de suporte. Qual desses dois você quer é uma questão sobre sua equipe, não sobre os modelos.

Os dois lados em uma única tecla, se você quiser resolver isso empiricamente.

O GLM 5.3 Flash está no catálogo do OrcaRouter pelo preço de tabela da Z.ai, com 0% de margem, repassado em vez de diluído, portanto a tarifa acima é a tarifa da fatura e qualquer alteração que a Z.ai faça chega ao nosso lado no mesmo dia.O Claude Haiku 5.5 não está no nosso catálogo — é acessível através da própria API da Anthropic — e é melhor dizer isso do que deixar subentendido.

O que o catálogo torna fácil é o formato de teste que este confronto realmente exige. A divergência entre o índice composto e as linhas agênticas é uma hipótese sobre sua carga de trabalho, e a única forma de resolvê-la é executar ambos os modelos sobre o mesmo trace. Com o GLM 5.3 Flash na rota e uma perna Anthropic do outro lado do mesmo gateway, isso se torna uma mudança de configuração em vez de duas integrações — uma API para mais de 200 modelos, uma chave, failover automático por baixo, e a DSL de roteamento quando você quer dividir o tráfego por classe de tarefa e ler o custo em uma única fatura.

A capture of the OrcaRouter model page for GLM 5.3 Flash under z-ai/glm-5.3-flash, showing a 1M-token context window, 128K maximum output, text, image and video input, benchmarks published by Z.ai on 2026-08-26, the description of its 320B total and 18B active parameters, and a price strip of $0.15 input, $0.50 output and $0.030 cache read per million tokens.

O veredito, declarado da forma como os números o sustentam

Se o seu trabalho é texto entra, texto sai, seus prompts ficam dentro da primeira faixa de preço, e você paga por token em volume real, o Claude Haiku 5.5 é o melhor modelo aqui: maior pontuação composta, mais barato por tarefa concluída e mais de duas vezes mais rápido por tarefa. O destaque do terminal-benchmark não faz diferença e não deve ser usado para decidir nada.

Se o seu trabalho for um agente que precisa concluir um fluxo de trabalho de várias etapas sem supervisão, o GLM 5.3 Flash está à frente no único benchmark compartilhado que mede exatamente isso, por 25 pontos, e é o mais barato dos dois para modificar porque você pode manter os pesos.

O empate em 0,32828 é a imagem certa para este par, mas não porque os modelos são iguais. É a única linha em que dois modelos que quase não têm nada em comum acabam chegando ao mesmo dígito — e tratar esse dígito como um resumo da comparação é como uma decisão de compras acaba sendo tomada com base no número menos informativo da tabela.