Um cartão de título gerado para 'Claude Haiku 5.5 vs GLM-5.3-FlashX — pagando 2,5x pelos mesmos pesos', mostrando os dois nomes de modelo de cada lado de um divisor e a legenda 'Dois modelos de preço médio, quatro tabelas de tarifas, um limite de 100K', com o rodapé 'Preços de tabela da Anthropic e Z.ai, outubro de 2026.' O logotipo real do OrcaRouter é composto no canto inferior direito.
Guides & Insights

Claude Haiku 5.5 vs GLM-5.3-FlashX: Pagar 2,5x pelos mesmos pesos, e se vale a pena

Autor

Gideon Frost

Data de publicação

Modelos mais recentes · 20Ver todos os modelos →
Benchmarks: Artificial Analysis · atualizado diariamente
Voltar para todas as publicações

A coisa mais útil a saber sobre o GLM-5.3-FlashX antes de compará-lo ao Claude Haiku 5.5 é que ele executa os mesmos pesos do GLM-5.3-Flash e custa 2,5 vezes mais para ser chamado. A Z​.ai lançou o FlashX em sua própria API em 18 de setembro de 2026, a US$ 0,37 por milhão de tokens de entrada e US$ 1,25 por milhão de tokens de saída, contra US$ 0,15 e US$ 0,50 do modelo base do qual ele deriva. Nada no modelo mudou; o que mudou foi onde ele roda e a velocidade com que promete rodar lá. Entender esse pareamento é o ponto central aqui, porque significa que esta não é uma comparação entre dois níveis de capacidade — é uma comparação entre uma faixa de preço e uma camada de serviço, e o Haiku 5.5 entra no meio dessa discussão vindo de uma direção completamente diferente.

Dois modelos, quatro preços, um limiar

Alinhe os quatro cartões de tarifas relevantes e o formato da decisão fica mais claro do que com qualquer par isolado:

• Claude Haiku 5.5, menos de 100.000 tokens — $0,10 de entrada, $0,50 de saída por milhão (lista da A​nthropic)

• Claude Haiku 5.5, mais de 100.000 tokens — US$ 0,50 de entrada, US$ 2,50 de saída por milhão (lista da Anthropic)

• GLM-5.3-Flash — $0,15 de entrada, $0,50 de saída por milhão (lista da Z​.ai)

• GLM-5.3-FlashX — $0,37 de entrada, $1,25 de saída por milhão (tabela da Z​.ai)

• Contexto — 1 milhão de tokens em todos os quatro (publicado pelo fornecedor)

• Pesos abertos — GLM-5.3-Flash e FlashX herdam os pesos licenciados sob MIT do modelo base; Claude Haiku 5.5 é fechado (publicado pelo fornecedor)

• Pontuação independente — GLM-5.3-Flash medido em 41.807 no Artificial Analysis Intelligence Index; Claude Haiku 5.5 medido em 43.395 (Artificial Analysis)

A primeira coisa a notar é que o preço do FlashX fica quase exatamente em cima da faixa de contexto longo do Claude Haiku 5.5 — US$ 0,37 contra US$ 0,50 na entrada, US$ 1,25 contra US$ 2,50 na saída. Isso não é uma coincidência do mercado; é o que custa uma camada de serviço premium quando o modelo subjacente é de porte médio e o fornecedor está cobrando por taxa de transferência, e não por capacidade. A segunda é que o GLM-5.3-FlashX é a versão cara de um modelo em relação ao qual o novo Haiku da Anthropic é mais barato em contexto curto e comparável em contexto longo. A terceira é que todos os quatro números estão dentro de um fator de cinco entre si, o que é uma faixa muito mais estreita do que a oposição “modelo barato versus modelo caro” da maioria das comparações diretas sugere.

A generated two-column scoreboard titled 'Claude Haiku 5.5 vs GLM-5.3-FlashX — the scoreboard'. Left column Claude Haiku 5.5: input price (short) $0.10 per million, output price (short) $0.50 per million, input price (over 100K) $0.50 per million. Right column GLM-5.3-FlashX: input price $0.37 per million, output price $1.25 per million, and a serving-premium row. A footer labels the sources. The real OrcaRouter logo is composited bottom-right.

O que o FlashX realmente é

GLM-5.3-FlashX não é um novo modelo. É o GLM-5.3-Flash servido na infraestrutura própria da Z​.ai, anunciado com até 200 tokens de saída por segundo no pico, em comparação com a taxa medida do modelo base, e com preço 2,5 vezes o preço de lista do modelo base. A proposta da Z​.ai é direta: as mesmas respostas, mais delas por segundo, e você paga pelo serving, não pelos pesos. Para uma carga de trabalho limitada pela taxa de transferência — classificação em lote, extração de alto volume, qualquer coisa em que a latência seja a restrição, e não o custo — isso é uma coisa coerente de se vender e uma coisa coerente de se comprar.

O que não é é uma atualização de capacidade, e o preço reflete isso com honestidade: se o FlashX fosse um modelo melhor, a Z.ai não conseguiria cobrar pelos pesos do modelo base separadamente. O 2,5x é um prêmio de serviço. Se vale a pena pagar é uma questão sobre o gargalo da sua carga de trabalho, e tem uma resposta diferente para um pipeline limitado por latência do que para um limitado por custo.

Artificial Analysis não tem uma página separada para o FlashX no momento em que escrevo, o que vale declarar sem rodeios em vez de encobrir: o número independente que o ranking publica para o GLM-5.3-Flash — 41,807 no Intelligence Index, 52,14 tokens de saída por segundo medidos, 0,328 no Terminal-Bench Hard — é um número para o modelo base, não para a versão servida a 2,5x. A própria alegação de throughput do fornecedor para o FlashX é um valor de pico e informado pelo fornecedor. Ninguém independente publicou throughput para o próprio FlashX, então qualquer comparação da velocidade medida do Haiku 5.5 com a do FlashX é uma comparação com um número que a Z​.ai forneceu sobre o seu próprio serviço.

O multiplicador de 2,5x da Z​.ai não é a única coisa que torna o FlashX caro em relação à sua base. Como os pesos base são licenciados sob a licença MIT e hospedados por terceiros, uma carga de trabalho que realmente precisa de mais throughput do que o endpoint de um único fornecedor oferece muitas vezes pode obtê-lo distribuindo-a entre vários provedores dos mesmos pesos a preço base ou próximo dele, em vez de pagar o nível premium de um único fornecedor. Essa é uma alternativa real com a qual a tabela de preços do FlashX está competindo, e a Z​.ai sabe disso — e é provavelmente por isso que o argumento de venda se apoia no throughput de pico em vez de na exclusividade.

A screenshot of Z.ai's documentation pricing page, showing the API pricing table for the GLM model line with per-million input and output rates, captured in English.

Onde Haiku 5.5 e FlashX se separam

Coloque os dois um contra o outro nas dimensões que decidem uma carga de trabalho real, e a separação é clara o suficiente para escolher com base nela:

• Preço no contexto abaixo de 100K — Haiku 5.5 $0.10 / $0.50 vs FlashX $0.37 / $1.25; Haiku vence nos dois lados

• Preço em contexto acima de 100K — Haiku 5.5 $0.50 / $2.50 vs. FlashX $0.37 / $1.25; FlashX vence em ambos os lados

• Throughput — pico do fornecedor de 200 tok/s para o FlashX vs. o serving publicado pela Anthropic para o Haiku 5.5, que não anuncia um pico desse tipo

• Índice independente — Haiku 5.5 43.395 vs GLM-5.3-Flash 41.807 (Artificial Analysis; sem número independente para o próprio FlashX)

• Pesos — FlashX herda pesos abertos licenciados sob MIT; Haiku 5.5 é fechado e somente via API

• Auto-hospedagem — possível para o FlashX por meio dos pesos abertos; não é possível para o Haiku 5.5

• Conjunto de recursos de ferramentas/agentes — nível de esforço ajustável no Haiku 5.5, ausente na linha G​LM Flash

A célula interessante é a segunda. O Claude Haiku 5.5 é um modelo cinco vezes mais barato que o GLM-5.3-FlashX em requisições curtas e um pouco mais caro que ele em requisições longas, porque a tabela de preços do Haiku aumenta 5x aos 100.000 tokens, enquanto o FlashX cobra uma tarifa fixa. Se o seu tráfego for majoritariamente curto, o Haiku é a escolha óbvia apenas com base no preço. Se for majoritariamente longo, o FlashX não está competindo de forma alguma com o preço do nível curto do Haiku — está competindo com o nível longo do Haiku, e vence essa comparação por cerca de um terço.

A comparação de capacidades está mais próxima do que qualquer um dos fornecedores gostaria. 41,807 contra 43,395 no mesmo índice independente é uma diferença de menos de quatro por cento, bem dentro do ruído da maioria das avaliações em nível de aplicação e pequena demais para justificar uma escolha por si só. Nenhum dos modelos domina o outro no raciocínio geral; a decisão está sendo tomada com base na tabela de preços e na vazão, não em qual deles é mais inteligente.

A screenshot of the Artificial Analysis model page for Claude Haiku 5.5, headlined 'Proprietary model — Released October 2026', showing an Intelligence Index of 43.395 and speed rank #10 of 182, with the cost comparison block reading $0.10 input.

A diferença de licença é uma diferença real

O fato de o FlashX ser open-weight na origem importa mais do que a diferença de preço em um aspecto: ele pode ser auto-hospedado e pode ser servido por qualquer pessoa. O Claude Haiku 5.5 não pode ser nem uma coisa nem outra. Para uma equipe com um requisito de conformidade de que a inferência aconteça em seu próprio hardware, ou com volume constante suficiente para que amortizar uma GPU seja mais barato do que pagar por token, a linha GLM é a única das duas que responde à questão. Para todos os outros — a maioria, que quer um modelo por trás de uma API e prefere não operar a camada de serviço —, a licença é uma nota de rodapé e o preço é o argumento.

Isso também significa que os dois modelos têm modos de falha diferentes quando um provedor tem um dia ruim. Um modelo fechado servido apenas por seu fornecedor e pelos parceiros de nuvem desse fornecedor fica indisponível quando eles ficam indisponíveis. Um modelo aberto com vários hosts independentes pode sofrer failover entre eles, desde que haja algo fazendo o failover. Essa é uma diferença operacional genuína e é o tipo de coisa que só aparece no dia em que importa.

Roteando ambos sem um segundo contrato

Se a decisão acima não der origem a um único vencedor para o seu tráfego — o que normalmente não acontece, porque os dois modelos superam-se mutuamente em metades diferentes da tabela de preços —, a questão prática é como usar ambos sem manter duas integrações. O OrcaRouter disponibiliza z-ai/glm-5.3-flash a $0,15 e $0,50 por milhão ao preço de tabela do fornecedor, a par de qwen/qwen3.8-flash e do resto de um catálogo com mais de 200 modelos, numa só chave e numa só fatura. Uma alteração de preço da A​nthropic no Claude Haiku 5.5, ou uma alteração da Z​.ai na linha Flash, é repercutida sem margem acrescida no próprio dia, em vez de ficar atrás da tabela de preços do próprio revendedor, pelo que os números acima continuam a ser os números que realmente paga.

Não servimos o Claude Haiku 5.5, e não servimos o GLM-5.3-FlashX — nenhum dos dois está no nosso catálogo; para esses, chame a A​nthropic e a Z​.ai diretamente. O que servimos é o GLM-5.3-Flash, o modelo base por trás do FlashX, que é a escolha certa para as muitas cargas de trabalho em que o prêmio de 2,5x no serviço compra uma vazão que ninguém pediu. Quando um caminho de produção depende genuinamente de um dos dois modelos que não hospedamos, nosso failover é o mecanismo para experimentá-lo sem apostar todo o caminho nele: aponte a requisição para ele, mantenha um modelo funcional como fallback e deixe a camada de roteamento decidir qual deles responde.

Qual escolher

Abaixo de 100.000 tokens por pedido, o Claude Haiku 5.5 vence no preço e aproxima-se o suficiente do FlashX em capacidade para que a escolha não seja difícil. Acima de 100.000 tokens, o GLM-5.3-FlashX é mais barato do que o escalão de contexto longo do Haiku 5.5 e é o modelo a que deve recorrer se o tamanho do pedido for uma propriedade da tarefa e não uma escolha — embora o GLM-5.3-Flash base seja ainda mais barato, e a única razão para pagar 2,5x seja se precisar especificamente da capacidade de processamento anunciada do FlashX.

O enquadramento a descartar é o de que um destes é a opção económica e o outro é a opção de desempenho. Ambos são modelos de preço médio, com tabelas de preços fixas e bem divulgadas, e a variável interessante não é qual deles é melhor, mas sim para que metade do seu tráfego cada um fica mais barato. Extraia primeiro a distribuição do tamanho dos seus pedidos; a comparação de preços em duas colunas acima dirá o resto.

um catálogo com mais de 200 modelos

Comparados neste artigo1

Detectado a partir deste artigo · Benchmarks: Artificial Analysis · atualizado diariamente