
Claude Haiku 5.5 vs GLM-5.3-FlashX: Pagar 2,5x pelos mesmos pesos, e se vale a pena
- openaiNOVOOpenAI: GPT-6.1 Sol2026-09-2952Inteligência
- anthropicNOVOAnthropic: Claude Sonnet 5.52026-09-2856Inteligência
- typesafeTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 por 1M de tokens · 128 tok/s
- OpenAIOpenAI: GPT-6 Luna2026-09-2238Inteligência
- OpenAIOpenAI: GPT-6 Sol2026-09-2248Inteligência
- AnthropicAnthropic: Claude Opus 5.52026-09-2258Inteligência
- xAIGrok 4.72026-09-2146Inteligência
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 por 1M de tokens · 57 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 por 1M de tokens · 320 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Inteligência
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Inteligência77Código
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Inteligência76Código
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Inteligência76Código
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Inteligência82Código
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 por 1M de tokens · 56 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 por 1M de tokens · 345 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Inteligência72Código
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 por 1M de tokens · 230 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Inteligência75Código
- obsidianQwen3.8 27B2026-08-1534Inteligência68Código
A coisa mais útil a saber sobre o GLM-5.3-FlashX antes de compará-lo ao Claude Haiku 5.5 é que ele executa os mesmos pesos do GLM-5.3-Flash e custa 2,5 vezes mais para ser chamado. A Z.ai lançou o FlashX em sua própria API em 18 de setembro de 2026, a US$ 0,37 por milhão de tokens de entrada e US$ 1,25 por milhão de tokens de saída, contra US$ 0,15 e US$ 0,50 do modelo base do qual ele deriva. Nada no modelo mudou; o que mudou foi onde ele roda e a velocidade com que promete rodar lá. Entender esse pareamento é o ponto central aqui, porque significa que esta não é uma comparação entre dois níveis de capacidade — é uma comparação entre uma faixa de preço e uma camada de serviço, e o Haiku 5.5 entra no meio dessa discussão vindo de uma direção completamente diferente.
Dois modelos, quatro preços, um limiar
Alinhe os quatro cartões de tarifas relevantes e o formato da decisão fica mais claro do que com qualquer par isolado:
• Claude Haiku 5.5, menos de 100.000 tokens — $0,10 de entrada, $0,50 de saída por milhão (lista da Anthropic)
• Claude Haiku 5.5, mais de 100.000 tokens — US$ 0,50 de entrada, US$ 2,50 de saída por milhão (lista da Anthropic)
• GLM-5.3-Flash — $0,15 de entrada, $0,50 de saída por milhão (lista da Z.ai)
• GLM-5.3-FlashX — $0,37 de entrada, $1,25 de saída por milhão (tabela da Z.ai)
• Contexto — 1 milhão de tokens em todos os quatro (publicado pelo fornecedor)
• Pesos abertos — GLM-5.3-Flash e FlashX herdam os pesos licenciados sob MIT do modelo base; Claude Haiku 5.5 é fechado (publicado pelo fornecedor)
• Pontuação independente — GLM-5.3-Flash medido em 41.807 no Artificial Analysis Intelligence Index; Claude Haiku 5.5 medido em 43.395 (Artificial Analysis)
A primeira coisa a notar é que o preço do FlashX fica quase exatamente em cima da faixa de contexto longo do Claude Haiku 5.5 — US$ 0,37 contra US$ 0,50 na entrada, US$ 1,25 contra US$ 2,50 na saída. Isso não é uma coincidência do mercado; é o que custa uma camada de serviço premium quando o modelo subjacente é de porte médio e o fornecedor está cobrando por taxa de transferência, e não por capacidade. A segunda é que o GLM-5.3-FlashX é a versão cara de um modelo em relação ao qual o novo Haiku da Anthropic é mais barato em contexto curto e comparável em contexto longo. A terceira é que todos os quatro números estão dentro de um fator de cinco entre si, o que é uma faixa muito mais estreita do que a oposição “modelo barato versus modelo caro” da maioria das comparações diretas sugere.

O que o FlashX realmente é
GLM-5.3-FlashX não é um novo modelo. É o GLM-5.3-Flash servido na infraestrutura própria da Z.ai, anunciado com até 200 tokens de saída por segundo no pico, em comparação com a taxa medida do modelo base, e com preço 2,5 vezes o preço de lista do modelo base. A proposta da Z.ai é direta: as mesmas respostas, mais delas por segundo, e você paga pelo serving, não pelos pesos. Para uma carga de trabalho limitada pela taxa de transferência — classificação em lote, extração de alto volume, qualquer coisa em que a latência seja a restrição, e não o custo — isso é uma coisa coerente de se vender e uma coisa coerente de se comprar.
O que não é é uma atualização de capacidade, e o preço reflete isso com honestidade: se o FlashX fosse um modelo melhor, a Z.ai não conseguiria cobrar pelos pesos do modelo base separadamente. O 2,5x é um prêmio de serviço. Se vale a pena pagar é uma questão sobre o gargalo da sua carga de trabalho, e tem uma resposta diferente para um pipeline limitado por latência do que para um limitado por custo.
Artificial Analysis não tem uma página separada para o FlashX no momento em que escrevo, o que vale declarar sem rodeios em vez de encobrir: o número independente que o ranking publica para o GLM-5.3-Flash — 41,807 no Intelligence Index, 52,14 tokens de saída por segundo medidos, 0,328 no Terminal-Bench Hard — é um número para o modelo base, não para a versão servida a 2,5x. A própria alegação de throughput do fornecedor para o FlashX é um valor de pico e informado pelo fornecedor. Ninguém independente publicou throughput para o próprio FlashX, então qualquer comparação da velocidade medida do Haiku 5.5 com a do FlashX é uma comparação com um número que a Z.ai forneceu sobre o seu próprio serviço.
O multiplicador de 2,5x da Z.ai não é a única coisa que torna o FlashX caro em relação à sua base. Como os pesos base são licenciados sob a licença MIT e hospedados por terceiros, uma carga de trabalho que realmente precisa de mais throughput do que o endpoint de um único fornecedor oferece muitas vezes pode obtê-lo distribuindo-a entre vários provedores dos mesmos pesos a preço base ou próximo dele, em vez de pagar o nível premium de um único fornecedor. Essa é uma alternativa real com a qual a tabela de preços do FlashX está competindo, e a Z.ai sabe disso — e é provavelmente por isso que o argumento de venda se apoia no throughput de pico em vez de na exclusividade.

Onde Haiku 5.5 e FlashX se separam
Coloque os dois um contra o outro nas dimensões que decidem uma carga de trabalho real, e a separação é clara o suficiente para escolher com base nela:
• Preço no contexto abaixo de 100K — Haiku 5.5 $0.10 / $0.50 vs FlashX $0.37 / $1.25; Haiku vence nos dois lados
• Preço em contexto acima de 100K — Haiku 5.5 $0.50 / $2.50 vs. FlashX $0.37 / $1.25; FlashX vence em ambos os lados
• Throughput — pico do fornecedor de 200 tok/s para o FlashX vs. o serving publicado pela Anthropic para o Haiku 5.5, que não anuncia um pico desse tipo
• Índice independente — Haiku 5.5 43.395 vs GLM-5.3-Flash 41.807 (Artificial Analysis; sem número independente para o próprio FlashX)
• Pesos — FlashX herda pesos abertos licenciados sob MIT; Haiku 5.5 é fechado e somente via API
• Auto-hospedagem — possível para o FlashX por meio dos pesos abertos; não é possível para o Haiku 5.5
• Conjunto de recursos de ferramentas/agentes — nível de esforço ajustável no Haiku 5.5, ausente na linha GLM Flash
A célula interessante é a segunda. O Claude Haiku 5.5 é um modelo cinco vezes mais barato que o GLM-5.3-FlashX em requisições curtas e um pouco mais caro que ele em requisições longas, porque a tabela de preços do Haiku aumenta 5x aos 100.000 tokens, enquanto o FlashX cobra uma tarifa fixa. Se o seu tráfego for majoritariamente curto, o Haiku é a escolha óbvia apenas com base no preço. Se for majoritariamente longo, o FlashX não está competindo de forma alguma com o preço do nível curto do Haiku — está competindo com o nível longo do Haiku, e vence essa comparação por cerca de um terço.
A comparação de capacidades está mais próxima do que qualquer um dos fornecedores gostaria. 41,807 contra 43,395 no mesmo índice independente é uma diferença de menos de quatro por cento, bem dentro do ruído da maioria das avaliações em nível de aplicação e pequena demais para justificar uma escolha por si só. Nenhum dos modelos domina o outro no raciocínio geral; a decisão está sendo tomada com base na tabela de preços e na vazão, não em qual deles é mais inteligente.

A diferença de licença é uma diferença real
O fato de o FlashX ser open-weight na origem importa mais do que a diferença de preço em um aspecto: ele pode ser auto-hospedado e pode ser servido por qualquer pessoa. O Claude Haiku 5.5 não pode ser nem uma coisa nem outra. Para uma equipe com um requisito de conformidade de que a inferência aconteça em seu próprio hardware, ou com volume constante suficiente para que amortizar uma GPU seja mais barato do que pagar por token, a linha GLM é a única das duas que responde à questão. Para todos os outros — a maioria, que quer um modelo por trás de uma API e prefere não operar a camada de serviço —, a licença é uma nota de rodapé e o preço é o argumento.
Isso também significa que os dois modelos têm modos de falha diferentes quando um provedor tem um dia ruim. Um modelo fechado servido apenas por seu fornecedor e pelos parceiros de nuvem desse fornecedor fica indisponível quando eles ficam indisponíveis. Um modelo aberto com vários hosts independentes pode sofrer failover entre eles, desde que haja algo fazendo o failover. Essa é uma diferença operacional genuína e é o tipo de coisa que só aparece no dia em que importa.
Roteando ambos sem um segundo contrato
Se a decisão acima não der origem a um único vencedor para o seu tráfego — o que normalmente não acontece, porque os dois modelos superam-se mutuamente em metades diferentes da tabela de preços —, a questão prática é como usar ambos sem manter duas integrações. O OrcaRouter disponibiliza z-ai/glm-5.3-flash a $0,15 e $0,50 por milhão ao preço de tabela do fornecedor, a par de qwen/qwen3.8-flash e do resto de um catálogo com mais de 200 modelos, numa só chave e numa só fatura. Uma alteração de preço da Anthropic no Claude Haiku 5.5, ou uma alteração da Z.ai na linha Flash, é repercutida sem margem acrescida no próprio dia, em vez de ficar atrás da tabela de preços do próprio revendedor, pelo que os números acima continuam a ser os números que realmente paga.
Não servimos o Claude Haiku 5.5, e não servimos o GLM-5.3-FlashX — nenhum dos dois está no nosso catálogo; para esses, chame a Anthropic e a Z.ai diretamente. O que servimos é o GLM-5.3-Flash, o modelo base por trás do FlashX, que é a escolha certa para as muitas cargas de trabalho em que o prêmio de 2,5x no serviço compra uma vazão que ninguém pediu. Quando um caminho de produção depende genuinamente de um dos dois modelos que não hospedamos, nosso failover é o mecanismo para experimentá-lo sem apostar todo o caminho nele: aponte a requisição para ele, mantenha um modelo funcional como fallback e deixe a camada de roteamento decidir qual deles responde.
Qual escolher
Abaixo de 100.000 tokens por pedido, o Claude Haiku 5.5 vence no preço e aproxima-se o suficiente do FlashX em capacidade para que a escolha não seja difícil. Acima de 100.000 tokens, o GLM-5.3-FlashX é mais barato do que o escalão de contexto longo do Haiku 5.5 e é o modelo a que deve recorrer se o tamanho do pedido for uma propriedade da tarefa e não uma escolha — embora o GLM-5.3-Flash base seja ainda mais barato, e a única razão para pagar 2,5x seja se precisar especificamente da capacidade de processamento anunciada do FlashX.
O enquadramento a descartar é o de que um destes é a opção económica e o outro é a opção de desempenho. Ambos são modelos de preço médio, com tabelas de preços fixas e bem divulgadas, e a variável interessante não é qual deles é melhor, mas sim para que metade do seu tráfego cada um fica mais barato. Extraia primeiro a distribuição do tamanho dos seus pedidos; a comparação de preços em duas colunas acima dirá o resto.
Comparados neste artigo1
Detectado a partir deste artigo · Benchmarks: Artificial Analysis · atualizado diariamente
