Cartão de título gerado intitulado 'Step 5 Preview vs. GLM-5.5 — um é lançado, o outro não', com duas colunas: Step 5 Preview no AA Index 44, 600B no total / 27B ativos, preço US$ 1,00 / US$ 2,70, saída de 99,8 tokens/s e uma API ativa desde 20 de setembro; GLM-5.5 com linhas indicando sem ficha do modelo, sem identificador de API, sem preço e sem nome confirmado. Um rodapé diz: 'Dados do Step 5 Preview conforme a Artificial Analysis; o GLM-5.5 é um modelo não anunciado e não lançado.'
Guides & Insights

Step 5 Preview vs GLM-5.5: Um Modelo Já Está Disponível Hoje, o Outro Ainda É Uma Previsão

Autor

Gideon Frost

Data de publicação

Modelos mais recentes · 20Ver todos os modelos
Benchmarks: Artificial Analysis · atualizado diariamente
Voltar para todas as publicações

Step 5 Preview abriu sua API em 20 de setembro de 2026, no mesmo dia em que a StepFun o anunciou, e você pode chamá-lo hoje à tarde a partir de um único endpoint por US$ 1,00 por milhão de tokens de entrada e US$ 2,70 por milhão de tokens de saída. GLM-5.5 não existe. Não há model card, nem identificador de API, nem preço, nem checkpoint e nem arquivo de licença, e não há nenhuma página da Z.ai em lugar algum que use o nome — porque GLM-5.5 é uma abreviação usada pela comunidade que a empresa nunca adotou. Essa assimetria é o artigo. O que segue é o que a StepFun realmente lançou, o que está de fato estabelecido sobre o próximo carro-chefe da Z.ai e o confronto direto que você pode rodar hoje no lugar do que está no título.

O que o GLM-5.5 é, e o que ele não é

O nome entrou em circulação em meados de 2026 vinculado a uma janela de lançamento, e a janela tem uma origem rastreável: uma previsão de analista repassada em 25 de junho de 2026, que situava o próximo carro-chefe da Z.ai em agosto. Era uma janela de observação, não um compromisso do fornecedor, e agosto terminou sem isso. O que a Z.ai lançou em vez disso foi o GLM-5.3, anunciado em 14 de agosto, com sua API ativa por volta de 18 de agosto e pesos abertos em 28 de agosto, seguido pelo GLM-5.3-Flash em 26 de agosto. Nenhum checkpoint do GLM-5.5 apareceu na própria organização Hugging Face do fornecedor, onde os repositórios mais recentes ainda param na série GLM-5.3.

A nomenclatura também está indefinida. GLM-5.3, GLM-5.4, GLM-5.5 e GLM-6 foram todos cogitados na mesma janela, e a Z.ai não confirmou nenhum deles. O único sinal por parte da empresa é o comentário de um cofundador sobre um lançamento "epic plus", que é mais uma disposição do que uma especificação. Analistas que leem a cadência do fornecedor — aproximadamente um modelo principal a cada 54 a 70 dias — agora projetam o próximo modelo para uma janela que vai de 8 de outubro a 9 de novembro de 2026, e esperam que ele seja numerado como GLM-5.4, e não GLM-5.5.

Três afirmações circulam como se fossem confirmadas, e vale a pena ser exato sobre todas as três. A contagem de parâmetros é a mais fraca: nada oficial sustenta o número "mais de 1 trilhão", e publicações sociais posteriores que o inflam para além de 3 trilhões não citam absolutamente nada. O contexto de 1M de tokens é a suposição mais segura, porque GLM-5.2 e GLM-5.3 ambos o possuem. Pesos abertos são uma expectativa, não uma promessa — a Z.ai disponibilizou pesos para seus últimos vários modelos principais, o que é um padrão, não um compromisso.

O que o Step 5 Preview realmente entrega

O modelo da StepFun é a metade concreta desta comparação, e a especificação é incomum. Trata-se de um modelo esparso de mistura de especialistas com 600B de parâmetros totais e cerca de 27B ativos por token — uma taxa de ativação próxima de 4,5% — construído sobre um transformer estreito e profundo de 92 camadas, com atenção de consulta agrupada esparsa e mesclagem de tokens em blocos. A janela de contexto é de 1M tokens, a entrada é texto e imagens, a saída é texto, e ele raciocina com pensamento estendido. A StepFun pulou toda a linha Step 4.x para chegar aqui, indo direto do Step-3.7-Flash para o Step 5.

• Índice de Inteligência — 44 no Artificial Analysis, 24.º de 200 modelos avaliados, face a uma mediana de 24

• Velocidade de saída — 99,8 tokens por segundo, 45º de 200

• Tempo até o primeiro token — 2,96 segundos na mesma execução independente

• Preço — $1,00 por 1M de tokens de entrada, $2,70 por 1M de tokens de saída, com 95% de desconto de cache

• Custo por tarefa do Intelligence Index — $0,71, 27º de 200

• Pesos — nenhum hoje; um checkpoint BF16 está programado para 15 de outubro de 2026

• Licença — nenhuma publicada. O modelo é proprietário, sem concessão de uso comercial, direito de redistribuição ou permissão de ajuste fino declarados.

O preço é a linha que chama a atenção, e também o é uma que favorece a StepFun menos do que parece à primeira vista: 160M tokens de saída no Intelligence Index contra uma mediana de 92M, 64.º de 200 nessa medida. O modelo é prolixo, e a verbosidade é um multiplicador de custo exatamente nas cargas de trabalho agênticas para as quais ele é vendido. A cifra de US$ 0,71 de custo por tarefa já tem isso em conta, e é por isso que é o número mais honesto de citar do que o preço de tabela.

As avaliações da própria StepFun não foram reproduzidas e devem ser lidas como material de fornecedor até que alguém independente as execute. Elas colocam o modelo em 29,5 no ALE-CLI, 66,4 no FrontierFinance, 83,3 no DRACO, 80,5 no ProgramBench, 67,7 no DeepSWE v1.1 e 49,0 no StepCodeBench, com 33,3% no Terminal-Bench 4.0 e 1571 no GDPval-AA v2. A StepFun também relata um pico de 508 TFLOPS de MLA em uma tarefa de otimização de kernel de GPU de 24 horas, contra 493 do Claude Opus 5. Esses são os números da StepFun sobre um modelo que a StepFun não abriu.

Screenshot of the Artificial Analysis model page for Step 5 Preview, showing StepFun as the creator with a September 2026 release date, an Intelligence Index of 44 at rank 24 of 200, output speed 99.8 tokens per second at rank 45 of 200, cost per Intelligence Index task $0.71 at rank 27 of 200, verbosity 160M output tokens against a 92M median, pricing of $1.00 per million input tokens and $2.70 per million output tokens with a 95% cache discount, and technical specifications listing reasoning support, text and image input, and a 1M-token context window.

O confronto direto que você pode executar em vez deste

Se você quer a comparação que o título promete, o substituto honesto é Step 5 Preview contra GLM-5.3 — o modelo que a Z.ai realmente lançou, ainda seu atual carro-chefe aberto, e aquele que qualquer GLM-5.5 substituiria. No ranking independente, os dois estão a um ponto de distância. Em quase todo o resto, não estão.

• Índice de Inteligência — Step 5 Preview 44 vs GLM-5.3 45

• Parâmetros — 600B no total / 27B ativos vs 753B no total / 40B ativos

• Velocidade de saída — 99,8 tokens/seg vs 72,1 tokens/seg

• Tempo até o primeiro token — 2,96 s vs 2,99 s

• Preço por 1M de tokens — $1,00 entrada / $2,70 saída vs $1,40 entrada / $4,40 saída

• Desconto de cache — 95% vs 81%

• Custo por tarefa do Intelligence Index — $0,71 vs $2,01

• Modalidade de entrada — texto e imagens vs apenas texto

• Licença — nenhuma publicada vs uma licença personalizada da Z.ai que não é MIT

O padrão repete o que o lançamento do Step 5 Preview estabeleceu diante de todos os modelos disponíveis no mercado com os quais foi avaliado: uma liderança decisiva em eficiência e um empate estatístico em capacidade. Ele gera tokens cerca de 38% mais rápido, custa aproximadamente metade por milhão de tokens nas duas direções e sai 2,8 vezes mais barato por tarefa de índice contra o GLM-5.3 — ainda que marque um ponto a menos. No placar, esse 44 também o coloca no mesmo nível do Kimi K3, o que vale saber antes de tratar qualquer um dos dois como líder.

A única linha em que o Step 5 Preview está inequivocamente atrás é aquela que você não pode submeter a benchmark. O GLM-5.3 tem um arquivo de licença e pesos baixáveis; o Step 5 Preview tem um repositório no Hugging Face contendo um único .gitattributes e uma data declarada de 15 de outubro para o checkpoint BF16. Se o próximo carro-chefe da Z.ai chegar com pesos abertos sob os mesmos termos personalizados que vem usando o ano todo, ele se encaixa na única categoria em que o Step 5 Preview atualmente não tem resposta — que é o verdadeiro motivo pelo qual vale a pena esperar para fazer uma comparação com o GLM-5.5, em vez de executá-la agora.

Generated two-column comparison scoreboard titled 'Step 5 Preview vs GLM-5.5 — the scoreboard'. The left column gives Step 5 Preview the rows AA Index 44, parameters 600B total / 27B active, price $1.00 / $2.70, cache discount 95%, cost per index task $0.71, and API live since September 20. The right column gives GLM-5.5 the rows AA Index no model to score, parameters more than 1T rumored and unconfirmed, price none, cache discount none, cost per index task none, and availability not released. A footer reads 'Step 5 Preview figures per Artificial Analysis Intelligence Index; GLM-5.5 is an unannounced, unreleased model with no vendor or independent figures.'

Por que esperar pelo GLM-5.5 é a opção cara

O problema prático de um modelo que está a dois meses de distância há dois meses é que o seu trabalho de avaliação não pode esperar por ele. O GLM-5.5 não tem endpoint, pelo que não pode ser submetido a benchmarks, comparado em termos de preço, testado sob carga nem colocado atrás de uma regra de fallback. Cada semana passada a fazer planos em torno dele é uma semana de decisões adiadas com base numa previsão — e a previsão já perdeu uma janela.

GLM-5.3, em contrapartida, está ativo no OrcaRouter sob z-ai/glm-5.3 a $1,26 de entrada e $3,96 de saída, contra os $1,40 e $4,40 das listas da Z.ai em sua própria página. Isso é repassado com margem zero, o que significa que o número que você vê é a tarifa atual do provedor, e não uma que nós definimos, e uma mudança de preço do fornecedor entra em vigor do nosso lado no mesmo dia, em vez de no próximo ciclo de cobrança.

O Step 5 Preview não está no nosso catálogo e não o roteamos. Ele roda na API e no Studio próprios da StepFun, e esse é o único lugar onde ele roda até o checkpoint de 15 de outubro chegar. O que o OrcaRouter oferece nesse meio-tempo é tudo do outro lado dessa comparação por trás de uma única API para mais de 200 modelos: GLM-5.3 na taxa acima, GPT-6 Astra, DeepSeek V4 Pro, Claude Opus 5 e o restante, com failover automático entre provedores mantendo um caminho de produção estável enquanto a curva de capacidade de um preview ainda é desconhecida, e o DSL de roteamento compondo vários deles em uma única chamada em vez de uma segunda integração. Faça benchmark do preview contra um modelo de produção na mesma chave; deixe o caminho de produção onde ele está.

Screenshot of the OrcaRouter model page for GLM-5.3 at www.orcarouter.ai/models/z-ai/glm-5.3, showing the model id z-ai/glm-5.3, a 1M-token context and 131.1K max output, input pricing of $1.26 and output pricing of $3.96 per million tokens against the crossed-out list rates of $1.40 and $4.40, a seven-day median time to first token of 3.68 seconds and a 95th percentile of 10.00 seconds, seven-day traffic of 2296.2M tokens, and the endpoints and SDK snippets behind the OrcaRouter API.

O que mudaria a resposta

Duas datas decidem isto. 15 de outubro é a data em que a StepFun afirmou que chega o checkpoint BF16 do Step 5 Preview, e a licença que o acompanha é a incógnita mais decisiva da comparação — uma licença permissiva faria de uma vantagem de custo por tarefa 2,8 vezes maior algo que se possui em vez de se alugar, e eliminaria o único eixo em que o GLM-5.3 está claramente à frente. Uma licença restritiva deixa o GLM-5.3 como o único dos dois sobre o qual se pode construir um produto, e transforma a diferença de um ponto em detalhe irrelevante sobre dois modelos que, de qualquer forma, você usaria de modo diferente.

A segunda é a janela de análise que vai de 8 de outubro a 9 de novembro para o próximo carro-chefe da Z.ai, que pode ou não se chamar GLM-5.5 e pode ou não se parecer com o boato. Se ele chegar, chega como um modelo com licença e checkpoint — as duas coisas que faltam ao Step 5 Preview — e a comparação se torna real.

Até que ambos sejam resolvidos, a pergunta útil não é qual dos dois é melhor, porque um deles não pode ser executado. É sobre qual dos modelos que existem você deveria estar construindo agora, e se a resposta muda quando o próximo checkpoint aparecer. Essa pergunta tem uma resposta testável esta semana, e não exige esperar que um nome se torne um modelo.

Comparados neste artigo3

Detectado a partir deste artigo · Benchmarks: Artificial Analysis · atualizado diariamente