
GLM 5.5 ou GLM 5.3-Vision? Um modelo anônimo que corresponde à impressão digital da Z.ai acaba de surgir.
- openaiNOVOOpenAI: GPT-6.1 Sol2026-09-2952Inteligência
- anthropicNOVOAnthropic: Claude Sonnet 5.52026-09-2856Inteligência
- typesafeNOVOTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 por 1M de tokens · 150 tok/s
- OpenAINOVOOpenAI: GPT-6 Luna2026-09-2238Inteligência
- OpenAINOVOOpenAI: GPT-6 Sol2026-09-2248Inteligência
- AnthropicNOVOAnthropic: Claude Opus 5.52026-09-2258Inteligência
- xAIGrok 4.72026-09-2146Inteligência
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 por 1M de tokens · 126 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 por 1M de tokens · 1202 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Inteligência
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Inteligência77Código
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Inteligência76Código
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Inteligência76Código
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Inteligência82Código
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 por 1M de tokens · 52 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 por 1M de tokens · 250 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Inteligência72Código
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 por 1M de tokens · 230 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Inteligência75Código
- obsidianQwen3.8 27B2026-08-1534Inteligência68Código
Um modelo não identificado cujo perfil de inferência — velocidade, tempo até o primeiro token, taxa de acerto de cache — corresponde à pilha GLM da Z.ai começou a atrair a atenção de analistas de capacidade, e o palpite provisório é que ele possa se chamar GLM 5.3-Vision ou GLM 5.5. Em 20 de agosto, o analista de computação e capacidade teortaxesTex publicou que um modelo anônimo que ele acompanha "claramente não é DeepSeek, pelo menos", que "não há nada descartando GLM até agora" e que "velocidade, ttft e taxa de acerto de cache também correspondem à GLM". A leitura dele: espera-se que seja chamado de GLM 5.3-Vision ou 5.5, com pontuação aproximada de 61 no Artificial Analysis Intelligence Index — um ponto acima de onde o GLM-5.3 lançado está hoje. Nada disso está confirmado. Não há model card, nenhum anúncio da Z.ai e nenhuma API, e esta página trata a observação como o que ela é: um sinal precoce de vazamento, ainda sem replicação, que vale a pena rastrear justamente porque o GLM-5.5 é o carro-chefe esperado da Z.ai há o mês inteiro e não apareceu. Cinco dias depois dessa postagem, um segundo dado, desta vez totalmente verificável, chegou: em 25 de agosto, o vLLM — o runtime de inferência por trás da maioria dos serviços de modelos em larga escala — abriu um pull request Do-Not-Merge habilitando suporte a kernel masked-MHA para as dimensões de cabeça do GLM-5. Ele não nomeia nenhuma variante e não prova nenhum lançamento; é trabalho de base na pilha de inferência, o tipo de atividade de bastidores que um novo modelo deixa para trás.
O que o sinal realmente diz
A fonte é um único post no X de teortaxesTex, datado de 20 de agosto — a mesma conta cujo sinal de "aproximadamente uma semana" sobre o lançamento do GLM-5.3 se confirmou ao dia certo em agosto. O enquadramento é explícito sobre o nível de evidência: "fortes evidências (ainda não replicadas)." O analista descarta a DeepSeek, não encontra nada que contradiga a GLM, e cita três medições de nível de serviço — throughput, tempo até o primeiro token e taxa de cache hit — como compatíveis com a stack da Z.ai. Depois, os dois nomes candidatos e uma pontuação projetada: "Atualmente, espero que seja chamado de GLM 5.3-Vision ou 5.5, e que atinja aproximadamente 61 no AA."
Analise cada parte separadamente. As alegações de identidade (não DeepSeek, corresponde a GLM) são inferências de impressão digital a partir de como o modelo é servido, não um model card. A pontuação é uma expectativa, não uma medição. Os nomes são suposições. O que torna o sinal mais valioso que o ruído é que ele é direcionalmente consistente com tudo o mais que sabemos sobre o roadmap da Z.ai neste mês: GLM-5.3 foi lançado apenas com texto, o pedido mais enfático da comunidade foi visão, e GLM-5.5 foi divulgado por diversos veículos (via JPMorgan, Reuters, CGTN e uma nota da Goldman em 18 de agosto) como chegando "dentro de agosto" — o desfecho do mês é agora.
Por que a impressão digital do serving é importante
Tempo até o primeiro token e taxa de acerto de cache são assinaturas em nível de infraestrutura. Elas são definidas por como um provedor constrói sua pilha de inferência — o escalonador, o layout do cache, a política de batching — e não pelo nome do modelo que um prompt invoca. Quando um analista diz que o TTFT e a taxa de acerto de cache de um modelo anônimo correspondem aos do GLM, ele está dizendo que a pilha de serving por trás dele se comporta como a da Z.ai, o que é o mais próximo de uma impressão digital que se pode obter sem pesos ou um model card. Não é uma prova. Outro fornecedor poderia espelhar a mesma pilha, ou a Z.ai poderia servir um modelo para um parceiro. Mas é uma alegação específica e verificável, e a ressalva de "ainda não replicamos" indica que o analista não a apresenta como algo resolvido.
A exclusão da DeepSeek também importa. O DeepSeek V4 Pro atingiu GA em 13 de agosto, e sua build Flash tem sido o outro lançamento chinês de pesos abertos de alta velocidade deste mês. Um modelo anônimo que descarta a DeepSeek, mas aponta para a GLM, restringe o campo ao pipeline da Z.ai — e o pipeline da Z.ai tem dois ocupantes plausíveis, que é exatamente a bifurcação que o sinal nomeia.
Um segundo sinal: a stack de serving está sendo construída para a atenção do GLM-5
Em 25 de agosto, um segundo ponto de dados chegou — este totalmente verificável. O vLLM, o runtime de inferência por trás do serving de modelos em larga escala, recebeu o pull request #53785, intitulado "[Do Not Merge][Attention] Enable masked MHA for GLM-5 head dimensions." Verificado no repositório, ele habilita o caminho de prefill de MHA mascarada para a geometria de atenção do GLM-5: 64 cabeças, rank KV de 512, dimensão de cabeça QK 192+64 e dimensão de cabeça V 256 — um layout QK/V 256/256, conforme a descrição do PR. Ele depende de uma alteração no FlashAttention para suporte a máscara de dimensão de cabeça 256, fixa temporariamente o FlashAttention em um commit de fork (que é para isso que serve o marcador Do Not Merge) e adiciona limites de roteamento aferidos por benchmark para o novo caminho: limites de prefill puro do FlashMLA de 8K / 20K / 48K / 112K tokens em TP 1/2/4/8, e um limite arredondado de 64K para o FlashInfer em TP8. O autor observa que nenhum outro PR aberto cobria o suporte a MHA mascarada do GLM-5.
Leia pelo que é: trabalho de base da pilha de serving, não um anúncio. O PR não nomeia GLM 5.5 nem GLM 5.3-Vision — ele diz "GLM-5" — e habilitar um caminho de prefill com MHA mascarada para as dimensões de heads do GLM-5 é trabalho de infraestrutura sobre uma família que o ecossistema vLLM já roda pelo caminho de MLA esparsa (a linhagem do próprio GLM-5.3 é servida lá hoje). Também não é um caso isolado: PRs irmãos neste mês abordaram verificações de dimensões de MLA do FlashInfer para o GLM-5, um fallback de MLA esparsa em Triton para modelos da classe GLM-5 e o suporte de dimensões relatado pelo FlashAttention. Dois detalhes mantêm o PR no radar de rastreadores de vazamentos. Primeiro, a geometria que ele visa — 64 heads, rank KV 512, 256/256 QK/V — é distinta dos 192/128 do DeepSeek, o que é a mesma separação "não é DeepSeek, corresponde ao GLM" traçada pela impressão digital do modelo anônimo, agora visível no nível do kernel de atenção. Segundo, o timing: o PR foi aberto em 25 de agosto, dentro da mesma janela de agosto em que o GLM-5.5 era esperado o mês todo. Nada disso prova que o modelo anônimo seja um GLM de próxima geração — isso também poderia ser engenharia no modelo já lançado —, mas é o tipo de atividade de bastidores que o ecossistema de serving faz antes do lançamento de um modelo, e é verificável de uma forma que nenhum post no X é.
Dois nomes, um fork: GLM 5.3-Vision vs GLM 5.5
As duas identidades candidatas são produtos genuinamente diferentes, e o vazamento não resolve qual delas está na placa.
{{1}}GLM 5.3-Vision seria uma variante com capacidade de visão do modelo lançado em 14 de agosto.{{/1}} {{2}}O GLM-5.3 é apenas de entrada de texto — a Artificial Analysis o lista como texto para texto, sem suporte a imagens — e essa lacuna é a queixa mais forte da comunidade.{{/2}} {{3}}Quando Tang Jie, da Z.ai, conduziu uma campanha global de feedback, os comentários foram essencialmente unânimes a favor da visão, e a Z.ai já tem os blocos de construção (o modelo multimodal GLM-5V-Turbo e o codificador CogVLM) que ainda não foram integrados à linha principal.{{/3}} Uma {{4}}variante 5.3-Vision seria a maneira mais rápida de fechar essa lacuna.{{/4}}
O GLM 5.5 é o próprio carro-chefe. Especificações relatadas, mas não confirmadas, apontam para uma base acima de um trilhão de parâmetros (ante os 743B do GLM-5.3), contexto de 1M de tokens mantido, pesos abertos e um foco mais intenso em agentes/codificação. Todas as notas de analistas deste mês tratam o 5.5 como o grande lançamento — o veículo que o cofundador da Z.ai, Tang Jie, deu a entender que fechará a lacuna em relação aos modelos fechados da classe Fable. É esperado para agosto e ainda não foi lançado até o momento desta redação.
A mesma impressão digital não consegue dizer qual dos dois é — um 5.3 ajustado para visão e um novo carro-chefe poderiam ambos rodar na mesma stack de serviço. Essa ambiguidade é o estado honesto do sinal, e os dois nomes no post do analista a refletem em vez de resolvê-la.
<img src="2.png" alt="Um placar de comparação de duas colunas intitulado 'GLM 5.5 vs GLM-5.3 — o placar'. Coluna esquerda GLM 5.5 (vazado): 'AA Index ~61 (projetado, não verificado)', 'Status: não lançado', 'Tamanho >1T parâmetros (rumor)', 'Visão: esperada', 'Contexto: 1M (esperado)', 'Preço: TBD'. Coluna direita GLM-5.3 (lançado): 'AA Index 60', 'Status: API no ar em 19 de ago', 'Tamanho 743B MoE / 40B ativos', 'Visão: somente texto', 'Contexto: 1M', 'Preço: $1,40 / $4,40'. O rodapé diz 'Os números do GLM 5.5 são projeções não verificadas; GLM-5.3 segundo a Artificial Analysis.'" />

O que um ~61 no Índice de Inteligência AA significaria
A pontuação projetada é a parte mais contundente do vazamento. O Artificial Analysis Intelligence Index (v4.1.1) atualmente coloca o GLM-5.3 em 60 — empatado com o Kimi K3 no topo das pontuações de pesos abertos, e 7 pontos à frente dos 53 do GLM-5.2. Um ponto acima disso, em 61, seria território do GPT-5.6 Sol, com Claude Fable 5 em 62 e Claude Opus 5 em 63. Em termos simples: um modelo da família GLM com pontuação 61 seria a maior pontuação de pesos abertos do índice, isolado acima do Kimi K3 e do GLM-5.3, e efetivamente na linha da fronteira fechada.
Vale a pena enfatizar o que 61 não é. É a expectativa da teortaxesTex sobre o que uma avaliação independente retornará, não uma pontuação publicada da Artificial Analysis e não um número de fornecedor. Uma projeção pode estar errada em qualquer direção — uma variante de visão pode trocar um ou dois pontos no índice com foco em texto, e um carro-chefe >1T pode alcançar resultado mais alto ou mais baixo dependendo de como seu pós-treinamento se desenrola. O valor do número é a afirmação que ele codifica: quem quer que esse modelo anônimo venha a ser, espera-se que supere o atual líder de pesos abertos, em vez de apenas igualá-lo.

O que está confirmado e o que não está
Mantenha o livro-razão limpo, porque uma peça de vazamento vive ou morre por causa disso.
• Confirmado: GLM-5.3 é real, lançado em 14 de agosto, API ativa em 18/19 de agosto, obteve 60 no Índice de Inteligência AA (medido de forma independente pela Artificial Analysis), com preço de $1.40 / $4.40 por 1M de tokens, apenas entrada de texto, com pesos abertos confirmados para sexta-feira, 28 de agosto. Esses fatos não dependem do vazamento.
• Confirmado: o GLM-5.5 ainda não foi lançado. Até o momento desta escrita, não há model card, nem preços, nem disponibilidade; a janela de agosto e o número de parâmetros >1T são relatados por analistas, não compromissos da Z.ai.
• Não confirmado: que o modelo anônimo existe como um produto separado, que é GLM, que seu nome será GLM 5.3-Vision ou 5.5, e que atinge 61 pontos. Todas as quatro afirmações se baseiam em uma postagem não replicada de um único analista.
• Também não confirmado: se este modelo anônimo é sequer distinto do próprio GLM-5.3. Um endpoint GLM-5.3 ativo sob um alias sem rótulo produziria a mesma fingerprint de serviço. Até que um nome, um model card ou uma liberação de pesos resolva isso, a leitura do "novo modelo" é o prior forte, mas não um fato.
O que assistir em seguida
• Sexta-feira, 28 de agosto — os pesos do GLM-5.3. Se o modelo anônimo for na verdade um 5.3 renomeado ou um 5.3-Vision, a divulgação dos pesos e o card do modelo resolverão isso rapidamente.
• Uma segunda observação corroborante. A impressão digital de um analista é uma hipótese; uma segunda leitura independente da mesma entrada anônima, ou uma listagem do Artificial Analysis que a nomeie, eleva-a a evidência.
• Qualquer declaração da Z.ai. O GLM-5.5 foi relatado para a janela de agosto, e o mês está quase no fim. A atribuição de um nome oficial, uma página de preços ou uma entrada no changelog da API é o evento que transforma esse vazamento em uma história de lançamento.
• Se o escore AA se materializa em 61. Se o modelo anônimo é real e da família GLM, um escore de índice independente próximo de 61 seria o primeiro número de pesos abertos a ultrapassar 60.
• Se o trabalho de atenção do vLLM recebe um nome de modelo. O PR #53785 tem como alvo as dimensões de cabeça do "GLM-5" sem nomear 5.3-Vision ou 5.5; um merge, uma entrada de modelos suportados ou um model card que associe essa geometria a um nome específico seria o sinal mais forte até agora.
Como agir diante de um vazamento como este
Um vazamento é uma razão para se preparar, não para trocar de plataforma. Se o próximo modelo da família GLM chegar ao topo ou perto dele no ranking de pesos abertos, a questão prática é se devemos rotear tráfego real para ele — e um modelo não comprovado com alegações do fornecedor e a projeção de um analista é exatamente o caso em que você quer uma rede de segurança em vez de uma aposta. O GLM-5.3, lançado na semana passada, já está ativo no OrcaRouter — a página do modelo o mostra a US$ 1,26 / US$ 3,96 por 1M de tokens, um desconto de lançamento de 10% sobre o preço de tabela do fornecedor de US$ 1,40 / US$ 4,40, repassado sem margem alguma — e a configuração de roteamento é o que um 5.5 ou 5.3-Vision herdaria no dia em que fosse lançado. Direcione uma fatia do tráfego para o novo modelo pelo roteador com failover automático para um modelo comprovado — GLM-5.3, DeepSeek V4 Pro, GPT-5.6 Sol — e você obtém um sinal de qualidade na sua própria carga de trabalho em vez de um slide deck. Se a projeção do vazamento estiver certa, você descobre primeiro; se estiver errada, o failover absorve isso e nada é lançado com defeito. A mesma chave, sem segundo contrato e sem necessidade de escolher entre os dois nomes candidatos até que a Z.ai o faça.
O próximo GLM está chegando — a única pergunta em aberto é qual nome ele usará. GLM 5.3-Vision seria a Z.ai fechando a lacuna mais reclamada do modelo que acabou de lançar; GLM 5.5 seria o carro-chefe de trilhão de parâmetros para o qual o mês inteiro vem apontando. A entrada anônima identificada por teortaxesTex em 20 de agosto é o primeiro objeto concreto que se parece com qualquer um dos dois, e sua projeção de 61 no AA Intelligence Index a colocaria à frente de todos os modelos de pesos abertos atualmente na tabela. Cinco dias após a identificação, a stack de serving também mudou: o trabalho de atenção GLM-5 da vLLM é exatamente o tipo de base que um novo modelo deixa para trás, mesmo sem nomear nenhuma variante. Nada disso está confirmado, e esta página será atualizada no momento em que o nome, a ficha ou os pesos resolverem a questão. Até lá, a jogada de baixo risco é ter o roteamento pronto — não apostar a stack inteira em uma impressão digital.

Comparados neste artigo1
Detectado a partir deste artigo · Benchmarks: Artificial Analysis · atualizado diariamente
