
LongCat-2.5-Preview vs GLM-5.2: Duas janelas de 1M de tokens, uma delas medida
- typesafeNOVOTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 por 1M de tokens · 610 tok/s
- openaiNOVOOpenAI: GPT-6 Luna2026-09-2237Inteligência
- openaiNOVOOpenAI: GPT-6 Sol2026-09-2248Inteligência
- anthropicNOVOAnthropic: Claude Opus 5.52026-09-2258Inteligência
- grokNOVOGrok 4.72026-09-2146Inteligência
- OrcaNOVOOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 por 1M de tokens · 189 tok/s
- orcaNOVOOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 por 1M de tokens · 1306 tok/s
- deepseekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Inteligência
- openaiOpenAI: GPT-6 Astra2026-09-0453Inteligência77Código
- googleGoogle: Gemini 3.8 Flash2026-09-0241Inteligência76Código
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Inteligência76Código
- anthropicAnthropic: Claude Fable 5.12026-09-0153Inteligência82Código
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 por 1M de tokens · 111 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Inteligência72Código
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 por 1M de tokens · 225 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Inteligência75Código
- obsidianQwen3.8 27B2026-08-1534Inteligência68Código
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Inteligência69Código
- grokSpaceXAI: Grok 4.62026-08-1244Inteligência77Código
- metaMeta: Muse Spark 1.22026-08-0540Inteligência72Código
LongCat-2.5-Preview e GLM-5.2 carregam o mesmo número de destaque: uma janela de contexto de um milhão de tokens. Essa única coincidência está fazendo todo o trabalho na maioria das comparações escritas esta semana, e não é o suficiente para comparar dois modelos. O GLM-5.2 está oficialmente registrado desde 16 de junho de 2026, com um perfil de benchmark público, uma tabela de preços publicada e uma pontuação de recall de contexto longo de um avaliador independente. O LongCat-2.5-Preview apareceu na Plataforma de API LongCat da Meituan em 25 de setembro de 2026, com uma tabela de preços com desconto, uma contagem de parâmetros noticiada pela imprensa especializada chinesa e nenhum benchmark publicado de qualquer tipo. Uma janela é medida. A outra é afirmada. Tudo o que vem abaixo mantém essas duas categorias separadas, porque uma ficha técnica e um resultado de teste não são o mesmo tipo de fato.
Esta é a versão honesta do confronto, e é mais útil do que a lisonjeira.
O que cada lado realmente publicou
O changelog da Meituan traz uma entrada datada — "Versão: 2026-09-25, LongCat-2.5-Preview Now Available" — listando três capacidades alegadas: compreensão de imagens, programação e compatibilidade com "Claude Code e outros ambientes de desenvolvimento mainstream", citando Hermes, OpenClaw, OpenCode e Kilo Code. A página de preços do fornecedor informa uma tarifa de pagamento conforme o uso de US$ 0,30 por milhão de tokens de entrada não armazenados em cache, US$ 0,006 por milhão de tokens de entrada em cache e US$ 1,20 por milhão de tokens de saída, marcada na própria página como um desconto por tempo limitado. A janela de contexto é de um milhão de tokens e a saída máxima é de 131.072. Aproximadamente 1,6 trilhão de parâmetros totais com cerca de 48 bilhões ativos por token, em uma base de mistura de especialistas, vêm dos metadados do próprio site da Meituan e da cobertura da imprensa especializada chinesa sobre o anúncio — não da documentação da API. Nenhum relatório técnico, nenhum model card e nenhuma tabela de benchmark acompanharam qualquer parte disso. Não existe repositório do LongCat-2.5-Preview no HuggingFace nem repositório com esse nome na organização da Meituan no GitHub; os metadados do catálogo de modelos que acompanham o OpenCode registram pesos abertos como false.

O GLM-5.2 da Z.ai encontra-se na posição oposta. É um lançamento de junho com uma tabela de preços que aplicamos ao preço de tabela: $1,40 por milhão de tokens de entrada, $0,26 por milhão de tokens de entrada em cache e $4,40 por milhão de tokens de saída no nosso catálogo, com uma janela de contexto de 1 000 000 de tokens e 128 000 tokens de saída máxima. As suas pontuações publicadas vêm de dois locais diferentes, e a distinção é importante: os números da própria Z.ai para o AIME 2026, o HMMT de fevereiro de 2026, o GPQA-Diamond e a suite FrontierSWE são reportados pelo fornecedor; os valores do Coding Index e do Intelligence Index que o nosso catálogo apresenta são provenientes da Artificial Analysis, que realiza as suas próprias avaliações.
A única dimensão em que eles são genuinamente iguais
Ambos os modelos alegam exatamente 1.000.000 de tokens de contexto. Apenas um deles tem uma pontuação publicada que testa se um modelo ainda consegue usar o que está lá dentro. A Artificial Analysis registra um valor de Long-Context Recall de 78,33 para o GLM-5.2. O LongCat-2.5-Preview não tem um número equivalente, de nenhuma fonte. Essa assimetria é o confronto inteiro em uma linha: uma janela de um milhão de tokens é uma afirmação sobre a capacidade da arquitetura, não sobre se o modelo recupera corretamente no token 900.000. Capacidade é barata de imprimir e cara de verificar, e é por isso que todo fornecedor a imprime e quase nenhum deles publica o teste de recall.
Portanto, se é para trabalho com contexto longo que você está escolhendo entre esses dois, você está escolhendo entre uma opção com uma pontuação de recall publicada e uma sem — e a que não tem também é a que tem o perfil de benchmark não medido. Isso não é um argumento contra ela. É um argumento contra tratar as duas como intercambiáveis com base em um número inteiro coincidente.

Como é a diferença de preço em um trabalho real
As tabelas de preços não estão próximas, e a direção não é a que as pessoas esperam de um desafiante chinês de pesos abertos contra um laboratório de fronteira ocidental. O LongCat-2.5-Preview é cerca de 4,7 vezes mais barato na entrada não cacheada e 3,7 vezes mais barato na saída do que o GLM-5.2 — uma razão que é aritmética nas duas tabelas publicadas, não uma medição. Em uma passagem de processamento de documento de 500.000 tokens que grava 20.000 tokens de volta, isso dá cerca de 17 centavos contra cerca de 79 centavos. Ambos os modelos precisam ler o mesmo documento. Apenas um deles tem uma pontuação publicada sobre se ainda estará prestando atenção no final dele.
Há uma segunda ressalva que precisa ser dita no mesmo fôlego: a Meituan classifica sua própria tabela de preços como um desconto por tempo limitado. O valor de US$ 0,30 é o número promocional, e o fornecedor não diz o que vem depois dele. Um modelo de custo baseado em um preço promocional tem uma data de validade que você não consegue ler. Isso é um motivo para manter barata a migração entre fornecedores, e não um motivo para evitar o modelo.
No OrcaRouter, as rotas que servimos ficam atrás de uma única chave ao preço de tabela do fornecedor, com margem zero, portanto uma alteração de preço de um fornecedor chega à sua fatura no mesmo dia, em vez de só na próxima renovação, e o failover automático move um pedido degradado para um fornecedor saudável sem que a sua aplicação saiba. O GLM-5.2 é uma das nossas rotas. O LongCat-2.5-Preview não é — não o servimos, e nada aqui deve ser interpretado como alegando o contrário. A Z.ai também avançou desde junho: o GLM-5.3 está ativo no nosso catálogo desde 18 de agosto de 2026, pelo que uma comparação enquadrada como "modelo novo versus modelo atual" já está a enquadrar o GLM-5.2 como o incumbente, em vez da fronteira.

O que resolveria isto, e o que não resolverá
• Uma pontuação de Recall de Contexto Longo para o LongCat-2.5-Preview, da Meituan ou de um avaliador independente. Até que isso exista, sua janela de 1M é uma alegação sem teste associado, e o 78,33 do GLM-5.2 é o único número na comparação que responde à mesma pergunta.
• Uma tabela de tarifas de fornecedor sem o sinalizador de tempo limitado. O preço com desconto diz quanto o modelo custa durante uma promoção, não quanto ele custa.
• Uma tabela de benchmark de qualquer tipo. Não uma posição em ranking — apenas uma execução de avaliação publicada, para que a comparação deixe de ser uma ficha técnica contra uma página de resultados.
• Uma confirmação de entrada de imagem. O changelog apresenta a compreensão de imagens como uma adição de destaque, mas a resposta de exemplo na própria documentação "Retrieve Model" da Meituan ainda mostra input_modalities como ["text"] com uma text->text string de modalidade. Essa amostra pode simplesmente estar desatualizada. Ainda assim, é o contrato publicado pelo fornecedor, então trate a entrada de imagem como alegada, e não como disponível. O GLM-5.2, em contrapartida, é texto-entrada e texto-saída no nosso catálogo, sem nenhuma modalidade de imagem — portanto, nessa dimensão, nenhum dos modelos oferece uma resposta verificada, e um deles oferece uma alegação.
• Seus próprios números. A lacuna entre o que é publicado e o que você precisa é fechada executando ambos os modelos nas suas tarefas, e a janela gratuita no LongCat-2.5-Preview torna isso barato agora. Um traço de raciocínio que chega em um campo reasoning_content intercalado é o detalhe do harness a ser verificado primeiro, porque ferramentas que o descartam silenciosamente perderão a maior parte da utilidade do modelo sem gerar erro.
Onde isso deixa a comparação
Se você precisa de uma decisão hoje e ela envolve contexto longo, o GLM-5.2 é aquele que você pode de fato avaliar: ele tem recall publicado, uma pontuação independente de programação de 68,8 e um Índice de Inteligência de 33,7 da Artificial Analysis, além de um preço com o qual você pode planejar seu orçamento. Esses números descrevem um modelo competente, e não de fronteira — o próprio sucessor da Z.ai, o GLM-5.3, supera sua pontuação —, mas descrevem alguma coisa. O LongCat-2.5-Preview é uma proposta mais barata, com contexto maior e totalmente não mensurada, cuja qualidade mais atraente, o preço, é explicitamente temporária. A postura correta em relação a ele não é o ceticismo. É uma avaliação de duas semanas com seu próprio harness de pontuação acoplado, feita antes que a tarifa promocional desapareça.
Comparados neste artigo1
Detectado a partir deste artigo · Benchmarks: Artificial Analysis · atualizado diariamente
