Um cartão de título hero gerado com o texto 'LongCat-2.5-Preview vs Grok 4.6', com a sobrelinha 'Um tem um cartão de benchmark, o outro tem um sucessor', e dois painéis: 'LongCat-2.5-Preview: contexto de 1M, retenção zero via OpenCode' e 'Grok 4.6: AA Coding 76.8, Grok 4.7 já foi lançado'. Logotipo da OrcaRouter no canto inferior direito.
Guides & Insights

LongCat-2.5-Preview vs Grok 4.6: Um tem um cartão de benchmark, o outro tem um sucessor

Autor

Gideon Frost

Data de publicação

Modelos mais recentes · 20Ver todos os modelos →
Benchmarks: Artificial Analysis · atualizado diariamente
Voltar para todas as publicações

Comparar LongCat-2.5-Preview com o Grok 4.6 é desconfortável por um motivo que não tem nada a ver com a qualidade de nenhum dos dois modelos: a pergunta tem prazo de validade. O Grok 4.6 foi lançado em 12 de agosto de 2026, e o Grok 4.7 foi lançado em 21 de setembro de 2026 — seis dias antes de isto ser escrito — com as mesmas tarifas de $2,00 / $6,00 por milhão e a mesma janela de contexto de 500.000 tokens. O LongCat-2.5-Preview, por sua vez, chegou à LongCat API Platform da Meituan em 25 de setembro de 2026, sem nenhum sucessor anunciado à vista e sem nenhum benchmark publicado. Portanto, a verdadeira escolha não é "qual modelo é melhor". É se você quer uma capacidade medida com um sucessor medido já logo atrás dela, ou uma não medida que é, ao menos, a coisa atual.

Esse enquadramento é menos empolgante do que um placar e consideravelmente mais útil.

Comece pelo que o Grok 4.6 realmente tem registrado.

Grok 4.6 é um modelo bem documentado. No nosso catálogo, possui uma janela de contexto de 500.000 tokens, entrada de texto, imagem e ficheiro, e uma tabela de preços de $2,00 por milhão de tokens de entrada, $6,00 por milhão de tokens de saída e $0,50 por milhão de tokens de entrada em cache, passando para $4,00 e $12,00 acima de 200.000 tokens de entrada. O seu perfil independente da Artificial Analysis inclui um Coding Index de 76,8 — quinto entre os modelos que esse índice acompanha — um Intelligence Index de 44,3 em décimo oitavo, GPQA Diamond em 94,9%, Humanity's Last Exam em 42,9%, SciCode em 56,5%, Terminal-Bench v2.1 em 88,4 e τ²-Bench para banca em 50,7. A sua Long-Context Recall é de 80,3.

A screenshot of Meituan's LongCat API Platform change-log page, headlined 'Version: 2026-09-25 - LongCat-2.5-Preview Now Available', listing the model's three stated features - multimodal image understanding, coding capability, and compatibility with Claude Code, Hermes, OpenClaw, OpenCode and Kilo Code - with the platform's Guide, API, Tools and Pricing navigation and its column of earlier dated releases visible.

LongCat-2.5-Preview não tem nada disso. A entrada de changelog da Meituan para 25 de setembro de 2026 é um aviso de disponibilidade datado que lista três capacidades alegadas — compreensão de imagens, programação e compatibilidade com "Claude Code e outros ambientes de desenvolvimento mainstream", incluindo Hermes, OpenClaw, OpenCode e Kilo Code — e nada que se assemelhe a um resultado. A página de preços do fornecedor indica US$ 0,30 por milhão de tokens de entrada não armazenados em cache, US$ 0,006 por milhão de tokens de entrada em cache e US$ 1,20 por milhão de tokens de saída, explicitamente marcados como desconto por tempo limitado. A janela de contexto é de 1.000.000 de tokens; a saída máxima é de 131.072. A contagem de aproximadamente 1,6 trilhão de parâmetros no total / 48 bilhões ativos vem dos metadados do site da Meituan e da cobertura da imprensa especializada chinesa, e não da documentação. Não há repositório para ele no HuggingFace nem na organização da Meituan no GitHub, e os metadados do catálogo que o OpenCode distribui registram pesos abertos como false.

A dimensão que um placar ignoraria por completo

Esses dois modelos diferem em algo que nenhum benchmark mede e, para muitas equipes, isso decide a questão por conta própria: o que acontece com os prompts que você envia.

A própria documentação do OpenCode afirma que o LongCat 2.5 Preview Free é fornecido por um provedor que segue uma política de retenção zero e não usa seus dados para treinamento; a tabela de privacidade do Zen quantifica isso — treinamento de modelo "Não usado", retenção de dados "0 dias". A mesma tabela de privacidade lista trinta dias de retenção para o Grok 4.6 e o Grok 4.7. Ambas essas afirmações são do OpenCode, publicadas nas páginas do OpenCode, e descrevem especificamente a listagem gratuita e a listagem de comparação. Mas se você está apontando um agente para um repositório privado, essa é a diferença entre uma conversa que você não precisa ter com o jurídico e uma que precisa — e isso não tem nada a ver com qual modelo pontua melhor no SciCode.

A screenshot of OrcaRouter's own model page for xAI Grok 4.6 at /models/grok/grok-4.6, showing the grok/grok-4.6 identifier, a 500K-token context window, text + image + file input and text output, Vision, Tools, JSON and Reasoning capability chips, a release date of 2026-08-12, $2.00 and $6.00 rate tiles, and a performance strip whose first-token and token-traffic tiles both read 'Collecting' rather than a figure. The page copy describes Grok 4.6 as the current flagship of the Grok line and cites a headline GPQA Diamond score of 94.9.

O que "measured" oferece e o que não oferece

Os números do Grok 4.6 são melhores que os do LongCat-2.5-Preview no único sentido que importa aqui: eles existem. Isso não é o mesmo que dizer que o Grok 4.6 é o melhor modelo. Seu Índice de Programação de 76,8 está abaixo da geração do Grok 4.7, e o modelo com o qual foi medido não é mais a fronteira de sua própria família. Seu sucessor publicado tem um Índice de Inteligência de 46,4 contra os 44,3 do Grok 4.6, e um Recall de Contexto Longo de 76,67 contra os 80,33 do Grok 4.6 — portanto, o sucessor não é melhor em todos os eixos, que é exatamente o tipo de detalhe que um número de geração esconde.

Há também uma ressalva sobre o serving em tempo real que vale a pena declarar sem rodeios, porque ela contraria a leitura lisonjeira para ambos os modelos. Na nossa própria amostra de playground de sete dias, o Grok 4.6 não registrou throughput medido nem tráfego de tokens, o que é o que a ausência de dados parece naquela coluna, e não um veredito de desempenho. O LongCat-2.5-Preview não tem nenhuma amostra de serving nossa, porque não o roteamos. Portanto, qualquer comparação de latência entre os dois é unilateral de uma forma que a prosa costuma encobrir: você não pode fazer benchmark de um modelo para o qual não está enviando tráfego.

Onde a camada de roteamento realmente ajuda aqui

Três dos fatos acima são do tipo para o qual um roteador foi construído, e não apenas compatível com ele. A tabela de preços do Grok 4.6 aumenta acima de 200.000 tokens de entrada, de modo que a mesma tarefa lógica pode ser cobrada a duas tarifas diferentes, dependendo de um número que sua aplicação já conhece antes de enviar qualquer coisa. O Grok 4.6 tem um sucessor publicado com tarifas idênticas, o que significa que a troca de um para o outro deve ser uma alteração de uma linha e nunca uma reintegração. E a propriedade mais atraente do LongCat-2.5-Preview — seu preço — é explicitamente rotulada como temporária pelo fornecedor.

Na OrcaRouter servimos o Grok 4.6 pelo preço de tabela da xAI, com zero margem, de modo que uma mudança de tarifa do fornecedor chega à sua fatura no mesmo dia, e não na próxima renovação, e o failover automático transfere uma requisição degradada para um provedor saudável sem que seu código saiba qual deles respondeu. Uma DSL de roteamento cobre diretamente o caso de preços por faixas, e a fusão de modelos cobre o caso em que o modelo que você quer para a leitura longa não é o modelo que você quer para a síntese final. O LongCat-2.5-Preview não é uma das nossas rotas — não o servimos, e nada aqui afirma o contrário. O objetivo de nomeá-lo não é encaminhar você para outro lugar; é que um modelo que você está avaliando, em vez de executando, fique atrás da mesma chave que os modelos que você executa, para que avaliá-lo custe uma entrada de configuração em vez de um projeto.

A generated two-column scoreboard titled 'LongCat-2.5-Preview vs Grok 4.6' with the subhead 'One model has a measured card and a measured successor; the other has a rate card'. Left column 'LongCat-2.5-Preview' (Meituan, listed 2026-09-25, no benchmark published): 1,000,000-token context, 131,072 max output, text with image input claimed not confirmed, $0.30 uncached / $0.006 cached input, $1.20 output flagged limited-time, coding index not published, long-context recall not published, data retention 0 days on the free listing per OpenCode. Right column 'Grok 4.6' (xAI, released 2026-08-12, successor shipped 2026-09-21): 500,000-token context, max output not published, text, image and file to text, $2.00 input up to 200K then $4.00, $6.00 output up to 200K then $12.00, coding index 76.8 at rank 5 by Artificial Analysis, long-context recall 80.33, data retention 30 days on the comparison listing per OpenCode. Footnote credits the left column to Meituan's changelog and pricing page and the right column to OrcaRouter's catalogue with index figures sourced to Artificial Analysis, and notes that LongCat-2.5-Preview is not routed by OrcaRouter. OrcaRouter logo bottom-right.

Como decidir

• Escolha o Grok 4.6 se você precisar de uma resposta que possa defender. Ele tem um card independente, um perfil de entrada documentado e um preço que não expira. Seu principal risco não é a qualidade, mas a relevância: o Grok 4.7 existe com as mesmas tarifas, e o custo de permanecer no 4.6 por inércia é a diferença entre um Intelligence Index de 44,3 e 46,4 que você não precisava pagar.

• Escolha o LongCat-2.5-Preview se o fator decisivo for retenção ou alcance. Acesso com retenção zero por meio do OpenCode, uma janela de um milhão de tokens, um teto de saída de 131.072 tokens e uma tabela de preços de aproximadamente um sétimo da do Grok 4.6 são vantagens reais — a primeira delas verificada pela política de privacidade de um terceiro, as demais afirmadas apenas pelo fornecedor.

• Não escolha entre eles com base em uma tabela de benchmark, porque só existe uma. A pontuação de 76,8 do Grok 4.6 em codificação e o recall de 80,3 em contexto longo descrevem o Grok 4.6. Nada descreve o LongCat-2.5-Preview ainda. Quem publicar uma pontuação do LongCat-2.5-Preview ao lado de uma pontuação do Grok 4.6 esta semana está ou citando um modelo LongCat diferente ou inventando o número.

• Verifique o lado da entrada antes de construir sobre ele. O changelog da Meituan começa com compreensão de imagens, mas a resposta de exemplo em sua própria documentação de "Retrieve Model" ainda mostra input_modalities como ["text"] com uma text->text string de modalidade — alegado pelo fornecedor contra um contrato publicado que diz o contrário. O Grok 4.6 aceita texto, imagens e arquivos sem essa ambiguidade. E verifique se seu harness expõe um campo reasoning_content intercalado antes de concluir qualquer coisa sobre a qualidade de raciocínio do LongCat-2.5-Preview; um cliente que descarta esse campo falhará silenciosamente.

Comparados neste artigo1

Detectado a partir deste artigo · Benchmarks: Artificial Analysis · atualizado diariamente