
LongCat-2.5-Preview vs Grok 4.6: Um tem um cartão de benchmark, o outro tem um sucessor
- typesafeNOVOTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 por 1M de tokens · 610 tok/s
- openaiNOVOOpenAI: GPT-6 Luna2026-09-2237Inteligência
- openaiNOVOOpenAI: GPT-6 Sol2026-09-2248Inteligência
- anthropicNOVOAnthropic: Claude Opus 5.52026-09-2258Inteligência
- grokNOVOGrok 4.72026-09-2146Inteligência
- OrcaNOVOOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 por 1M de tokens · 189 tok/s
- orcaNOVOOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 por 1M de tokens · 1306 tok/s
- deepseekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Inteligência
- openaiOpenAI: GPT-6 Astra2026-09-0453Inteligência77Código
- googleGoogle: Gemini 3.8 Flash2026-09-0241Inteligência76Código
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Inteligência76Código
- anthropicAnthropic: Claude Fable 5.12026-09-0153Inteligência82Código
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 por 1M de tokens · 111 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Inteligência72Código
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 por 1M de tokens · 225 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Inteligência75Código
- obsidianQwen3.8 27B2026-08-1534Inteligência68Código
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Inteligência69Código
- grokSpaceXAI: Grok 4.62026-08-1244Inteligência77Código
- metaMeta: Muse Spark 1.22026-08-0540Inteligência72Código
Comparar LongCat-2.5-Preview com o Grok 4.6 é desconfortável por um motivo que não tem nada a ver com a qualidade de nenhum dos dois modelos: a pergunta tem prazo de validade. O Grok 4.6 foi lançado em 12 de agosto de 2026, e o Grok 4.7 foi lançado em 21 de setembro de 2026 — seis dias antes de isto ser escrito — com as mesmas tarifas de $2,00 / $6,00 por milhão e a mesma janela de contexto de 500.000 tokens. O LongCat-2.5-Preview, por sua vez, chegou à LongCat API Platform da Meituan em 25 de setembro de 2026, sem nenhum sucessor anunciado à vista e sem nenhum benchmark publicado. Portanto, a verdadeira escolha não é "qual modelo é melhor". É se você quer uma capacidade medida com um sucessor medido já logo atrás dela, ou uma não medida que é, ao menos, a coisa atual.
Esse enquadramento é menos empolgante do que um placar e consideravelmente mais útil.
Comece pelo que o Grok 4.6 realmente tem registrado.
Grok 4.6 é um modelo bem documentado. No nosso catálogo, possui uma janela de contexto de 500.000 tokens, entrada de texto, imagem e ficheiro, e uma tabela de preços de $2,00 por milhão de tokens de entrada, $6,00 por milhão de tokens de saída e $0,50 por milhão de tokens de entrada em cache, passando para $4,00 e $12,00 acima de 200.000 tokens de entrada. O seu perfil independente da Artificial Analysis inclui um Coding Index de 76,8 — quinto entre os modelos que esse índice acompanha — um Intelligence Index de 44,3 em décimo oitavo, GPQA Diamond em 94,9%, Humanity's Last Exam em 42,9%, SciCode em 56,5%, Terminal-Bench v2.1 em 88,4 e τ²-Bench para banca em 50,7. A sua Long-Context Recall é de 80,3.

LongCat-2.5-Preview não tem nada disso. A entrada de changelog da Meituan para 25 de setembro de 2026 é um aviso de disponibilidade datado que lista três capacidades alegadas — compreensão de imagens, programação e compatibilidade com "Claude Code e outros ambientes de desenvolvimento mainstream", incluindo Hermes, OpenClaw, OpenCode e Kilo Code — e nada que se assemelhe a um resultado. A página de preços do fornecedor indica US$ 0,30 por milhão de tokens de entrada não armazenados em cache, US$ 0,006 por milhão de tokens de entrada em cache e US$ 1,20 por milhão de tokens de saída, explicitamente marcados como desconto por tempo limitado. A janela de contexto é de 1.000.000 de tokens; a saída máxima é de 131.072. A contagem de aproximadamente 1,6 trilhão de parâmetros no total / 48 bilhões ativos vem dos metadados do site da Meituan e da cobertura da imprensa especializada chinesa, e não da documentação. Não há repositório para ele no HuggingFace nem na organização da Meituan no GitHub, e os metadados do catálogo que o OpenCode distribui registram pesos abertos como false.
A dimensão que um placar ignoraria por completo
Esses dois modelos diferem em algo que nenhum benchmark mede e, para muitas equipes, isso decide a questão por conta própria: o que acontece com os prompts que você envia.
A própria documentação do OpenCode afirma que o LongCat 2.5 Preview Free é fornecido por um provedor que segue uma política de retenção zero e não usa seus dados para treinamento; a tabela de privacidade do Zen quantifica isso — treinamento de modelo "Não usado", retenção de dados "0 dias". A mesma tabela de privacidade lista trinta dias de retenção para o Grok 4.6 e o Grok 4.7. Ambas essas afirmações são do OpenCode, publicadas nas páginas do OpenCode, e descrevem especificamente a listagem gratuita e a listagem de comparação. Mas se você está apontando um agente para um repositório privado, essa é a diferença entre uma conversa que você não precisa ter com o jurídico e uma que precisa — e isso não tem nada a ver com qual modelo pontua melhor no SciCode.

O que "measured" oferece e o que não oferece
Os números do Grok 4.6 são melhores que os do LongCat-2.5-Preview no único sentido que importa aqui: eles existem. Isso não é o mesmo que dizer que o Grok 4.6 é o melhor modelo. Seu Índice de Programação de 76,8 está abaixo da geração do Grok 4.7, e o modelo com o qual foi medido não é mais a fronteira de sua própria família. Seu sucessor publicado tem um Índice de Inteligência de 46,4 contra os 44,3 do Grok 4.6, e um Recall de Contexto Longo de 76,67 contra os 80,33 do Grok 4.6 — portanto, o sucessor não é melhor em todos os eixos, que é exatamente o tipo de detalhe que um número de geração esconde.
Há também uma ressalva sobre o serving em tempo real que vale a pena declarar sem rodeios, porque ela contraria a leitura lisonjeira para ambos os modelos. Na nossa própria amostra de playground de sete dias, o Grok 4.6 não registrou throughput medido nem tráfego de tokens, o que é o que a ausência de dados parece naquela coluna, e não um veredito de desempenho. O LongCat-2.5-Preview não tem nenhuma amostra de serving nossa, porque não o roteamos. Portanto, qualquer comparação de latência entre os dois é unilateral de uma forma que a prosa costuma encobrir: você não pode fazer benchmark de um modelo para o qual não está enviando tráfego.
Onde a camada de roteamento realmente ajuda aqui
Três dos fatos acima são do tipo para o qual um roteador foi construído, e não apenas compatível com ele. A tabela de preços do Grok 4.6 aumenta acima de 200.000 tokens de entrada, de modo que a mesma tarefa lógica pode ser cobrada a duas tarifas diferentes, dependendo de um número que sua aplicação já conhece antes de enviar qualquer coisa. O Grok 4.6 tem um sucessor publicado com tarifas idênticas, o que significa que a troca de um para o outro deve ser uma alteração de uma linha e nunca uma reintegração. E a propriedade mais atraente do LongCat-2.5-Preview — seu preço — é explicitamente rotulada como temporária pelo fornecedor.
Na OrcaRouter servimos o Grok 4.6 pelo preço de tabela da xAI, com zero margem, de modo que uma mudança de tarifa do fornecedor chega à sua fatura no mesmo dia, e não na próxima renovação, e o failover automático transfere uma requisição degradada para um provedor saudável sem que seu código saiba qual deles respondeu. Uma DSL de roteamento cobre diretamente o caso de preços por faixas, e a fusão de modelos cobre o caso em que o modelo que você quer para a leitura longa não é o modelo que você quer para a síntese final. O LongCat-2.5-Preview não é uma das nossas rotas — não o servimos, e nada aqui afirma o contrário. O objetivo de nomeá-lo não é encaminhar você para outro lugar; é que um modelo que você está avaliando, em vez de executando, fique atrás da mesma chave que os modelos que você executa, para que avaliá-lo custe uma entrada de configuração em vez de um projeto.

Como decidir
• Escolha o Grok 4.6 se você precisar de uma resposta que possa defender. Ele tem um card independente, um perfil de entrada documentado e um preço que não expira. Seu principal risco não é a qualidade, mas a relevância: o Grok 4.7 existe com as mesmas tarifas, e o custo de permanecer no 4.6 por inércia é a diferença entre um Intelligence Index de 44,3 e 46,4 que você não precisava pagar.
• Escolha o LongCat-2.5-Preview se o fator decisivo for retenção ou alcance. Acesso com retenção zero por meio do OpenCode, uma janela de um milhão de tokens, um teto de saída de 131.072 tokens e uma tabela de preços de aproximadamente um sétimo da do Grok 4.6 são vantagens reais — a primeira delas verificada pela política de privacidade de um terceiro, as demais afirmadas apenas pelo fornecedor.
• Não escolha entre eles com base em uma tabela de benchmark, porque só existe uma. A pontuação de 76,8 do Grok 4.6 em codificação e o recall de 80,3 em contexto longo descrevem o Grok 4.6. Nada descreve o LongCat-2.5-Preview ainda. Quem publicar uma pontuação do LongCat-2.5-Preview ao lado de uma pontuação do Grok 4.6 esta semana está ou citando um modelo LongCat diferente ou inventando o número.
• Verifique o lado da entrada antes de construir sobre ele. O changelog da Meituan começa com compreensão de imagens, mas a resposta de exemplo em sua própria documentação de "Retrieve Model" ainda mostra input_modalities como ["text"] com uma text->text string de modalidade — alegado pelo fornecedor contra um contrato publicado que diz o contrário. O Grok 4.6 aceita texto, imagens e arquivos sem essa ambiguidade. E verifique se seu harness expõe um campo reasoning_content intercalado antes de concluir qualquer coisa sobre a qualidade de raciocínio do LongCat-2.5-Preview; um cliente que descarta esse campo falhará silenciosamente.
Comparados neste artigo1
Detectado a partir deste artigo · Benchmarks: Artificial Analysis · atualizado diariamente
