
LongCat-2.5-Preview vs Kimi K3: A questão do recall de contexto longo que ninguém consegue responder ainda
- typesafeNOVOTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 por 1M de tokens · 610 tok/s
- openaiNOVOOpenAI: GPT-6 Luna2026-09-2237Inteligência
- openaiNOVOOpenAI: GPT-6 Sol2026-09-2248Inteligência
- anthropicNOVOAnthropic: Claude Opus 5.52026-09-2258Inteligência
- grokNOVOGrok 4.72026-09-2146Inteligência
- OrcaNOVOOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 por 1M de tokens · 189 tok/s
- orcaNOVOOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 por 1M de tokens · 1306 tok/s
- deepseekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Inteligência
- openaiOpenAI: GPT-6 Astra2026-09-0453Inteligência77Código
- googleGoogle: Gemini 3.8 Flash2026-09-0241Inteligência76Código
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Inteligência76Código
- anthropicAnthropic: Claude Fable 5.12026-09-0153Inteligência82Código
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 por 1M de tokens · 111 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Inteligência72Código
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 por 1M de tokens · 225 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Inteligência75Código
- obsidianQwen3.8 27B2026-08-1534Inteligência68Código
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Inteligência69Código
- grokSpaceXAI: Grok 4.62026-08-1244Inteligência77Código
- metaMeta: Muse Spark 1.22026-08-0540Inteligência72Código
Kimi K3 obtém 88,67 em Long-Context Recall. Esse é o número mais alto entre todos os modelos do nosso catálogo para a questão específica de saber se um modelo ainda usa informações enterradas bem no fundo de uma entrada longa. LongCat-2.5-Preview não tem nenhuma pontuação de Long-Context Recall — nem da Artificial Analysis, nem da Meituan, nem de ninguém. E o LongCat-2.5-Preview é justamente o que anuncia uma janela de um milhão de tokens como sua principal característica. Esse descompasso, um modelo cuja alegação central é o contexto longo e para o qual não existe nenhuma medição de contexto longo, é toda a substância desta comparação. Todo o resto é secundário.
Vale a pena ser preciso sobre o que o número ausente significa e não significa, porque é fácil deslizar de “não medido” para “provavelmente ruim”, e nenhuma das duas direções tem sustentação.
O que cada um dos dois modelos registrou oficialmente
O Kimi K3 da MoonshotAI foi lançado em 15 de julho de 2026. Nosso catálogo o disponibiliza com uma janela de contexto de 1.048.576 tokens, entrada de texto e imagem, e uma tabela de preços de US$ 3,00 por milhão de tokens de entrada, US$ 0,30 por milhão de tokens de entrada em cache e US$ 15,00 por milhão de saída. Seu perfil independente da Artificial Analysis apresenta: Coding Index 76,2, nono; Intelligence Index 43,6, décimo nono; GPQA Diamond 93,5%; Humanity's Last Exam 46,9%; SciCode 59,5%; Terminal-Bench v2.1 85,0; τ²-Bench banking 46,0. E Long-Context Recall 88,67, o melhor do nosso catálogo.

O LongCat-2.5-Preview da Meituan surgiu na LongCat API Platform em 25 de setembro de 2026. Sua entrada no changelog nomeia três capacidades alegadas — compreensão de imagens, programação e compatibilidade com "Claude Code e outros ambientes de desenvolvimento mainstream" —, listando Hermes, OpenClaw, OpenCode e Kilo Code. A página de preços indica US$ 0,30 por milhão de tokens de entrada não cacheados, US$ 0,006 por milhão de tokens de entrada em cache e US$ 1,20 por milhão de tokens de saída, sinalizados como desconto por tempo limitado. Janela de contexto: 1.000.000; saída máxima: 131.072. O número de ~1,6 T de parâmetros totais / ~48 B de parâmetros ativos vem dos metadados do site da Meituan e da cobertura da imprensa especializada chinesa, não da documentação. Nenhuma tabela de benchmark, nenhum cartão de modelo, nenhum relatório técnico, nenhum repositório no HuggingFace ou na organização da Meituan no GitHub, e metadados de catálogo registrando pesos abertos como falso.
Por que o número ausente importa mais aqui do que em qualquer outro confronto
O Recall de Contexto Longo não é apenas mais uma pontuação entre muitas para esses dois modelos. É a pontuação que testa justamente aquilo que ambos vendem. Uma janela de um milhão de tokens é uma declaração sobre capacidade de arquitetura; o recall mede se o modelo ainda consegue recuperar e usar um fato posicionado no token 900.000 em vez do token 900. Os fornecedores publicam a primeira porque ela é uma especificação. Avaliadores independentes publicam o segundo porque ele é um teste, e a maioria dos modelos não se sai tão bem nele quanto o tamanho de sua janela sugere.
Então, a posição honesta é mais estreita do que parece. O 88,67 do Kimi K3 não significa que o Kimi K3 seja um modelo de contexto longo melhor do que o LongCat-2.5-Preview. Significa que o Kimi K3 é o modelo para o qual a pergunta foi feita e respondida. O LongCat-2.5-Preview pode ser melhor. Pode ser substancialmente pior. O ponto é que ninguém fora da Meituan sabe atualmente, e uma janela de 1M impressa numa página de preços não é evidência em nenhuma direção.

O panorama de custos, com o mesmo aviso aritmético
Nas tarifas publicadas, o LongCat-2.5-Preview é 10 vezes mais barato em entrada não cacheada e 12,5 vezes mais barato em saída do que o Kimi K3. Uma leitura de 500.000 tokens que grava 20.000 tokens de volta fica em cerca de US$ 1,80 no Kimi K3 e cerca de 17 centavos no LongCat-2.5-Preview. Ambos são aritmética sobre preços de tabela, e não medições, e o número do LongCat carrega uma ressalva extra que o do Kimi não carrega: a Meituan rotula sua própria tarifa como um desconto por tempo limitado, então o número que sobrevive à promoção é desconhecido.
Coloque isso em contraste com a questão da cobertura. Se você estiver processando uma entrada de 500.000 tokens e o recall do seu modelo nessa profundidade não tiver sido medido, a diferença de custo não é uma economia — é o preço de uma taxa de falha desconhecida. Uma requisição de 17 centavos que deixa passar silenciosamente a seção relevante é mais cara do que uma requisição de US$ 1,80 que a encontra, porque você paga pela reexecução e pela depuração de qualquer maneira. Essa é a forma específica do risco, e é por isso que o benchmark ausente é um problema de custo, e não apenas de marketing.
O que fazer enquanto o número não existe
Gere o seu. Este é o caso raro em que a janela gratuita é genuinamente bem adequada para a lacuna: LongCat-2.5-Preview não custa nada para chamar através do OpenCode por um período de duração não declarada, com uma política de retenção zero que o OpenCode documenta — treinamento de modelo "Não utilizado", retenção de dados "0 dias" — o que significa que você pode apontá-lo para um repositório privado sem antes uma conversa sobre processamento de dados. Crie um teste de agulha no palheiro na profundidade que você realmente usa, execute-o em ambos os modelos, e você terá o número que nenhum dos fornecedores publicou. Duas coisas para verificar antes de confiar no resultado: que seu harness expõe o intercalado conteúdo_de_raciocínio campo que o modelo retorna, e que a entrada de imagem funciona mesmo, já que o changelog da Meituan afirma isso enquanto seu próprio exemplo "Retrieve Model" ainda mostra modalidades_de_entrada como ["texto"] com uma texto->texto string.

A parte do OrcaRouter nisto
Servimos o Kimi K3 pelo preço de tabela da MoonshotAI, com margem zero. O LongCat-2.5-Preview não é uma das nossas rotas — não o servimos, e nada neste texto deve ser interpretado como uma alegação de que o fazemos.
Nesta comparação em particular, a parte útil de um roteador não é o preço. É que o modelo que você está avaliando e o modelo no qual você confia podem ficar atrás da mesma chave. A recall de 88,67 do Kimi K3 faz dele o modelo pelo qual você encaminharia uma passagem de contexto longo hoje; o LongCat-2.5-Preview é o modelo que você quer testar contra ele, porque se a recall dele se mantiver a um doze avos do preço de saída, a economia do trabalho com documentos longos muda. A fusão de modelos é o mecanismo que torna isso concreto em vez de teórico: uma passagem de recuperação de contexto longo e uma etapa final de síntese podem ser dois modelos diferentes em uma única requisição, de modo que o modelo barato não medido e o caro medido não precisam ser uma escolha de um ou outro. O failover automático, então, cobre o caso em que um deles se degrada, o que importa mais do que o normal quando um dos seus dois candidatos não tem histórico de serviço que você possa inspecionar.
O veredito, enunciado com sua própria incerteza atrelada.
Se você precisa que o trabalho com contexto longo seja confiável esta semana, o Kimi K3 é a escolha defensável: recall de 88,67 é o melhor número disponível para a capacidade exata em questão, e seu perfil mais amplo — Codificação 76,2, Inteligência 43,6, GPQA Diamond 93,5% — é sólido, e não espetacular, tudo com fontes independentes. Se você estiver disposto a passar uma tarde gerando sua própria avaliação, o LongCat-2.5-Preview é a aposta mais interessante: uma janela de um milhão de tokens, um teto de saída de 131.072 tokens, acesso com retenção zero e uma tabela de preços uma ordem de grandeza abaixo da do Kimi K3, tudo isso apoiado em alegações do fornecedor que ninguém ainda testou em público.
O que não é defensável é tratá-los como equivalentes só porque ambos listam um milhão de tokens. Um deles tem um número atrelado a essa janela, e o outro tem um preço. Esses são tipos diferentes de evidência, e a lacuna entre eles é a única coisa de que esta comparação realmente trata.
