Um cartão de título hero gerado com o texto 'LongCat-2.5-Preview vs Kimi K3' e o overline 'A questão do recall de contexto longo', além de dois painéis: 'LongCat-2.5-Preview: contexto de 1M, pontuação de recall não publicada' e 'Kimi K3: AA Long-Context Recall 88.67, o mais alto que disponibilizamos'. Logotipo OrcaRouter no canto inferior direito.
Engineering & Research

LongCat-2.5-Preview vs Kimi K3: A questão do recall de contexto longo que ninguém consegue responder ainda

Autor

Rowan Sterling

Data de publicação

Modelos mais recentes · 20Ver todos os modelos →
Benchmarks: Artificial Analysis · atualizado diariamente
Voltar para todas as publicações

Kimi K3 obtém 88,67 em Long-Context Recall. Esse é o número mais alto entre todos os modelos do nosso catálogo para a questão específica de saber se um modelo ainda usa informações enterradas bem no fundo de uma entrada longa. LongCat-2.5-Preview não tem nenhuma pontuação de Long-Context Recall — nem da Artificial Analysis, nem da Meituan, nem de ninguém. E o LongCat-2.5-Preview é justamente o que anuncia uma janela de um milhão de tokens como sua principal característica. Esse descompasso, um modelo cuja alegação central é o contexto longo e para o qual não existe nenhuma medição de contexto longo, é toda a substância desta comparação. Todo o resto é secundário.

Vale a pena ser preciso sobre o que o número ausente significa e não significa, porque é fácil deslizar de “não medido” para “provavelmente ruim”, e nenhuma das duas direções tem sustentação.

O que cada um dos dois modelos registrou oficialmente

O Kimi K3 da MoonshotAI foi lançado em 15 de julho de 2026. Nosso catálogo o disponibiliza com uma janela de contexto de 1.048.576 tokens, entrada de texto e imagem, e uma tabela de preços de US$ 3,00 por milhão de tokens de entrada, US$ 0,30 por milhão de tokens de entrada em cache e US$ 15,00 por milhão de saída. Seu perfil independente da Artificial Analysis apresenta: Coding Index 76,2, nono; Intelligence Index 43,6, décimo nono; GPQA Diamond 93,5%; Humanity's Last Exam 46,9%; SciCode 59,5%; Terminal-Bench v2.1 85,0; τ²-Bench banking 46,0. E Long-Context Recall 88,67, o melhor do nosso catálogo.

A screenshot of Meituan's LongCat API Platform change-log page, headlined 'Version: 2026-09-25 - LongCat-2.5-Preview Now Available', listing the model's three stated features - multimodal image understanding, coding capability, and compatibility with Claude Code, Hermes, OpenClaw, OpenCode and Kilo Code - with the platform's Guide, API, Tools and Pricing navigation and its column of earlier dated releases visible.

O LongCat-2.5-Preview da Meituan surgiu na LongCat API Platform em 25 de setembro de 2026. Sua entrada no changelog nomeia três capacidades alegadas — compreensão de imagens, programação e compatibilidade com "Claude Code e outros ambientes de desenvolvimento mainstream" —, listando Hermes, OpenClaw, OpenCode e Kilo Code. A página de preços indica US$ 0,30 por milhão de tokens de entrada não cacheados, US$ 0,006 por milhão de tokens de entrada em cache e US$ 1,20 por milhão de tokens de saída, sinalizados como desconto por tempo limitado. Janela de contexto: 1.000.000; saída máxima: 131.072. O número de ~1,6 T de parâmetros totais / ~48 B de parâmetros ativos vem dos metadados do site da Meituan e da cobertura da imprensa especializada chinesa, não da documentação. Nenhuma tabela de benchmark, nenhum cartão de modelo, nenhum relatório técnico, nenhum repositório no HuggingFace ou na organização da Meituan no GitHub, e metadados de catálogo registrando pesos abertos como falso.

Por que o número ausente importa mais aqui do que em qualquer outro confronto

O Recall de Contexto Longo não é apenas mais uma pontuação entre muitas para esses dois modelos. É a pontuação que testa justamente aquilo que ambos vendem. Uma janela de um milhão de tokens é uma declaração sobre capacidade de arquitetura; o recall mede se o modelo ainda consegue recuperar e usar um fato posicionado no token 900.000 em vez do token 900. Os fornecedores publicam a primeira porque ela é uma especificação. Avaliadores independentes publicam o segundo porque ele é um teste, e a maioria dos modelos não se sai tão bem nele quanto o tamanho de sua janela sugere.

Então, a posição honesta é mais estreita do que parece. O 88,67 do Kimi K3 não significa que o Kimi K3 seja um modelo de contexto longo melhor do que o LongCat-2.5-Preview. Significa que o Kimi K3 é o modelo para o qual a pergunta foi feita e respondida. O LongCat-2.5-Preview pode ser melhor. Pode ser substancialmente pior. O ponto é que ninguém fora da Meituan sabe atualmente, e uma janela de 1M impressa numa página de preços não é evidência em nenhuma direção.

A screenshot of OrcaRouter's own model page for MoonshotAI Kimi K3 at /models/kimi/kimi-k3, showing the kimi/kimi-k3 identifier, a 1M-token context window, text + image input and text output, Vision, Tools, JSON and Reasoning capability chips, a release date of 2026-07-15, a p50 first-token figure of 8.24 s, $3.00 and $15.00 rate tiles, and the OpenAI-compatible code samples.

O panorama de custos, com o mesmo aviso aritmético

Nas tarifas publicadas, o LongCat-2.5-Preview é 10 vezes mais barato em entrada não cacheada e 12,5 vezes mais barato em saída do que o Kimi K3. Uma leitura de 500.000 tokens que grava 20.000 tokens de volta fica em cerca de US$ 1,80 no Kimi K3 e cerca de 17 centavos no LongCat-2.5-Preview. Ambos são aritmética sobre preços de tabela, e não medições, e o número do LongCat carrega uma ressalva extra que o do Kimi não carrega: a Meituan rotula sua própria tarifa como um desconto por tempo limitado, então o número que sobrevive à promoção é desconhecido.

Coloque isso em contraste com a questão da cobertura. Se você estiver processando uma entrada de 500.000 tokens e o recall do seu modelo nessa profundidade não tiver sido medido, a diferença de custo não é uma economia — é o preço de uma taxa de falha desconhecida. Uma requisição de 17 centavos que deixa passar silenciosamente a seção relevante é mais cara do que uma requisição de US$ 1,80 que a encontra, porque você paga pela reexecução e pela depuração de qualquer maneira. Essa é a forma específica do risco, e é por isso que o benchmark ausente é um problema de custo, e não apenas de marketing.

O que fazer enquanto o número não existe

Gere o seu. Este é o caso raro em que a janela gratuita é genuinamente bem adequada para a lacuna: LongCat-2.5-Preview não custa nada para chamar através do OpenCode por um período de duração não declarada, com uma política de retenção zero que o OpenCode documenta — treinamento de modelo "Não utilizado", retenção de dados "0 dias" — o que significa que você pode apontá-lo para um repositório privado sem antes uma conversa sobre processamento de dados. Crie um teste de agulha no palheiro na profundidade que você realmente usa, execute-o em ambos os modelos, e você terá o número que nenhum dos fornecedores publicou. Duas coisas para verificar antes de confiar no resultado: que seu harness expõe o intercalado conteúdo_de_raciocínio campo que o modelo retorna, e que a entrada de imagem funciona mesmo, já que o changelog da Meituan afirma isso enquanto seu próprio exemplo "Retrieve Model" ainda mostra modalidades_de_entrada como ["texto"] com uma texto->texto string.

A generated two-column scoreboard titled 'LongCat-2.5-Preview vs Kimi K3' with the subhead 'The one model advertising a long window is the one with no recall score'. Left column 'LongCat-2.5-Preview' (Meituan, listed 2026-09-25, no benchmark published): 1,000,000-token context, 131,072 max output, text with image input claimed not confirmed, $0.30 uncached / $0.006 cached input, $1.20 output flagged limited-time, long-context recall not published by anyone, coding index not published, no repo and catalogue open_weights false. Right column 'Kimi K3' (MoonshotAI, released 2026-07-15, independently scored): 1,048,576-token context, max output not published, text and image to text, $3.00 uncached / $0.30 cached input, $15.00 output, long-context recall 88.67 described as the highest we carry, coding index 76.2 at rank 9 and intelligence index 43.6 at rank 19 by Artificial Analysis. The footnote adds that a 500,000-token read writing 20,000 tokens back is roughly $1.80 on Kimi K3 against roughly 17 cents on LongCat-2.5-Preview at its published promotional rate. Footnote credits the left column to Meituan's changelog and pricing page and the right column to OrcaRouter's catalogue with index figures sourced to Artificial Analysis, and notes that LongCat-2.5-Preview is not routed by OrcaRouter. OrcaRouter logo bottom-right.

A parte do OrcaRouter nisto

Servimos o Kimi K3 pelo preço de tabela da MoonshotAI, com margem zero. O LongCat-2.5-Preview não é uma das nossas rotas — não o servimos, e nada neste texto deve ser interpretado como uma alegação de que o fazemos.

Nesta comparação em particular, a parte útil de um roteador não é o preço. É que o modelo que você está avaliando e o modelo no qual você confia podem ficar atrás da mesma chave. A recall de 88,67 do Kimi K3 faz dele o modelo pelo qual você encaminharia uma passagem de contexto longo hoje; o LongCat-2.5-Preview é o modelo que você quer testar contra ele, porque se a recall dele se mantiver a um doze avos do preço de saída, a economia do trabalho com documentos longos muda. A fusão de modelos é o mecanismo que torna isso concreto em vez de teórico: uma passagem de recuperação de contexto longo e uma etapa final de síntese podem ser dois modelos diferentes em uma única requisição, de modo que o modelo barato não medido e o caro medido não precisam ser uma escolha de um ou outro. O failover automático, então, cobre o caso em que um deles se degrada, o que importa mais do que o normal quando um dos seus dois candidatos não tem histórico de serviço que você possa inspecionar.

O veredito, enunciado com sua própria incerteza atrelada.

Se você precisa que o trabalho com contexto longo seja confiável esta semana, o Kimi K3 é a escolha defensável: recall de 88,67 é o melhor número disponível para a capacidade exata em questão, e seu perfil mais amplo — Codificação 76,2, Inteligência 43,6, GPQA Diamond 93,5% — é sólido, e não espetacular, tudo com fontes independentes. Se você estiver disposto a passar uma tarde gerando sua própria avaliação, o LongCat-2.5-Preview é a aposta mais interessante: uma janela de um milhão de tokens, um teto de saída de 131.072 tokens, acesso com retenção zero e uma tabela de preços uma ordem de grandeza abaixo da do Kimi K3, tudo isso apoiado em alegações do fornecedor que ninguém ainda testou em público.

O que não é defensável é tratá-los como equivalentes só porque ambos listam um milhão de tokens. Um deles tem um número atrelado a essa janela, e o outro tem um preço. Esses são tipos diferentes de evidência, e a lacuna entre eles é a única coisa de que esta comparação realmente trata.