Une carte de titre principale générée indiquant « LongCat-2.5-Preview vs Kimi K3 », avec le surtitre « La question du rappel en contexte long », et deux panneaux : « LongCat-2.5-Preview : contexte de 1 M, score de rappel non publié » et « Kimi K3 : AA Long-Context Recall 88,67, le score le plus élevé que nous proposons ». Logo OrcaRouter en bas à droite.
Engineering & Research

LongCat-2.5-Preview vs Kimi K3 : la question du rappel en contexte long à laquelle personne ne peut encore répondre

Auteur

Rowan Sterling

Date de publication

Derniers modèles · 20Voir tous les modèles →
Benchmarks : Artificial Analysis · mis à jour quotidiennement
Retour à tous les articles

Kimi K3 obtient un score de 88,67 au rappel en contexte long. C'est le chiffre le plus élevé de tous les modèles de notre catalogue pour la question précise de savoir si un modèle utilise encore des informations enfouies profondément dans une longue entrée. LongCat-2.5-Preview n'a absolument aucun score de rappel en contexte long — ni d'Artificial Analysis, ni de Meituan, ni de qui que ce soit. Et LongCat-2.5-Preview est celui qui met en avant une fenêtre d'un million de tokens comme fonctionnalité phare. Cette discordance, un modèle dont la revendication centrale est le contexte long et pour lequel aucune mesure de contexte long n'existe, constitue toute la substance de cette comparaison. Tout le reste est secondaire.

Il vaut la peine d’être précis sur ce que le nombre manquant signifie et ne signifie pas, car il est facile de glisser de « non mesuré » à « probablement mauvais », et aucune des deux orientations n’est étayée.

Ce que chacun des deux modèles a consigné au dossier

Le Kimi K3 de MoonshotAI est sorti le 15 juillet 2026. Notre catalogue le propose avec une fenêtre de contexte de 1 048 576 tokens, une entrée texte et image, et une grille tarifaire de 3,00 $ par million de tokens d’entrée, 0,30 $ par million d’entrée en cache et 15,00 $ par million de sortie. Son profil indépendant d’Artificial Analysis affiche : Coding Index 76,2, neuvième ; Intelligence Index 43,6, dix-neuvième ; GPQA Diamond 93,5 % ; Humanity’s Last Exam 46,9 % ; SciCode 59,5 % ; Terminal-Bench v2.1 85,0 ; τ²-Bench banking 46,0. Et Long-Context Recall 88,67, le meilleur de notre catalogue.

A screenshot of Meituan's LongCat API Platform change-log page, headlined 'Version: 2026-09-25 - LongCat-2.5-Preview Now Available', listing the model's three stated features - multimodal image understanding, coding capability, and compatibility with Claude Code, Hermes, OpenClaw, OpenCode and Kilo Code - with the platform's Guide, API, Tools and Pricing navigation and its column of earlier dated releases visible.

Le LongCat-2.5-Preview de Meituan est apparu sur la plateforme API LongCat le 25 septembre 2026. Son entrée de journal des modifications nomme trois capacités revendiquées — la compréhension d'images, le codage et la compatibilité avec « Claude Code et d'autres environnements de développement courants », citant Hermes, OpenClaw, OpenCode et Kilo Code. La page de tarification indique 0,30 $ par million de tokens d'entrée non mis en cache, 0,006 $ par million de tokens d'entrée mis en cache et 1,20 $ par million de tokens de sortie, signalé comme une remise à durée limitée. Fenêtre de contexte 1 000 000 ; sortie maximale 131 072. Le chiffre d'environ 1,6 T de paramètres au total / environ 48 Md de paramètres actifs provient des métadonnées du site de Meituan et de la couverture de la presse spécialisée chinoise, et non de la documentation. Aucun tableau de benchmarks, aucune fiche de modèle, aucun rapport technique, aucun dépôt sur HuggingFace ni dans l'organisation GitHub de Meituan, et des métadonnées de catalogue indiquant des poids ouverts comme faux.

Pourquoi le numéro manquant compte davantage ici que dans n’importe quel autre affrontement.

Long-Context Recall n'est pas un score parmi tant d'autres pour ces deux modèles. C'est le score qui teste ce qu'ils vendent tous les deux. Une fenêtre d'un million de jetons est une déclaration sur la capacité architecturale ; le rappel mesure si le modèle peut encore retrouver et utiliser un fait placé au jeton 900 000 plutôt qu'au jeton 900. Les fournisseurs publient le premier parce qu'il s'agit d'une spécification. Les évaluateurs indépendants publient le second parce qu'il s'agit d'un test, et la plupart des modèles ne réussissent pas aussi bien que la taille de leur fenêtre ne le laisse supposer.

Donc, la position honnête est plus étroite qu’elle n’en a l’air. Le 88,67 de Kimi K3 ne signifie pas que Kimi K3 est un meilleur modèle à long contexte que LongCat-2.5-Preview. Cela signifie que Kimi K3 est celui pour lequel la question a été posée et a reçu une réponse. LongCat-2.5-Preview pourrait être meilleur. Il pourrait être sensiblement pire. Le point important est que personne en dehors de Meituan ne le sait actuellement, et qu’une fenêtre de 1 M imprimée sur une page de tarification ne constitue pas une preuve dans un sens ou dans l’autre.

A screenshot of OrcaRouter's own model page for MoonshotAI Kimi K3 at /models/kimi/kimi-k3, showing the kimi/kimi-k3 identifier, a 1M-token context window, text + image input and text output, Vision, Tools, JSON and Reasoning capability chips, a release date of 2026-07-15, a p50 first-token figure of 8.24 s, $3.00 and $15.00 rate tiles, and the OpenAI-compatible code samples.

Le tableau des coûts, avec le même avertissement arithmétique

Aux tarifs publiés, LongCat-2.5-Preview est 10 fois moins cher sur les entrées non mises en cache et 12,5 fois moins cher sur les sorties que Kimi K3. Une lecture de 500 000 tokens qui en réécrit 20 000 revient à environ 1,80 $ sur Kimi K3 et à environ 17 cents sur LongCat-2.5-Preview. Les deux relèvent de l'arithmétique sur des tarifs affichés plutôt que de mesures, et le chiffre de LongCat comporte une réserve supplémentaire que celui de Kimi n'a pas : Meituan qualifie son propre tarif de remise à durée limitée, de sorte que le chiffre qui subsistera après la promotion est inconnu.

Mettez cela en regard de la question de la couverture. Si vous traitez une entrée de 500 000 tokens et que le rappel de votre modèle à cette profondeur n’est pas mesuré, la différence de coût n’est pas une économie — c’est le prix d’un taux d’échec inconnu. Une requête à 17 cents qui manque silencieusement la section pertinente est plus coûteuse qu’une requête à 1,80 $ qui la trouve, car vous payez de toute façon la réexécution et le débogage. C’est la forme précise du risque, et c’est pourquoi l’absence de benchmark est un problème de coût, et pas seulement un problème de marketing.

Que faire tant que le numéro n'existe pas

Générez le vôtre. C'est le rare cas où la fenêtre gratuite est réellement bien adaptée à la situation : LongCat-2.5-Preview ne coûte rien à appeler via OpenCode pendant une durée non précisée, avec une politique de rétention nulle que documente OpenCode — entraînement du modèle « Not used », conservation des données « 0 days » — ce qui signifie que vous pouvez le pointer vers un dépôt privé sans avoir à engager au préalable une discussion sur le traitement des données. Construisez un test de l'aiguille dans la botte de foin à la profondeur que vous utilisez réellement, exécutez-le sur les deux modèles, et vous obtiendrez le chiffre qu'aucun des deux fournisseurs n'a publié. Deux choses à vérifier avant de faire confiance au résultat : que votre harnais expose bien le champ entrelacé reasoning_content renvoyé par le modèle, et que l'entrée d'images fonctionne tout court, car le journal des modifications de Meituan l'affirme alors que son propre exemple « Retrieve Model » affiche encore input_modalities comme ["text"] avec une chaîne text->text.

A generated two-column scoreboard titled 'LongCat-2.5-Preview vs Kimi K3' with the subhead 'The one model advertising a long window is the one with no recall score'. Left column 'LongCat-2.5-Preview' (Meituan, listed 2026-09-25, no benchmark published): 1,000,000-token context, 131,072 max output, text with image input claimed not confirmed, $0.30 uncached / $0.006 cached input, $1.20 output flagged limited-time, long-context recall not published by anyone, coding index not published, no repo and catalogue open_weights false. Right column 'Kimi K3' (MoonshotAI, released 2026-07-15, independently scored): 1,048,576-token context, max output not published, text and image to text, $3.00 uncached / $0.30 cached input, $15.00 output, long-context recall 88.67 described as the highest we carry, coding index 76.2 at rank 9 and intelligence index 43.6 at rank 19 by Artificial Analysis. The footnote adds that a 500,000-token read writing 20,000 tokens back is roughly $1.80 on Kimi K3 against roughly 17 cents on LongCat-2.5-Preview at its published promotional rate. Footnote credits the left column to Meituan's changelog and pricing page and the right column to OrcaRouter's catalogue with index figures sourced to Artificial Analysis, and notes that LongCat-2.5-Preview is not routed by OrcaRouter. OrcaRouter logo bottom-right.

Le rôle d'OrcaRouter dans celui-ci

Nous servons Kimi K3 au prix catalogue de MoonshotAI avec zéro marge. LongCat-2.5-Preview ne fait pas partie de nos routes — nous ne le servons pas, et rien dans cet article ne doit être interprété comme affirmant que nous le faisons.

Pour cette comparaison en particulier, la partie utile d'un routeur n'est pas le prix. C'est le fait que le modèle que vous évaluez et le modèle sur lequel vous vous appuyez peuvent se trouver derrière la même clé. Le rappel de 88,67 de Kimi K3 en fait le modèle à travers lequel vous feriez passer aujourd'hui un traitement à contexte long ; LongCat-2.5-Preview est le modèle que vous voulez tester face à lui, car si son rappel se maintient à un douzième du prix de sortie, l'économie du travail sur documents longs change. La fusion de modèles est le mécanisme qui rend cela concret plutôt que théorique : une passe de récupération à contexte long et une étape de synthèse finale peuvent être deux modèles différents sur une même requête, de sorte que le modèle bon marché non mesuré et le modèle coûteux mesuré n'aient pas à être un choix binaire. Le basculement automatique, ensuite, couvre le cas où l'un des deux se dégrade, ce qui compte plus que d'habitude quand l'un de vos deux candidats n'a aucun historique de service que vous pouvez inspecter.

Le verdict, énoncé avec l’incertitude qui lui est propre.

Si vous avez besoin que le travail sur de longs contextes soit fiable cette semaine, Kimi K3 est le choix défendable : un rappel de 88,67 est le meilleur chiffre disponible pour la capacité exacte en question, et son profil plus large — Coding 76,2, Intelligence 43,6, GPQA Diamond 93,5 % — est solide plutôt que spectaculaire, le tout provenant de sources indépendantes. Si vous êtes prêt à passer un après-midi à générer votre propre évaluation, LongCat-2.5-Preview est un pari plus intéressant : une fenêtre d'un million de tokens, un plafond de sortie de 131 072 tokens, un accès sans rétention et une grille tarifaire d'un ordre de grandeur inférieur à celle de Kimi K3, le tout reposant sur des affirmations du fournisseur que personne n'a encore testées publiquement.

Ce qui n’est pas défendable, c’est de les traiter comme équivalents parce que tous les deux affichent un million de tokens. L’un a un nombre associé à cette fenêtre, et l’autre a un prix. Ce sont des types de preuves différents, et l’écart entre eux est la seule chose dont cette comparaison traite réellement.