
LongCat-2.5-Preview vs GLM-5.2 : deux fenêtres de 1 M de tokens, dont une seule est mesurée
- typesafeNOUVEAUTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 par million de tokens · 610 tok/s
- openaiNOUVEAUOpenAI: GPT-6 Luna2026-09-2237Intelligence
- openaiNOUVEAUOpenAI: GPT-6 Sol2026-09-2248Intelligence
- anthropicNOUVEAUAnthropic: Claude Opus 5.52026-09-2258Intelligence
- grokNOUVEAUGrok 4.72026-09-2146Intelligence
- OrcaNOUVEAUOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 par million de tokens · 189 tok/s
- orcaNOUVEAUOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 par million de tokens · 1306 tok/s
- deepseekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligence
- openaiOpenAI: GPT-6 Astra2026-09-0453Intelligence77Code
- googleGoogle: Gemini 3.8 Flash2026-09-0241Intelligence76Code
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Intelligence76Code
- anthropicAnthropic: Claude Fable 5.12026-09-0153Intelligence82Code
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 par million de tokens · 111 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligence72Code
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 par million de tokens · 225 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Intelligence75Code
- obsidianQwen3.8 27B2026-08-1534Intelligence68Code
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Intelligence69Code
- grokSpaceXAI: Grok 4.62026-08-1244Intelligence77Code
- metaMeta: Muse Spark 1.22026-08-0540Intelligence72Code
LongCat-2.5-Preview et GLM-5.2 portent le même chiffre phare : une fenêtre de contexte d'un million de jetons. Cette seule coïncidence fait tout le travail dans la plupart des comparaisons écrites cette semaine, et elle ne suffit pas pour comparer deux modèles. GLM-5.2 est documenté publiquement depuis le 16 juin 2026 avec un profil de benchmarks publics, une grille tarifaire publiée et un score de rappel en contexte long fourni par un évaluateur indépendant. LongCat-2.5-Preview est apparu sur la plateforme API LongCat de Meituan le 25 septembre 2026 avec une grille tarifaire réduite, un nombre de paramètres rapporté par la presse spécialisée chinoise, et aucun benchmark publié, de quelque nature que ce soit. Une fenêtre est mesurée. L'autre est affirmée. Tout ce qui suit maintient ces deux catégories distinctes, car une fiche technique et un résultat de test ne sont pas du même type de fait.
Voici la version honnête de cette confrontation, et elle est plus utile que la version flatteuse.
Ce que chaque partie a réellement publié
Le journal des modifications de Meituan comporte une entrée datée — « Version : 2026-09-25, LongCat-2.5-Preview désormais disponible » — qui énumère trois capacités revendiquées : la compréhension d'images, le codage et la compatibilité avec « Claude Code et d'autres environnements de développement courants », citant Hermes, OpenClaw, OpenCode et Kilo Code. La page de tarification du fournisseur indique un tarif à l'usage de 0,30 $ par million de jetons d'entrée non mis en cache, de 0,006 $ par million de jetons d'entrée mis en cache et de 1,20 $ par million de jetons de sortie, signalé sur la page elle-même comme une remise à durée limitée. La fenêtre de contexte est d'un million de jetons et la sortie maximale est de 131 072. Le chiffre d'environ 1,6 billion de paramètres au total, avec environ 48 milliards actifs par jeton, sur une architecture de mélange d'experts, provient des métadonnées du site de Meituan lui-même et de la couverture de la presse spécialisée chinoise de cette annonce — et non de la documentation de l'API. Aucun rapport technique, aucune fiche de modèle et aucun tableau de benchmarks n'accompagnaient cet ensemble. Il n'existe aucun dépôt LongCat-2.5-Preview sur HuggingFace ni aucun dépôt portant ce nom dans l'organisation GitHub de Meituan ; les métadonnées du catalogue de modèles livrées avec OpenCode indiquent que les poids ouverts sont « false ».

GLM-5.2 de Z.ai occupe la position opposée. Il s'agit d'une sortie de juin, avec une grille tarifaire que nous proposons au prix catalogue : 1,40 $ par million de tokens d'entrée, 0,26 $ par million de tokens d'entrée mis en cache et 4,40 $ par million de tokens de sortie sur notre catalogue, avec une fenêtre de contexte de 1 000 000 de tokens et 128 000 tokens de sortie maximale. Ses scores publiés proviennent de deux sources différentes, et cette distinction est importante : les chiffres propres à Z.ai pour AIME 2026, HMMT février 2026, GPQA-Diamond et la suite FrontierSWE sont déclarés par le fournisseur ; les chiffres des indices Coding Index et Intelligence Index que porte notre catalogue proviennent d'Artificial Analysis, qui mène ses propres évaluations.
La seule dimension où ils sont véritablement égaux
Les deux modèles revendiquent exactement 1 000 000 de tokens de contexte. Un seul d'entre eux dispose d'un score publié qui teste si un modèle peut encore exploiter ce qui s'y trouve. Artificial Analysis consigne un chiffre de rappel en contexte long (Long-Context Recall) de 78,33 pour GLM-5.2. LongCat-2.5-Preview n'a aucun chiffre équivalent, de la part de qui que ce soit. Cette asymétrie résume tout le duel en une ligne : une fenêtre d'un million de tokens est une affirmation sur la capacité de l'architecture, pas sur la question de savoir si le modèle récupère correctement l'information au token 900 000. La capacité coûte peu à afficher et cher à vérifier, c'est pourquoi tous les fournisseurs l'affichent et presque aucun ne publie le test de rappel.
Donc, si c’est pour du travail à long contexte que vous choisissez entre ces deux-là, vous choisissez entre une option avec un score de rappel publié et une sans — et celle sans est aussi celle dont le profil de benchmark n’est pas mesuré. Ce n’est pas un argument contre elle. C’est un argument contre le fait de les traiter comme interchangeables sur la foi d’un entier identique.

À quoi ressemble l'écart de prix sur un vrai chantier
Les grilles tarifaires ne sont pas proches, et la tendance n'est pas celle que l'on attend d'un challenger chinois à poids ouverts face à un laboratoire occidental de pointe. LongCat-2.5-Preview est environ 4,7 fois moins cher sur les entrées non mises en cache et 3,7 fois moins cher sur les sorties que GLM-5.2 — un rapport qui relève de l'arithmétique sur les deux grilles publiées, pas d'une mesure. Sur un passage de traitement de document de 500 000 jetons qui réécrit 20 000 jetons, cela représente environ 17 cents contre environ 79 cents. Les deux modèles doivent lire le même document. Un seul d'entre eux dispose d'un score publié indiquant s'il prêtera encore attention à la fin de celui-ci.
Il y a une deuxième mise en garde qui doit être faite dans la foulée : Meituan qualifie sa propre grille tarifaire de remise à durée limitée. Le montant de 0,30 $ est le tarif promotionnel, et le fournisseur ne précise pas ce qui suit. Un modèle de coûts fondé sur un prix promotionnel a une date d’expiration que l’on ne peut pas lire. C’est une raison de maintenir le coût des migrations entre fournisseurs faible, plutôt qu’une raison d’éviter le modèle.
Sur OrcaRouter, les routes que nous servons sont accessibles derrière une seule clé au prix catalogue du fournisseur, avec zéro marge, de sorte qu'une modification tarifaire d'un fournisseur se répercute sur votre facture le jour même plutôt qu'au prochain renouvellement, et le basculement automatique redirige une requête dégradée vers un fournisseur sain sans que votre application ne s'en aperçoive. GLM-5.2 est l'une de nos routes. LongCat-2.5-Preview n'en fait pas partie — nous ne le servons pas, et rien ici ne doit être interprété comme affirmant le contraire. Z.ai a également évolué depuis juin : GLM-5.3 est en ligne sur notre catalogue depuis le 18 août 2026, si bien qu'une comparaison formulée comme « nouveau modèle contre modèle actuel » présente déjà GLM-5.2 comme le modèle en place plutôt que comme la pointe de l'état de l'art.

Qu’est-ce qui réglerait cela, et qu’est-ce qui ne le fera pas
• Un score Long-Context Recall pour LongCat-2.5-Preview, de la part de Meituan ou d'un évaluateur indépendant. Tant qu'il n'existe pas, sa fenêtre de 1 M est une affirmation sans test associé, et le 78,33 de GLM-5.2 est le seul chiffre de la comparaison qui porte sur la même question.
• Une grille tarifaire fournisseur sans l’indicateur de durée limitée. Le prix remisé vous indique ce que coûte le modèle pendant une promotion, pas ce qu’il coûte.
• Un tableau de benchmark, quel qu’il soit. Pas une place dans un classement — juste une exécution d’évaluation publiée, pour que la comparaison cesse d’opposer une fiche technique à une page de résultats.
• Une confirmation de l'entrée d'image. Le journal des modifications présente la compréhension des images comme un ajout majeur mis en avant, mais l'exemple de réponse dans la propre documentation « Retrieve Model » de Meituan affiche toujours input_modalities comme ["text"] avec une text->text chaîne de modalité. Cet exemple n'est peut-être tout simplement plus à jour. Il n'en demeure pas moins le contrat publié par le fournisseur ; considérez donc l'entrée d'image comme revendiquée plutôt que disponible. GLM-5.2, en revanche, est en entrée texte et en sortie texte dans notre catalogue, sans aucune modalité d'image — ainsi, sur cette dimension, aucun des deux modèles ne vous fournit de réponse vérifiée, et l'un d'eux vous fournit une revendication.
• Vos propres chiffres. L'écart entre ce qui est publié et ce dont vous avez besoin se comble en exécutant les deux modèles sur vos tâches, et la fenêtre gratuite sur LongCat-2.5-Preview rend cela abordable en ce moment. Une trace de raisonnement qui arrive dans un champ reasoning_content entrelacé est le détail du harnais à vérifier en premier, car un outillage qui le supprime silencieusement fera perdre l'essentiel de l'utilité du modèle sans produire d'erreur.
Où cela laisse la comparaison
Si vous devez prendre une décision aujourd'hui et qu'elle implique du contexte long, GLM-5.2 est celui que vous pouvez réellement évaluer : il dispose d'un rappel publié, d'un score de codage indépendant de 68,8 et d'un Intelligence Index de 33,7 selon Artificial Analysis, ainsi que d'un prix sur lequel vous pouvez bâtir un budget. Ces chiffres décrivent un modèle compétent plutôt que de pointe — le propre successeur de Z.ai, GLM-5.3, obtient un meilleur score — mais ils décrivent quelque chose. LongCat-2.5-Preview est une proposition moins chère, à contexte plus large et entièrement non mesurée, dont la qualité la plus attrayante, son prix, est explicitement temporaire. La bonne posture à son égard n'est pas le scepticisme. C'est une évaluation de deux semaines, avec votre propre harnais de notation attaché, menée avant que le tarif promotionnel ne disparaisse.
Comparés dans cet article1
Détecté à partir de cet article · Benchmarks : Artificial Analysis · mis à jour quotidiennement
