Une carte de titre générée pour « LongCat-2.5-Preview vs Qwen3.8-Max », avec le sous-titre « Un septième du prix, et aucun tableau de scores », au-dessus de quatre cartes indiquant « Entrée non mise en cache : 0,30 $ vs 2,00 $ par 1 M », « Entrée mise en cache : 0,006 $ vs 0,25 $ par 1 M », « Sortie : 1,20 $ vs 6,00 $ par 1 M » et « Score indépendant : aucun vs AA Intelligence 45.4 ». Le logo OrcaRouter est intégré dans le coin inférieur droit.
Guides & Insights

LongCat-2.5-Preview vs Qwen3.8-Max : un septième du prix et rien au tableau des scores

Auteur

Gideon Frost

Date de publication

Derniers modèles · 20Voir tous les modèles →
Benchmarks : Artificial Analysis · mis à jour quotidiennement
Retour à tous les articles

Meituan a mis LongCat-2.5-Preview sur sa plateforme API le 25 septembre 2026, avec une entrée de changelog, une grille tarifaire, et aucun benchmark d'aucune sorte — puis l'a facturé à environ un septième de ce que Qwen3.8-Max facture pour le même appel. Ce n'est pas un petit écart, et ce n'est pas un écart sans risque. Qwen3.8-Max, le modèle phare de l'éditeur, est en disponibilité générale depuis le 3 août 2026, dispose d'un classement indépendant d'Artificial Analysis, publie un instantané daté que vous pouvez épingler par son nom, et facture 6,7× plus cher en entrée et 5× plus cher en sortie. La question à laquelle cette comparaison doit répondre n'est pas de savoir quel modèle est le meilleur — personne en dehors de Meituan n'est en mesure d'y répondre pour l'instant. C'est ce que vous achetez avec la différence, et si cette différence vaut la peine d'être achetée.

Ce que chaque partie a réellement publié

Commencez par la provenance, car c'est ce qui sépare ces deux-là plus nettement que ne le ferait n'importe quel benchmark.

LongCat-2.5-Preview est apparu avec une entrée datée dans le journal des modifications de Meituan lui-même — les mots de l'éditeur : « Version : 2026-09-25 — LongCat-2.5-Preview désormais disponible » — une page tarifaire le répertoriant comme le modèle actuel de la plateforme en paiement à l'usage, et un guide de démarrage rapide couvrant les deux formats de communication. Le compte de Meituan sur X le décrit en ces termes : « 1,6 T de paramètres. ~48 B actifs. Une fenêtre de contexte de 1 M de tokens. Nativement multimodal. » Au-delà de cela, il n'y a rien à lire. Aucun dépôt dans l'organisation meituan-longcat de Hugging Face ne couvre ce modèle — le dépôt le plus récent de l'organisation est LongCat-Flash-Lite-Sparse, du 31 juillet — et le catalogue de modèles OpenCode, qui le sert, le répertorie comme étant à poids fermés. Aucune fiche de modèle, aucun rapport technique, aucune licence, aucun tableau de paramètres publié par l'éditeur, et aucune évaluation indépendante nulle part : au 27 septembre, il n'existe pas de page LongCat-2.5-Preview sur Artificial Analysis.

Qwen3.8-Max est le cas opposé à presque tous les égards. Il est devenu généralement disponible le 3 août 2026 avec une grille tarifaire publiée, et Alibaba a livré une mise à jour nommée, Qwen3.8-Max-0902, le 2 septembre. Artificial Analysis le mesure : Intelligence Index 45,4, classé 15e sur 145 modèles, et un Coding Index de 76,2, classé 9e sur 138. Il affiche GPQA Diamond 92,8 %, Humanity's Last Exam 43,1 %, SciCode 52,1 %, Long-Context Recall 80,3 %, Terminal-Bench 2.1 à 88,8 %, et τ-bench banking à 47,8 %. C'est un modèle mesuré, avec un justificatif pour chaque chiffre.

Donc, le résumé honnête de la colonne des preuves est déséquilibré d’une manière qui n’a rien à voir avec la capacité. L’un de ces modèles peut être évalué avant que vous ne vous engagiez. L’autre ne peut qu’être essayé.

La grille tarifaire, ligne par ligne

Tous deux sont des modèles à un million de tokens avec le même plafond de sortie, si bien que les fiches techniques convergent précisément là où une fiche technique est le moins utile :

• Entrée non mise en cache — LongCat-2.5-Preview à 0,30 $ par million contre Qwen3.8-Max à 2,00 $ par million, soit un écart de 6,7×.

• Entrée mise en cache — 0,006 $ par million contre 0,25 $ par million, soit un écart de 41,7×.

• Sortie — 1,20 $ par million contre 6,00 $ par million, un écart de 5×.

• Fenêtre de contexte — 1 048 576 tokens contre 1 000 000 de tokens. Fonctionnellement, égalité.

• Sortie maximale — 131 072 jetons sur les deux. Identique.

• Score indépendant — aucun publié, contre AA Intelligence 45,4 et AA Coding 76,2.

Chaque chiffre LongCat présent provient de la propre page de tarification de Meituan, et la page intitule toute la colonne « Prix remisé (durée limitée) ». Les chiffres de Qwen3.8-Max correspondent au tarif catalogue d'Alibaba, relevés sur notre propre fiche de modèle, avec une lecture de cache à 0,25 $ et une écriture de cache à 2,50 $ par million. L'instantané d'Artificial Analysis est daté du 2 septembre 2026.

La ligne « entrée mise en cache » est celle sur laquelle il faut se pencher. Un écart de 42× sur les lectures de cache est le plus grand nombre isolé de cette comparaison, et il porte sur la dimension dans laquelle vivent réellement les charges de travail des agents. Une boucle d’agent qui renvoie un prompt système de 100 000 tokens et un schéma d’outils à chaque tour paie le tarif mis en cache pour la plupart de ses tokens, et non le tarif d’entrée affiché.

Un appel de 150 000 tokens, facturé dans les deux sens

Prenons une requête plausible de type agent : 150 000 jetons d'entrée, dont 50 000 servis depuis le cache, et une réponse de 4 000 jetons. Au tarif remisé de Meituan, cet appel coûte 0,0501 $. Au tarif catalogue de Qwen3.8-Max, l'appel identique coûte 0,3365 $ — 6,7 fois plus, soit 50 $ contre 337 $ pour mille appels par jour. Poussez la répartition entièrement en cache, ce qui est le régime stationnaire d'un prompt répété, et le ratio passe à 12,3 fois : 0,006 $ contre 0,074 $ par appel.

Rien dans cette arithmétique ne dépend du fait que LongCat-2.5-Preview soit bon. C’est précisément le problème. Le multiplicateur qu’on vous propose est réel, et le mot qui y est associé sur la page même du fournisseur est « limited-time », sans date de fin ni prix de successeur annoncé. Une remise de 6,7× sans expiration publiée est une ligne budgétaire que vous ne pouvez pas inscrire dans un plan ; c’est une ligne budgétaire que vous surveillez.

Il y a aussi une asymétrie de routage qu'il vaut la peine d'énoncer clairement. Qwen3.8-Max est une route que nous servons — qwen/qwen3.8-max et la version épinglée qwen/qwen3.8-max-0902 — chez Alibaba au prix catalogue, sans marge, de sorte qu'une variation de prix du fournisseur se répercute de notre côté le jour même plutôt que des semaines plus tard. LongCat-2.5-Preview ne fait pas partie de nos routes, et nous n'allons pas prétendre le contraire ; du côté bon marché de cette comparaison, vous avez affaire à l'API de Meituan elle-même et à la plateforme par laquelle vous y accédez.

La seule affirmation que l'API de Meituan elle-même contredit

Voici le constat qui devrait départager le match pour quiconque dont la charge de travail n’est pas purement textuelle.

Le journal des modifications de Meituan liste la compréhension d’images comme la nouveauté phare de la génération 2.5 : « Compréhension multimodale : nouvelle capacité de compréhension d’images, capable d’analyser le contenu des images, prenant en charge les questions-réponses intermodales, le résumé de contenu et le raisonnement visuel complexe. » La publication sur X indique « nativement multimodal ». Ce sont des déclarations de fournisseur et, en soi, il serait raisonnable de les prendre en compte dans une décision.

Ensuite, le même site de documentation publie l'exemple de réponse permettant de récupérer les métadonnées propres à ce modèle, et le modèle qu'il renvoie est uniquement textuel. Pour l'identifiant « LongCat-2.5-Preview », la charge utile affiche context_length: 1048576, input_modalities: ["text"], output_modalities: ["text"], et une chaîne de modalité text->text. Aucune entrée d'image. Pas dans un ancien instantané — dans l'exemple concret figurant sur la page qui documente le point de terminaison.

A screenshot of Meituan's LongCat API documentation for the model-retrieval endpoint, showing the worked example response for 'LongCat-2.5-Preview': context_length 1048576, input_modalities ["text"], output_modalities ["text"] and modality "text->text". The word 'text' is visible in red against the grey page.

Cela ne prouve pas que le modèle ne peut pas voir. Cela prouve que le fournisseur n’a pas concilié son discours avec son propre schéma d’API, et cela signifie qu’un acheteur ne peut pas imputer une charge de travail de vision à cette phrase du journal des modifications tant que quelqu’un ne l’a pas tranchée. Mettez-la en regard de l’autre côté : notre catalogue répertorie Qwen3.8-Max comme acceptant des entrées texte, image et vidéo, avec la vision parmi ses capacités déclarées, et un tableau de benchmarks indépendant soutient le modèle. Si votre tâche est la compréhension de documents, le tri de captures d’écran ou l’analyse de trames vidéo, la colonne coûteuse est celle dont la modalité d’entrée est vérifiée, et la colonne bon marché est celle dont la modalité n’est pas résolue. Cette seule ligne peut effacer tout le 6,7×.

À quoi un Preview ne peut pas être épinglé

Alibaba livre des instantanés datés. qwen/qwen3.8-max-0902 est une version figée et nommée, au même tarif de 2 $/6 $ que le modèle de base, ce qui signifie qu'une règle de routage qui la nomme continuera de renvoyer les mêmes poids le mois prochain. Les changements de comportement arrivent sous la forme d'un nouvel identifiant que vous pouvez adopter selon votre propre calendrier.

LongCat-2.5-Preview n’a pas un tel identifiant. L’identifiant du modèle est l’identifiant de préversion, il n’y a pas de suffixe d’instantané, pas d’historique des versions sur la plateforme, et aucune entrée de journal des modifications ne vous dirait que les poids ont changé — seulement que la remise est « à durée limitée ». C’est une préversion au sens ordinaire : ce qui se trouve sous ce nom peut changer, et vous le découvririez à partir de vos sorties plutôt que d’une note de version.

La façon la moins chère d'acheter la preuve manquante, c'est la fenêtre que Meituan a ouverte de l'autre côté de cette histoire : OpenCode répertorie LongCat-2.5-Preview comme gratuit pour une période limitée, le fournisseur appliquant une politique de rétention zéro et n'entraînant pas de modèles sur vos données, et il a indiqué le 26 septembre que cette fenêtre dure deux semaines. Entrée gratuite, sortie gratuite, lectures de cache gratuites. C'est un moyen légitime de construire le tableau de benchmarks que personne n'a publié — faites tourner votre propre corpus d'évaluation dessus, et vous obtenez un chiffre là où le fournisseur vous a donné une phrase. Ce que ce n'est pas, c'est un prix sur lequel vous pouvez planifier : les deux semaines prennent fin, et le chiffre de l'autre côté, c'est Meituan qui le fixe.

Qui devrait choisir lequel ?

Choisissez Qwen3.8-Max lorsque la charge de travail est la raison même pour laquelle vous achetez le modèle. Si l'entrée est constituée d'images ou de vidéo, si la réponse doit être reproductible d'une version à l'autre, si un indice indépendant est une exigence d'achat, ou si la tâche relève de ce type de codage agentique dont Terminal-Bench et le Coding Index sont les proxys, le 6,7× est le prix à payer pour pouvoir vérifier votre travail. Sur une clé, il se trouve en outre derrière une chaîne de repli, de sorte qu'un modèle noté peut absorber une mauvaise journée du modèle non noté sans que vous ayez à gérer deux intégrations.

A screenshot of the OrcaRouter model page for qwen/qwen3.8-max, headed 'Qwen3.8 Max', listing input modalities 'text + Image + video' with Vision, Tools, JSON and Reasoning capability chips, a price of $2.00 per 1M input and $6.00 per 1M output, open weights 'No', a p50 time-to-first-token of 2.73s, and a public benchmark panel sourced to Qwen dated 2026-08-03.

Recourez à LongCat-2.5-Preview lorsque la charge de travail est à gros volume, à contexte court, uniquement textuelle et interne — classification, extraction, synthèse, réécriture en masse — et lorsque le coût d’une erreur est une nouvelle tentative plutôt qu’un client. Dans ce cas de figure, la ligne des entrées mises en cache n’est pas une remise, c’est toute l’économie de la tâche, et 42× est un chiffre qui vaut l’effort de mesure. Utilisez la fenêtre gratuite pour produire le benchmark qui n’existe pas. Ne migrez pas un chemin critique dessus.

Qu’est-ce qui changerait ce verdict, par ordre d’importance : une évaluation indépendante de LongCat-2.5-Preview ; une date de fin publiée et un prix successeur pour la remise ; un historique des versions avec des instantanés datés ; et une clarification de si la liste des modalités est uniquement textuelle ou non. N’importe lequel de ces éléments fait de la colonne « bon marché » plus qu’une remise. Tant qu’au moins l’un d’eux ne s’est pas concrétisé, cette comparaison n’est pas un duel entre deux modèles — c’est un duel entre un prix que vous pouvez vérifier et une capacité que vous ne pouvez pas.

A generated two-column scoreboard titled 'LongCat-2.5-Preview vs Qwen3.8-Max - the scoreboard'. The left column, LongCat-2.5-Preview, reads 'Uncached input $0.30 / 1M', 'Cached input $0.006 / 1M', 'Output $1.20 / 1M', 'Context 1,048,576', 'Max output 131,072' and 'AA Intelligence none'; the right column, Qwen3.8-Max, reads 'Uncached input $2.00 / 1M', 'Cached input $0.25 / 1M', 'Output $6.00 / 1M', 'Context 1,000,000', 'Max output 131,072' and 'AA Intelligence 45.4'. A footer credits LongCat prices to Meituan as limited-time, Qwen prices to Alibaba, and the AA index to Artificial Analysis dated 2 Sept 2026. The OrcaRouter logo is composited in the bottom-right corner.

Comparés dans cet article1

Détecté à partir de cet article · Benchmarks : Artificial Analysis · mis à jour quotidiennement