Une carte de titre principale générée portant l'inscription « LongCat-2.5-Preview vs Grok 4.6 », avec le surtitre « L'un a une fiche de benchmark, l'autre a un successeur », et deux panneaux : « LongCat-2.5-Preview : contexte de 1 M, rétention zéro via OpenCode » et « Grok 4.6 : AA Coding 76,8, Grok 4.7 déjà livré ». Logo OrcaRouter en bas à droite.
Guides & Insights

LongCat-2.5-Preview vs Grok 4.6 : l'un a une fiche de benchmark, l'autre a un successeur

Auteur

Gideon Frost

Date de publication

Derniers modèles · 20Voir tous les modèles →
Benchmarks : Artificial Analysis · mis à jour quotidiennement
Retour à tous les articles

Comparer LongCat-2.5-Preview à Grok 4.6 est délicat pour une raison qui n'a rien à voir avec la qualité de l'un ou l'autre modèle : la question a une date de péremption. Grok 4.6 est sorti le 12 août 2026 et Grok 4.7 est sorti le 21 septembre 2026 — six jours avant la rédaction de ces lignes — aux mêmes tarifs de 2,00 $ / 6,00 $ par million de tokens et avec la même fenêtre de contexte de 500 000 tokens. LongCat-2.5-Preview, quant à lui, est arrivé sur la LongCat API Platform de Meituan le 25 septembre 2026, sans aucun successeur annoncé à l'horizon et sans le moindre benchmark publié. Le vrai choix n'est donc pas « quel modèle est le meilleur ». Il est de savoir si vous voulez une capacité mesurée, avec un successeur mesuré déjà prêt derrière elle, ou une capacité non mesurée qui est au moins la chose actuelle.

Cette formulation est moins palpitante qu’un tableau d’affichage, et nettement plus utile.

Commencez par ce que Grok 4.6 a réellement dans ses dossiers.

Grok 4.6 est un modèle bien documenté. Dans notre catalogue, il dispose d'une fenêtre de contexte de 500 000 tokens, d'une entrée texte, image et fichier, et d'une grille tarifaire de 2,00 $ par million de tokens d'entrée, 6,00 $ par million de tokens de sortie et 0,50 $ par million de tokens d'entrée mis en cache, passant à 4,00 $ et 12,00 $ au-delà de 200 000 tokens d'entrée. Son profil indépendant d'Artificial Analysis comprend un Coding Index de 76,8 — cinquième parmi les modèles suivis par cet indice — un Intelligence Index de 44,3 au dix-huitième rang, GPQA Diamond à 94,9 %, Humanity's Last Exam à 42,9 %, SciCode à 56,5 %, Terminal-Bench v2.1 à 88,4 et τ²-Bench pour la banque à 50,7. Son Long-Context Recall est de 80,3.

A screenshot of Meituan's LongCat API Platform change-log page, headlined 'Version: 2026-09-25 - LongCat-2.5-Preview Now Available', listing the model's three stated features - multimodal image understanding, coding capability, and compatibility with Claude Code, Hermes, OpenClaw, OpenCode and Kilo Code - with the platform's Guide, API, Tools and Pricing navigation and its column of earlier dated releases visible.

LongCat-2.5-Preview n'a rien de tout cela. L'entrée du journal des modifications de Meituan pour le 25 septembre 2026 est un avis de disponibilité daté qui énumère trois capacités revendiquées — compréhension d'images, codage et compatibilité avec « Claude Code et d'autres environnements de développement courants », notamment Hermes, OpenClaw, OpenCode et Kilo Code — et rien qui ressemble à un résultat. La page de tarification du fournisseur indique 0,30 $ par million de jetons d'entrée non mis en cache, 0,006 $ par million de jetons d'entrée mis en cache et 1,20 $ par million de jetons de sortie, avec la mention explicite qu'il s'agit d'une remise à durée limitée. La fenêtre de contexte est de 1 000 000 de jetons ; la sortie maximale est de 131 072. Le nombre de paramètres d'environ 1,6 billion au total / 48 milliards actifs provient des métadonnées du site de Meituan et de la couverture médiatique spécialisée chinoise plutôt que de la documentation. Il n'existe aucun dépôt pour ce modèle sur HuggingFace ni dans l'organisation GitHub de Meituan, et les métadonnées de catalogue qu'OpenCode fournit indiquent que les poids ouverts sont faux.

La dimension qu’un tableau d’affichage manquerait totalement

Ces deux modèles diffèrent sur un point qu'aucun benchmark ne mesure, et pour beaucoup d'équipes, cela tranche la question à lui seul : ce qu'il advient des prompts que vous envoyez.

La propre documentation d'OpenCode indique que LongCat 2.5 Preview Free est servi par un fournisseur qui applique une politique de rétention zéro et n'utilise pas vos données pour l'entraînement ; le tableau de confidentialité de Zen met des chiffres sur ces affirmations — entraînement du modèle « Non utilisé », conservation des données « 0 jour ». Le même tableau de confidentialité indique trente jours de conservation pour Grok 4.6 et Grok 4.7. Ces deux affirmations sont celles d'OpenCode, publiées sur les pages d'OpenCode, et elles décrivent spécifiquement l'entrée gratuite et l'entrée comparative. Mais si vous pointez un agent vers un dépôt privé, c'est la différence entre une conversation que vous n'avez pas à avoir avec le service juridique et une que vous devez avoir — et cela n'a rien à voir avec le modèle qui obtient le meilleur score sur SciCode.

A screenshot of OrcaRouter's own model page for xAI Grok 4.6 at /models/grok/grok-4.6, showing the grok/grok-4.6 identifier, a 500K-token context window, text + image + file input and text output, Vision, Tools, JSON and Reasoning capability chips, a release date of 2026-08-12, $2.00 and $6.00 rate tiles, and a performance strip whose first-token and token-traffic tiles both read 'Collecting' rather than a figure. The page copy describes Grok 4.6 as the current flagship of the Grok line and cites a headline GPQA Diamond score of 94.9.

Ce que « mesuré » vous apporte et ne vous apporte pas

Les chiffres de Grok 4.6 sont meilleurs que ceux de LongCat-2.5-Preview dans le seul sens qui compte ici : ils existent. Cela ne signifie pas pour autant que Grok 4.6 est le meilleur modèle. Son indice de codage de 76,8 est inférieur à celui de la génération Grok 4.7, et le modèle auquel il a été comparé n'est plus à la frontière de sa propre famille. Son successeur publié a un indice d'intelligence de 46,4 contre 44,3 pour Grok 4.6, et un rappel en contexte long de 76,67 contre 80,33 pour Grok 4.6 — donc le successeur n'est pas meilleur sur tous les axes, ce qui est exactement le genre de détail qu'un numéro de génération masque.

Il y a aussi une mise en garde liée au serving en conditions réelles qu'il vaut la peine d'énoncer sans détour, car elle va à l'encontre de l'interprétation flatteuse pour les deux modèles. Sur notre propre échantillon playground de sept jours, Grok 4.6 n'a enregistré aucun débit mesuré et aucun trafic de tokens, ce qui correspond à ce qu'une absence de données donne dans cette colonne, plutôt qu'à un verdict de performance. LongCat-2.5-Preview n'a aucun échantillon de serving provenant de chez nous, tout simplement parce que nous ne le routons pas. Ainsi, toute comparaison de latence entre ces deux modèles est unilatérale d'une manière que la prose masque habituellement : on ne peut pas évaluer un modèle auquel on n'envoie pas de trafic.

Là où la couche de routage est réellement utile ici

Trois des faits ci-dessus sont de ceux pour lesquels un routeur est conçu, plutôt que simplement compatible. La grille tarifaire de Grok 4.6 passe à un palier supérieur au-delà de 200 000 jetons d'entrée, de sorte qu'une même tâche logique peut être facturée à deux tarifs différents selon un nombre que votre application connaît déjà avant d'envoyer quoi que ce soit. Grok 4.6 a un successeur publié à des tarifs identiques, ce qui signifie que le passage de l'un à l'autre devrait être une modification d'une seule ligne, et jamais une réintégration. Et la propriété la plus attrayante de LongCat-2.5-Preview — son prix — est explicitement qualifiée de temporaire par le fournisseur.

Sur OrcaRouter nous servons Grok 4.6 au tarif catalogue de xAI avec zéro marge, de sorte qu'un changement de tarif d'un fournisseur se répercute sur votre facture le jour même plutôt qu'au prochain renouvellement, et le basculement automatique déplace une requête dégradée vers un fournisseur sain sans que votre code sache lequel a répondu. Un DSL de routage couvre directement le cas de la tarification par paliers, et la fusion de modèles couvre le cas où le modèle que vous voulez pour la lecture longue n'est pas celui que vous voulez pour la synthèse finale. LongCat-2.5-Preview ne fait pas partie de nos routes — nous ne le servons pas, et rien ici n'affirme le contraire. Le but de le nommer n'est pas de vous rediriger ailleurs ; c'est qu'un modèle que vous évaluez plutôt que vous exécutez a sa place derrière la même clé que les modèles que vous exécutez, afin que son évaluation coûte une entrée de configuration au lieu d'un projet.

A generated two-column scoreboard titled 'LongCat-2.5-Preview vs Grok 4.6' with the subhead 'One model has a measured card and a measured successor; the other has a rate card'. Left column 'LongCat-2.5-Preview' (Meituan, listed 2026-09-25, no benchmark published): 1,000,000-token context, 131,072 max output, text with image input claimed not confirmed, $0.30 uncached / $0.006 cached input, $1.20 output flagged limited-time, coding index not published, long-context recall not published, data retention 0 days on the free listing per OpenCode. Right column 'Grok 4.6' (xAI, released 2026-08-12, successor shipped 2026-09-21): 500,000-token context, max output not published, text, image and file to text, $2.00 input up to 200K then $4.00, $6.00 output up to 200K then $12.00, coding index 76.8 at rank 5 by Artificial Analysis, long-context recall 80.33, data retention 30 days on the comparison listing per OpenCode. Footnote credits the left column to Meituan's changelog and pricing page and the right column to OrcaRouter's catalogue with index figures sourced to Artificial Analysis, and notes that LongCat-2.5-Preview is not routed by OrcaRouter. OrcaRouter logo bottom-right.

Comment décider

• Choisissez Grok 4.6 si vous avez besoin d'une réponse que vous pouvez défendre. Il dispose d'une fiche indépendante, d'un profil d'entrée documenté et d'un prix qui n'expire pas. Son principal risque n'est pas la qualité, mais la pertinence : Grok 4.7 existe aux mêmes tarifs, et le coût de rester sur 4.6 par inertie correspond à la différence entre un indice d'intelligence de 44,3 et de 46,4 que vous n'auriez pas eu à payer.

• Choisissez LongCat-2.5-Preview si le facteur décisif est la rétention ou la portée. Un accès sans rétention via OpenCode, une fenêtre d’un million de tokens, un plafond de sortie de 131 072 tokens et une grille tarifaire d’environ un septième de celle de Grok 4.6 sont de réels avantages — le premier vérifié par la politique de confidentialité d’un tiers, les autres affirmés par le fournisseur seul.

• Ne choisissez pas entre eux sur la foi d'un tableau de benchmarks, car un seul existe. Le score de codage de 76,8 et le rappel de contexte long de 80,3 de Grok 4.6 décrivent Grok 4.6. Rien ne décrit encore LongCat-2.5-Preview. Quiconque publie cette semaine un score de LongCat-2.5-Preview à côté d'un score de Grok 4.6 cite soit un autre modèle LongCat, soit invente le chiffre.

• Vérifiez le côté entrée avant de vous appuyer dessus. Le changelog de Meituan met en avant la compréhension d'images, mais la réponse d'exemple dans sa propre documentation « Retrieve Model » indique encore input_modalities comme ["text"] avec une chaîne de modalité text->text — une affirmation du fournisseur face à un contrat publié qui dit le contraire. Grok 4.6 accepte du texte, des images et des fichiers sans une telle ambiguïté. Et vérifiez que votre harnais expose un champ entrelacé reasoning_content avant de tirer la moindre conclusion sur la qualité de raisonnement de LongCat-2.5-Preview ; un client qui laisse tomber ce champ échouera silencieusement.

Comparés dans cet article1

Détecté à partir de cet article · Benchmarks : Artificial Analysis · mis à jour quotidiennement